HeadlinesBriefing favicon HeadlinesBriefing.com

Quadro matemático para circuitos Transformer

Hacker News •
×

Este artigo apresenta passos iniciais para a engenharia reversa de modelos de linguagem transformadores por meio de interpretabilidade mecânica. À medida que modelos como GPT-3, LaMDA, Codex, Meena e Gopher aumentam de escala, seu caráter aberto cria riscos de comportamentos prejudiciais inesperados. A interpretabilidade mecânica visa a engenharia reversa de cálculos detalhados, semelhante à engenharia reversa de binários em código-fonte, potencialmente fornecendo abordagens sistemáticas para problemas de segurança.

Os autores estudam transformadores de atenção apenas com duas camadas ou menos, contrastando com as 96 camadas do GPT-3 alternando blocos de atenção e MLP. Ao conceitualizar as operações de transformador em um quadro matematicamente equivalente, eles obtêm uma compreensão significativa das operações internas. As descobertas principais incluem: transformadores de camada zero modelam estatísticas bigrama acessíveis diretamente dos pesos; modelos de uma camada são conjuntos de modelos bigrama e "skip-trigram" (sequências como "A… B C") com tabelas diretamente acessíveis; e "cabeças de indução" específicas explicam aprendizado em contexto em modelos pequenos, desenvolvendo-se apenas em modelos com pelo menos duas camadas de atenção.

O quadro inclui conceitos como pesos virtuais, fluxo residual como canal de comunicação, cabeças de atenção aditivas independentes, truques de expansão de caminho e análise de circuitos QK/OV. Embora ainda não aplicado a modelos maiores neste primeiro artigo, o trabalho futuro mostra que o quadro e as cabeças de indução permanecem parcialmente relevantes para modelos maiores, embora a engenharia reversa completa ainda esteja distante.

Entidades-chave: Empresas: GPT-3, LaMDA, Codex, Meena, Gopher

Perguntas frequentes: O que são cabeças de indução e por que elas são significativas?

Cabeças de indução são cabeças de atenção específicas que explicam o aprendizado em contexto em modelos transformadores pequenos. Elas se desenvolvem apenas em modelos com pelo menos duas camadas de atenção, sugerindo uma base mecânica de como os transformadores aprendem a copiar e completar padrões do contexto.

FAQ Q: O que são cabeças de indução e por que elas são significativas?

FAQ A: Cabeças de indução são cabeças de atenção específicas que explicam o aprendizado em contexto em modelos transformadores pequenos. Elas se desenvolvem apenas em modelos com pelo menos duas camadas de atenção, sugerindo uma base mecânica de como os transformadores aprendem a copiar e completar padrões do contexto.