HeadlinesBriefing favicon HeadlinesBriefing.com

Visualização de atenção de LLM: mecanismo de copiar e colar

Hacker News •
×

LLMs baseados em Transformer podem extrair informações de qualquer token anterior durante a geração, mas precisam ser seletivos. Esse mecanismo pode ser visualizado tocando ou passando o mouse sobre os tokens gerados para ver quais tokens passados os influenciaram.

A visualização calcula o peso de atenção escalado pela magnitude do vetor de valor, agregado em cabeças e camadas, e depois controla a opacidade dos tokens anteriores. Apesar da simplificação, padrões interessantes emergem. Por exemplo, no prompt "Office Move Summary", texto copiado como endereços e datas se destaca porque o token gerado se baseia fortemente nos dados de origem.

Isso aborda um enigma: se os LLMs preveem tokens probabilisticamente, por que são tão bons em copiar e colar? O mecanismo mostra que o modelo não prevê sequências completas a partir de estados internos limitados; ele acessa todos os tokens passados e decide de quais extrair, reduzindo a probabilidade de erro.

Em outro exemplo, passar o mouse sobre "remain" mostra que ele extrai de "work" e "stay the same", combinando informações de frases diferentes. A visualização usa um aplicativo React com Transformers.js, mas exigiu modificar o arquivo .onnx para expor valores internos e prompts pré-gerados para visualização instantânea.