HeadlinesBriefing favicon HeadlinesBriefing.com

Visualización de atención de LLM: mecanismo de copiar y pegar

Hacker News •
×

Los LLM basados en Transformer pueden extraer información de cualquier token anterior durante la generación, pero deben ser selectivos. Este mecanismo se puede visualizar tocando o pasando el cursor sobre los tokens generados para ver qué tokens pasados los influenciaron.

La visualización calcula el peso de atención escalado por la magnitud del vector de valor, agregado a través de cabezas y capas, y luego controla la opacidad de los tokens anteriores. A pesar de la simplificación, surgen patrones interesantes. Por ejemplo, en el prompt "Office Move Summary", el texto copiado como direcciones y fechas se destaca porque el token generado se basa en gran medida en los datos de origen.

Esto aborda un enigma: si los LLM predicen tokens probabilísticamente, ¿por qué son tan buenos para copiar y pegar? El mecanismo muestra que el modelo no predice secuencias completas desde estados internos limitados; accede a todos los tokens pasados y decide de cuáles extraer, reduciendo la probabilidad de error.

En otro ejemplo, pasar el cursor sobre "remain" muestra que extrae de "work" y "stay the same", combinando información de diferentes frases. La visualización usa una aplicación React con Transformers.js, pero requirió modificar el archivo .onnx para exponer valores internos y generar prompts previamente para visualización instantánea.