HeadlinesBriefing favicon HeadlinesBriefing.com

Marco matemático para circuitos Transformer

Hacker News •
×

Este artículo presenta pasos iniciales hacia la ingeniería inversa de modelos de lenguaje transformadores mediante interpretabilidad mecánica. A medida que modelos como GPT-3, LaMDA, Codex, Meena y Gopher aumentan de escala, su apertura crea riesgos de comportamientos dañinos inesperados. La interpretabilidad mecánica busca ingeniería inversa de cálculos detallados, similar a ingeniería inversa de binarios en código fuente, proporcionando potencialmente enfoques sistemáticos para problemas de seguridad.

Los autores estudian transformadores de atención únicamente con dos capas o menos, contrastando con las 96 capas de GPT-3 que alternan bloques de atención y MLP. Al conceptualizar las operaciones de transformador en un marco matemáticamente equivalente, obtienen una comprensión significativa de las operaciones internas. Los hallazgos clave incluyen: los transformadores de capa cero modelan estadísticas bigrama accesibles directamente desde pesos; los modelos de una capa son conjuntos de modelos bigrama y "skip-trigram" (secuencias como "A… B C") con tablas directamente accesibles; y los específicos "cabezales de inducción" explican el aprendizaje en contexto en modelos pequeños, desarrollándose solo en modelos con al menos dos capas de atención.

El marco incluye conceptos como pesos virtuales, flujo residual como canal de comunicación, cabezales de atención aditivos independientes, trucos de expansión de ruta y análisis de circuitos QK/OV. Aunque aún no se ha aplicado a modelos más grandes en este primer artículo, el trabajo futuro muestra que el marco y los cabezales de inducción siguen siendo parcialmente relevantes para modelos más grandes, aunque el ingeniería inversa completa sigue siendo distante.

Entidades clave: Empresas: GPT-3, LaMDA, Codex, Meena, Gopher

Preguntas frecuentes: ¿Qué son los cabezales de inducción y por qué son significativos?

Los cabezales de inducción son cabezales de atención específicos que explican el aprendizaje en contexto en modelos transformadores pequeños. Solo se desarrollan en modelos con al menos dos capas de atención, lo que sugiere una base mecánica de cómo los transformadores aprenden a copiar y completar patrones del contexto.

FAQ Q: ¿Qué son los cabezales de inducción y por qué son significativos?

FAQ A: Los cabezales de inducción son cabezales de atención específicos que explican el aprendizaje en contexto en modelos transformadores pequeños. Solo se desarrollan en modelos con al menos dos capas de atención, lo que sugiere una base mecánica de cómo los transformadores aprenden a copiar y completar patrones del contexto.