HeadlinesBriefing favicon HeadlinesBriefing.com

Cadre mathématique pour circuits Transformer

Hacker News •
×

Cet article présente des premières étapes vers l'ingénierie inverse des modèles de langage transformeurs via l'interprétabilité mécaniste. À mesure que des modèles comme GPT-3, LaMDA, Codex, Meena et Gopher augmentent d'échelle, leur ouverture crée des risques de comportements néfastes inattendus. L'interprétabilité mécaniste vise à ingénierie inverse des calculs détaillés, similaire à l'ingénierie inverse des binaires en code source, pouvant potentiellement fournir des approches systématiques aux problèmes de sécurité.

Les auteurs étudient des transformateurs d'attention uniquement avec deux couches ou moins, contrastant avec les 96 couches de GPT-3 alternant les blocs d'attention et MLP. En conceptualisant les opérations de transformateur dans un cadre mathématiquement équivalent, ils acquièrent une compréhension significative des opérations internes. Les principales découvertes incluent : les transformateurs de couche zéro modélisent des statistiques bigrammes accessibles directement depuis les poids ; les modèles d'une couche sont des ensembles de modèles bigrammes et "skip-trigramme" (séquences comme "A… B C") avec des tables directement accessibles ; et les "têtes d'induction" spécifiques expliquent l'apprentissage en contexte dans les petits modèles, ne se développant que dans les modèles avec au moins deux couches d'attention.

Le cadre comprend des concepts tels que les poids virtuels, le flux résiduel comme canal de communication, les têtes d'attention additives indépendantes, les astuces d'expansion de chemin et l'analyse des circuits QK/OV. Bien qu'il n'ait pas encore été appliqué aux grands modèles dans cet premier article, les travaux à venir montrent que le cadre et les têtes d'induction restent partiellement pertinents pour les grands modèles, bien que l'ingénierie inverse complète reste lointaine.

Entités clés : Entreprises : GPT-3, LaMDA, Codex, Meena, Gopher

Questions fréquentes : Que sont les têtes d'induction et pourquoi sont-elles importantes ?

Les têtes d'induction sont des têtes d'attention spécifiques qui expliquent l'apprentissage en contexte dans les petits modèles transformeurs. Elles ne se développent que dans les modèles avec au moins deux couches d'attention, ce qui suggère une base mécanique de la manière dont les transformeurs apprennent à copier et à compléter des motifs à partir du contexte.

FAQ Q : Que sont les têtes d'induction et pourquoi sont-elles importantes ?

FAQ A : Les têtes d'induction sont des têtes d'attention spécifiques qui expliquent l'apprentissage en contexte dans les petits modèles transformeurs. Elles ne se développent que dans les modèles avec au moins deux couches d'attention, ce qui suggère une base mécanique de la manière dont les transformeurs apprennent à copier et à compléter des motifs à partir du contexte.