HeadlinesBriefing favicon HeadlinesBriefing.com

Transformer电路的数学框架

Hacker News •
×

本文提出了通过机械可解释性逆向工程Transformer语言模型的初步步骤。随着像GPT-3、LaMDA、Codex、Meena和Gopher这样的模型不断扩大规模,它们的开放性创造了意外有害行为的风险。机械可解释性旨在逆向工程详细的计算过程,类似于将二进制文件逆向工程为源代码,从而可能为安全问题提供系统性的方法。

作者研究了仅包含两层或更少层的注意力-only Transformer,这与GPT-3的96层交替注意力和MLP块形成对比。通过将Transformer操作概念化为数学上等价的框架,他们获得了对内部操作的重要理解。主要发现包括:零层Transformer模拟可直接从权重中访问的二元统计;一层模型是二元和"跳过三元"(如"A… B C")模型的集合,具有直接可访问的表格;特定的"归纳头"解释了小型模型中的上下文学习,并且仅在至少包含两层注意力层的模型中发展。

该框架包括虚拟权重、残差流作为通信信道、独立的加性注意力头、路径展开技巧和QK/OV电路分析等概念。虽然本文尚未将其应用于更大的模型,但即将发表的工作表明该框架和归纳头在更大的模型中仍然部分相关,尽管完全的逆向工程仍然遥远。

关键实体:公司:GPT-3、LaMDA、Codex、Meena、Gopher

常见问题解答:什么是归纳头,为什么它们很重要?

归纳头是特定的注意力头,它们解释了小型Transformer模型中的上下文学习。它们仅在至少包含两层注意力层的模型中发展,这表明了Transformer如何学习从上下文中复制和完成模式的机械基础。

FAQ Q:什么是归纳头,为什么它们很重要?

FAQ A:归纳头是特定的注意力头,它们解释了小型Transformer模型中的上下文学习。它们仅在至少包含两层注意力层的模型中发展,这表明了Transformer如何学习从上下文中复制和完成模式的机械基础。