HeadlinesBriefing favicon HeadlinesBriefing.com

LLM注意力可视化:揭示复制粘贴机制

Hacker News •
×

基于Transformer的LLM在生成过程中可以从任何先前的令牌中提取信息,但需要有选择性。这种机制可以通过点击或悬停生成的令牌来可视化,以查看哪些过去的令牌影响了它们。

该可视化计算了按值向量幅度缩放的注意力权重,跨头和层聚合,然后控制先前令牌的不透明度。尽管进行了简化,但出现了有趣的模式。例如,在“办公室搬迁摘要”提示中,复制的文本如地址和日期会突出显示,因为生成的令牌大量从源数据中提取。

这解决了一个谜题:如果LLM概率性地预测令牌,为什么它们在复制粘贴方面如此出色?该机制表明,模型不会从有限的内部状态预测整个序列;它访问所有过去的令牌并决定从中提取哪些,从而降低错误概率。

在另一个例子中,悬停在“remain”上显示它从“work”和“stay the same”中提取,结合了不同短语的信息。该可视化使用带有Transformers.js的React应用,但需要修改.onnx文件以暴露内部值,并预生成提示以便即时查看。