HeadlinesBriefing favicon HeadlinesBriefing.com

无限参数LLM:来自实时数据的权重

Hacker News •
×

缩放定律认为,语言模型的能力随参数和训练数据的增加而提升。混合专家(MoE)架构遵循这些定律取得了显著成果,每个token仅激活庞大存储参数库中的一小部分。

这一成功建立在静态预训练数据之上。已部署的模型面对的是不同的世界,其中许多能使其更有用的数据并不在训练集中,而在它当前正在处理的实时交互中,例如用户提供的事实或给出的纠正。传统模型无法从这些数据中学习,因为其权重在训练后即被冻结。相反,运行时提供的知识和行为被放入提示中,请求结束后即被丢弃。

我们探讨一种架构如何通过将实时交互写入权重来从中学习。受MoE启发,我们提出无限参数LLM。一个紧凑的超网络将运行时数据转化为共享基础网络的低秩调制,因此前馈权重由实时数据生成,而非存储在固定参数库中。此前的权重生成器只读取一次上下文便冻结,而我们则对生成器潜在代码维持贝叶斯信念并在线更新。

存储占用保持固定,但模型能够编译的权重实际上是无限的。将运行时知识以权重而非提示的形式承载,在计算上可摊销,释放上下文窗口,跨轮次持久存在,并且能更好地泛化。我们指定了一个评估协议,将其与上下文学习和检索进行对比测试。

关键实体:人物:Jinli Hu

FAQ:什么是无限参数LLM?

它是一种提出的架构,其中紧凑的超网络将实时运行数据转化为共享基础网络的低秩调制,从实时数据生成前馈权重,而非将其存储在固定参数库中。

FAQ 问:什么是无限参数LLM?

FAQ 答:它是一种提出的架构,其中紧凑的超网络将实时运行数据转化为共享基础网络的低秩调制,从实时数据生成前馈权重,而非将其存储在固定参数库中。