HeadlinesBriefing favicon HeadlinesBriefing.com

缓存到缓存:LLM 之间的直接语义通信

Hacker News •
×

多 LLM 系统结合多种模型以获得更好的性能,但现有设计强制通过文本进行通信,丢失了丰富的语义并产生逐 token 的延迟。LLM 能否超越文本进行通信?Oracle 实验表明,丰富 KV-Cache 语义可以在不增加缓存大小的情况下提升响应质量。

因此,提出了 Cache-to-Cache (C2C):一种 LLM 之间直接语义通信的新范式。C2C 使用神经网络将源模型的 KV-cache 投影并与目标模型的 KV-cache 融合,实现直接的语义传递。可学习的门控机制选择受益于缓存通信的目标层。

与文本通信相比,C2C 利用了来自两个模型的深层、专门化语义,同时避免了显式的中间文本生成。实验表明,C2C 比单个模型平均准确率高出 6.4-14.2%,比文本通信高出约 3.1-5.4%,并在延迟上平均实现 2.5 倍加速。代码可在提供的 URL 获取。

关键实体:人物:Tianyu Fu

FAQ:什么是 Cache-to-Cache (C2C)?

C2C 是一种 LLM 之间直接语义通信的范式,通过投影和融合 KV-cache,避免文本生成,提升准确率并降低延迟。

FAQ 问题:什么是 Cache-to-Cache (C2C)?

FAQ 回答:C2C 是一种 LLM 之间直接语义通信的范式,通过投影和融合 KV-cache,避免文本生成,提升准确率并降低延迟。