HeadlinesBriefing favicon HeadlinesBriefing.com

LLM提速3倍:投机解码技巧

ByteByteGo •
×

每个智能体已经在运行一个循环。循环工程在智能体自身周围添加一个循环,使其能够评估自己的输出,在工作不足时重试,并在相同错误重复出现时改进指令。今天,你扮演这个角色:审查工作,诊断问题所在,并再次提示智能体。本文通过一个实际示例展示如何自动化这个过程,同时探讨人类判断仍然适用的地方。

一个700亿参数的模型需要从GPU内存中读取约140GB的权重。在现代数据中心GPU上,这种传输可能需要几十毫秒。实际应用于这些权重的计算只占其中一小部分时间。这意味着在生成token的步骤中,处理器的数学单元大部分时间处于闲置状态。投机解码是一种将这种闲置容量转化为输出的技术。

第二个更小的模型预先产生几个候选token。大模型在单次前向传递中评估所有这些候选token,而不是每个token一次传递,从而使生成速度提高2-3倍。更妙的是,生成的文本在统计上与单独运行的大模型输出相同。

文本生成一次只处理一个token。模型读取到目前为止生成的所有内容,计算其词汇表上的概率分布,选择下一个token,将该token附加到输入中,然后重复循环。每个循环称为一次前向传递,每次前向传递都会将输入通过模型的所有层。现代推理系统使用KV缓存,它存储已处理token的注意力状态,减少了每次传递中的工作量,但仍然需要每个token一次传递。

关键实体:公司:ByteByteGo