HeadlinesBriefing favicon HeadlinesBriefing.com

打破三值LLM的1.58比特壁垒

Hacker News •
×

三值大型语言模型(LLM)将每个权重存储为{-1,0,+1}三个符号之一,因此三值模型的成本通常以信息论的log₂ 3 ≈ 1.585比特每权重为参照。主流的部署格式将五个三值权重打包进一个字节(五三进制打包),由于实践中使用的二次幂组大小,这向上取整为1.625比特每权重。

这种有效存储位宽将三个符号视为等概率。我们测量了29个三值LLM模型的实际符号分布,发现零占所有权重的比例高达51.5%。受此发现启发,我们引入了BITCOS,一种简单的分布自适应布局,由稠密存在位图加上压缩符号向量组成,在模型权重中零密度为z时,每个权重元素的成本为2 - z比特。

BITCOS在29个测试模型中的26个上比五三进制打包更紧凑地存储权重,在最稀疏的模型上达到1.485比特每权重。BITCOS适合在现代处理器和GPU上高效解包,我们为AVX-512、AVX2和Intel Xe2 GPU提供了优化的解包序列。

与生产级最先进的三值矩阵-向量乘法内核相比,在真实世界三值模型表现出的零密度下,我们提出的布局实现的增益高达1.28×。最后,我们展示了在5个不同平台上的端到端LLM推理结果,其中解码吞吐量在CPU上提升高达1.18×,在GPU上提升高达1.27×。

关键实体:公司:Intel | 人物:Evangelos Georganas

FAQ:BITCOS相对于五三进制打包的主要优势是什么?

BITCOS在29个测试的三值LLM模型中的26个上比五三进制打包更紧凑地存储权重,在最稀疏的模型上达到1.485比特每权重,并在矩阵-向量乘法内核中实现高达1.28×的增益。