HeadlinesBriefing favicon HeadlinesBriefing.com

三値LLMの1.58ビット障壁を打破する

Hacker News •
×

三値大規模言語モデル(LLM)は各重みを3つの記号{-1,0,+1}のいずれかとして保存するため、三値モデルのコストは慣例的に情報理論的なlog₂ 3 ≈ 1.585ビット/重みを基準とします。主流の展開フォーマットは5つの三値重みを1バイトにパックし(5トリットパッキング)、実際に使用される2の冪のグループサイズのため、これは1.625ビット/重みに切り上げられます。

この実効ストレージビット幅は3つの記号を等確率として扱います。我々は29の三値LLMモデルの実際の記号分布を測定し、ゼロが全重みの最大51.5%を占めることを発見しました。この発見に動機付けられ、我々はBITCOSを導入します。これは高密度プレゼンスビットマップと圧縮符号ベクトルからなる単純な分布適応型レイアウトで、モデルの重みにおけるゼロ密度zが与えられたとき、重み要素あたり2 - zビットのコストがかかります。

BITCOSは29のテスト済みモデルのうち26で5トリットパッキングよりもコンパクトに重みを保存し、それらの中で最も疎なものでは重みあたり1.485ビットに達します。BITCOSは現代のプロセッサとGPUでの効率的なアンパッキングに適しており、我々はAVX-512、AVX2、Intel Xe2 GPU向けの最適化されたアンパッキングシーケンスを提示します。

本番環境の最先端三値行列-ベクトル乗算カーネルと比較して測定すると、実世界の三値モデルが示すゼロ密度において、我々の提案レイアウトによる実現ゲインは最大1.28×です。最後に、5つの異なるプラットフォームでのエンドツーエンドLLM推論結果を示し、デコードスループットがCPUで最大1.18×、GPUで最大1.27×改善します。

主要エンティティ:企業:Intel | 人物:Evangelos Georganas

FAQ:5トリットパッキングに対するBITCOSの主な利点は何ですか?

BITCOSは29のテスト済み三値LLMモデルのうち26で5トリットパッキングよりもコンパクトに重みを保存し、最も疎なモデルで重みあたり1.485ビットに達し、行列-ベクトル乗算カーネルで最大1.28×のゲインを達成します。