HeadlinesBriefing favicon HeadlinesBriefing.com

Durchbrechung der 1,58-Bit-Barriere für ternäre LLMs

Hacker News •
×

Ternäre große Sprachmodelle (LLM) speichern jedes Gewicht als eines von drei Symbolen {-1,0,+1}, daher wird der Aufwand eines ternären Modells konventionell auf die informationstheoretischen log₂ 3 ≈ 1,585 Bit pro Gewicht bezogen. Das vorherrschende Bereitstellungsformat packt fünf ternäre Gewichte in ein Byte (Fünf-Trit-Packing), und aufgrund der in der Praxis verwendeten Zweierpotenz-Gruppengrößen rundet dies auf 1,625 Bit pro Gewicht auf.

Diese effektive Speicherbitbreite behandelt die drei Symbole als gleichwahrscheinlich. Wir messen die tatsächliche Symbolverteilung von 29 ternären LLM-Modellen und stellen fest, dass Nullen bis zu 51,5% aller Gewichte ausmachen. Motiviert durch diesen Befund führen wir BITCOS ein, ein einfaches verteilungsadaptives Layout, das aus einer dichten Präsenz-Bitmap plus einem kompaktierten Vorzeichenvektor besteht und bei einer Nulldichte z in den Gewichten des Modells 2 - z Bit pro Gewichtselement kostet.

BITCOS speichert Gewichte in 26 der 29 getesteten Modelle kompakter als das Fünf-Trit-Packing und erreicht 1,485 Bit pro Gewicht beim spärlichsten von ihnen. BITCOS eignet sich für effizientes Entpacken auf modernen Prozessoren und GPUs, und wir präsentieren optimierte Entpacksequenzen für AVX-512, AVX2 und Intel Xe2 GPUs.

Gemessen gegen Produktions-Kernel der Spitzenklasse für ternäre Matrix-Vektor-Multiplikation, bei den Nulldichten, die reale ternäre Modelle aufweisen, beträgt der realisierte Gewinn mit unserem vorgeschlagenen Layout bis zu 1,28×. Schließlich veranschaulichen wir End-to-End-LLM-Inferenzergebnisse auf 5 verschiedenen Plattformen, bei denen sich der Decode-Durchsatz um bis zu 1,18× auf CPUs und 1,27× auf GPUs verbessert.

Schlüsselentitäten: Unternehmen: Intel | Personen: Evangelos Georganas