HeadlinesBriefing favicon HeadlinesBriefing.com

Briser la barrière des 1,58 bits pour les LLM ternaires

Hacker News •
×

Les grands modèles de langage (LLM) ternaires stockent chaque poids comme l'un des trois symboles {-1,0,+1}, de sorte que le coût d'un modèle ternaire est conventionnellement référencé au log₂ 3 ≈ 1,585 bit par poids de la théorie de l'information. Le format de déploiement dominant emballe cinq poids ternaires dans un octet (empaquetage à cinq trits), et en raison des tailles de groupe en puissance de deux utilisées en pratique, cela arrondit à 1,625 bit par poids.

Cette largeur de bits de stockage effective traite les trois symboles comme équiprobables. Nous mesurons la distribution réelle des symboles de 29 modèles LLM ternaires et constatons que les zéros représentent jusqu'à 51,5 % de tous les poids. Motivés par cette découverte, nous introduisons BITCOS, une disposition simple adaptative à la distribution composée d'un bitmap de présence dense plus un vecteur de signe compacté, et coûte 2 - z bits par élément de poids étant donné une densité de zéros z dans les poids du modèle.

BITCOS stocke les poids plus compactement que l'empaquetage à cinq trits dans 26 des 29 modèles testés, et atteint 1,485 bit par poids sur le plus clairsemé d'entre eux. BITCOS se prête à un déballage efficace sur les processeurs modernes et les GPU, et nous présentons des séquences de déballage optimisées pour AVX-512, AVX2 et les GPU Intel Xe2.

Mesuré par rapport aux noyaux de multiplication matrice-vecteur ternaires de pointe en production, aux densités de zéros que présentent les modèles ternaires du monde réel, le gain réalisé avec notre disposition proposée est jusqu'à 1,28×. Enfin, nous illustrons les résultats d'inférence LLM de bout en bout sur 5 plateformes différentes où le débit de décodage s'améliore jusqu'à 1,18× sur les CPU et 1,27× sur les GPU.

Entités clés : Entreprises : Intel | Personnes : Evangelos Georganas

FAQ : Quel est le principal avantage de BITCOS par rapport à l'empaquetage à cinq trits ?

BITCOS stocke les poids plus compactement que l'empaquetage à cinq trits dans 26 des 29 modèles LLM ternaires testés, atteignant 1,485 bit par poids sur le modèle le plus clairsemé, et obtient un gain allant jusqu'à 1,28× dans les noyaux de multiplication matrice-vecteur.