HeadlinesBriefing favicon HeadlinesBriefing.com

Rompiendo la barrera de 1.58 bits para LLM ternarios

Hacker News •
×

Los Modelos de Lenguaje Grande (LLM) ternarios almacenan cada peso como uno de tres símbolos {-1,0,+1}, por lo que el costo de un modelo ternario se referencia convencionalmente a los log₂ 3 ≈ 1.585 bits por peso de la teoría de la información. El formato de despliegue predominante empaqueta cinco pesos ternarios en un byte (empaquetado de cinco trits), y debido a los tamaños de grupo potencia de dos utilizados en la práctica, esto se redondea a 1.625 bits por peso.

Este ancho de bits de almacenamiento efectivo trata los tres símbolos como equiprobables. Medimos la distribución real de símbolos de 29 modelos LLM ternarios y encontramos que los ceros representan hasta el 51.5% de todos los pesos. Motivados por este hallazgo, introducimos BITCOS, un diseño simple adaptativo a la distribución compuesto por un mapa de bits de presencia denso más un vector de signo compactado, y cuesta 2 - z bits por elemento de peso dada una densidad de ceros z en los pesos del modelo.

BITCOS almacena pesos más compactamente que el empaquetado de cinco trits en 26 de los 29 modelos probados, y alcanza 1.485 bits por peso en el más disperso de ellos. BITCOS es susceptible de desempaquetado eficiente en procesadores modernos y GPUs, y presentamos secuencias de desempaquetado optimizadas para AVX-512, AVX2 y GPUs Intel Xe2.

Medido contra núcleos de multiplicación matriz-vector ternarios de última generación en producción, a las densidades de ceros que exhiben los modelos ternarios del mundo real, la ganancia realizada con nuestro diseño propuesto es de hasta 1.28×. Finalmente, ilustramos resultados de inferencia LLM de extremo a extremo en 5 plataformas diferentes donde el rendimiento de decodificación mejora hasta 1.18× en CPUs y 1.27× en GPUs.

Entidades clave: Empresas: Intel | Personas: Evangelos Georganas