HeadlinesBriefing favicon HeadlinesBriefing.com

Quebrando a barreira de 1,58 bits para LLMs ternários

Hacker News •
×

Modelos de Linguagem Grande (LLM) ternários armazenam cada peso como um de três símbolos {-1,0,+1}, então o custo de um modelo ternário é convencionalmente referenciado ao log₂ 3 ≈ 1,585 bits por peso da teoria da informação. O formato de implantação predominante empacota cinco pesos ternários em um byte (empacotamento de cinco trits), e devido aos tamanhos de grupo potência de dois usados na prática, isso arredonda para 1,625 bits por peso.

Esta largura de bits de armazenamento efetiva trata os três símbolos como equiprováveis. Medimos a distribuição real de símbolos de 29 modelos LLM ternários e descobrimos que os zeros representam até 51,5% de todos os pesos. Motivados por esta descoberta, introduzimos o BITCOS, um layout simples adaptativo à distribuição composto por um bitmap de presença denso mais um vetor de sinal compactado, e custa 2 - z bits por elemento de peso dada uma densidade de zeros z nos pesos do modelo.

O BITCOS armazena pesos mais compactamente que o empacotamento de cinco trits em 26 dos 29 modelos testados, e atinge 1,485 bits por peso no mais esparso deles. O BITCOS é adequado para desempacotamento eficiente em processadores modernos e GPUs, e apresentamos sequências de desempacotamento otimizadas para AVX-512, AVX2 e GPUs Intel Xe2.

Medido contra kernels de multiplicação matriz-vetor ternários de última geração em produção, nas densidades de zeros que os modelos ternários do mundo real exibem, o ganho realizado com nosso layout proposto é de até 1,28×. Finalmente, ilustramos resultados de inferência LLM de ponta a ponta em 5 plataformas diferentes onde a taxa de transferência de decodificação melhora em até 1,18× em CPUs e 1,27× em GPUs.

Entidades-chave: Empresas: Intel | Pessoas: Evangelos Georganas