HeadlinesBriefing favicon HeadlinesBriefing.com

Преодоление барьера 1,58 бита для тернарных LLM

Hacker News •
×

Тернарные большие языковые модели (LLM) хранят каждый вес как один из трех символов {-1,0,+1}, поэтому стоимость тернарной модели традиционно привязывается к информационно-теоретическому log₂ 3 ≈ 1,585 бита на вес. Преобладающий формат развертывания упаковывает пять тернарных весов в один байт (пятитритная упаковка), и из-за используемых на практике размеров групп, являющихся степенями двойки, это округляется до 1,625 бита на вес.

Эта эффективная битовая ширина хранения рассматривает три символа как равновероятные. Мы измеряем фактическое распределение символов 29 тернарных LLM-моделей и обнаруживаем, что нули составляют до 51,5% всех весов. Вдохновленные этим открытием, мы представляем BITCOS — простую адаптивную к распределению схему, состоящую из плотной битовой карты присутствия плюс сжатого вектора знаков, которая стоит 2 - z бита на элемент веса при плотности нулей z в весах модели.

BITCOS хранит веса компактнее, чем пятитритная упаковка, в 26 из 29 протестированных моделей и достигает 1,485 бита на вес на самой разреженной из них. BITCOS поддается эффективной распаковке на современных процессорах и GPU, и мы представляем оптимизированные последовательности распаковки для AVX-512, AVX2 и GPU Intel Xe2.

При измерении против производственных современных ядер тернарного умножения матрицы на вектор, при плотностях нулей, которые демонстрируют реальные тернарные модели, достигнутый выигрыш с нашей предложенной схемой составляет до 1,28×. Наконец, мы иллюстрируем сквозные результаты вывода LLM на 5 различных платформах, где пропускная способность декодирования улучшается до 1,18× на CPU и 1,27× на GPU.

Ключевые сущности: Компании: Intel | Люди: Evangelos Georganas