HeadlinesBriefing favicon HeadlinesBriefing.com

Bonsai 2 27B: в 9x меньше, 98,2% способен

Hacker News •
×

Два месяца назад мы выпустили наши первые модели Bonsai 27B и показали, что мультимодальная модель класса 27B может быть сжата достаточно, чтобы эффективно работать на локальном устройстве. Сегодня мы выпускаем Ternary Bonsai 2 27B — нашу самую способную модель на данный момент. Основанная на Qwen3.8 27B, она обеспечивает более сильное рассуждение, программирование, зрение и агентные возможности, сохраняя при этом кардинально меньший объём памяти, высокую локальную пропускную способность и лучшую энергоэффективность.

Ternary Bonsai 2 27B использует троичные веса {−1, 0, +1} с групповым масштабированием FP16, что даёт 1,76 эффективных бита на вес и общий объём модели 5,9GB. Она поддерживает контекстное окно 262K токенов, мультимодальный ввод текста и изображений и выпускается под лицензией Apache 2.0. По сравнению с полноточным аналогом она более чем в 9 раз меньше, сохраняя 98,2% совокупной производительности в бенчмарках. При таком уровне сохранения сжатие становится ключом к развёртыванию: почти те же возможности при объёме, который может работать гораздо в большем числе мест.

В наборе бенчмарков, охватывающем рассуждение, математику, программирование, следование инструкциям, зрение и агентное использование инструментов, Ternary Bonsai 2 27B набирает 83,9, сохраняя 98,2% совокупной производительности Qwen3.8 27B. Ключевой результат — не только совокупный балл, но и то, где сохраняются возможности. Кодирующие агенты, системы использования инструментов, мультимодальные рабочие процессы и долгосрочные задачи особенно чувствительны к деградации модели, поскольку небольшие ошибки могут накапливаться на многих шагах. Bonsai 2 27B сохраняет большую часть производительности полноточной модели именно в этих областях, работая при доле объёма памяти.

Ternary Bonsai 2 27B достигает до 143 токенов/секунду на NVIDIA Ge Force RTX 5090 и 46,8 токенов/секунду на M5 Max. На RTX 4090 она потребляет всего 0,714 m Wh/токен, что делает её на 40% энергоэффективнее модели 8B, работающей в полной точности.

Ключевые сущности: Компании: Qwen, NVIDIA, Cline