HeadlinesBriefing favicon HeadlinesBriefing.com

Bonsai 2 27B: 9x menor, 98,2% capaz

Hacker News •
×

Há dois meses, lançamos nossos primeiros modelos Bonsai 27B e mostramos que um modelo multimodal de classe 27B podia ser comprimido o suficiente para rodar eficientemente em um dispositivo local. Hoje, estamos lançando o Ternary Bonsai 2 27B, nosso modelo mais capaz até agora. Baseado no Qwen3.8 27B, ele traz raciocínio, codificação, visão e capacidade agêntica mais fortes, preservando uma pegada de memória drasticamente menor, alto throughput local e melhor eficiência energética.

O Ternary Bonsai 2 27B usa pesos ternários {−1, 0, +1} com escalonamento por grupos em FP16, para 1,76 bits efetivos por peso e uma pegada total do modelo de 5,9GB. Ele suporta uma janela de contexto de 262K tokens, entrada multimodal de texto e imagem, e é lançado sob a licença Apache 2.0. Em comparação com sua contraparte de precisão total, é mais de 9x menor enquanto retém 98,2% do desempenho agregado em benchmarks. Nesse nível de retenção, a compressão se torna um desbloqueio de implantação: quase a mesma capacidade, em uma pegada que pode rodar em muito mais lugares.

Em uma suíte de benchmarks abrangendo raciocínio, matemática, codificação, seguimento de instruções, visão e uso de ferramentas agênticas, o Ternary Bonsai 2 27B pontua 83,9, retendo 98,2% do desempenho agregado do Qwen3.8 27B. O resultado principal não é apenas a pontuação agregada, mas onde a capacidade é retida. Agentes de codificação, sistemas de uso de ferramentas, fluxos de trabalho multimodais e tarefas de longo horizonte são particularmente sensíveis à degradação do modelo porque pequenos erros podem se acumular ao longo de muitos passos. O Bonsai 2 27B preserva grande parte do desempenho do modelo de precisão total exatamente nessas áreas enquanto opera com uma fração da pegada de memória.

O Ternary Bonsai 2 27B atinge até 143 tokens/segundo na NVIDIA Ge Force RTX 5090 e 46,8 tokens/segundo no M5 Max. Em uma RTX 4090, consome apenas 0,714 m Wh/token, tornando-o 40% mais eficiente em energia do que um modelo 8B rodando em precisão total.

Entidades principais: Empresas: Qwen, NVIDIA, Cline