HeadlinesBriefing favicon HeadlinesBriefing.com

Bonsai 2 27B : 9x plus petit, 98,2 % capable

Hacker News •
×

Il y a deux mois, nous avons publié nos premiers modèles Bonsai 27B et montré qu'un modèle multimodal de classe 27B pouvait être suffisamment compressé pour s'exécuter efficacement sur un appareil local. Aujourd'hui, nous publions Ternary Bonsai 2 27B, notre modèle le plus capable à ce jour. Basé sur Qwen3.8 27B, il apporte un raisonnement, un codage, une vision et une capacité agentique plus forts tout en préservant une empreinte mémoire considérablement réduite, un débit local élevé et une meilleure efficacité énergétique.

Ternary Bonsai 2 27B utilise des poids ternaires {−1, 0, +1} avec une mise à l'échelle par groupes en FP16, pour 1,76 bit effectif par poids et une empreinte totale du modèle de 5,9GB. Il prend en charge une fenêtre de contexte de 262K tokens, une entrée multimodale texte et image, et est publié sous licence Apache 2.0. Face à son homologue en pleine précision, il est plus de 9 fois plus petit tout en conservant 98,2 % des performances agrégées aux benchmarks. À ce niveau de rétention, la compression devient un déblocage de déploiement : presque les mêmes capacités, dans une empreinte qui peut s'exécuter dans bien plus d'endroits.

Sur une suite de benchmarks couvrant le raisonnement, les mathématiques, le codage, le suivi d'instructions, la vision et l'utilisation d'outils agentiques, Ternary Bonsai 2 27B obtient 83,9, conservant 98,2 % des performances agrégées de Qwen3.8 27B. Le résultat clé n'est pas seulement le score agrégé, mais où la capacité est conservée. Les agents de codage, les systèmes d'utilisation d'outils, les flux de travail multimodaux et les tâches à long horizon sont particulièrement sensibles à la dégradation du modèle car de petites erreurs peuvent s'accumuler sur de nombreuses étapes. Bonsai 2 27B préserve une grande partie des performances du modèle en pleine précision exactement dans ces domaines tout en fonctionnant avec une fraction de l'empreinte mémoire.

Ternary Bonsai 2 27B atteint jusqu'à 143 tokens/seconde sur NVIDIA Ge Force RTX 5090 et 46,8 tokens/seconde sur M5 Max. Sur une RTX 4090, il ne consomme que 0,714 m Wh/token, ce qui le rend 40 % plus économe en énergie qu'un modèle 8B fonctionnant en pleine précision.

Entités clés : Entreprises : Qwen, NVIDIA, Cline

FAQ : Qu'est-ce que Ternary Bonsai 2 27B ?

Ternary Bonsai 2 27B est un modèle multimodal compressé de classe 27B basé sur Qwen3.8 27B, utilisant des poids ternaires avec une mise à l'échelle par groupes en FP16 pour 1,76 bit effectif par poids et une empreinte de 5,9GB. Il conserve 98,2 % des performances de référence en pleine précision et prend en charge une fenêtre de contexte de 262K tokens sous licence Apache 2.0.

FAQ Q : Qu'est-ce que Ternary Bonsai 2 27B ?

FAQ A : Ternary Bonsai 2 27B est un modèle multimodal compressé de classe 27B basé sur Qwen3.8 27B, utilisant des poids ternaires avec une mise à l'échelle par groupes en FP16 pour 1,76 bit effectif par poids et une empreinte de 5,9GB. Il conserve 98,2 % des performances de référence en pleine précision et prend en charge une fenêtre de contexte de 262K tokens sous licence Apache 2.0.