HeadlinesBriefing favicon HeadlinesBriefing.com

Bonsai 2 27B: 9x kleiner, 98,2 % fähig

Hacker News •
×

Vor zwei Monaten haben wir unsere ersten Bonsai 27B-Modelle veröffentlicht und gezeigt, dass ein multimodales Modell der 27B-Klasse ausreichend komprimiert werden kann, um effizient auf einem lokalen Gerät zu laufen. Heute veröffentlichen wir Ternary Bonsai 2 27B, unser bisher leistungsfähigstes Modell. Basierend auf Qwen3.8 27B bringt es stärkeres Reasoning, Coding, Vision und agentische Fähigkeiten mit, während es einen dramatisch kleineren Speicherbedarf, hohen lokalen Durchsatz und bessere Energieeffizienz beibehält.

Ternary Bonsai 2 27B verwendet ternäre {−1, 0, +1}-Gewichte mit FP16-Gruppenskalierung für 1,76 effektive Bits pro Gewicht und einen gesamten Modell-Footprint von 5,9GB. Es unterstützt ein 262K-Token-Kontextfenster, multimodale Text- und Bildeingabe und wird unter der Apache 2.0-Lizenz veröffentlicht. Gegenüber seinem Vollpräzisions-Pendant ist es mehr als 9x kleiner und behält 98,2 % der aggregierten Benchmark-Leistung. Bei diesem Retentionsniveau wird Kompression zu einem Deployment-Unlock: nahezu die gleiche Fähigkeit, in einem Footprint, der an weit mehr Orten laufen kann.

In einer Benchmark-Suite, die Reasoning, Mathematik, Coding, Instruktionsbefolgung, Vision und agentische Tool-Nutzung umfasst, erzielt Ternary Bonsai 2 27B 83,9 und behält 98,2 % der aggregierten Leistung von Qwen3.8 27B. Das entscheidende Ergebnis ist nicht nur der aggregierte Score, sondern wo die Fähigkeit erhalten bleibt. Coding-Agenten, Tool-Nutzungssysteme, multimodale Workflows und Langhorizont-Aufgaben sind besonders empfindlich gegenüber Modellverschlechterung, da sich kleine Fehler über viele Schritte summieren können. Bonsai 2 27B bewahrt einen Großteil der Leistung des Vollpräzisionsmodells genau in diesen Bereichen, während es mit einem Bruchteil des Speicher-Footprints arbeitet.

Ternary Bonsai 2 27B erreicht bis zu 143 Token/Sekunde auf NVIDIA Ge Force RTX 5090 und 46,8 Token/Sekunde auf M5 Max. Auf einer RTX 4090 verbraucht es nur 0,714 m Wh/Token und ist damit 40 % energieeffizienter als ein 8B-Modell, das in Vollpräzision läuft.

Wichtige Entitäten: Unternehmen: Qwen, NVIDIA, Cline