HeadlinesBriefing favicon HeadlinesBriefing.com

Bonsai 2 27B: 9x más pequeño, 98.2% capaz

Hacker News •
×

Hace dos meses, lanzamos nuestros primeros modelos Bonsai 27B y demostramos que un modelo multimodal de clase 27B podía comprimirse lo suficiente para ejecutarse eficientemente en un dispositivo local. Hoy lanzamos Ternary Bonsai 2 27B, nuestro modelo más capaz hasta la fecha. Basado en Qwen3.8 27B, aporta un razonamiento, codificación, visión y capacidad agéntica más fuertes, a la vez que conserva una huella de memoria drásticamente menor, un alto rendimiento local y una mejor eficiencia energética.

Ternary Bonsai 2 27B utiliza pesos ternarios {−1, 0, +1} con escalado por grupos en FP16, para 1.76 bits efectivos por peso y una huella total del modelo de 5.9GB. Admite una ventana de contexto de 262K tokens, entrada multimodal de texto e imagen, y se publica bajo la licencia Apache 2.0. Frente a su contraparte de precisión completa, es más de 9 veces más pequeño mientras retiene el 98.2% del rendimiento agregado en benchmarks. En este nivel de retención, la compresión se convierte en un desbloqueo de despliegue: casi la misma capacidad, en una huella que puede ejecutarse en muchos más lugares.

En una suite de benchmarks que abarca razonamiento, matemáticas, codificación, seguimiento de instrucciones, visión y uso de herramientas agénticas, Ternary Bonsai 2 27B obtiene 83.9, reteniendo el 98.2% del rendimiento agregado de Qwen3.8 27B. El resultado clave no es solo la puntuación agregada, sino dónde se retiene la capacidad. Los agentes de codificación, los sistemas de uso de herramientas, los flujos de trabajo multimodales y las tareas de largo horizonte son particularmente sensibles a la degradación del modelo porque los pequeños errores pueden acumularse a lo largo de muchos pasos. Bonsai 2 27B conserva gran parte del rendimiento del modelo de precisión completa exactamente en estas áreas mientras opera con una fracción de la huella de memoria.

Ternary Bonsai 2 27B alcanza hasta 143 tokens/segundo en NVIDIA Ge Force RTX 5090 y 46.8 tokens/segundo en M5 Max. En una RTX 4090, consume solo 0.714 m Wh/token, lo que lo hace un 40% más eficiente energéticamente que un modelo 8B ejecutándose en precisión completa.

Entidades clave: Empresas: Qwen, NVIDIA, Cline