HeadlinesBriefing favicon HeadlinesBriefing.com

Bonsai 2 27B:缩小9倍,能力保留98.2%

Hacker News •
×

两个月前,我们发布了首批Bonsai 27B模型,并展示了27B级多模态模型可以被压缩到足以在本地设备上高效运行的程度。今天,我们发布Ternary Bonsai 2 27B,这是我们迄今为止能力最强的模型。它基于Qwen3.8 27B,带来更强的推理、编码、视觉和智能体能力,同时保持大幅缩小的内存占用、高本地吞吐量和更优的能效。

Ternary Bonsai 2 27B采用三值{−1, 0, +1}权重与FP16分组缩放,实现每权重1.76有效比特,模型总占用为5.9GB。它支持262K token上下文窗口、多模态文本与图像输入,并以Apache 2.0许可证发布。与其全精度对应版本相比,它的体积缩小超过9倍,同时保留98.2%的综合基准性能。在这一保留水平下,压缩成为部署的解锁点:几乎相同的能力,却能在更多地方运行。

在涵盖推理、数学、编码、指令遵循、视觉和智能体工具使用的基准测试套件中,Ternary Bonsai 2 27B得分83.9,保留了Qwen3.8 27B综合性能的98.2%。关键结果不仅是综合得分,更在于能力保留的位置。编码智能体、工具使用系统、多模态工作流和长时程任务对模型退化尤为敏感,因为小错误会在多步中累积。Bonsai 2 27B正是在这些领域保留了全精度模型的大部分性能,同时仅以极小部分的内存占用运行。

Ternary Bonsai 2 27B在NVIDIA Ge Force RTX 5090上达到最高143 tokens/秒,在M5 Max上达到46.8 tokens/秒。在RTX 4090上,它仅消耗0.714 m Wh/token,比全精度运行的8B模型能效高40%。

关键实体:公司:Qwen、NVIDIA、Cline

FAQ:什么是Ternary Bonsai 2 27B?

Ternary Bonsai 2 27B是基于Qwen3.8 27B的压缩27B级多模态模型,采用三值权重与FP16分组缩放,实现每权重1.76有效比特和5.9GB占用。它保留98.2%的全精度基准性能,并在Apache 2.0许可证下支持262K token上下文窗口。

FAQ Q:什么是Ternary Bonsai 2 27B?

FAQ A:Ternary Bonsai 2 27B是基于Qwen3.8 27B的压缩27B级多模态模型,采用三值权重与FP16分组缩放,实现每权重1.76有效比特和5.9GB占用。它保留98.2%的全精度基准性能,并在Apache 2.0许可证下支持262K token上下文窗口。