HeadlinesBriefing favicon HeadlinesBriefing.com

Bonsai 2 27B:9倍小型、98.2%の能力

Hacker News •
×

2か月前、私たちは最初のBonsai 27Bモデルをリリースし、27Bクラスのマルチモーダルモデルがローカルデバイスで効率的に動作するのに十分なほど圧縮できることを示しました。本日、私たちはTernary Bonsai 2 27Bをリリースします。これはこれまでで最も能力の高いモデルです。Qwen3.8 27Bをベースに、より強力な推論、コーディング、視覚、エージェント能力をもたらしながら、劇的に小さなメモリフットプリント、高いローカルスループット、優れたエネルギー効率を維持します。

Ternary Bonsai 2 27Bは、FP16グループワイズスケーリングを備えた三値{−1, 0, +1}重みを使用し、重みあたり1.76実効ビット、モデル全体のフットプリントは5.9GBです。262Kトークンのコンテキストウィンドウ、マルチモーダルなテキストと画像の入力に対応し、Apache 2.0ライセンスの下でリリースされています。フル精度の対応モデルと比較して、9倍以上小さく、総合ベンチマーク性能の98.2%を維持しています。この維持レベルでは、圧縮が展開の鍵となります。ほぼ同じ能力を、はるかに多くの場所で実行できるフットプリントで実現します。

推論、数学、コーディング、指示追従、視覚、エージェントツール使用にわたるベンチマークスイート全体で、Ternary Bonsai 2 27Bは83.9を記録し、Qwen3.8 27Bの総合性能の98.2%を維持しています。重要な結果は総合スコアだけでなく、能力がどこで維持されるかです。コーディングエージェント、ツール使用システム、マルチモーダルワークフロー、長期的タスクは、小さなエラーが多くのステップで蓄積する可能性があるため、モデルの劣化に特に敏感です。Bonsai 2 27Bは、まさにこれらの領域でフル精度モデルの性能の多くを維持しながら、メモリフットプリントのほんの一部で動作します。

Ternary Bonsai 2 27Bは、NVIDIA Ge Force RTX 5090で最大143トークン/秒、M5 Maxで46.8トークン/秒に達します。RTX 4090では、わずか0.714 m Wh/トークンを消費し、フル精度で動作する8Bモデルよりも40%エネルギー効率が高くなります。

主要エンティティ:企業:Qwen、NVIDIA、Cline

FAQ:Ternary Bonsai 2 27Bとは何ですか?

Ternary Bonsai 2 27Bは、Qwen3.8 27Bをベースにした圧縮された27Bクラスのマルチモーダルモデルで、FP16グループワイズスケーリングを備えた三値重みを使用し、重みあたり1.76実効ビット、5.9GBのフットプリントを実現しています。フル精度のベンチマーク性能の98.2%を維持し、Apache 2.0ライセンスの下で262Kトークンのコンテキストウィンドウをサポートします。

FAQ Q:Ternary Bonsai 2 27Bとは何ですか?

FAQ A:Ternary Bonsai 2 27Bは、Qwen3.8 27Bをベースにした圧縮された27Bクラスのマルチモーダルモデルで、FP16グループワイズスケーリングを備えた三値重みを使用し、重みあたり1.76実効ビット、5.9GBのフットプリントを実現しています。フル精度のベンチマーク性能の98.2%を維持し、Apache 2.0ライセンスの下で262Kトークンのコンテキストウィンドウをサポートします。