HeadlinesBriefing favicon HeadlinesBriefing.com

Bonsai 2 27B: 9x lebih kecil, 98,2% mampu

Hacker News •
×

Dua bulan lalu, kami merilis model Bonsai 27B pertama kami dan menunjukkan bahwa model multimodal kelas 27B dapat dikompresi cukup untuk berjalan efisien di perangkat lokal. Hari ini, kami merilis Ternary Bonsai 2 27B, model kami yang paling mampu hingga saat ini. Berbasis Qwen3.8 27B, model ini menghadirkan penalaran, pengkodean, visi, dan kemampuan agen yang lebih kuat sambil mempertahankan jejak memori yang jauh lebih kecil, throughput lokal yang tinggi, dan efisiensi energi yang lebih baik.

Ternary Bonsai 2 27B menggunakan bobot ternari {−1, 0, +1} dengan penskalaan per grup FP16, untuk 1,76 bit efektif per bobot dan total jejak model 5,9GB. Model ini mendukung jendela konteks 262K token, input multimodal teks-dan-gambar, dan dirilis di bawah lisensi Apache 2.0. Dibandingkan dengan padanan presisi penuhnya, model ini lebih dari 9x lebih kecil sambil mempertahankan 98,2% performa benchmark agregat. Pada tingkat retensi ini, kompresi menjadi pembuka deployment: hampir kemampuan yang sama, dalam jejak yang dapat berjalan di jauh lebih banyak tempat.

Di seluruh rangkaian benchmark yang mencakup penalaran, matematika, pengkodean, mengikuti instruksi, visi, dan penggunaan alat agen, Ternary Bonsai 2 27B mencetak 83,9, mempertahankan 98,2% performa agregat Qwen3.8 27B. Hasil kuncinya bukan hanya skor agregat, tetapi di mana kemampuan dipertahankan. Agen pengkodean, sistem penggunaan alat, alur kerja multimodal, dan tugas berhorizon panjang sangat sensitif terhadap degradasi model karena kesalahan kecil dapat menumpuk selama banyak langkah. Bonsai 2 27B mempertahankan sebagian besar performa model presisi penuh tepat di area ini sambil beroperasi dengan sebagian kecil dari jejak memori.

Ternary Bonsai 2 27B mencapai hingga 143 token/detik pada NVIDIA Ge Force RTX 5090 dan 46,8 token/detik pada M5 Max. Pada RTX 4090, model ini hanya mengonsumsi 0,714 m Wh/token, membuatnya 40% lebih hemat energi daripada model 8B yang berjalan dalam presisi penuh.

Entitas Utama: Perusahaan: Qwen, NVIDIA, Cline