HeadlinesBriefing favicon HeadlinesBriefing.com

Bonsai 2 27B: 9x छोटा, 98.2% सक्षम

Hacker News •
×

दो महीने पहले, हमने अपने पहले Bonsai 27B मॉडल जारी किए और दिखाया कि 27B-श्रेणी का मल्टीमॉडल मॉडल स्थानीय डिवाइस पर कुशलता से चलाने के लिए पर्याप्त रूप से संपीड़ित किया जा सकता है। आज, हम Ternary Bonsai 2 27B जारी कर रहे हैं, जो अब तक का हमारा सबसे सक्षम मॉडल है। Qwen3.8 27B पर आधारित, यह मजबूत तर्क, कोडिंग, दृष्टि और एजेंटिक क्षमता लाता है, साथ ही नाटकीय रूप से छोटे मेमोरी फुटप्रिंट, उच्च स्थानीय थ्रूपुट और बेहतर ऊर्जा दक्षता बनाए रखता है।

Ternary Bonsai 2 27B FP16 समूह-वार स्केलिंग के साथ टर्नरी {−1, 0, +1} भार का उपयोग करता है, प्रति भार 1.76 प्रभावी बिट और कुल मॉडल फुटप्रिंट 5.9GB के लिए। यह 262K-टोकन संदर्भ विंडो, मल्टीमॉडल टेक्स्ट-और-इमेज इनपुट का समर्थन करता है, और Apache 2.0 लाइसेंस के तहत जारी किया गया है। अपने पूर्ण-सटीक समकक्ष की तुलना में, यह 9 गुना से अधिक छोटा है जबकि समग्र बेंचमार्क प्रदर्शन का 98.2% बनाए रखता है। इस स्तर के प्रतिधारण पर, संपीड़न एक तैनाती अनलॉक बन जाता है: लगभग समान क्षमता, एक फुटप्रिंट में जो बहुत अधिक स्थानों पर चल सकता है।

तर्क, गणित, कोडिंग, निर्देश अनुसरण, दृष्टि और एजेंटिक टूल उपयोग तक फैली बेंचमार्क सूट में, Ternary Bonsai 2 27B 83.9 स्कोर करता है, Qwen3.8 27B के समग्र प्रदर्शन का 98.2% बनाए रखता है। मुख्य परिणाम केवल समग्र स्कोर नहीं है, बल्कि यह है कि क्षमता कहाँ बनाए रखी जाती है। कोडिंग एजेंट, टूल-उपयोग प्रणाली, मल्टीमॉडल वर्कफ़्लो और लंबी-क्षितिज कार्य मॉडल गिरावट के प्रति विशेष रूप से संवेदनशील हैं क्योंकि छोटी त्रुटियाँ कई चरणों में संचित हो सकती हैं। Bonsai 2 27B ठीक इन क्षेत्रों में पूर्ण-सटीक मॉडल के प्रदर्शन का अधिकांश हिस्सा बनाए रखता है, जबकि मेमोरी फुटप्रिंट के एक अंश पर संचालित होता है।

Ternary Bonsai 2 27B NVIDIA Ge Force RTX 5090 पर 143 टोकन/सेकंड तक और M5 Max पर 46.8 टोकन/सेकंड तक पहुँचता है। RTX 4090 पर, यह केवल 0.714 m Wh/टोकन की खपत करता है, जिससे यह पूर्ण-सटीक में चलने वाले 8B मॉडल की तुलना में 40% अधिक ऊर्जा-कुशल हो जाता है।

मुख्य संस्थाएँ: कंपनियाँ: Qwen, NVIDIA, Cline