HeadlinesBriefing favicon HeadlinesBriefing.com

Bonsai 2 27B: 9x ছোট, 98.2% সক্ষম

Hacker News •
×

দুই মাস আগে, আমরা আমাদের প্রথম Bonsai 27B মডেল প্রকাশ করেছিলাম এবং দেখিয়েছিলাম যে একটি 27B-শ্রেণির মাল্টিমোডাল মডেল স্থানীয় ডিভাইসে দক্ষতার সাথে চালানোর জন্য যথেষ্ট সংকুচিত করা যায়। আজ, আমরা Ternary Bonsai 2 27B প্রকাশ করছি, যা এখন পর্যন্ত আমাদের সবচেয়ে সক্ষম মডেল। Qwen3.8 27B-এর উপর ভিত্তি করে, এটি শক্তিশালী যুক্তি, কোডিং, দৃষ্টি এবং এজেন্টিক সক্ষমতা নিয়ে আসে, একই সাথে নাটকীয়ভাবে ছোট মেমরি ফুটপ্রিন্ট, উচ্চ স্থানীয় থ্রুপুট এবং উন্নত শক্তি দক্ষতা বজায় রাখে।

Ternary Bonsai 2 27B FP16 গ্রুপ-ভিত্তিক স্কেলিং সহ টার্নারি {−1, 0, +1} ওয়েট ব্যবহার করে, প্রতি ওয়েটে 1.76 কার্যকর বিট এবং মোট মডেল ফুটপ্রিন্ট 5.9GB। এটি 262K-টোকেন কনটেক্সট উইন্ডো, মাল্টিমোডাল টেক্সট-এবং-ইমেজ ইনপুট সমর্থন করে এবং Apache 2.0 লাইসেন্সের অধীনে প্রকাশিত। এর পূর্ণ-নির্ভুলতার সমতুল্যের তুলনায়, এটি 9 গুণেরও বেশি ছোট যখন সামগ্রিক বেঞ্চমার্ক পারফরম্যান্সের 98.2% ধরে রাখে। এই স্তরের ধারণে, কম্প্রেশন একটি ডিপ্লয়মেন্ট আনলক হয়ে ওঠে: প্রায় একই সক্ষমতা, এমন একটি ফুটপ্রিন্টে যা অনেক বেশি জায়গায় চলতে পারে।

যুক্তি, গণিত, কোডিং, নির্দেশ অনুসরণ, দৃষ্টি এবং এজেন্টিক টুল ব্যবহার জুড়ে বিস্তৃত একটি বেঞ্চমার্ক স্যুটে, Ternary Bonsai 2 27B 83.9 স্কোর করে, Qwen3.8 27B-এর সামগ্রিক পারফরম্যান্সের 98.2% ধরে রাখে। মূল ফলাফল কেবল সামগ্রিক স্কোর নয়, বরং সক্ষমতা কোথায় ধরে রাখা হয়। কোডিং এজেন্ট, টুল-ব্যবহার সিস্টেম, মাল্টিমোডাল ওয়ার্কফ্লো এবং দীর্ঘ-দিগন্তের কাজগুলি মডেল অবক্ষয়ের প্রতি বিশেষভাবে সংবেদনশীল কারণ ছোট ত্রুটিগুলি অনেক ধাপে জমা হতে পারে। Bonsai 2 27B ঠিক এই ক্ষেত্রগুলিতে পূর্ণ-নির্ভুলতা মডেলের পারফরম্যান্সের অনেকটা ধরে রাখে যখন মেমরি ফুটপ্রিন্টের একটি ভগ্নাংশে কাজ করে।

Ternary Bonsai 2 27B NVIDIA Ge Force RTX 5090-এ 143 টোকেন/সেকেন্ড পর্যন্ত এবং M5 Max-এ 46.8 টোকেন/সেকেন্ড পর্যন্ত পৌঁছায়। একটি RTX 4090-এ, এটি মাত্র 0.714 m Wh/টোকেন খরচ করে, যা এটিকে পূর্ণ-নির্ভুলতায় চলমান একটি 8B মডেলের চেয়ে 40% বেশি শক্তি-দক্ষ করে তোলে।

মূল সত্তা: কোম্পানি: Qwen, NVIDIA, Cline