HeadlinesBriefing HeadlinesBriefing.com

Beam: Reflection का 501B ओपन-वेट मॉडल

Hacker News •
×

हम Beam पेश कर रहे हैं, जो Reflection का पहला ओपन-वेट मॉडल है। Beam एक स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स मॉडल है जिसमें 501 बिलियन कुल पैरामीटर और 23 बिलियन सक्रिय हैं, जो कोडिंग, तर्क और एजेंटिक कार्यभार के लिए बनाया गया है। Beam की क्षमताएं प्रीट्रेनिंग और रीइन्फोर्समेंट लर्निंग (RL) दोनों में बड़े निवेश से आती हैं। हमने मॉडल को वेब और स्वामित्व लाइसेंस प्राप्त डेटासेट से 23.8 ट्रिलियन विविध, क्यूरेटेड, उच्च-गुणवत्ता वाले टोकन पर प्रीट्रेन किया, जो उपलब्ध समान आकार के ओपन बेस मॉडल से मेल खाता या बेहतर है। समानांतर में, हमने उच्च-कंप्यूट RL को असाधारण पैमाने पर बनाए रखने के लिए आवश्यक एल्गोरिदम, प्रशिक्षण वातावरण और बुनियादी ढांचा विकसित किया।

हमारे उच्च-कंप्यूट RL रन ने 10.5K NVIDIA GB300 GPU पर 4 सप्ताह के प्रशिक्षण में 100 मिलियन से अधिक रोलआउट उत्पन्न किए। साथ में, इन प्रयासों ने फ्रंटियर इन्फ्रेंस कंप्यूट दक्षता के साथ प्रतिस्पर्धी ओपन-वेट प्रदर्शन उत्पन्न किया। Beam अंतिम रेड-टीमिंग और मूल्यांकन से गुजर रहा है। हम इस महीने के अंत में वेट, तकनीकी रिपोर्ट, मॉडल कार्ड और डेवलपर आर्टिफैक्ट जारी करेंगे।

Beam पश्चिमी ओपन-वेट फ्रंटियर को आगे बढ़ाता है और कोडिंग और एजेंटिक कार्यों में GLM 5.2 जैसे बड़े ओपन मॉडल के साथ प्रतिस्पर्धी है और Qwen 3.8-Max के करीब पहुंच रहा है। Beam कोडिंग और एजेंटिक क्षमताओं को अत्यधिक कुशल तर्क के साथ जोड़ता है। उन्नत तर्क बेंचमार्क पर, यह 3–4× कम इन्फ्रेंस कंप्यूट का उपयोग करके GLM-5.2 के बराबर स्कोर प्राप्त करता है। ये परिणाम प्रति टोकन अधिक बुद्धिमत्ता में अनुवादित होते हैं, कम लागत पर मजबूत मॉडल क्षमताएं प्रदान करते हैं, जिससे Beam उद्यम कोडिंग और एजेंटिक कार्यभार के लिए एक शक्तिशाली वर्कहॉर्स मॉडल बन जाता है।

स्रोत: Hacker News · HeadlinesBriefing द्वारा सारांशित