আমরা Beam চালু করছি, যা Reflection-এর প্রথম ওপেন-ওয়েট মডেল। Beam একটি স্পার্স মিক্সচার-অফ-এক্সপার্টস মডেল যার মোট 501 বিলিয়ন প্যারামিটার এবং 23 বিলিয়ন সক্রিয়, যা কোডিং, যুক্তি এবং এজেন্টিক কাজের জন্য নির্মিত। Beam-এর ক্ষমতা প্রিট্রেনিং এবং রিইনফোর্সমেন্ট লার্নিং (RL) উভয় ক্ষেত্রে বড় বিনিয়োগ থেকে আসে। আমরা ওয়েব এবং মালিকানাধীন লাইসেন্সপ্রাপ্ত ডেটাসেট থেকে 23.8 ট্রিলিয়ন বৈচিত্র্যময়, কিউরেটেড, উচ্চ-মানের টোকেনে মডেলটি প্রিট্রেন করেছি, যা উপলব্ধ অনুরূপ আকারের ওপেন বেস মডেলের সাথে মেলে বা ছাড়িয়ে যায়। সমান্তরালে, আমরা উচ্চ-কম্পিউট RL টেকসই করার জন্য প্রয়োজনীয় অ্যালগরিদম, প্রশিক্ষণ পরিবেশ এবং অবকাঠামো তৈরি করেছি।
আমাদের উচ্চ-কম্পিউট RL রান 10.5K NVIDIA GB300 GPU-তে 4 সপ্তাহের প্রশিক্ষণে 100 মিলিয়নেরও বেশি রোলআউট তৈরি করেছে। একসাথে, এই প্রচেষ্টাগুলি ফ্রন্টিয়ার ইনফারেন্স কম্পিউট দক্ষতার সাথে প্রতিযোগিতামূলক ওপেন-ওয়েট পারফরম্যান্স তৈরি করেছে। Beam চূড়ান্ত রেড-টিমিং এবং মূল্যায়নের মধ্য দিয়ে যাচ্ছে। আমরা এই মাসের শেষে ওয়েট, টেকনিক্যাল রিপোর্ট, মডেল কার্ড এবং ডেভেলপার আর্টিফ্যাক্ট প্রকাশ করব।
Beam পশ্চিমা ওপেন-ওয়েট ফ্রন্টিয়ারকে এগিয়ে নিয়ে যায় এবং কোডিং এবং এজেন্টিক কাজে GLM 5.2-এর মতো বড় ওপেন মডেলের সাথে প্রতিযোগিতামূলক এবং Qwen 3.8-Max-এর কাছাকাছি। Beam কোডিং এবং এজেন্টিক ক্ষমতাকে অত্যন্ত দক্ষ যুক্তির সাথে যুক্ত করে। উন্নত যুক্তি বেঞ্চমার্কে, এটি 3–4× কম ইনফারেন্স কম্পিউট ব্যবহার করে GLM-5.2-এর সমান স্কোর অর্জন করে। এই ফলাফলগুলি প্রতি টোকেনে আরও বুদ্ধিমত্তায় রূপান্তরিত হয়, কম খরচে শক্তিশালী মডেল ক্ষমতা প্রদান করে, যা Beam-কে এন্টারপ্রাইজ কোডিং এবং এজেন্টিক কাজের জন্য একটি শক্তিশালী ওয়ার্কহর্স মডেল করে তোলে।
উৎস: Hacker News · সারাংশ: HeadlinesBriefing