Kami memperkenalkan Beam, model open-weight pertama dari Reflection. Beam adalah model Mixture-of-Experts yang jarang dengan 501 miliar total parameter dan 23 miliar aktif, dibangun untuk beban kerja coding, penalaran, dan agen. Kemampuan Beam berasal dari investasi besar dalam pra-pelatihan dan pembelajaran penguatan (RL). Kami melatih model pada 23,8 triliun token yang beragam, dikurasi, dan berkualitas tinggi dari web dan dataset berlisensi proprietary, menyamai atau melampaui model dasar terbuka serupa yang tersedia. Secara paralel, kami mengembangkan algoritma, lingkungan pelatihan, dan infrastruktur yang diperlukan untuk mendukung RL komputasi tinggi pada skala luar biasa.
Jalankan RL komputasi tinggi kami menghasilkan lebih dari 100 juta rollout pada 10,5K NVIDIA GB300 GPU selama 4 minggu pelatihan. Bersama-sama, upaya ini menghasilkan kinerja open-weight yang kompetitif dengan efisiensi komputasi inferensi mutakhir. Beam sedang menjalani red-teaming dan evaluasi akhir. Kami akan merilis bobot, laporan teknis, kartu model, dan artefak pengembang akhir bulan ini.
Beam memajukan batas open-weight Barat dan kompetitif dengan model terbuka yang lebih besar seperti GLM 5.2 dan mendekati Qwen 3.8-Max pada tugas coding dan agen. Beam menggabungkan kemampuan coding dan agen dengan penalaran yang sangat efisien. Pada benchmark penalaran lanjutan, ia mencapai skor sebanding dengan GLM-5.2 sambil menggunakan 3–4× lebih sedikit komputasi inferensi. Hasil ini menghasilkan lebih banyak kecerdasan per token, memberikan kemampuan model yang kuat dengan biaya lebih rendah, menjadikan Beam model pekerja keras yang kuat untuk beban kerja coding dan agen perusahaan.
Sumber: Hacker News · Diringkas oleh HeadlinesBriefing