Nous présentons Beam, le premier modèle open-weight de Reflection. Beam est un modèle de mélange d'experts épars avec 501 milliards de paramètres totaux et 23 milliards actifs, conçu pour les charges de travail de codage, de raisonnement et agentiques. Les capacités de Beam proviennent d'investissements majeurs dans le pré-entraînement et l'apprentissage par renforcement (RL). Nous avons pré-entraîné le modèle sur 23,8 billions de jetons diversifiés, organisés et de haute qualité provenant du web et de jeux de données propriétaires sous licence, égalant ou surpassant les modèles de base ouverts de taille similaire disponibles. En parallèle, nous avons développé les algorithmes, les environnements d'entraînement et l'infrastructure nécessaires pour soutenir un RL à haute computation à une échelle exceptionnelle.
Notre exécution de RL à haute computation a généré plus de 100 millions de déploiements sur 10,5K GPU NVIDIA GB300 pendant 4 semaines d'entraînement. Ensemble, ces efforts ont produit des performances open-weight compétitives avec une efficacité de calcul d'inférence de pointe. Beam subit actuellement des tests de red team et des évaluations finales. Nous publierons les poids, le rapport technique, la fiche modèle et les artefacts développeur plus tard ce mois-ci.
Beam fait progresser la frontière open-weight occidentale et est compétitif avec des modèles ouverts plus grands comme GLM 5.2 et se rapproche de Qwen 3.8-Max sur les tâches de codage et agentiques. Beam associe capacités de codage et agentiques à un raisonnement très efficace. Sur les benchmarks de raisonnement avancé, il atteint des scores comparables à GLM-5.2 tout en utilisant 3 à 4 fois moins de calcul d'inférence. Ces résultats se traduisent par plus d'intelligence par jeton, offrant des capacités de modèle solides à moindre coût, faisant de Beam un modèle de travail puissant pour les charges de travail de codage et agentiques en entreprise.
Source: Hacker News · Résumé par HeadlinesBriefing