Presentamos Beam, el primer modelo de peso abierto de Reflection. Beam es un modelo de mezcla de expertos dispersa con 501 mil millones de parámetros totales y 23 mil millones activos, construido para cargas de trabajo de codificación, razonamiento y agénticas. Las capacidades de Beam provienen de grandes inversiones tanto en preentrenamiento como en aprendizaje por refuerzo (RL). Preentrenamos el modelo en 23.8 billones de tokens diversos, curados y de alta calidad de la web y conjuntos de datos propietarios con licencia, igualando o superando los modelos base abiertos de tamaño similar disponibles. En paralelo, desarrollamos los algoritmos, entornos de entrenamiento e infraestructura necesarios para sostener RL de alta computación a escala excepcional.
Nuestra ejecución de RL de alta computación generó más de 100 millones de rollouts en 10.5K GPU NVIDIA GB300 durante 4 semanas de entrenamiento. Juntos, estos esfuerzos produjeron un rendimiento competitivo de peso abierto con eficiencia de cómputo de inferencia de frontera. Beam está en fase final de red-teaming y evaluaciones. Publicaremos los pesos, el informe técnico, la tarjeta del modelo y los artefactos de desarrollador a finales de este mes.
Beam avanza la frontera de peso abierto occidental y es competitivo con modelos abiertos más grandes como GLM 5.2 y se acerca a Qwen 3.8-Max en tareas de codificación y agénticas. Beam combina capacidades de codificación y agénticas con razonamiento altamente eficiente. En benchmarks de razonamiento avanzado, logra puntuaciones comparables a GLM-5.2 usando 3–4× menos cómputo de inferencia. Estos resultados se traducen en más inteligencia por token, ofreciendo capacidades de modelo sólidas a menor costo, haciendo de Beam un modelo de trabajo potente para cargas de trabajo empresariales de codificación y agénticas.
Fuente: Hacker News · Resumido por HeadlinesBriefing