Estamos apresentando o Beam, o primeiro modelo de peso aberto da Reflection. Beam é um modelo de mistura de especialistas esparsa com 501 bilhões de parâmetros totais e 23 bilhões ativos, construído para cargas de trabalho de codificação, raciocínio e agênticas. As capacidades do Beam vêm de grandes investimentos tanto em pré-treinamento quanto em aprendizado por reforço (RL). Pré-treinamos o modelo em 23,8 trilhões de tokens diversos, curados e de alta qualidade da web e conjuntos de dados proprietários licenciados, igualando ou superando modelos base abertos de tamanho semelhante disponíveis. Em paralelo, desenvolvemos os algoritmos, ambientes de treinamento e infraestrutura necessários para sustentar RL de alta computação em escala excepcional.
Nossa execução de RL de alta computação gerou mais de 100 milhões de rollouts em 10,5K GPUs NVIDIA GB300 durante 4 semanas de treinamento. Juntos, esses esforços produziram desempenho competitivo de peso aberto com eficiência de computação de inferência de fronteira. Beam está passando por red-teaming e avaliações finais. Publicaremos os pesos, relatório técnico, cartão do modelo e artefatos de desenvolvedor no final deste mês.
Beam avança a fronteira de peso aberto ocidental e é competitivo com modelos abertos maiores como GLM 5.2 e se aproximando do Qwen 3.8-Max em tarefas de codificação e agênticas. Beam combina capacidades de codificação e agênticas com raciocínio altamente eficiente. Em benchmarks de raciocínio avançado, alcança pontuações comparáveis ao GLM-5.2 usando 3–4× menos computação de inferência. Esses resultados se traduzem em mais inteligência por token, entregando capacidades de modelo fortes a menor custo, tornando o Beam um modelo de trabalho poderoso para cargas de trabalho empresariais de codificação e agênticas.
Fonte: Hacker News · Resumido por HeadlinesBriefing