我们推出 Beam,这是 Reflection 的首个开放权重模型。Beam 是一个稀疏混合专家模型,总参数达 5010 亿,活跃参数 230 亿,专为编码、推理和智能体任务而构建。Beam 的能力源于我们在预训练和强化学习(RL)方面的大量投入。我们在 23.8 万亿 个多样化、精选、高质量的 token 上预训练了该模型,这些 token 来自网络和专有许可数据集,匹配或超越了现有类似规模的开源基础模型。与此同时,我们开发了算法、训练环境和基础设施,以支持超大规模的高计算强化学习。
我们的高计算 RL 运行在 10.5K NVIDIA GB300 GPU 上生成了超过 1 亿 次 rollout,训练时长 4 周。这些努力共同产生了具有竞争力的开放权重性能,并具备前沿的推理计算效率。Beam 正在进行最终的红队测试和评估。我们将在本月晚些时候发布权重、技术报告、模型卡和开发者工件。
Beam 推进了西方开放权重的前沿,在编码和智能体任务上与 GLM 5.2 等更大的开放模型竞争,并接近 Qwen 3.8-Max。Beam 将编码和智能体能力与高效推理相结合。在高级推理基准上,它达到了与 GLM-5.2 相当的成绩,同时推理计算量减少 3–4 倍。这些结果转化为每个 token 更高的智能,以更低成本提供强大的模型能力,使 Beam 成为企业编码和智能体工作负载的强大主力模型。
来源: Hacker News · 由HeadlinesBriefing整理摘要