Reflection 初のオープンウェイトモデルである Beam を紹介します。Beam はスパース混合エキスパートモデルで、総パラメータ 5010 億、アクティブ 230 億 を持ち、コーディング、推論、エージェントワークロード向けに構築されています。Beam の能力は、事前学習と強化学習(RL)の両方への大規模な投資によるものです。ウェブとプロプライエタリなライセンスデータセットから 23.8 兆 の多様で厳選された高品質トークンでモデルを事前学習し、利用可能な同規模のオープンベースモデルに匹敵またはそれを上回りました。並行して、高計算 RL を例外的な規模で持続させるために必要なアルゴリズム、トレーニング環境、インフラストラクチャを開発しました。
当社の高計算 RL ランは、10.5K NVIDIA GB300 GPU で 4 週間のトレーニング中に 1 億 以上のロールアウトを生成しました。これらの取り組みにより、フロンティアの推論計算効率を備えた競争力のあるオープンウェイトパフォーマンスが実現しました。Beam は現在、最終的なレッドチーミングと評価を受けています。ウェイト、テクニカルレポート、モデルカード、開発者向けアーティファクトは今月下旬にリリースします。
Beam は西洋のオープンウェイトフロンティアを前進させ、コーディングおよびエージェントタスクにおいて GLM 5.2 などのより大きなオープンモデルと競争力があり、Qwen 3.8-Max に近づいています。Beam はコーディングとエージェント機能を高効率な推論と組み合わせています。高度な推論ベンチマークでは、GLM-5.2 に匹敵するスコアを達成しつつ、推論計算を 3〜4 倍削減します。これらの結果は、トークンあたりのインテリジェンス向上につながり、低コストで強力なモデル機能を提供し、Beam をエンタープライズのコーディングおよびエージェントワークロードのための強力なワークホースモデルにしています。
出典: Hacker News · 要約:HeadlinesBriefing