HeadlinesBriefing favicon HeadlinesBriefing.com

Real-SWE:プライベートコードベースのAI性能

Hacker News •
×

2026年9月のReal-SWEベンチマーキングは、プライベートな実世界の企業コードベースで最先端AIモデルを評価します。各タスクは実在企業からライセンス供与されたプライベートな本番コードベースに由来し、エンジニアに専有システムとビジネス上重要な問題をもたらします。結果は主要モデル間で大きなパフォーマンス差を明らかにしており、Claude Codeが38.8%で最高解像度率を達成し、次いでGPT-6 Astra Codex CLIが33.8%、Gemini 3.8 Flashが31.2%でした。この評価はモデルとハーネスの組み合わせを測定し、エージェントに専有規約をナビゲートし、複数のサービスにまたがるビジネス運用に影響する変更を実装することを求めます。実在企業のタスクには固有のコンテキストが必要であり、例えば正確な請求はビジネスルールと外部税務サービスに依存します。タスクには、各ビジネスが正しい税金を課金しつつ、免税顧客には課税しないよう、請求書の請求を修正することが含まれます。このベンチマークは、専門家が生成したタスクや合成的タスクが実際のエンジニアの仕事とは異なることを浮き彫りにします。基盤となるコーディング成果物と指示の具体性の両方が複雑さを加え、今日の最先端モデルに挑戦を突きつけるからです。