HeadlinesBriefing favicon HeadlinesBriefing.com

ターミナルベンチサイエンス: 研究のためのAIエージェントベンチマーク

Hacker News •
×

ターミナルベンチサイエンスは、スタンフォード大学の研究者によって主導されるベンチマークで、実際の科学研究から導き出されたワークフローでAIエージェントを評価します。ターミナルベンチチームによって構築され、さまざまな科学分野のドメインエキスパートと協力して、教科書の演習ではなく専門家がキュレートしたワークフローを使用してAIエージェントの能力を測定します。

最初のリリースには、生命、物理、地球、数学、工学の科学にわたる70タスクが含まれます。評価された中で最も強力なモデル、Claude Opus 5は、ターミナルベンチサイエンス 0.1で30%の解決率を達成します。他のモデルであるGPT-5.6 Sol CodexとClaude Fable 5はそれぞれ22.4%と21.4%を達成します。

このベンチマークは継続的であり、フロンティアAIとともに定期的なリリースを通じて進化するように設計されています。科学者が新しいワークフローを提供し、既存のタスクを改善することで、科学のニーズとAI開発の間にフィードバックループが生じます。目標は、技術的に要求の高いワークフローを実行し、科学者が研究質問の定義、仮説の形成、結果の解釈に集中できるようにする有用な研究アシスタントとして機能するエージェントの開発を促進することです。

ターミナルベンチサイエンスは、現実的な環境でエージェントを評価し、分析、シミュレーション、証明、コードなどの具体的な成果物をタスク固有の再現可能なテストで採点し、科学的能力の検証可能な証拠を提供します。

主要なエンティティ: 企業: Claude Opus 5, GPT-5.6 Sol Codex, Claude Fable 5, Claude Opus 4.8, GPT-5.6 Terra Codex, GLM 5.3, Kimi K3, Grok 4.6, GPT-5.6 Luna Codex | 場所: スタンフォード大学

よくある質問: ターミナルベンチサイエンスとは何か、そしてどのようにAIエージェントを評価するのか?

ターミナルベンチサイエンスは、スタンフォード大学の研究者によって主導される継続的なベンチマークで、複数の分野にわたる70の専門家がキュレートした科学的ワークフローでAIエージェントを評価し、タスク固有の再現可能なテストで具体的な成果物を採点して能力の検証可能な証拠を提供します。