HeadlinesBriefing favicon HeadlinesBriefing.com

终端基准科学:AI代理科研基准

Hacker News •
×

终端基准科学是由斯坦福大学研究人员领导的基准测试,用于评估AI代理在源自真实科学研究的工作流上的能力。由终端基准团队与各科学领域的领域专家合作构建,它通过专家策划的工作流而非教材练习来衡量AI代理的能力。

首个版本包含70个任务,覆盖生命、物理、地球、数学和工程科学。评估中表现最强的模型Claude Opus 5在终端基准科学0.1版上达到30%的解决率。其他模型如GPT-5.6 Sol Codex和Claude Fable 5分别达到22.4%和21.4%。

该基准旨在持续演进,随着前沿AI通过定期发布而发展,科学家贡献新工作流并改进现有任务。这在科学需求和AI发展之间形成了反馈循环。目标是推动代理的发展,使其成为有用的研究助手,执行技术要求高的工作流,从而让科学家专注于定义研究问题、形成假设和解释结果。

终端基准科学在真实环境中评估代理,对诸如分析、模拟、证明和代码等具体成果进行评分,使用可重复的特定任务测试,提供科学能力的可验证证据。

关键实体:公司:Claude Opus 5,GPT-5.6 Sol Codex,Claude Fable 5,Claude Opus 4.8,GPT-5.6 Terra Codex,GLM 5.3,Kimi K3,Grok 4.6,GPT-5.6 Luna Codex | 地点:斯坦福大学

常见问题:什么是终端基准科学以及它如何评估AI代理?

终端基准科学是由斯坦福大学研究人员领导的持续基准测试,评估AI代理在多个学科的70个专家策划的科学工作流上的能力,通过可重复的特定任务测试对具体成果进行评分,以提供能力的可验证证据。