HeadlinesBriefing favicon HeadlinesBriefing.com

Terminal-Bench-Science: KI-Agenten-Benchmark für Forschung

Hacker News •
×

Terminal-Bench-Science ist ein von Forschern der Stanford University geleiteter Benchmark, der KI-Agenten anhand von Workflows aus echter wissenschaftlicher Forschung bewertet. Erstellt vom Team hinter Terminal-Bench in Zusammenarbeit mit Fachexperten aus verschiedenen wissenschaftlichen Disziplinen, misst er die Fähigkeiten von KI-Agenten anhand von expert-kurierten Workflows statt Lehrbuchübungen.

Die erste Veröffentlichung umfasst 70 Aufgaben aus den Lebens-, Physik-, Erd-, Mathematik- und Ingenieurwissenschaften. Das stärkste evaluierte Modell, Claude Opus 5, erreicht eine Lösungsrate von 30% bei Terminal-Bench-Science 0.1. Andere Modelle wie GPT-5.6 Sol Codex und Claude Fable 5 erreichen jeweils 22,4% und 21,4%.

Der Benchmark ist darauf ausgelegt, kontinuierlich zu sein und sich gemeinsam mit der Frontier-KI durch regelmäßige Releases weiterzuentwickeln, bei denen Wissenschaftler neue Workflows beisteuern und bestehende Aufgaben verbessern. Dadurch entsteht ein Feedback-Loop zwischen wissenschaftlichen Anforderungen und KI-Entwicklung. Das Ziel besteht darin, die Entwicklung von Agenten voranzutreiben, die als nützliche Forschungsassistenten dienen, technisch anspruchsvolle Workflows ausführen und Wissenschaftler befreien, um sich auf die Formulierung von Forschungsfragen, die Bildung von Hypothesen und die Interpretation von Ergebnissen zu konzentrieren.

Terminal-Bench-Science bewertet Agenten in realistischen Umgebungen, indem konkrete Artefakte wie Analysen, Simulationen, Beweise und Code mit aufgaben-spezifischen, reproduzierbaren Tests bewertet werden, um verifizierbare Beweise für wissenschaftliche Fähigkeiten zu liefern.

Wichtige Entitäten: Unternehmen: Claude Opus 5, GPT-5.6 Sol Codex, Claude Fable 5, Claude Opus 4.8, GPT-5.6 Terra Codex, GLM 5.3, Kimi K3, Grok 4.6, GPT-5.6 Luna Codex | Orte: Stanford University

Häufig gestellte Fragen: Was ist Terminal-Bench-Science und wie bewertet es KI-Agenten?

Terminal-Bench-Science ist ein kontinuierlicher Benchmark, der von Forschern der Stanford University geleitet wird und KI-Agenten anhand von 70 expert-kurierten wissenschaftlichen Workflows in mehreren Disziplinen bewertet, indem konkrete Artefakte mit aufgaben-spezifischen, reproduzierbaren Tests bewertet werden, um verifizierbare Beweise für Fähigkeiten zu liefern.