HeadlinesBriefing favicon HeadlinesBriefing.com

Terminal-Bench-Science : Référentiel d'agents IA pour la recherche

Hacker News •
×

Terminal-Bench-Science est un référentiel dirigé par des chercheurs de l'Université de Stanford qui évalue les agents IA sur des flux de travail issus de la recherche scientifique réelle. Construit par l'équipe derrière Terminal-Bench en collaboration avec des experts de domaine dans diverses disciplines scientifiques, il mesure les capacités des agents IA grâce à des flux de travail curés par des experts plutôt qu'à des exercices de manuel.

La première version comprend 70 tâches couvrant les sciences de la vie, physiques, de la Terre, mathématiques et d'ingénierie. Le modèle le plus performant évalué, Claude Opus 5, atteint un taux de résolution de 30 % sur Terminal-Bench-Science 0.1. Les autres modèles comme GPT-5.6 Sol Codex et Claude Fable 5 obtiennent respectivement 22,4 % et 21,4 %.

Le référentiel est conçu pour être continu, évoluant aux côtés de l'IA de pointe grâce à des publications régulières où les scientifiques contribuent à de nouveaux flux de travail et améliorent les tâches existentes. Cela crée une boucle de rétroaction entre les besoins scientifiques et le développement de l'IA. L'objectif est de stimuler le développement d'agents qui servent d'assistants de recherche utiles, exécutant des flux de travail techniquement exigeants et libérant les scientifiques pour qu'ils se concentrent sur la définition des questions de recherche, la formulation d'hypothèses et l'interprétation des résultats.

Terminal-Bench-Science évalue les agents dans des environnements réalistes, en notant des artefacts concrets tels que des analyses, des simulations, des preuves et du code avec des tests spécifiques à la tâche reproductibles, fournissant ainsi une preuve vérifiable de capacité scientifique.

Entités clés : Entreprises : Claude Opus 5, GPT-5.6 Sol Codex, Claude Fable 5, Claude Opus 4.8, GPT-5.6 Terra Codex, GLM 5.3, Kimi K3, Grok 4.6, GPT-5.6 Luna Codex | Lieux : Université de Stanford

FAQ : Qu'est-ce que Terminal-Bench-Science et comment évalue-t-il les agents IA ?

Terminal-Bench-Science est un référentiel continu dirigé par des chercheurs de l'Université de Stanford qui évalue les agents IA sur 70 flux de travail scientifiques curés par des experts dans plusieurs disciplines, en notant des artefacts concrets avec des tests spécifiques à la tâche reproductibles pour fournir une preuve vérifiable de capacité.