HeadlinesBriefing favicon HeadlinesBriefing.com

Terminal-Bench-Science: Referencia de Agentes de IA para Investigación

Hacker News •
×

Terminal-Bench-Science es una referencia liderada por investigadores de la Universidad de Stanford que evalúa agentes de IA en flujos de trabajo extraídos de la investigación científica real. Construido por el equipo detrás de Terminal-Bench en colaboración con expertos de dominio en diversas disciplinas científicas, mide las capacidades de los agentes de IA mediante flujos de trabajo curados por expertos en lugar de ejercicios de libro de texto.

La primera versión incluye 70 tareas que abarcan ciencias de la vida, físicas, de la Tierra, matemáticas e ingenieriles. El modelo más fuerte evaluado, Claude Opus 5, logra una tasa de resolución del 30% en Terminal-Bench-Science 0.1. Otros modelos como GPT-5.6 Sol Codex y Claude Fable 5 alcanzan el 22.4% y el 21.4%, respectivamente.

La referencia está diseñada para ser continua, evolucionando junto con la IA de frontera mediante lanzamientos regulares donde los científicos contribuyen con nuevos flujos de trabajo y mejoran las tareas existentes. Esto crea un bucle de retroalimentación entre las necesidades científicas y el desarrollo de IA. El objetivo es impulsar el desarrollo de agentes que sirvan como asistentes de investigación útiles, ejecutando flujos de trabajo técnicamente exigentes y liberando a los científicos para que se enfoquen en definir preguntas de investigación, formular hipótesis e interpretar resultados.

Terminal-Bench-Science evalúa agentes en entornos realistas, calificando artefactos concretos como análisis, simulaciones, pruebas y código con pruebas específicas de tarea reproducibles, proporcionando evidencia verificable de capacidad científica.

Entidades clave: Empresas: Claude Opus 5, GPT-5.6 Sol Codex, Claude Fable 5, Claude Opus 4.8, GPT-5.6 Terra Codex, GLM 5.3, Kimi K3, Grok 4.6, GPT-5.6 Luna Codex | Ubicaciones: Universidad de Stanford

Preguntas frecuentes: ¿Qué es Terminal-Bench-Science y cómo evalúa los agentes de IA?

Terminal-Bench-Science es una referencia continua liderada por investigadores de la Universidad de Stanford que evalúa agentes de IA en 70 flujos de trabajo científicos curados por expertos en múltiples disciplinas, calificando artefactos concretos con pruebas reproducibles específicas de tarea para proporcionar evidencia verificable de capacidad.