HeadlinesBriefing favicon HeadlinesBriefing.com

Terminal-Bench-Science: Benchmark de Agentes de IA para Pesquisa

Hacker News •
×

Terminal-Bench-Science é um benchmark liderado por pesquisadores da Universidade de Stanford que avalia agentes de IA em fluxos de trabalho derivados da pesquisa científica real. Construído pela equipe por trás do Terminal-Bench em colaboração com especialistas de domínio em diversas disciplinas científicas, ele mede as capacidades dos agentes de IA por meio de fluxos de trabalho curados por especialistas em vez de exercícios de livro didático.

A primeira versão inclui 70 tarefas abrangendo ciências da vida, físicas, da Terra, matemáticas e de engenharia. O modelo mais forte avaliado, Claude Opus 5, alcança uma taxa de resolução de 30% no Terminal-Bench-Science 0.1. Outros modelos como GPT-5.6 Sol Codex e Claude Fable 5 atingem 22,4% e 21,4%, respectivamente.

O benchmark foi projetado para ser contínuo, evoluindo junto com a IA de fronteira por meio de lançamentos regulares onde os cientistas contribuem com novos fluxos de trabalho e melhoram as tarefas existentes. Isso cria um ciclo de feedback entre as necessidades científicas e o desenvolvimento de IA. O objetivo é impulsionar o desenvolvimento de agentes que sirvam como assistentes de pesquisa úteis, executando fluxos de trabalho tecnicamente exigentes e libertando os cientistas para se concentrarem na definição de perguntas de pesquisa, formulação de hipóteses e interpretação dos resultados.

Terminal-Bench-Science avalia agentes em ambientes realistas, classificando artefatos concretos como análises, simulações, provas e código com testes específicos de tarefa reproduzíveis, fornecendo evidência verificável de capacidade científica.

Entidades-chave: Empresas: Claude Opus 5, GPT-5.6 Sol Codex, Claude Fable 5, Claude Opus 4.8, GPT-5.6 Terra Codex, GLM 5.3, Kimi K3, Grok 4.6, GPT-5.6 Luna Codex | Locais: Universidade de Stanford

Perguntas frequentes: O que é Terminal-Bench-Science e como ele avalia os agentes de IA?

Terminal-Bench-Science é um benchmark contínuo liderado por pesquisadores da Universidade de Stanford que avalia agentes de IA em 70 fluxos de trabalho científicos curados por especialistas em várias disciplinas, classificando artefatos concretos com testes específicos de tarefa reproduzíveis para fornecer evidência verificável de capacidade.