HeadlinesBriefing favicon HeadlinesBriefing.com

Terminal-Bench-Science: Бенчмарк AI-агентов для исследований

Hacker News •
×

Terminal-Bench-Science — это бенчмарк, возглавляемый исследователями Стэнфордского университета, который оценивает AI-агентов на рабочих процессах, взятых из реальных научных исследований. Созданный командой detrás Terminal-Bench в сотрудничестве с экспертами в различных научных дисциплинах, он измеряет возможности AI-агентов с помощью экспертно curated рабочих процессов вместо учебных упражнений.

Первый релиз включает 70 задач, охватывающих биологические, физические, геонаучные, математические и инженерные науки. Наиболее сильная модель, оцененная в тесте, Claude Opus 5, достигает 30% уровня решения в Terminal-Bench-Science 0.1. Другие модели, такие как GPT-5.6 Sol Codex и Claude Fable 5, достигают 22,4% и 21,4% соответственно.

Бенчмарк спроектирован как непрерывный, развивающийся вместе с передовой ИИ через регулярные релизы, где учёные вносят новые рабочие процессы и улучшают существующие задачи. Это создает обратную связь между научными потребностями и развитием ИИ. Цель состоит в том, чтобы стимулировать развитие агентов, которые будут служить полезными исследовательскими помощниками, выполнять технически сложные рабочие процессы и освобождать учёных для сосредоточения на формулировании исследовательских вопросов, построении гипотез и интерпретации результатов.

Terminal-Bench-Science оценивает агентов в реалистичных условиях, оценивая конкретные артефакты, такие как анализы, симуляции, доказательства и код, с использованием воспроизводимых тестов, специфичных для задачи, предоставляя проверяемое доказательство научной способности.

Ключевые сущности: Компании: Claude Opus 5, GPT-5.6 Sol Codex, Claude Fable 5, Claude Opus 4.8, GPT-5.6 Terra Codex, GLM 5.3, Kimi K3, Grok 4.6, GPT-5.6 Luna Codex | Местоположения: Стэнфордский университет

Часто задаваемые вопросы: Что такое Terminal-Bench-Science и как он оценивает AI-агентов?

Terminal-Bench-Science — это непрерывный бенчмарк, возглавляемый исследователями Стэнфордского университета, который оценивает AI-агентов на 70 экспертно curated научных рабочих процессах в различных дисциплинах, оценивая конкретные артефакты с помощью воспроизводимых задачно-специфичных тестов для предоставления проверяемого доказательства способности.