HeadlinesBriefing favicon HeadlinesBriefing.com

Terminal-Bench-Science: Benchmark Agen AI untuk Penelitian

Hacker News •
×

Terminal-Bench-Science adalah benchmark yang dipimpin oleh peneliti dari Universitas Stanford yang mengevaluasi agen AI pada alur kerja yang diambil dari penelitian ilmiah nyata. Dibangun oleh tim di balik Terminal-Bench dalam kolaborasi dengan ahli bidang dari berbagai disiplin ilmu pengetahuan, ia mengukur kemampuan agen AI melalui alur kerja yang dikurasi oleh ahli alih-alih latihan buku teks.

Rilis pertama mencakup 70 tugas yang mencakup ilmu kehidupan, fisika, bumi, matematika, dan teknik. Model yang paling kuat yang dievaluasi, Claude Opus 5, mencapai tingkat resolusi sebesar 30% pada Terminal-Bench-Science 0.1. Model lain seperti GPT-5.6 Sol Codex dan Claude Fable 5 masing-masing mencapai 22,4% dan 21,4%.

Benchmark ini dirancang agar berkelanjutan, berkembang bersama AI terdepan melalui rilis rutin di mana ilmuwan menyumbangkan alur kerja baru dan meningkatkan tugas yang ada. Ini menciptakan loop umpan balik antara kebutuhan ilmiah dan pengembangan AI. Tujuannya adalah mendorong pengembangan agen yang berfungsi sebagai asisten penelitian yang berguna, mengeksekusi alur kerja yang secara teknis menuntut, dan membebaskan ilmuwan untuk fokus pada menentukan pertanyaan penelitian, membentuk hipotesa, dan menginterpretasi hasil.

Terminal-Bench-Science mengevaluasi agen dalam lingkungan yang realistis, menilai artefak konkret seperti analisis, simulasi, bukti, dan kode dengan uji khusus tugas yang dapat direproduksi, memberikan bukti yang dapat diverifikasi tentang kemampuan ilmiah.

Entitas kunci: Perusahaan: Claude Opus 5, GPT-5.6 Sol Codex, Claude Fable 5, Claude Opus 4.8, GPT-5.6 Terra Codex, GLM 5.3, Kimi K3, Grok 4.6, GPT-5.6 Luna Codex | Lokasi: Universitas Stanford