Studi baru dari peneliti Universitas Princeton menunjukkan bahwa janji industri AI tentang peningkatan diri rekursif yang cepat mungkin berlebihan. Dipimpin oleh Peter Kirgis dan Sayash Kapoor, tim menilai kemampuan agen AI untuk melakukan riset AI terbuka menggunakan metode yang disebut "evaluasi bayangan". Mereka meminta Claude Opus 4.8 dari Anthropic untuk menjawab pertanyaan dari makalah NeurIPS 2026 yang belum dipublikasikan, memberikan agen enam hari, $3,000 dalam kredit API, dan akses ke GPU dan web.
Meskipun agen berhasil menyelesaikan aspek teknis dari riset — meninjau literatur, menjalankan eksperimen, dan mengkompilasi hasil — mereka gagal menghasilkan karya yang dapat dipublikasikan. Penulis asli menolak kedua makalah tersebut, mengaitkan dengan kurangnya kreativitas, penilaian yang buruk, dan tidak ada kontribusi baru. Agen melakukan eksperimen aneh, kesulitan menulis, dan terlalu cepat memutuskan untuk pendekatan yang tidak menjanjikan.
Kapoor menyalahkan kesenjangan ini pada metode pelatihan saat ini, menyatakan bahwa pembelajaran penguatan unggul dalam tugas yang dapat diverifikasi tetapi kesulitan dalam riset terbuka yang membutuhkan intuisi dan selera. Meskipun ada keterbatasan ini, studi ini menunjukkan bahwa jadwal yang berlebihan untuk mengotomatisasi riset AI mungkin tidak tepat waktu.
Temuan ini selaras dengan pengamatan internal dari perusahaan AI. Pendiri bersama Anthropic, Jack Clark, mencatat kesenjangan kreativitas yang serupa dalam upaya otomatisasi riset keamanan mereka, menyebutnya sebagai "sinyal negatif tentang jadwal peningkatan diri rekursif jangka pendek".
Sumber: MIT Technology Review AI · Diringkas oleh HeadlinesBriefing