Posting blog ini merangkum penelitian 'Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks' yang disajikan di COLM 2026 oleh Yunxiang Zhang dan Profesor Lu Wang dari University of Michigan. Ia menyeliduri mengapa agen LLM, meskipun klaim breakthrough seperti Alpha Evolve dan Kosmos AI scientist, masih kurang performa peneliti manusia terbaik dalam tugas ML sebenar. Para penulis berargumen bahwa kreativitas--didefinisikan sebagai produksi ide yang both original and useful--menyediakan lensa yang berguna untuk menilai dan meningkatkan performa agen.
Dari psikologi kreatif diambil, mereka memecah kreativitas menjadi P-Kreativitas (novelty relatif terhadap memori agen), H-Kreativitas (novelty versus semua pengetahuan manusia), dampak, dan feasibilitas. Posting ini meneliti bagaimana kerangka agen menyusun dan memandu proses pencarian kreatif, dengan tujuan mengukur seberapa kreativitas muncul dan berkembang dalam desain yang berbeda. Dengan menghubungkan kreativitas dengan pencarian dalam ruang konsep--merujuk pada Boden, Newell, Shaw, dan Simon--pekerjaan ini berusaha memahami perbedaan performa antara kerangka melalui kemampuan mereka untuk mendukung generasi ide yang baru dan efektif.
Tujuannya adalah mengembangkan metrik evaluasi yang lebih baik untuk agen LLM dalam pengembangan ilmiah dengan mengukur kreativitas sebagai kombinasi originalitas dan utilitas.
Sumber: Towards Data Science · Diringkas oleh HeadlinesBriefing