Cet article de blog résume la recherche 'Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks' présentée lors de COLM 2026 par Yunxiang Zhang et le professeur Lu Wang de l'Université du Michigan. Elle explore pourquoi les agents LLM, malgré des affirmations de percées comme Alpha Evolve et Kosmos AI scientist, sous-performant toujours les meilleurs chercheurs humains dans des tâches réelles de ML. Les auteurs soutiennent que la créativité--définie comme la production d'idées qui sont à la fois originales et utiles--offre un prisme utile pour évaluer et améliorer les performances des agents.
En s'appuyant sur la psychologie créative, ils décomposent la créativité en P-Créativité (novelty relative à la mémoire de l'agent), H-Créativité (novelty versus tout le savoir humain), impact et faisabilité. L'article examine comment les cadres d'agents structurent et guident le processus de recherche créative, visant à quantifier comment la créativité émerge et évolue au sein de différents designs. En reliant la créativité à la recherche dans les espaces conceptuels--référence à Boden, Newell, Shaw, et Simon--le travail cherche à comprendre les différences de performance entre les cadres grâce à leur capacité à soutenir la génération d'idées nouvelles et efficaces.
L'objectif est de développer de meilleures métriques d'évaluation pour les agents LLM dans la découverte scientifique en mesurant la créativité comme une combinaison d'originalité et d'utilité.
Source: Towards Data Science · Résumé par HeadlinesBriefing