Dieser Blog-Beitrag fasst die Forschung 'Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks' zusammen, die auf der COLM 2026 von Yunxiang Zhang und Professor Lu Wang von der University of Michigan vorgestellt wurde. Er untersucht, warum LLM-Agenten trotz Claims von Durchbrüchen wie Alpha Evolve und Kosmos AI Scientist in echten ML-Aufgaben immer noch hinter den besten menschlichen Forschern zurückbleiben. Die Autoren argumentieren, dass Kreativität--definiert als Produktion von Ideen, die sowohl originell als auch nützlich sind--ein nützlicher Blickwinkel ist, um die Leistung von Agenten zu bewerten und zu verbessern.
Aus der kreativen Psychologie gezogen, zerlegen sie Kreativität in P-Kreativität (Neuheit relativ zum Gedächtnis des Agents), H-Kreativität (Neuheit gegenüber allen menschlichen Kenntnissen), Wirkung und Umsetzbarkeit. Der Beitrag untersucht, wie Agentenframeworks den kreativen Suchprozess strukturieren und leiten, um zu quantifizieren, wie Kreativität in verschiedenen Designs entsteht und sich entwickelt. Durch die Verknüpfung von Kreativität mit der Suche in Konzepträumen--Referenz auf Boden, Newell, Shaw und Simon--sucht die Arbeit, Leistungsunterschiede zwischen Frameworks durch ihre Fähigkeit, neue und effektive Ideengenerierung zu unterstützen, zu verstehen.
Ziel ist es, bessere Evaluierungsmetriken für LLM-Agenten in der wissenschaftlichen Entdeckung zu entwickeln, indem Kreativität als Kombination aus Originalität und Nutzen gemessen wird.
Quelle: Towards Data Science · Zusammengefasst von HeadlinesBriefing