Этот пост в блоге суммирует исследование "Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks", представленное на COLM 2026 Yunxiang Zhang и профессором Lu Wang из Университета Мичигана. Он исследует, почему агенты LLM, несмотря на заявления о прорывах вроде Alpha Evolve и Kosmos AI scientist, все еще уступают топовым человеческим исследователям в реальных задачах ML. Авторы утверждают, что креативность--определенная как производство идей, которые являются одновременно оригинальными и полезными--является полезным критерием для оценки и улучшения производительности агента. Взяв из креативной психологии, они разбивают креативность на P-Креативность (новост relative к памяти агента), H-Креативность (новост versus все человеческие знания), влияние и осуществимость. Пост рассматривает, как рамки агентов структурируют и направляют процесс креативного поиска, ставя целью количественно оценить, как креативность emerges and evolves within different designs. Связывая креативность с поиском в концептуальных пространствах--ссылка на Boden, Newell, Shaw, и Simon--работа стремится понять различия в производительности между фреймворками через их способность поддерживать генерацию новых и эффективных идей. Цель -- разработать лучшие метрики оценки для агентов LLM в научном открытии, измеряя креативность как комбинация оригинальности и полезности.
Источник: Towards Data Science · Сводку подготовил HeadlinesBriefing