このブログ投稿は、COLM 2026でYunxiang Zhangとミシガン大学のLu Wang教授によって発表された研究「Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks」の要約です。Alpha EvolveやKosmos AI scientistといったブレイクスルーが主張されても、LLMエージェントが実際のMLタスクでトップの人間研究者を上回ることは依然としてないことを探求します。著者は、創造性--オリジナルで有用なアイデアを生成することと定義される--は、エージェントのパフォーマンスを評価し改善するための有用なレンズであると主張します。創造的心理学から着想を得て、彼らはP-創造性(エージェントの記憶相対の新規性)、H-創造性(すべての人間知識相対の新規性)、インパクト、および実現可能性に創造性を分解します。投稿では、エージェントフレームワークがどのように創造的検索プロセスを構造化し、ガイドするかを検討し、さまざまなデザインの中で創造性がどのように浮かび上がり、進化するかを定量化することを目指しています。Boden、Newell、Shaw、Simonによって参照される概念空間での検索と創造性を結びつけることで、この作品は、新規で効果的なアイデア生成をサポートする能力を通じて、フレームワーク間のパフォーマンス差を理解しようとするものです。目標は、科学的発見におけるLLMエージェントのより良い評価指標を開発することで、創造性をオリジナル性と有用性の組み合わせとして測定することです。
出典: Towards Data Science · 要約:HeadlinesBriefing