يُلخص هذا المنشور المدونة البحث 'Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks' الذي تم عرضه في COLM 2026 من قبل يونكسيانغ زهانغ وبروفيسور لو وانغ من جامعة ميشيغان. يستكشف لماذا لا تزال وكلاء LLM، على الرغم من الادعاءات بالإنجازات مثل Alpha Evolve وKosmos AI scientist، تؤدي أداءً أقل من باحثين بشر كبار في المهام الحقيقية لـ ML. ويجادل المؤلفون بأن الإبداع--المعرفة على أنه إنتاج أفكار هي في نفس الوقت أصلية ومفيدة--يقدم نظرة مفيدة لتقييم وتحسين أداء الوكيل. مستوحى من علم النفس الإبداعي، يقومون بتفكيك الإبداع إلى P-إبداع (الجديدة relative إلى ذاكرة الوكيل)، H-إبداع (الجديدة versus كل المعرفة البشرية)، التأثير، وقابلية التطبيق. ويناقش المنشور كيف أن إطارات الوكيل تُنظم وتوجه عملية البحث الإبداعي، aiming to quantify how creativity emerges and evolves within different designs. By linking creativity to search in conceptual spaces--referencing Boden, Newell, Shaw, and Simon--يهدف العمل إلى فهم الفروقات في الأداء بين الإطارات من خلال قدرتها على دعم génération أفكار جديدة وفعالة. الهدف هو تطوير مقاييس تقييم أفضل لوكالات LLM في الاكتشاف العلمي بقياس الإبداع كمزيج من الأصالة والفائدة.
المصدر: Towards Data Science · لخّصه HeadlinesBriefing