Esta entrada de blog resume la investigación 'Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks' presentada en COLM 2026 por Yunxiang Zhang y el profesor Lu Wang de la Universidad de Michigan. Explora por qué los agentes LLM, a pesar de afirmaciones de avances como Alpha Evolve y Kosmos AI scientist, aún superan a los principales investigadores humanos en tareas reales de ML. Los autores argumentan que la creatividad--definida como la producción de ideas que son tanto originales como útiles--ofrece una lente útil para evaluar y mejorar el rendimiento del agente.
Dibujando de la psicología creativa, descomponen la creatividad en P-Creatividad (novedad relativa a la memoria del agente), H-Creatividad (novedad versus todo el conocimiento humano), impacto y viabilidad. El post examina cómo los marcos de agentes estructuran y guían el proceso de búsqueda creativa, con el objetivo de cuantificar cómo surge y evoluciona la creatividad dentro de diferentes diseños. Al vincular la creatividad a la búsqueda en espacios conceptuales--referenciando a Boden, Newell, Shaw y Simon--el trabajo busca comprender las diferencias de rendimiento entre marcos a través de su capacidad para apoyar la generación de ideas novedosas y efectivas.
El objetivo es desarrollar mejores métricas de evaluación para agentes LLM en el descubrimiento científico midiendo la creatividad como una combinación de originalidad y utilidad.
Fuente: Towards Data Science · Resumido por HeadlinesBriefing