Este post de blog resume a pesquisa 'Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks' apresentada no COLM 2026 por Yunxiang Zhang e o professor Lu Wang da Universidade de Michigan. Explora por que agentes LLM, apesar de alegações de quebras como Alpha Evolve e Kosmos AI scientist, ainda subperformam pesquisadores humanos de topo em tarefas reais de ML. Os autores argumentam que a criatividade--definida como a produção de ideias que são tanto originais quanto úteis--oferece um lente útil para avaliar e melhorar o desempenho do agente.
Desenhando da psicologia criativa, eles dividem a criatividade em P-Criatividade (novidade relativa à memória do agente), H-Criatividade (novidade versus todo o conhecimento humano), impacto e viabilidade. O post examina como os frameworks de agentes estruturam e guiam o processo de busca criativa, aiming to quantify how creativity emerges and evolves within different designs. Ao vincular a criatividade à busca em espaços conceituais--referenciando Boden, Newell, Shaw, e Simon--o trabalho busca compreender as diferenças de desempenho entre frameworks através de sua capacidade de apoiar a geração de ideias novas e eficazes.
O objetivo é desenvolver melhores métricas de avaliação para agentes LLM na descoberta científica medindo a criatividade como uma combinação de originalidade e utilidade.
Fonte: Towards Data Science · Resumido por HeadlinesBriefing