Um novo estudo conduzido por pesquisadores da Universidade de Princeton sugere que as promessas da indústria de IA sobre uma rápida autorreferência recursiva podem ser exageradas. Liderado por Peter Kirgis e Sayash Kapoor, a equipe avaliou a capacidade de agentes de IA de conduzir pesquisas abertas de IA usando um método chamado "avaliação em sombra". Eles pediram ao Claude Opus 4.8 da Anthropic para responder a perguntas de artigos não publicados do NeurIPS 2026, fornecendo aos agentes seis dias, $3,000 em créditos de API e acesso a GPUs e à web.
Embora os agentes tenham concluído com sucesso os aspectos de engenharia da pesquisa — revisando literatura, executando experimentos e compilando resultados — eles não conseguiram produzir trabalhos publicáveis. Os autores originais rejeitaram ambos os artigos, apontando para uma falta de criatividade, um mau julgamento e a ausência de contribuições novas. Os agentes realizaram experimentos estranhos, tiveram dificuldades para escrever e se comprometeram muito rapidamente a abordagens pouco promissoras.
Kapoor atribui essa lacuna aos métodos de treinamento atuais, observando que a aprendizagem por reforço brilha em tarefas verificáveis, mas enfrenta dificuldades em pesquisas abertas que exigem intuição e senso estético. Apesar dessas limitações, o estudo sugere que os prazos hipados para automatizar a pesquisa de IA podem ser prematuros.
Os resultados estão alinhados com observações internas de empresas de IA. O cofundador da Anthropic, Jack Clark, observou lacunas semelhantes de criatividade em seus esforços de automação de pesquisa de segurança, chamando-as de "sinal negativo sobre prazos curtos de autorreferência recursiva".
Fonte: MIT Technology Review AI · Resumido por HeadlinesBriefing