HeadlinesBriefing favicon HeadlinesBriefing.com

Intelligence Index v4.2 lançado

Hacker News •
×

Artificial Analysis lançou Intelligence Index v4.2, uma atualização intermediária que acelera elementos da versão v5 planejada para manter o ritmo com os rápidos avanços dos modelos de fronteira. A atualização introduz tarefas mais complexas e realistas, e aumenta os conjuntos de teste privados e reservados para 40% do peso do Index — o dobro da versão v4.1 — para evitar manipulação. Duas avaliações importantes são adicionadas: AA-Briefcase, um benchmark de trabalho de conhecimento baseado em agentes desenvolvido internamente, com conjuntos de teste privados testando projetos de várias semanas através de milhares de arquivos de origem, e o GDP.pdf da Surge AI, avaliando o raciocínio em documentos de longo contexto através de 4.592 páginas PDF com 1.275 critérios atômicos criados por especialistas.

As melhorias na infraestrutura de avaliação incluem maior precisão de pontuação em AA-LCR v1.1, classificações Elo estabilizadas para GDPval-AA v2 e AA-Briefcase, e sandboxes de avaliação mais robustos para Sci Code. Os resultados principais mostram que Claude Fable 5.1 da Anthropic lidera o Index, seguido por GPT-6 Astra da Open AI, com um ganho de 4 pontos sobre GPT-5.6 Sol. Meta ocupa a terceira posição, seguida por Space XAI, Moonshot/Kimi, Z. AI e Google.

A fronteira de Pareto do custo por tarefa é compartilhada por Anthropic, Open AI, Meta e Z. AI, enquanto GPT-6 Astra domina a fronteira de eficiência de tokens de saída perto da fronteira de inteligência.