HeadlinesBriefing favicon HeadlinesBriefing.com

Artificial Analysis Intelligence Index v4.2 publicado

Hacker News •
×

Artificial Analysis ha publicado Intelligence Index v4.2, una actualización intermedia que acelera elementos de la versión v5 planificada para mantener el ritmo con los rápidos avances de los modelos de vanguardia. La actualización introduce tareas más complejas y realistas, y aumenta los conjuntos de prueba privados y reservados al 40% del peso del Index — el doble que la cifra de v4.1 — para evitar manipulaciones. Se añaden dos evaluaciones importantes: AA-Briefcase, un benchmark de trabajo de conocimiento basado en agentes desarrollado internamente, con conjuntos de prueba privados que evalúan proyectos de varias semanas a través de miles de archivos de origen, y el GDP.pdf de Surge AI, que evalúa el razonamiento de documentos de largo contexto a través de 4.592 páginas PDF con 1.275 criterios atómicos creados por expertos.

Las mejoras en la infraestructura de calificación incluyen una mayor precisión en la puntuación de AA-LCR v1.1, valoraciones Elo estabilizadas para GDPval-AA v2 y AA-Briefcase, y entornos de sandbox de calificación más robustos para Sci Code. Los resultados clave muestran que Claude Fable 5.1 de Anthropic lidera el Index, seguido por GPT-6 Astra de Open AI, con una ganancia de 4 puntos sobre GPT-5.6 Sol. Meta ocupa el tercer lugar, seguida por Space XAI, Moonshot/Kimi, Z. AI y Google.

La frontera Pareto de Cost per Task es compartida por Anthropic, Open AI, Meta y Z. AI, mientras que GPT-6 Astra domina la frontera de eficiencia de tokens de salida cerca de la frontera de inteligencia.