HeadlinesBriefing favicon HeadlinesBriefing.com

Intelligence Index v4.2 publié par Artificial Analysis

Hacker News •
×

Artificial Analysis a publié Intelligence Index v4.2, une mise à jour intermédiaire qui accélère certains éléments de la version v5 prévue afin de garder le rythme avec les rapides avancées des modèles de pointe. Cette mise à jour introduit des tâches plus complexes et réalistes, et augmente les jeux de test privés et réservés à 40 % du poids de l’Index — le double de la version v4.1 — pour éviter la manipulation. Deux évaluations majeures sont ajoutées : AA-Briefcase, un benchmark de travail de connaissance agentique développé en interne avec des jeux de test privés évaluant des projets de plusieurs semaines à travers des milliers de fichiers sources, et GDP.pdf de Surge AI, qui évalue le raisonnement sur des documents à long contexte sur 4 592 pages PDF avec 1 275 critères atomiques rédigés par des experts.

Les améliorations de l’infrastructure de notation comprennent une meilleure précision de notation dans AA-LCR v1.1, des évaluations Elo stabilisées pour GDPval-AA v2 et AA-Briefcase, et des environnements de notation plus robustes pour Sci Code. Les résultats clés montrent que Claude Fable 5.1 d’Anthropic mène l’Index, suivi par GPT-6 Astra d’Open AI, avec une amélioration de 4 points par rapport à GPT-5.6 Sol. Meta occupe la troisième place, suivie par Space XAI, Moonshot/Kimi, Z. AI et Google.

La frontière de Pareto du coût par tâche est partagée par Anthropic, Open AI, Meta et Z. AI, tandis que GPT-6 Astra domine la frontière d’efficacité des jetons de sortie près de la frontière de l’intelligence.