HeadlinesBriefing favicon HeadlinesBriefing.com

Intelligence Index v4.2 veröffentlicht

Hacker News •
×

Artificial Analysis hat Intelligence Index v4.2 veröffentlicht, ein Zwischenupdate, das Elemente der geplanten v5-Veröffentlichung beschleunigt, um mit den schnellen Fortschritten der frontier-Modelle Schritt zu halten. Das Update führt komplexere, realistischere Aufgaben ein und erhöht private, zurückgehaltene Testsets auf 40 % des Index-Gewichts — das Doppelte der v4.1-Zahl — um Betrug zu verhindern. Zwei wichtige Bewertungen werden hinzugefügt: AA-Briefcase, ein intern entwickelter agentenbasierter Wissensarbeits-Benchmark mit privaten Testsets, der mehrwöchige Projekte über Tausende von Quelldateien testet, und Surge AIs GDP.pdf, das die Langkontext-Dokumentenanalyse über 4.592 PDF-Seiten mit 1.275 expertenerstellten atomaren Kriterien bewertet.

Die Infrastruktur-Upgrades für die Bewertung umfassen verbesserte Bewertungsgenauigkeit in AA-LCR v1.1, stabilisierte Elo-Bewertungen für GDPval-AA v2 und AA-Briefcase sowie robusteres Bewertungssandboxing für Sci Code. Die wichtigsten Ergebnisse zeigen, dass Claude Fable 5.1 von Anthropic den Index anführt, gefolgt von GPT-6 Astra von Open AI mit einer 4-Punkte-Verschiebung gegenüber GPT-5.6 Sol. Meta belegt den dritten Platz, gefolgt von Space XAI, Moonshot/Kimi, Z. AI und Google.

Die Cost-per-Task-Pareto-Grenze wird von Anthropic, Open AI, Meta und Z. AI geteilt, während GPT-6 Astra die Ausgabetoken-Effizienz-Grenze in der Nähe der Intelligenz-Grenze dominiert.