HeadlinesBriefing favicon HeadlinesBriefing.com

Analyse der Intelligenz, Leistung und Preis von Merkur 2.5

Hacker News •
×

Der Künstliche Analyse Intelligenzindex v4.3.2 umfasst 10 Bewertungen: AA-Briefcase v1.1, GDPval-AA v2.1, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. Der Index misst offene Gewichte gegenüber proprietären Modellen, mit Kennzeichnungen für kommerzielle Nutzungsbeschränkungen. AA-Briefcase v1.1 ist ein agentischer Wissensarbeits-Benchmark, der Rubrik-Bestehensrate, analytische Qualität Elo und Präsentationsqualität Elo kombiniert.

Die Werte des AA-Omniscience-Index reichen von -100 bis 100 und messen die Zuverlässigkeit von Wissen und Halluzinationen ohne Strafe für Ablehnung. Der Kosten-pro-Intelligenz-Aufgaben-Index berechnet den gewichteten Durchschnitt in USD der Kosten für Eingabe, Cache-Treffer, Cache-Schreibung, Reasoning und Antwort-Token-Preise geteilt durch die Anzahl der Aufgaben. Die Modellintelligenz lässt sich im Allgemeinen auf verschiedene Anwendungsfälle übertragen, obwohl bestimmte Bewertungen für bestimmte Anwendungen relevanter sein können.

Die Methodik umfasst eine Aufschlüsselung jeder Bewertung und wie sie durchgeführt wird.