HeadlinesBriefing favicon HeadlinesBriefing.com

Claude Opus 5.5 Analyse: Intelligenz, Leistung & Preis

Hacker News •
×

Der Artificial Analysis Intelligence Index v4.3.2 umfasst 10 Bewertungen: AA-Briefcase v1.1, GDPval-AA v2.1, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. Weitere Details, einschließlich einer Aufschlüsselung jeder Bewertung und wie wir sie durchführen, finden Sie in der Methodik des Intelligence Index.

AA-Briefcase v1.1 ist ein agentischer Wissensarbeits-Benchmark, der von Artificial Analysis entwickelt wurde. AA-Briefcase Elo ist eine kombinierte Metrik, die Rubrik-Bestehensrate, analytische Qualität Elo und Präsentation Elo aggregiert · Höher ist besser. Der AA-Omniscience Index misst Wissenszuverlässigkeit und Halluzination. Er belohnt richtige Antworten, bestraft Halluzinationen und hat keine Strafe für die Verweigerung einer Antwort. Die Werte reichen von -100 bis 100, wobei 0 bedeutet, dass es genauso viele richtige wie falsche Antworten gibt.

Intelligence Index Vergleiche: Intelligence Index vs. Kosten pro Intelligence Index Aufgabe. Gewichteter durchschnittlicher Kosten pro Intelligence Index Aufgabe. Die Kosten jeder Bewertung werden aus den Preisen für Eingabe-, Cache-Treffer-, Cache-Schreib-, Reasoning- und Antwort-Token berechnet, durch die Aufgabenanzahl geteilt und mit ihrem Intelligence Index Gewicht gewichtet.

Wichtige Entitäten: Unternehmen: Artificial Analysis