HeadlinesBriefing favicon HeadlinesBriefing.com

Analyse des AI-Intelligenzindex v4.3

Hacker News •
×

Der AI-Intelligenzindex v4.3 von Artificial Analysis integriert 10 Bewertungen: AA-Briefcase, GDPval-AA v2, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. Siehe die Methodik des Intelligence Index für weitere Details, einschließlich einer Aufteilung jeder Bewertung und wie wir sie durchführen.

Gibt an, ob die Modellgewichte verfügbar sind. Modelle werden als "Commercial Use Restricted" bezeichnet, wenn die kommerzielle Nutzung durch Bedingungen eingeschränkt ist, und als "Non-commercial", wenn die Lizenz die kommerzielle Nutzung verbietet.

Capabilities-Indizes messen die Leistung von Modellen auf spezifischen Fähigkeiten und Branchen.

Intelligenz-Bewertungen werden von Artificial Analysis unabhängig gemessen · Je höher, desto besser.

Agentisches Codieren und Terminalverwendung Professionelles Dokumenten-Schlussfolgern Alle bestanden Medizin Langer Kontext-Schlussfolgerung Während das Modellintelligenz allgemein über Anwendungsfälle hinweg übersetzt wird, können spezifische Bewertungen für bestimmte Anwendungsfälle relevanter sein.

AA-Briefcase Elo ist eine kombinierte Metrik, die Rubrik-Bestandssatz, analytische Qualität Elo und Präsentations-Elo aggregiert. Elo und 95%ige Konfidenzintervall-Grenzen sind auf 0 begrenzt.

Der AA-Omniscience-Index (je höher, desto besser) misst die Zuverlässigkeit von Wissen und Halluzinationen. Er belohnt korrekte Antworten, bestraft Halluzinationen und macht keine Strafe für die Verweigerung zu antworten. Punkte liegen im Bereich von -100 bis 100.

Schlüssel-Entitäten: Unternehmen: Artificial Analysis