HeadlinesBriefing favicon HeadlinesBriefing.com

Analyse de l'Indice d'Intelligence IA v4.3

Hacker News •
×

L'Indice d'Intelligence IA v4.3 d'Artificial Analysis intègre 10 évaluations : AA-Briefcase, GDPval-AA v2, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. Consultez la méthodologie de l'Indice d'Intelligence pour plus de détails, notamment une ventilation de chaque évaluation et de leur exécution.

Indique si les poids du modèle sont disponibles. Les modèles sont étiquetés comme "Utilisation commerciale restreinte" si l'utilisation commerciale est limitée par des conditions, et comme "Non commercial" si la licence interdit l'utilisation commerciale.

Les Indice de capacité mesurent les performances des modèles sur des capacités et des industries spécifiques.

Les évaluations d'intelligence sont mesurées indépendamment par Artificial Analysis · Plus le chiffre est élevé, meilleur est le résultat.

Codage agentique et utilisation terminale Raisonnement professionnel de documents Tous passent médical Raisonnement sur contexte long dans la médecine Bien que l'intelligence du modèle se traduise généralement entre les cas d'usage, certaines évaluations spécifiques peuvent être plus pertinentes pour certains cas d'usage.

AA-Briefcase Elo est une métrique combinée qui agrège le taux de réussite du rubric, la qualité analytique Elo et l'Elo de présentation. Elo et les limites de l'intervalle de confiance à 95 % sont limités à 0.

L'Indice AA-Omniscience (plus élevé est mieux) mesure la fiabilité des connaissances et les hallucinations. Il récompense les bonnes réponses, pénalise les hallucinations et n'impose pas de pénalité pour refuser de répondre. Les scores varient de -100 à 100.

Entités clés : Entreprises : Artificial Analysis