HeadlinesBriefing favicon HeadlinesBriefing.com

Analyse de Claude Opus 5.5 : Intelligence, Performance et Prix

Hacker News •
×

L'Indice d'Intelligence v4.3.2 d'Artificial Analysis intègre 10 évaluations : AA-Briefcase v1.1, GDPval-AA v2.1, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. Consultez la méthodologie de l'Indice d'Intelligence pour plus de détails, y compris une ventilation de chaque évaluation et la façon dont nous les exécutons.

AA-Briefcase v1.1 est un benchmark de travail de connaissance agentique développé par Artificial Analysis. AA-Briefcase Elo est une métrique combinée qui agrège le taux de réussite des rubriques, l'Elo de qualité analytique et l'Elo de présentation · Plus élevé est meilleur. L'Indice AA-Omniscience mesure la fiabilité des connaissances et l'hallucination. Il récompense les réponses correctes, pénalise les hallucinations et n'a aucune pénalité pour le refus de répondre. Les scores vont de -100 à 100, où 0 signifie autant de réponses correctes qu'incorrectes.

Comparaisons de l'Indice d'Intelligence : Indice d'Intelligence vs. Coût par tâche de l'Indice d'Intelligence. Coût moyen pondéré par tâche de l'Indice d'Intelligence. Le coût de chaque évaluation est calculé à partir des prix des tokens d'entrée, de succès de cache, d'écriture de cache, de raisonnement et de réponse, divisé par le nombre de tâches, et pondéré par son poids dans l'Indice d'Intelligence.

Entités clés : Entreprises : Artificial Analysis

FAQ : Qu'est-ce que l'Indice d'Intelligence d'Artificial Analysis ?

L'Indice d'Intelligence v4.3.2 d'Artificial Analysis intègre 10 évaluations : AA-Briefcase v1.1, GDPval-AA v2.1, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1.

Question FAQ : Qu'est-ce que l'Indice d'Intelligence d'Artificial Analysis ?

Réponse FAQ : L'Indice d'Intelligence v4.3.2 d'Artificial Analysis intègre 10 évaluations : AA-Briefcase v1.1, GDPval-AA v2.1, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1.