HeadlinesBriefing favicon HeadlinesBriefing.com

Analyse de l'intelligence, des performances et du prix de Mercure 2.5

Hacker News •
×

L'indice d'intelligence de l'analyse artificielle v4.3.2 intègre 10 évaluations : AA-Briefcase v1.1, GDPval-AA v2.1, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. L'indice mesure les modèles à poids ouverts par rapport aux modèles propriétaires, avec des étiquettes pour les restrictions d'usage commercial. AA-Briefcase v1.1 est un benchmark de travail de connaissance agent qui combine le taux de réussite du référentiel, la qualité analytique Elo et la qualité de présentation Elo.

Les scores de l'indice AA-Omniscience varient de -100 à 100, mesurant la fiabilité des connaissances et l'hallucination sans pénalité pour le refus. L'indice de coût par tâche d'intelligence calcule la moyenne pondérée en USD du coût d'entrée, de coup de cache, d'écriture de cache, de raisonnement et de prix des jetons de réponse divisée par le nombre de tâches. L'intelligence du modèle se traduit généralement d'un cas d'utilisation à l'autre, bien que certaines évaluations puissent être plus pertinentes pour certaines applications.

La méthodologie inclut une ventilation de chaque évaluation et de la manière dont elles sont exécutées.