HeadlinesBriefing favicon HeadlinesBriefing.com

MiMo-V2.6-Pro - Analyse de l'intelligence, des performances et du prix | Analyse Artificielle

Hacker News •
×

Analyse Artificielle a publié l'Indice d'Intelligence v4.3.2, intégrant dix évaluations incluant AA-Briefcase v1.1, GDPval-AA v2.1, Benchmark d'Automatisation-AA, Terminal-Bench 4.0, Code Scientifique, Le Dernier Examen de l'Humanité, GDP.pdf, Point Critique, AA-Omniscience et AA-LCR v1.1. Le benchmark mis à jour mesure les performances des modèles en travail de connaissance agent, codage et raisonnement documentaire. L'Indice d'Intelligence compare le coût moyen pondéré par tâche en USD aux scores de capacité.

Les modèles sont étiquetés 'Usage Commercial Restreint' ou 'Non commercial' selon les termes de licence. Le benchmark AA-Briefcase v1.1 agrège le taux de réussite de la grille d'évaluation, la qualité analytique Elo et l'Elo de présentation. L'Indice AA-Omniscience mesure la fiabilité des connaissances et l'hallucination sur une échelle de -100 à 100.

L'Indice d'Ouverture évalue l'ouverture du modèle de 0 à 100. Ces métriques standardisées permettent une comparaison directe des capacités de l'IA dans divers cas d'utilisation et points de prix.