HeadlinesBriefing favicon HeadlinesBriefing.com

GLM-5.3-Flash : analyse intelligence et prix

Hacker News •
×

Artificial Analysis présente l'analyse du modèle GLM-5.3-Flash. L'indice d'intelligence Artificial Analysis v4.1.1 intègre 9 évaluations : GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, Sci Code, Humanity's Last Exam, GPQA Diamond, Crit Pt, AA-Omniscience, AA-LCR. Les modèles de raisonnement sont indiqués par une icône d'ampoule.

L'indice d'intelligence inclut ces évaluations, avec des détails méthodologiques disponibles. Les modèles sont étiquetés comme 'Usage commercial restreint' si l'utilisation commerciale est limitée, ou 'Non commercial' si la licence interdit l'utilisation commerciale. Les évaluations d'intelligence sont mesurées indépendamment par Artificial Analysis, les scores plus élevés étant meilleurs.

L'indice AA-Omniscience mesure la fiabilité des connaissances et l'hallucination. Il récompense les réponses correctes, pénalise les hallucinations et ne pénalise pas le refus de répondre. Les scores vont de -100 à 100, où 0 signifie autant de réponses correctes que d'incorrectes, et les scores négatifs signifient plus d'incorrectes que de correctes.

Les comparaisons incluent l'indice d'intelligence par rapport au coût par tâche, en utilisant le coût moyen pondéré des prix des jetons d'entrée, de succès de cache, d'écriture de cache, de raisonnement et de réponse. L'utilisation de jetons est mesurée en jetons de sortie par tâche de l'indice d'intelligence, calculée en multipliant les jetons de sortie par évaluation par les poids de référence.

Entités clés : Entreprises : Artificial Analysis