HeadlinesBriefing favicon HeadlinesBriefing.com

Análisis de Inteligencia, Rendimiento y Precio de Mercurio 2.5

Hacker News •
×

El Índice de Inteligencia de Análisis Artificial v4.3.2 incorpora 10 evaluaciones: AA-Briefcase v1.1, GDPval-AA v2.1, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. El índice mide los pesos abiertos frente a los modelos propietarios, con etiquetas para restricciones de uso comercial. AA-Briefcase v1.1 es un benchmark de trabajo de conocimiento agente que combina tasa de aprobación de rúbrica, calidad analítica Elo y calidad de presentación Elo.

Las puntuaciones del Índice AA-Omniscience van desde -100 hasta 100, midiendo la confiabilidad del conocimiento y las alucinaciones, sin penalización por rechazo. El Índice de Costo por Tarea de Inteligencia calcula el promedio ponderado en USD del costo de entrada, acierto de caché, escritura de caché, razonamiento y precio de token de respuesta dividido por el número de tareas. La inteligencia del modelo generalmente se traduce entre casos de uso, aunque ciertas evaluaciones pueden ser más relevantes para aplicaciones específicas.

La metodología incluye un desglose de cada evaluación y cómo se ejecutan.