HeadlinesBriefing favicon HeadlinesBriefing.com

Análisis del Índice de Inteligencia AI v4.3

Hacker News •
×

El Índice de Inteligencia AI v4.3 incorpora 10 evaluaciones: AA-Briefcase, GDPval-AA v2, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. Consulte la metodología del Índice de Inteligencia para más detalles, incluido un desglose de cada evaluación y cómo las ejecutamos.

Indica si los pesos del modelo están disponibles. Los modelos se etiquetan como "Uso comercial restringido" si el uso comercial está limitado por condiciones, y como "No comercial" si la licencia prohíbe el uso comercial.

Los Índices de Capacidad miden el rendimiento de los modelos en capacidades y industrias específicas.

Las evaluaciones de inteligencia se miden independientemente por Artificial Analysis · Cuanto mayor, mejor.

Codificación y uso terminal agente Razonamiento profesional de documentos Todos pasan médico Razonamiento de contexto largo en medicina Mientras que la inteligencia del modelo generalmente se traduce entre casos de uso, específicas evaluaciones pueden ser más relevantes para ciertos casos de uso.

AA-Briefcase Elo es un métrica combinada que agrega tasa de paso de rúbrica, calidad analítica Elo y Elo de presentación. Elo y los límites del intervalo de confianza del 95% están limitados en 0.

El Índice AA-Omniscience (cuanto mayor, mejor) mide la fiabilidad del conocimiento y la alucinación. Recompensa respuestas correctas, penaliza las alucinaciones y no impone penalización por negarse a responder. Las puntuaciones oscilan entre -100 y 100.

Entidades clave: Empresas: Artificial Analysis