HeadlinesBriefing favicon HeadlinesBriefing.com

MiMo-V2.6-Pro - Análisis de Inteligencia, Rendimiento y Precio | Análisis Artificial

Hacker News •
×

Análisis Artificial lanzó el Índice de Inteligencia v4.3.2, incorporando diez evaluaciones incluyendo AA-Briefcase v1.1, GDPval-AA v2.1, Automatización Bench-AA, Terminal-Bench 4.0, Código Científico, El Último Examen de la Humanidad, GDP.pdf, Punto Crítico, AA-Omnisciencia y AA-LCR v1.1. El benchmark actualizado mide el rendimiento del modelo en trabajo de conocimiento agente, codificación y razonamiento de documentos. El Índice de Inteligencia compara el costo promedio ponderado por tarea en USD con las puntuaciones de capacidad.

Los modelos se etiquetan como 'Uso Comercial Restringido' o 'No comercial' según los términos de licencia. El benchmark AA-Briefcase v1.1 agrupa la tasa de aprobación de rúbrica, la calidad analítica Elo y la presentación Elo. El Índice AA-Omnisciencia mide la confiabilidad del conocimiento y la alucinación en una escala de -100 a 100.

El Índice de Apertura evalúa la apertura del modelo de 0 a 100. Estas métricas estandarizadas permiten una comparación directa de las capacidades de IA en diversos casos de uso y puntos de precio.