HeadlinesBriefing favicon HeadlinesBriefing.com

Análisis de Claude Opus 5.5: Inteligencia, Rendimiento y Precio

Hacker News •
×

El Índice de Inteligencia v4.3.2 de Artificial Analysis incorpora 10 evaluaciones: AA-Briefcase v1.1, GDPval-AA v2.1, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. Consulte la metodología del Índice de Inteligencia para obtener más detalles, incluido un desglose de cada evaluación y cómo las ejecutamos.

AA-Briefcase v1.1 es un benchmark de trabajo de conocimiento agéntico desarrollado por Artificial Analysis. AA-Briefcase Elo es una métrica combinada que agrega la tasa de aprobación de rúbricas, el Elo de calidad analítica y el Elo de presentación · Más alto es mejor. El Índice AA-Omniscience mide la fiabilidad del conocimiento y la alucinación. Recompensa las respuestas correctas, penaliza las alucinaciones y no tiene penalización por negarse a responder. Las puntuaciones van de -100 a 100, donde 0 significa tantas respuestas correctas como incorrectas.

Comparaciones del Índice de Inteligencia: Índice de Inteligencia vs. Coste por tarea del Índice de Inteligencia. Coste promedio ponderado por tarea del Índice de Inteligencia. El coste de cada evaluación se calcula a partir de los precios de tokens de entrada, acierto de caché, escritura de caché, razonamiento y respuesta, dividido por el número de tareas y ponderado por su peso en el Índice de Inteligencia.

Entidades clave: Empresas: Artificial Analysis