HeadlinesBriefing favicon HeadlinesBriefing.com

GLM-5.3-Flash: análisis de inteligencia y precio

Hacker News •
×

Artificial Analysis presenta el análisis del modelo GLM-5.3-Flash. El Índice de Inteligencia de Artificial Analysis v4.1.1 incorpora 9 evaluaciones: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, Sci Code, Humanity's Last Exam, GPQA Diamond, Crit Pt, AA-Omniscience, AA-LCR. Los modelos de razonamiento se indican con un icono de bombilla.

El Índice de Inteligencia incluye estas evaluaciones, con detalles de metodología disponibles. Los modelos se etiquetan como 'Restringido para uso comercial' si el uso comercial está limitado, o 'No comercial' si la licencia prohíbe el uso comercial. Las evaluaciones de inteligencia son medidas de forma independiente por Artificial Analysis, siendo mejores las puntuaciones más altas.

El Índice AA-Omniscience mide la fiabilidad del conocimiento y la alucinación. Recompensa las respuestas correctas, penaliza las alucinaciones y no penaliza el negarse a responder. Las puntuaciones van de -100 a 100, donde 0 significa tantas respuestas correctas como incorrectas, y las puntuaciones negativas significan más incorrectas que correctas.

Las comparaciones incluyen el Índice de Inteligencia frente al coste por tarea, utilizando el coste medio ponderado de los precios de tokens de entrada, acierto de caché, escritura de caché, razonamiento y respuesta. El uso de tokens se mide como tokens de salida por tarea del Índice de Inteligencia, calculado multiplicando los tokens de salida por evaluación por los pesos de referencia.

Entidades clave: Empresas: Artificial Analysis