HeadlinesBriefing favicon HeadlinesBriefing.com

GLM-5.3-Flash: IA de frontera a costo flash

Hacker News •
×

2026-08-26 · Investigación GLM-5.3-Flash: Inteligencia de frontera, costo flash* Llámalo en Z.ai* Plan de codificación Z.ai* Codifica con ZCode* Hugging Face Presentamos GLM-5.3-Flash, el primer modelo nativamente multimodal de la serie GLM-5. Con 320B parámetros totales y solo 18B parámetros activos, supera a GLM-5.2 en puntos de referencia y cargas de trabajo del mundo real a una décima parte del precio, acercándose a Claude Opus 4.8 en codificación y puntos de referencia de agentes.

GLM-5.3-Flash incorpora varias mejoras arquitectónicas sobre GLM-5. Por primera vez, introducimos una arquitectura híbrida que combina atención dispersa y lineal, reduciendo drásticamente los costos de servicio de contexto largo mientras preserva capacidades precisas de contexto largo. También adopta Conexiones Hiperrestrictas por Manifold (m HC) para mejorar aún más la eficiencia de escalado. Combinado con nuestro último corpus de preentrenamiento multimodal de 30T tokens, estos cambios permiten que GLM-5.3-Flash produzca más inteligencia con menos cómputo.

Antes del lanzamiento, probamos GLM-5.3-Flash anónimamente como `ox-alpha` en Open Code y Open Router para recopilar comentarios de los usuarios. Rápidamente se convirtió en el modelo más popular de la semana, con todo este tráfico servido en chips de IA chinos. GLM-5.3-Flash empuja la frontera de Pareto del Índice de Inteligencia Artificial Analysis v4.1.1, obteniendo 57 a solo $0.045 por tarea (con descuento), un nivel de inteligencia que antes solo estaba disponible a aproximadamente 10 veces el costo.

En seis puntos de referencia de codificación y agentes, GLM-5.3-Flash supera consistentemente a GLM-5.2, a menudo por un amplio margen: 63.4 vs. 46.2 en Deep SWE v1.1 y 48.8 vs. 26.2 en Automation Bench, acercándose a Claude Opus 4.8 en general. En comparación con la serie GLM-4.5, GLM-5.3-Flash está específicamente diseñado para inferencia de ultra bajo costo, casi reduciendo a la mitad tanto el número de parámetros activados como el número de capas.

Entidades clave: Empresas: Z.ai, Hugging Face, Open Code, Open Router