HeadlinesBriefing favicon HeadlinesBriefing.com

GLM-5.3-Flash : IA de pointe à coût éclair

Hacker News •
×

2026-08-26 · Recherche GLM-5.3-Flash : Intelligence de pointe, coût éclair* Appelez-le sur Z.ai* Plan de codage Z.ai* Codez avec ZCode* Hugging Face Nous présentons GLM-5.3-Flash, le premier modèle nativement multimodal de la série GLM-5. Avec 320B paramètres totaux et seulement 18B paramètres actifs, il surpasse GLM-5.2 sur les benchmarks et les charges de travail réelles à un dixième du prix, tout en approchant Claude Opus 4.8 sur les benchmarks de codage et d'agents.

GLM-5.3-Flash intègre plusieurs améliorations architecturales par rapport à GLM-5. Pour la première fois, nous introduisons une architecture hybride combinant attention sparse et linéaire, réduisant considérablement les coûts de service pour les contextes longs tout en préservant des capacités précises de contexte long. Il adopte également des Hyper-Connexions Contraintes par Variété (m HC) pour améliorer encore l'efficacité de mise à l'échelle. Combinés à notre dernier corpus de pré-entraînement multimodal de 30T tokens, ces changements permettent à GLM-5.3-Flash de produire plus d'intelligence avec moins de calcul.

Avant la sortie, nous avons testé GLM-5.3-Flash anonymement sous le nom de `ox-alpha` sur Open Code et Open Router pour recueillir les retours des utilisateurs. Il est rapidement devenu le modèle le plus populaire de la semaine — avec tout ce trafic servi sur des puces IA chinoises. GLM-5.3-Flash repousse la frontière de Pareto de l'Artificial Analysis Intelligence Index v4.1.1, obtenant 57 à seulement 0,045 $ par tâche (avec remise) — un niveau d'intelligence auparavant disponible uniquement à environ 10 fois le coût.

Sur six benchmarks de codage et d'agents, GLM-5.3-Flash surpasse constamment GLM-5.2, souvent avec une large marge — 63,4 contre 46,2 sur Deep SWE v1.1 et 48,8 contre 26,2 sur Automation Bench — tout en approchant Claude Opus 4.8 dans l'ensemble. Par rapport à la série GLM-4.5, GLM-5.3-Flash est spécifiquement conçu pour une inférence à ultra-faible coût, réduisant presque de moitié à la fois le nombre de paramètres activés et le nombre de couches.

Entités clés : Entreprises : Z.ai, Hugging Face, Open Code, Open Router