HeadlinesBriefing favicon HeadlinesBriefing.com

GLM-5.3-Flash: IA de fronteira a custo relâmpago

Hacker News •
×

2026-08-26 · Pesquisa GLM-5.3-Flash: Inteligência de fronteira, custo relâmpago* Chame no Z.ai* Plano de codificação Z.ai* Codifique com ZCode* Hugging Face Apresentamos o GLM-5.3-Flash, o primeiro modelo nativamente multimodal da série GLM-5. Com 320B parâmetros totais e apenas 18B parâmetros ativos, ele supera o GLM-5.2 em benchmarks e cargas de trabalho do mundo real a um décimo do preço, enquanto se aproxima do Claude Opus 4.8 em benchmarks de codificação e agentes.

O GLM-5.3-Flash incorpora várias melhorias arquitetônicas sobre o GLM-5. Pela primeira vez, introduzimos uma arquitetura híbrida combinando atenção esparsa e linear, reduzindo drasticamente os custos de serviço de contexto longo, preservando capacidades precisas de contexto longo. Ele também adota Conexões Hiperrestritas por Variedade (m HC) para melhorar ainda mais a eficiência de escalonamento. Combinado com nosso mais recente corpus de pré-treinamento multimodal de 30T tokens, essas mudanças permitem que o GLM-5.3-Flash produza mais inteligência com menos computação.

Antes do lançamento, testamos o GLM-5.3-Flash anonimamente como `ox-alpha` no Open Code e Open Router para coletar feedback dos usuários. Ele rapidamente se tornou o modelo mais popular da semana — com todo esse tráfego servido em chips de IA chineses. O GLM-5.3-Flash empurra a fronteira de Pareto do Artificial Analysis Intelligence Index v4.1.1, pontuando 57 a apenas US$ 0,045 por tarefa (com desconto) — um nível de inteligência anteriormente disponível apenas a aproximadamente 10 vezes o custo.

Em seis benchmarks de codificação e agentes, o GLM-5.3-Flash supera consistentemente o GLM-5.2, muitas vezes por uma margem ampla — 63,4 vs. 46,2 no Deep SWE v1.1 e 48,8 vs. 26,2 no Automation Bench — enquanto se aproxima do Claude Opus 4.8 no geral. Em comparação com a série GLM-4.5, o GLM-5.3-Flash é especificamente projetado para inferência de ultrabaixo custo, reduzindo quase pela metade tanto o número de parâmetros ativados quanto o número de camadas.

Entidades-chave: Empresas: Z.ai, Hugging Face, Open Code, Open Router