HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3.8-Flash-Next: Alibaba presenta Qwen4

Hacker News •
×

Alibaba ha lanzado Qwen3.8-Flash-Next, un modelo multimodal de mezcla de expertos de pesos abiertos construido sobre la arquitectura Qwen4, antes de que exista cualquier modelo Qwen4. El repositorio oficial de Hugging Face se publicó el 24 de agosto, dos días antes del lanzamiento programado de Model Scope el 26 de agosto. La tarjeta del modelo confirma que es "una vista previa experimental de la arquitectura que sustentará Qwen4".

Los cambios arquitectónicos clave incluyen la Red Delta con Compuerta (GDN) y la Atención Dispersa Qwen (QSA), dentro de una capa híbrida de 48 capas, con 36 capas de atención lineal y 12 de atención completa. El modelo tiene 125B parámetros totales con 6B activados por token, 512 expertos, una tabla de incrustación n-grama separada de 51B, y un contexto nativo de 262,144 tokens, extensible a 1,000,000. Los pesos no tienen compuerta y están completamente especificados.

Alibaba presenta esto como un compromiso técnico: previsualizar primero la parte difícil, para que los tiempos de ejecución y las aplicaciones estén listos para la familia Qwen4. Sin embargo, los puntajes de referencia no están confirmados ni reproducidos de forma independiente. El lanzamiento formal de Model Scope sigue programado para 2026-08-26 23:00 (UTC+08:00), pero los pesos ya han superado el temporizador.

Entidades clave: Empresas: Alibaba | Personas: @kimmonismus | Ubicaciones: Hugging Face, Model Scope