HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3.8-Flash-Next : Alibaba présente Qwen4

Hacker News •
×

Alibaba a publié Qwen3.8-Flash-Next, un modèle multimodal à mélange d'experts à poids ouverts construit sur l'architecture Qwen4, avant même qu'aucun modèle Qwen4 n'existe. Le dépôt officiel Hugging Face est devenu public le 24 août, deux jours avant la sortie prévue de Model Scope le 26 août. La fiche du modèle confirme qu'il s'agit d'« un aperçu expérimental de l'architecture qui sous-tendra Qwen4 ».

Les changements architecturaux clés incluent le réseau Delta à porte (GDN) et l'attention éparse Qwen (QSA), dans une couche hybride de 48 couches, avec 36 couches d'attention linéaire et 12 couches d'attention complète. Le modèle possède 125B paramètres au total avec 6B activés par jeton, 512 experts, une table d'intégration n-gramme séparée de 51B, et un contexte natif de 262 144 jetons, extensible à 1 000 000. Les poids sont non portés et entièrement spécifiés.

Alibaba présente cela comme un engagement technique : prévisualiser d'abord la partie difficile, afin que les runtimes et les applications soient prêts pour la famille Qwen4. Cependant, les scores de référence restent non confirmés et non reproduits indépendamment. La sortie officielle de Model Scope est toujours prévue pour le 2026-08-26 23:00 (UTC+08:00), mais les poids ont déjà battu le chronomètre.

Entités clés : Entreprises : Alibaba | Personnes : @kimmonismus | Lieux : Hugging Face, Model Scope