HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3.8-Flash-Next:阿里巴巴预览Qwen4架构

Hacker News •
×

阿里巴巴已发布Qwen3.8-Flash-Next,这是一个基于Qwen4架构的开源权重多模态混合专家模型,尽管目前尚无任何Qwen4模型存在。官方Hugging Face仓库于8月24日上线,比原定于8月26日的Model Scope发布提前了两天。模型卡确认其“作为Qwen4架构的实验性预览”。

关键的架构变化包括门控Delta网络(GDN)和Qwen稀疏注意力(QSA),采用48层混合结构,其中36层为线性注意力,12层为全注意力。该模型总参数为125B,每个token激活6B参数,包含512个专家,独立的51B n-gram嵌入表,原生上下文长度为262,144 token,可扩展至1,000,000。权重非门控且完全规格化。

阿里巴巴将此视为技术承诺:先预览难点,以便运行时和应用程序为Qwen4系列做好准备。然而,基准测试分数尚未确认,也未独立复现。正式的Model Scope发布仍定于2026-08-26 23:00(UTC+08:00),但权重已提前发布。

关键实体:公司:Alibaba | 人物:@kimmonismus | 地点:Hugging Face, Model Scope