HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3.8-Flash-Next: Alibaba показывает Qwen4

Hacker News •
×

Alibaba выпустила Qwen3.8-Flash-Next — мультимодальную модель смеси экспертов с открытыми весами, построенную на архитектуре Qwen4, до того, как какая-либо модель Qwen4 существует. Официальный репозиторий Hugging Face стал доступен 24 августа, за два дня до запланированного выпуска Model Scope 26 августа. Карточка модели подтверждает, что это «экспериментальный предварительный просмотр архитектуры, которая ляжет в основу Qwen4».

Ключевые архитектурные изменения включают Gated Delta Network (GDN) и Qwen Sparse Attention (QSA) в гибридном слое из 48 слоев, с 36 слоями линейного внимания и 12 слоями полного внимания. Модель имеет 125B общих параметров с 6B активируемых на токен, 512 экспертов, отдельную таблицу вложений n-грамм размером 51B и собственный контекст 262 144 токена, расширяемый до 1 000 000. Веса не гейтированы и полностью специфицированы.

Alibaba представляет это как техническое обязательство: сначала предварительно показать сложную часть, чтобы среды выполнения и приложения были готовы к семейству Qwen4. Однако результаты бенчмарков остаются неподтвержденными и независимо не воспроизведены. Официальный выпуск Model Scope по-прежнему запланирован на 2026-08-26 23:00 (UTC+08:00), но веса уже опередили таймер.

Ключевые сущности: Компании: Alibaba | Люди: @kimmonismus | Местоположения: Hugging Face, Model Scope