HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3.8-Flash-Next: Alibaba Tampilkan Qwen4

Hacker News •
×

Alibaba telah merilis Qwen3.8-Flash-Next, model multimodal mixture-of-experts dengan bobot terbuka yang dibangun di atas arsitektur Qwen4, sebelum model Qwen4 apa pun ada. Repositori Hugging Face resmi ditayangkan pada 24 Agustus, dua hari sebelum rilis Model Scope yang dijadwalkan pada 26 Agustus. Kartu model mengonfirmasi bahwa ini adalah "pratinjau eksperimental dari arsitektur yang akan mendasari Qwen4".

Perubahan arsitektur utama mencakup Gated Delta Network (GDN) dan Qwen Sparse Attention (QSA), dalam lapisan hibrida 48 lapisan, dengan 36 lapisan attention linier dan 12 lapisan attention penuh. Model ini memiliki 125B total parameter dengan 6B yang diaktifkan per token, 512 pakar, tabel embedding n-gram terpisah 51B, dan konteks asli 262.144 token, yang dapat diperluas hingga 1.000.000. Bobotnya tidak bergated dan sepenuhnya spesifik.

Alibaba menyajikan ini sebagai komitmen teknis: mempratinjau bagian yang sulit terlebih dahulu, sehingga runtime dan aplikasi siap untuk keluarga Qwen4. Namun, skor benchmark tetap belum dikonfirmasi dan tidak direproduksi secara independen. Rilis Model Scope resmi masih dijadwalkan pada 2026-08-26 23:00 (UTC+08:00), tetapi bobotnya telah mengalahkan pengatur waktu.

Entitas kunci: Perusahaan: Alibaba | Orang: @kimmonismus | Lokasi: Hugging Face, Model Scope