HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3-Omni-Flash-2025-12-01: Model Multimodal Generasi Selanjutnya

Hacker News •
×

Qwen3-Omni-Flash-2025-12-01 adalah model multimodal generasi selanjutnya dengan 30 miliar parameter dan 3 miliar parameter aktif, success model 7B sebelumnya. Diposisikan sebagai successsor Qwen3-Omni-30B-A3B-Instruct, meskipun bobotnya saat ini tidak tersedia di framework open-source, membuatnya sul digunakan meskipun klaim performa kuat. Model mencakup 650M Audio Encoder, 540M Vision Encoder, 30B-A3B LLM, 3B-A0.3B Audio LLM, dan 80M Transformer/200M Conv Net untuk konversi token audio ke waveform.

Versi reasoning ada yang mungkin menampakkan thinking token saat interaksi suara, menambahkan elemen interaktif yang lucu. Beberapa spekulasi mungkin model tertutup model-as-a-service karena desain 'Flash', yang lain menunjukkannya sebagai versi omni Qwen3-235B-A22B, mengingat performa benchmark-nya terhadap model yang lebih besar. Konteks window model bisa diperluas hingga 200K+ token, tetapi bobotnya saat artikel ditulis belum tersedia di Hugging Face atau ModelScope.

Dukungan percakapan real-time dikonfirmasi, meski implementasi hardware lokal masih diverifikasi oleh komunitas.