HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3-Omni-Flack-2025-12-01 : Modèle multimodal de nouvelle génération

Hacker News •
×

Qwen3-Omni-Flash-2025-12-01 est un modèle multimodal de nouvelle génération avec 30 milliards de paramètres et 3 milliards de paramètres actifs, succédant au modèle précédent de 7B. Il est positionné comme successeur de Qwen3-Omni-30B-A3B-Instruct, bien que ses poids ne soient pas actuellement disponibles dans les cadres open-source, ce qui rend son utilisation difficile malgré les affirmances de performances fortes. Le modèle comprend un encodeur audio de 650M, un encodeur visuel de 540M, LLM 30B-A3B, LLM audio 3B-A0.3B, et 80M Transformer/200M Réseau deConv pour la conversion de tokens audio en onde.

Une version raisonnement existe qui peut prononcer les tokens de pensée lors de l'interaction vocale, ajoutant un élément interactif amusant. Bien que certains spéculent qu'il puisse s'agir d'un modèle fermé en raison du design 'Flash', d'autres notent qu'il peut s'agir d'une version omni de Qwen3-235B-A22B, compte tenu de ses performances aux benchmarks contre des modèles plus grands. La fenêtre de contexte du modèle peut s'étendre à 200K+ tokens, mais les poids restent indisponibles sur Hugging Face ou ModelScope à l'écriture de l'article.

Le support de conversation en temps réel est confirmé, bien que la mise en œuvre matérielle locale reste non vérifiée par la communauté.