HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3-Omni-Flash-2025-12-01: Modelo Multimodal de Nova Geração

Hacker News •
×

Qwen3-Omni-Flash-2025-12-01 é um modelo multimodal de nova geração com 30 bilhões de parâmetros e 3 bilhões de parâmetros ativos, sucedendo o modelo anterior de 7B. Está posicionado como sucessor de Qwen3-Omni-30B-A3B-Instruct, embora seus pesos não estejam disponíveis atualmente em frameworks de código aberto, o que dificulta seu uso apesar das alegações de desempenho forte. O modelo inclui um encoder de áudio de 650M, um encoder visual de 540M, LLM 30B-A3B, LLM de áudio 3B-A0.3B e 80M Transformer/200M Rede Conv para conversão de tokens de áudio para onda.

Existe uma versão de raciocínio que pode pronunciar tokens de pensamento durante a interação de voz, adicionando um elemento interativo divertido. Embora alguns especulem que possa ser um modelo fechado como serviço devido ao design 'Flash', outros observam que pode ser uma versão omni de Qwen3-235B-A22B, dado seu desempenho em benchmarks contra modelos maiores. O contexto do modelo pode estender-se a 200K+ tokens, mas os pesos permanecem indisponíveis no Hugging Face ou ModelScope à escrita do artigo.

O suporte a conversa em tempo real é confirmado, embora a implementação de hardware local permaneça não verificada pela comunidade.