HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3-Omni-Flash-2025-12-01: Modelo Multimodal de Nueva Generación

Hacker News •
×

Qwen3-Omni-Flash-2025-12-01 es un modelo multimodal de nueva generación con 30.000 millones de parámetros y 3.000 millones de parámetros activos, sucesor del modelo anterior de 7B. Está posicionado como sucesor de Qwen3-Omni-30B-A3B-Instruct, aunque sus pesos no están disponibles actualmente en marcos de código abierto, lo que dificulta su uso a pesar de las afirmaciones de un rendimiento fuerte. El modelo incluye un codificador de audio de 650M, un codificador de visión de 540M, LLM de 30B-A3B, LLM de audio de 3B-A0.3B y 80M Transformer/200M Red Conv para la conversión de tokens de audio a onda.

Existe una versión de razonamiento que puede pronunciar los tokens de pensamiento durante la interacción de voz, añadiendo un elemento interactivo divertido. Aunque algunos especulan que puede ser un modelo cerrado como servicio debido al diseño 'Flash', otros señalan que puede ser una versión omni de Qwen3-235B-A22B, dado su rendimiento en benchmarks contra modelos más grandes. El contexto del modelo puede extenderse a 200K+ tokens, pero los pesos siguen sin estar disponibles en Hugging Face o ModelScope a la escritura del artículo.

Se confirma soporte para conversación en tiempo real, aunque la implementación de hardware local sigue sin verificarse por la comunidad.