HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3-Omni-Flash-2025-12-01: Мультимодальная модель новой генерации

Hacker News •
×

Qwen3-Omni-Flash-2025-12-01 — мультимодальная модель новой генерации с 30 млрд параметров и 3 млрд активных параметров, succeeding previous 7B model. Позиционируется как successor Qwen3-Omni-30B-A3B-Instruct, хотя его веса в настоящее время не доступны в open-source фреймворках, что затрудняет использование несмотря на заявления о сильном производительности. Модель включает 650M Audio Encoder, 540M Vision Encoder, 30B-A3B LLM, 3B-A0.3B Audio LLM и 80M Transformer/200M Conv Net для конвертации аудио токенов в волну. Существует версия reasoning, которая может произносить токены мыслей во время голосового взаимодействия, добавляя забавный интерактивный элемент. Хотя некоторые предполагают, что это может быть закрытая модель-за-службой из-за обозначения 'Flash', другие отмечают, что это может быть omni-версия Qwen3-235B-A22B, учитывая его бенчмарк-производительность против больших моделей. Контекстное окно модели может достигать 200K+ токенов, но веса на момент написания статьи недоступны на Hugging Face или ModelScope. Подтверждена поддержка реального времени разговора, хотя локальная реализация оборудования сообществом не проверена.