HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3-Omni-Flash-2025-12-01: Next-Generation Multimodal-Modell

Hacker News •
×

Qwen3-Omni-Flash-2025-12-01 ist ein Next-Generation Multimodal-Modell mit 30 Milliarden Parametern und 3 Milliarden aktiven Parametern, das das vorherige 7B Omni-Modell ablöste. Es ist als Nachfolger von Qwen3-Omni-30B-A3B-Instruct positioniert, obwohl seine Gewichte derzeit nicht in Open-Source-Frameworks verfügbar sind, was die Nutzung trotz Leistungsansprüchen erschwert. Das Modell umfasst einen 650M Audio Encoder, 540M Vision Encoder, 30B-A3B LLM, 3B-A0.3B Audio LLM und 80M Transformer/200M Conv Net für die Audio-Token-zu-Waveform-Konvertierung.

Es existiert eine Reasoning-Version, die während der Sprachinteraktion Denk-Tokens aussprechen kann, was einen unterhaltsamen interaktiven Element hinzufügt. Während einige spekulieren, dass es sich aufgrund des 'Flash'-Designs um ein geschlossenes Modell-as-a-Service handeln könnte, weisen andere darauf hin, dass es sich um eine Omni-Version von Qwen3-235B-A22B handeln könnte, gegeben seine Benchmark-Leistung gegen größere Modelle. Der Kontextfenster des Modells kann auf 200K+ Tokens erweitert werden, aber die Gewichte sind zum Zeitpunkt des Artikels nicht auf Hugging Face oder ModelScope verfügbar.

Die Unterstützung für Echtzeit-Gespräch wurde bestätigt, lokale Hardware-Implementierung von der Community jedoch nicht verifiziert.