HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3-Omni-Flash-2025-12-01: نموذج لغوي متعدد الوسائط من الجيل القادم

Hacker News •
×

Qwen3-Omni-Flash-2025-12-01 هو نموذج لغوي متعدد الوسائط من الجيل القادم مع 30 مليار parámetro و 3 مليار parámetro نشط، خلفًا للنموذج السابق 7B. تم وضعه كنموذج successor لـ Qwen3-Omni-30B-A3B-Instruct، على الرغم من أن أوزانه ليست متاحة حاليًا في frameworks المصادر المفتوحة، مما يجعل استخدامها صعبًا رغم الادعاءات بأداء قوي. يتضمن النموذج Encoder صوتي 650M، Encoder بصري 540M، LLM 30B-A3B، LLM صوتي 3B-A0.3B، و 80M Transformer/200M شبكة Conv لتحويل tokens الصوتي إلى waveform. يوجد إصدار استدلال قد ينطقTokens التفكير أثناء التفاعل الصوتي، مما يضيف عنصرًا تفاعليًا مرحًا. وبينما يSpeculate البعض أنه قد يكون نموذجًا مغلقًا من نوع نموذج كخدمة بسبب تسمية 'Flash'، يلاحظ آخرون أنه قد يكون إصدار Omni من Qwen3-235B-A22B، given أداءه في benchmarks ضدModels أكبر. قد يمتد نافذة سياق النموذج إلى 200K+ tokens، لكن الأوزان لا تزال غير متاحة على Hugging Face أو ModelScope عند كتابة المقال. تم تأكيد دعم المحادثة في الوقت الحقيقي، though تنفيذ hardware المحلي لا يزال غير مُثبت من قبل المجتمع.