HeadlinesBriefing favicon HeadlinesBriefing.com

Nari Qwen3-TTS और Qwen3-ASR: उच्च सटीकता, कम विलंबता

Hacker News •
×

हे HN, मैं Nari Labs से Toby हूँ। हम OSS स्पीच मॉडल को सुपर-फास्ट बनाने पर काम कर रहे हैं। पिछले साल, हमने Dia बनाया, जो प्राकृतिक संवाद करने में सक्षम पहला OSS टेक्स्ट-टू-स्पीच मॉडल था। तब से, कई और बेहतरीन स्पीच मॉडल जारी किए गए हैं। लेकिन बाजार पर अभी भी क्लोज्ड सोर्स मॉडल का दबदबा है। हमें लगता है कि यह एक इन्फरेंस समस्या है। vLLM / SGLang जैसे मौजूदा सिस्टम मल्टीमॉडल इन्फरेंस के लिए उपयुक्त नहीं हैं। इसे साबित करने के लिए, हमने Qwen3-TTS के लिए एक विशेष इन्फरेंस इंजन बनाया और इसे ओपन-सोर्स किया। 10 RPS पर 50 मिलीसेकंड से कम विलंबता पर चलने से, यह दिखाया गया कि ओपन मॉडल बहुत तेज़ और सस्ते में चलाए जा सकते हैं।

तब से, हम सभी के लिए सस्ती, तेज़ और उच्च गुणवत्ता वाली सेवा लाने के लिए कड़ी मेहनत कर रहे हैं। और हमने क्लोज्ड मॉडल को उनके ही खेल में हरा दिया है! अत्यधिक उद्धृत Coval (YC S24) वॉइस AI बेंचमार्क पर मापा गया, हमारा Qwen3-TTS एंडपॉइंट न केवल विलंबता में #2 है, बल्कि 11Labs, Cartesia आदि की तुलना में सटीकता (WER) में #1 है, जबकि सबसे सस्ता एंडपॉइंट है। हमारे Qwen3-ASR एंडपॉइंट में सबसे कम विलंबता और #2 सटीकता है, जो #1 से सिर्फ 0.1% दूर है। यह सूची में दूसरा सबसे सस्ता मॉडल है।

इन मॉडलों को तेज़, अच्छा प्रदर्शन करने और लागत कम रखने के लिए बहुत सारी चतुर इन्फरेंस इंजीनियरिंग की आवश्यकता थी। दिलचस्प बात यह है कि Alibaba के आधिकारिक एंडपॉइंट हमारे की तुलना में सटीकता और विलंबता के मामले में खराब प्रदर्शन करते हैं। लेकिन फिर भी, इन अद्भुत स्पीच मॉडलों को OSS करने के लिए Qwen टीम को बहुत प्यार। हम कीमतों को और कम करना जारी रखना चाहते हैं ताकि स्पीच तकनीक एक वस्तु बन जाए - ताकि हर ऐप में बिना यूनिट लागत की चिंता किए बेहतरीन TTS और STT हो सके। हम ऑडियो के अन्य हिस्सों जैसे डायराइजेशन - साथ ही वीडियो और वर्ल्ड मॉडल इन्फरेंस पर भी काम कर रहे हैं। और बहुत कुछ आने वाला है!

मुख्य संस्थाएँ: कंपनियाँ: Nari Labs, Qwen, Coval, 11Labs, Cartesia, Alibaba, Assembly AI, Deepgram, Fluxions | लोग: Toby