HeadlinesBriefing favicon HeadlinesBriefing.com

Nari Qwen3-TTS এবং Qwen3-ASR: উচ্চ নির্ভুলতা, কম লেটেন্সি

Hacker News •
×

হে HN, আমি Nari Labs থেকে Toby। আমরা OSS স্পিচ মডেলগুলিকে অতি-দ্রুত করার কাজ করছি। গত বছর, আমরা Dia তৈরি করেছি, যা প্রাকৃতিক সংলাপ করতে সক্ষম প্রথম OSS টেক্সট-টু-স্পিচ মডেল। তারপর থেকে, আরও অনেক দুর্দান্ত স্পিচ মডেল প্রকাশিত হয়েছে। কিন্তু বাজার এখনও ক্লোজড সোর্স মডেল দ্বারা প্রভাবিত। আমরা মনে করি এটি একটি ইনফারেন্স সমস্যা। vLLM / SGLang-এর মতো বিদ্যমান সিস্টেমগুলি মাল্টিমোডাল ইনফারেন্সের জন্য উপযুক্ত নয়। এটি প্রমাণ করার জন্য, আমরা Qwen3-TTS-এর জন্য একটি বিশেষ ইনফারেন্স ইঞ্জিন তৈরি করেছি এবং ওপেন-সোর্স করেছি। 10 RPS-এ 50 মিলিসেকেন্ডের কম লেটেন্সিতে চলার মাধ্যমে, এটি দেখায় যে ওপেন মডেলগুলি অনেক দ্রুত এবং সস্তায় চালানো যেতে পারে।

তারপর থেকে, আমরা সবার জন্য সস্তা, দ্রুত এবং উচ্চ মানের পরিষেবা আনতে কঠোর পরিশ্রম করছি। এবং আমরা এমনকি ক্লোজড মডেলগুলিকে তাদের নিজের খেলায় হারিয়েছি! অত্যন্ত উদ্ধৃত Coval (YC S24) ভয়েস AI বেঞ্চমার্কে পরিমাপ করা, আমাদের Qwen3-TTS এন্ডপয়েন্ট শুধুমাত্র লেটেন্সিতে #2 নয়, বরং 11Labs, Cartesia ইত্যাদির তুলনায় নির্ভুলতায় (WER) #1, যখন সবচেয়ে সস্তা এন্ডপয়েন্ট। আমাদের Qwen3-ASR এন্ডপয়েন্টের সর্বনিম্ন লেটেন্সি এবং #2 নির্ভুলতা রয়েছে, #1 থেকে মাত্র 0.1% দূরে। এটি তালিকার দ্বিতীয় সস্তা মডেল।

এই মডেলগুলিকে দ্রুত, ভাল পারফর্ম করতে এবং খরচ কম রাখতে অনেক চতুর ইনফারেন্স ইঞ্জিনিয়ারিং লেগেছে। মজার বিষয় হল, Alibaba-এর অফিসিয়াল এন্ডপয়েন্টগুলি নির্ভুলতা এবং লেটেন্সির ক্ষেত্রে আমাদের তুলনায় খারাপ পারফর্ম করে বলে মনে হয়। তবে তবুও, এই আশ্চর্যজনক স্পিচ মডেলগুলি OSS করার জন্য Qwen দলকে অনেক ভালোবাসা। আমরা দাম আরও কমাতে চাই যাতে স্পিচ প্রযুক্তি একটি পণ্য হয়ে ওঠে - যাতে প্রতিটি অ্যাপের ইউনিট খরচের চিন্তা ছাড়াই দুর্দান্ত TTS এবং STT থাকতে পারে। আমরা অডিওর অন্যান্য অংশ যেমন ডায়ারাইজেশন - সেইসাথে ভিডিও এবং ওয়ার্ল্ড মডেল ইনফারেন্স নিয়েও কাজ করছি। আরও আসছে!

মূল সত্তা: কোম্পানি: Nari Labs, Qwen, Coval, 11Labs, Cartesia, Alibaba, Assembly AI, Deepgram, Fluxions | ব্যক্তি: Toby