HeadlinesBriefing favicon HeadlinesBriefing.com

Nari Qwen3-TTS と Qwen3-ASR:高精度、低遅延

Hacker News •
×

やあ HN、Nari Labs の Toby です。私たちは OSS 音声モデルを超高速にする取り組みを続けてきました。昨年、私たちは Dia を構築しました。これは自然な対話が可能な初の OSS テキスト読み上げモデルです。それ以来、多くの優れた音声モデルがリリースされています。しかし、市場は依然としてクローズドソースモデルが支配しています。私たちはこれが推論の問題だと考えています。vLLM / SGLang などの既存システムは、マルチモーダル推論にあまり適していません。これを証明するために、私たちは Qwen3-TTS に特化した推論エンジンを構築し、オープンソース化しました。10 RPS で 50 ミリ秒未満の遅延で動作し、オープンモデルがはるかに高速かつ安価に実行できることを示しました。

それ以来、私たちは誰もが安価で高速、高品質なサービスを利用できるよう努力してきました。そして、クローズドモデルをその得意分野で打ち負かしました!引用数の多い Coval (YC S24) 音声 AI ベンチマークで測定すると、私たちの Qwen3-TTS エンドポイントは遅延で第 2 位であるだけでなく、11Labs や Cartesia などと比較して精度 (WER) で第 1 位であり、しかも最も安価なエンドポイントです。私たちの Qwen3-ASR エンドポイントは最低の遅延と第 2 位の精度を持ち、第 1 位とはわずか 0.1% の差です。リストの中で 2 番目に安価なモデルです。

これらのモデルを高速で高性能に保ちながらコストを低く抑えるには、多くの巧妙な推論エンジニアリングが必要でした。興味深いことに、Alibaba の公式エンドポイントは、精度と遅延の点で私たちのものよりも劣っているようです。しかしそれでも、これらの素晴らしい音声モデルを OSS 化してくれた Qwen チームに多大な感謝を送ります。私たちは音声技術をコモディティ化するために価格をさらに下げ続けたいと考えています。そうすれば、すべてのアプリが単位コストを気にすることなく優れた TTS と STT を持てるようになります。私たちはまた、話者分離などのオーディオの他の部分や、ビデオとワールドモデルの推論にも取り組んでいます。今後もさらに続きます!

主要エンティティ:企業:Nari Labs、Qwen、Coval、11Labs、Cartesia、Alibaba、Assembly AI、Deepgram、Fluxions | 人物:Toby

FAQ:Nari Labs の Qwen3-TTS と Qwen3-ASR とは何ですか?

Nari Labs の Qwen3-TTS と Qwen3-ASR は、高精度と低遅延を備えたオープンソースの音声モデルで、高速推論に最適化されています。

FAQ 質問:Nari Labs の Qwen3-TTS と Qwen3-ASR とは何ですか?

FAQ 回答:Nari Labs の Qwen3-TTS と Qwen3-ASR は、高精度と低遅延を備えたオープンソースの音声モデルで、高速推論に最適化されています。