HeadlinesBriefing favicon HeadlinesBriefing.com

Nari Qwen3-TTS und Qwen3-ASR: Hohe Genauigkeit, niedrige Latenz

Hacker News •
×

Hey HN, hier ist Toby von Nari Labs. Wir haben daran gearbeitet, OSS-Sprachmodelle super schnell zu machen. Letztes Jahr haben wir Dia entwickelt, das erste OSS-Text-to-Speech-Modell, das natürliche Dialoge führen kann. Seitdem wurden viele weitere großartige Sprachmodelle veröffentlicht. Aber der Markt wird immer noch von Closed-Source-Modellen dominiert. Wir denken, dass es ein Inferenzproblem ist. Bestehende Systeme wie vLLM / SGLang sind für multimodale Inferenz nicht gut geeignet. Um dies zu beweisen, haben wir eine auf Qwen3-TTS spezialisierte Inferenz-Engine gebaut und als Open Source veröffentlicht. Mit einer Latenz von unter 50 ms bei 10 RPS zeigte dies, dass offene Modelle viel schneller und billiger betrieben werden können.

Seitdem haben wir hart daran gearbeitet, allen einen günstigen, schnellen und hochwertigen Service zu bieten. Und wir haben sogar Closed-Modelle in ihrem eigenen Spiel geschlagen! Gemessen an den viel zitierten Coval (YC S24) Voice-AI-Benchmarks ist unser Qwen3-TTS-Endpunkt nicht nur Nr. 2 bei der Latenz, sondern Nr. 1 bei der Genauigkeit (WER) im Vergleich zu 11Labs, Cartesia usw., während er der günstigste Endpunkt ist. Unser Qwen3-ASR-Endpunkt hat die niedrigste Latenz und die zweitbeste Genauigkeit, nur 0,1 % vom ersten Platz entfernt. Es ist das zweitgünstigste Modell in der Liste.

Es erforderte viel cleveres Inferenz-Engineering, um diese Modelle schnell und leistungsfähig zu machen und gleichzeitig die Kosten niedrig zu halten. Interessanterweise scheinen die offiziellen Endpunkte von Alibaba in Bezug auf Genauigkeit und Latenz schlechter abzuschneiden als unsere. Aber nichtsdestotrotz, viel Liebe an das Qwen-Team für die Open-Source-Veröffentlichung dieser erstaunlichen Sprachmodelle. Wir wollen die Preise weiter senken, um Sprachtechnologie zu einer Ware zu machen – damit jede App großartige TTS und STT haben kann, ohne sich um Stückkosten sorgen zu müssen. Wir arbeiten auch an anderen Teilen von Audio wie Diarisierung – sowie an Video- und Weltmodell-Inferenz. Mehr kommt noch!

Wichtige Entitäten: Unternehmen: Nari Labs, Qwen, Coval, 11Labs, Cartesia, Alibaba, Assembly AI, Deepgram, Fluxions | Personen: Toby