HeadlinesBriefing favicon HeadlinesBriefing.com

Nari Qwen3-TTS et Qwen3-ASR : Haute précision, faible latence

Hacker News •
×

Salut HN, c'est Toby de Nari Labs. Nous avons travaillé à rendre les modèles vocaux open source super rapides. L'année dernière, nous avons construit Dia, le premier modèle de synthèse vocale open source capable de dialogue naturel. Depuis, de nombreux autres excellents modèles vocaux ont été publiés. Mais le marché est encore dominé par les modèles à code fermé. Nous pensons que c'est un problème d'inférence. Les systèmes existants comme vLLM / SGLang ne sont pas bien adaptés à l'inférence multimodale. Pour le prouver, nous avons construit un moteur d'inférence spécialisé pour Qwen3-TTS et l'avons open-sourcé. Fonctionnant avec une latence inférieure à 50 ms à 10 RPS, cela a montré que les modèles ouverts peuvent être exécutés beaucoup plus rapidement et moins cher.

Depuis, nous travaillons dur pour apporter un service bon marché, rapide et de haute qualité à tous. Et nous avons même battu les modèles fermés à leur propre jeu ! Mesuré sur les benchmarks vocaux très cités de Coval (YC S24), notre endpoint Qwen3-TTS n'est pas seulement n°2 en latence, mais n°1 en précision (WER) par rapport à 11Labs, Cartesia, etc., tout en étant l'endpoint le moins cher. Notre endpoint Qwen3-ASR a la latence la plus faible et une précision n°2, à seulement 0,1 % du n°1. C'est le deuxième modèle le moins cher de la liste.

Il a fallu beaucoup d'ingénierie d'inférence astucieuse pour rendre ces modèles rapides, performants tout en gardant les coûts bas. Curieusement, les endpoints officiels d'Alibaba semblent moins performants en termes de précision et de latence par rapport aux nôtres. Mais néanmoins, beaucoup d'amour à l'équipe Qwen pour avoir open-sourcé ces incroyables modèles vocaux. Nous voulons continuer à faire baisser les prix pour faire de la technologie vocale une commodité - afin que chaque application puisse avoir un excellent TTS et STT sans se soucier des coûts unitaires. Nous travaillons également sur d'autres parties de l'audio comme la diarisation - ainsi que sur l'inférence vidéo et de modèles du monde. Plus à venir !

Entités clés : Entreprises : Nari Labs, Qwen, Coval, 11Labs, Cartesia, Alibaba, Assembly AI, Deepgram, Fluxions | Personnes : Toby

FAQ : Qu'est-ce que Qwen3-TTS et Qwen3-ASR de Nari Labs ?

Qwen3-TTS et Qwen3-ASR de Nari Labs sont des modèles vocaux open source à haute précision et faible latence, optimisés pour une inférence rapide.

Question FAQ : Qu'est-ce que Qwen3-TTS et Qwen3-ASR de Nari Labs ?

Réponse FAQ : Qwen3-TTS et Qwen3-ASR de Nari Labs sont des modèles vocaux open source à haute précision et faible latence, optimisés pour une inférence rapide.