HeadlinesBriefing favicon HeadlinesBriefing.com

Nari Qwen3-TTS e Qwen3-ASR: Alta precisão, baixa latência

Hacker News •
×

Olá HN, aqui é o Toby da Nari Labs. Temos trabalhado para tornar os modelos de fala de código aberto super rápidos. No ano passado, construímos o Dia, o primeiro modelo de texto para fala de código aberto capaz de fazer diálogo natural. Desde então, muitos outros ótimos modelos de fala foram lançados. Mas o mercado ainda é dominado por modelos de código fechado. Achamos que é um problema de inferência. Sistemas existentes como vLLM / SGLang não são adequados para inferência multimodal. Para provar isso, construímos um mecanismo de inferência especializado para Qwen3-TTS e o abrimos. Funcionando com latência inferior a 50 ms a 10 RPS, isso mostrou que modelos abertos podem ser executados muito mais rápido e barato.

Desde então, temos trabalhado duro para trazer um serviço barato, rápido e de alta qualidade para todos. E até superamos os modelos fechados no próprio jogo deles! Medido nos benchmarks de voz da Coval (YC S24), nosso endpoint Qwen3-TTS não é apenas o nº 2 em latência, mas o nº 1 em precisão (WER) em comparação com 11Labs, Cartesia etc., sendo o endpoint mais barato. Nosso endpoint Qwen3-ASR tem a menor latência e precisão nº 2, apenas 0,1% atrás do nº 1. É o segundo modelo mais barato da lista.

Foi preciso muita engenharia de inferência inteligente para tornar esses modelos rápidos, com bom desempenho e mantendo os custos baixos. Curiosamente, os endpoints oficiais da Alibaba parecem ter desempenho pior em termos de precisão e latência em comparação com os nossos. Mas, no entanto, muito amor à equipe Qwen por abrir esses incríveis modelos de fala. Queremos continuar a reduzir os preços para tornar a tecnologia de fala uma commodity - para que cada aplicativo possa ter ótimos TTS e STT sem se preocupar com custos unitários. Também estamos trabalhando em outras partes do áudio, como diarização - bem como inferência de vídeo e modelos de mundo. Mais por vir!

Entidades-chave: Empresas: Nari Labs, Qwen, Coval, 11Labs, Cartesia, Alibaba, Assembly AI, Deepgram, Fluxions | Pessoas: Toby