HeadlinesBriefing favicon HeadlinesBriefing.com

Nari Qwen3-TTS y Qwen3-ASR: Alta precisión, baja latencia

Hacker News •
×

Hola HN, soy Toby de Nari Labs. Hemos estado trabajando en hacer que los modelos de voz de código abierto sean súper rápidos. El año pasado, construimos Dia, el primer modelo de texto a voz de código abierto capaz de hacer diálogo natural. Desde entonces, se han lanzado muchos más modelos de voz excelentes. Pero el mercado todavía está dominado por modelos de código cerrado. Creemos que es un problema de inferencia. Los sistemas existentes como vLLM / SGLang no son adecuados para la inferencia multimodal. Para probarlo, construimos un motor de inferencia especializado para Qwen3-TTS y lo abrimos. Funcionando con una latencia inferior a 50 ms a 10 RPS, esto demostró que los modelos abiertos pueden ejecutarse mucho más rápido y más barato.

Desde entonces, hemos estado trabajando duro para llevar un servicio barato, rápido y de alta calidad a todos. ¡Y hasta hemos superado a los modelos cerrados en su propio juego! Medido en los muy citados benchmarks de voz de Coval (YC S24), nuestro endpoint Qwen3-TTS no solo es el número 2 en latencia, sino el número 1 en precisión (WER) en comparación con 11Labs, Cartesia, etc., siendo el endpoint más barato. Nuestro endpoint Qwen3-ASR tiene la latencia más baja y la precisión número 2, a solo un 0.1% del número 1. Es el segundo modelo más barato de la lista.

Se necesitó mucha ingeniería de inferencia inteligente para hacer que estos modelos sean rápidos, funcionen bien y mantengan los costos bajos. Curiosamente, los endpoints oficiales de Alibaba parecen tener un rendimiento peor en términos de precisión y latencia en comparación con los nuestros. Pero, sin embargo, mucho cariño al equipo de Qwen por abrir estos increíbles modelos de voz. Queremos seguir bajando los precios para hacer de la tecnología de voz una mercancía, para que cada aplicación pueda tener un gran TTS y STT sin preocuparse por los costos unitarios. También estamos trabajando en otras partes del audio, como la diarización, así como en la inferencia de video y modelos del mundo. ¡Más por venir!

Entidades clave: Empresas: Nari Labs, Qwen, Coval, 11Labs, Cartesia, Alibaba, Assembly AI, Deepgram, Fluxions | Personas: Toby