HeadlinesBriefing favicon HeadlinesBriefing.com

Canto: modelo de voz para dictado real

Hacker News •
×

Los modelos de reconocimiento de voz sobresalen al transcribir audio limpio, pero el dictado real rara vez ocurre en esas condiciones. Millones de personas usan Wispr Flow para enviar mensajes, escribir correos electrónicos, programar y desarrollar ideas en escritorios, entre reuniones, durante desplazamientos y en oficinas concurridas. Hablan a través de micrófonos de portátiles, auriculares y diademas, a menudo con otras voces, música o tráfico de fondo. Hoy, Wispr Advanced Interfaces Lab presenta Canto, nuestro modelo de voz más reciente para dictado en tiempo real.

En una evaluación de dictados del mundo real, Canto logró la tasa de error de palabras más baja entre todos los modelos que probamos. Comparamos Canto con modelos de Google, Open AI, Assembly AI y Deepgram. Canto es el primer modelo de un programa más amplio de investigación y desarrollo en Wispr Advanced Interfaces Lab. En esta publicación, compartimos cómo se desempeña, cómo lo entrenamos para manejar condiciones desafiantes del mundo real y la investigación que ya está dando forma a lo que viene después.

“Hoy, Wispr Advanced Interfaces Lab presenta Canto, nuestro modelo de voz más reciente para dictado en tiempo real.” — Ariya Rastrow, CSO, Wispr Flow

Para probar Canto en condiciones del mundo real, creamos un conjunto de evaluación compuesto por 10 horas de dictados de Wispr Flow en inglés de más de 2,300 hablantes únicos, muestreados aleatoriamente entre aplicaciones y casos de uso. Impusimos una separación estricta entre los hablantes de los conjuntos de entrenamiento y prueba para evitar el sobreajuste. Cada muestra provino de un usuario que optó por la configuración de uso compartido de datos de Wispr, que permite que sus datos se utilicen de forma anónima para evaluar y mejorar nuestros modelos. Hay más información sobre esta configuración disponible en nuestra documentación de controles de datos.

Canto logró la tasa de error de palabras (WER) más baja de los modelos en nuestra comparación. WER mide sustituciones, omisiones e inserciones de palabras en relación con una referencia transcrita por humanos (más bajo es mejor).

Entidades clave: Empresas: Wispr Flow, Wispr Advanced Interfaces Lab, Google, Open AI, Assembly AI, Deepgram | Personas: Ariya Rastrow