HeadlinesBriefing favicon HeadlinesBriefing.com

Canto : modèle vocal pour la dictée réelle

Hacker News •
×

Les modèles de reconnaissance vocale excellent dans la transcription d'un audio propre, mais la dictée réelle se produit rarement dans ces conditions. Des millions de personnes utilisent Wispr Flow pour envoyer des messages, écrire des e-mails, coder et travailler leurs idées à leur bureau, entre deux réunions, pendant leurs trajets et dans des bureaux occupés. Elles parlent via des microphones d'ordinateur portable, des écouteurs et des casques, souvent avec d'autres voix, de la musique ou de la circulation en arrière-plan. Aujourd'hui, Wispr Advanced Interfaces Lab présente Canto, notre tout dernier modèle vocal pour la dictée en temps réel.

Lors d'une évaluation de dictées du monde réel, Canto a obtenu le plus faible taux d'erreur sur les mots parmi tous les modèles que nous avons testés. Nous avons comparé Canto avec des modèles de Google, Open AI, Assembly AI et Deepgram. Canto est le premier modèle d'un programme de recherche et développement plus large chez Wispr Advanced Interfaces Lab. Dans cet article, nous partageons ses performances, la manière dont nous l'avons entraîné à gérer des conditions difficiles du monde réel, et la recherche qui façonne déjà la suite.

« Aujourd'hui, Wispr Advanced Interfaces Lab présente Canto, notre tout dernier modèle vocal pour la dictée en temps réel. » — Ariya Rastrow, CSO, Wispr Flow

Pour tester Canto dans des conditions du monde réel, nous avons créé un ensemble d'évaluation composé de 10 heures de dictées Wispr Flow en anglais provenant de plus de 2 300 locuteurs uniques, échantillonnés aléatoirement selon les applications et les cas d'usage. Nous avons imposé une séparation stricte entre les locuteurs des ensembles d'entraînement et de test afin d'éviter le surapprentissage. Chaque échantillon provenait d'un utilisateur ayant activé le paramètre de partage de données de Wispr, qui permet d'utiliser ses données de manière anonyme pour évaluer et améliorer nos modèles. Plus d'informations sur ce paramètre sont disponibles dans notre documentation sur les contrôles des données.

Canto a obtenu le plus faible taux d'erreur sur les mots (WER) parmi les modèles de notre comparaison. Le WER mesure les substitutions, omissions et insertions de mots par rapport à une référence transcrite par un humain (plus bas, c'est mieux).

Entités clés : Entreprises : Wispr Flow, Wispr Advanced Interfaces Lab, Google, Open AI, Assembly AI, Deepgram | Personnes : Ariya Rastrow

FAQ : Qu'est-ce que Canto ?

Canto est un modèle vocal pour la dictée en temps réel présenté par Wispr Advanced Interfaces Lab. Il a obtenu le plus faible taux d'erreur sur les mots parmi tous les modèles testés sur des dictées du monde réel.

Question FAQ : Qu'est-ce que Canto ?

Réponse FAQ : Canto est un modèle vocal pour la dictée en temps réel présenté par Wispr Advanced Interfaces Lab. Il a obtenu le plus faible taux d'erreur sur les mots parmi tous les modèles testés sur des dictées du monde réel.