HeadlinesBriefing favicon HeadlinesBriefing.com

Canto: Sprachmodell für reales Diktieren

Hacker News •
×

Spracherkennungsmodelle sind hervorragend darin, sauberes Audio zu transkribieren, doch echtes Diktieren findet selten unter diesen Bedingungen statt. Millionen nutzen Wispr Flow, um Nachrichten zu senden, E-Mails zu schreiben, zu programmieren und Ideen zu entwickeln – am Schreibtisch, zwischen Meetings, auf dem Arbeitsweg und in belebten Büros. Sie sprechen über Laptop-Mikrofone, Ohrhörer und Headsets, oft mit anderen Stimmen, Musik oder Verkehr im Hintergrund. Heute stellt das Wispr Advanced Interfaces Lab Canto vor, unser neuestes Sprachmodell für Echtzeit-Diktieren.

In einer Bewertung realer Diktate erzielte Canto die niedrigste Wortfehlerrate unter allen Modellen, die wir getestet haben. Wir verglichen Canto mit Modellen von Google, Open AI, Assembly AI und Deepgram. Canto ist das erste Modell in einem breiteren Forschungs- und Entwicklungsprogramm am Wispr Advanced Interfaces Lab. In diesem Beitrag teilen wir, wie es abschneidet, wie wir es trainiert haben, um herausfordernde reale Bedingungen zu bewältigen, und welche Forschung bereits das Kommende prägt.

„Heute stellt das Wispr Advanced Interfaces Lab Canto vor, unser neuestes Sprachmodell für Echtzeit-Diktieren.“ — Ariya Rastrow, CSO, Wispr Flow

Um Canto unter realen Bedingungen zu testen, erstellten wir ein Bewertungsset aus 10 Stunden englischsprachiger Wispr Flow-Diktate von mehr als 2.300 einzigartigen Sprecherinnen und Sprechern, die zufällig über Anwendungen und Anwendungsfälle hinweg ausgewählt wurden. Wir erzwangen eine strikte Trennung zwischen den Sprecherinnen und Sprechern in Trainings- und Testsets, um Overfitting zu vermeiden. Jede Stichprobe stammte von einer Nutzerin oder einem Nutzer, die bzw. der die Datenfreigabeeinstellung von Wispr aktiviert hat, die es erlaubt, ihre oder seine Daten anonym zur Bewertung und Verbesserung unserer Modelle zu verwenden. Weitere Informationen zu dieser Einstellung finden sich in unserer Dokumentation zu Datenkontrollen.

Canto erzielte die niedrigste Wortfehlerrate (WER) unter den Modellen in unserem Vergleich. WER misst Wortersetzungen, Auslassungen und Einfügungen im Verhältnis zu einer von Menschen transkribierten Referenz (niedriger ist besser).

Wichtige Entitäten: Unternehmen: Wispr Flow, Wispr Advanced Interfaces Lab, Google, Open AI, Assembly AI, Deepgram | Personen: Ariya Rastrow