HeadlinesBriefing favicon HeadlinesBriefing.com

Gemini 3.5 Transcribe: Präzise Sprache zu Text

Google DeepMind Blog •
×

Heute stellen wir Gemini 3.5 Transcribe vor, unser bisher präzisestes Sprach-zu-Text-Modell, das für intelligente Sprachinteraktionen entwickelt wurde. Im Gegensatz zu herkömmlichen Spracherkennungsmodellen, die mit Hintergrundgeräuschen, komplexem Fachjargon und der Bereinigung von Sprachstörungen zu kämpfen haben, wandelt Gemini 3.5 Transcribe rohes Audio direkt in genauen, polierten, formatierten Text um.

In unseren Produkten wie der Gemini-App und auf Android haben wir gesehen, dass Verbraucher bereits von diesem Transkriptionsmodell mit neuen Sprachfunktionen wie Rambler auf Android und in der Gemini-App auf macOS profitieren. Jetzt können Entwickler ähnliche Funktionen mit Gemini 3.5 Transcribe in der Gemini-API in Google AI Studio und der Gemini Enterprise Agent Platform erstellen.

Das Modell ist über zwei separate APIs verfügbar: Echtzeit-Streaming bietet kontinuierliches bidirektionales Streaming mit Latenz unter einer Sekunde für interaktive Sprach-Apps über die Live-API mit gemini-3.5-transcribe-live. Die Verarbeitung vorab aufgezeichneter Audiodaten transkribiert aufgezeichnetes Audio, Besprechungen, Anrufprotokolle und mehr mit Sprecherzuordnung und Wort-Zeitstempeln über die Interactions-API mit gemini-3.5-transcribe.

Wie von Artificial Analysis gemessen, erreicht es eine durchschnittliche Wortfehlerrate (WER) von 4,0% für Streaming und 2,6% für Nicht-Streaming-Anwendungsfälle. Es zeigt starke Leistung in lauten realen Umgebungen und erfasst alphanumerische Entitäten wie Postleitzahlen und Bestell-IDs genau. Die Leistung von Gemini 3.5 Transcribe stellt einen großen Fortschritt gegenüber unserem vorherigen Transkriptionsmodell Chirp 3 dar und bietet neue Funktionen, verbesserte Wortfehlerraten und deutlich bessere Latenz.

Wichtige Entitäten: Unternehmen: Google DeepMind, Google | Personen: Luke Leonhard