HeadlinesBriefing favicon HeadlinesBriefing.com

Gemini 3.5 Transcribe : Reconnaissance vocale précise

Google DeepMind Blog •
×

Aujourd'hui, nous présentons Gemini 3.5 Transcribe, notre modèle de reconnaissance vocale le plus précis à ce jour, conçu pour des interactions vocales intelligentes. Contrairement aux modèles de reconnaissance vocale conventionnels qui peinent avec le bruit de fond, le jargon complexe et le nettoyage des disfluences, Gemini 3.5 Transcribe convertit directement l'audio brut en texte précis, soigné et formaté.

Dans nos produits comme l'application Gemini et sur Android, nous avons constaté que les consommateurs bénéficient déjà de ce modèle de transcription avec de nouvelles capacités vocales comme Rambler sur Android et dans l'application Gemini sur macOS. Désormais, les développeurs peuvent créer des capacités similaires avec Gemini 3.5 Transcribe dans l'API Gemini dans Google AI Studio et la plateforme Gemini Enterprise Agent Platform.

Le modèle est disponible via deux API distinctes : La diffusion en temps réel offre une diffusion continue bidirectionnelle avec une latence inférieure à la seconde pour les applications vocales interactives via l'API Live utilisant gemini-3.5-transcribe-live. Le traitement audio pré-enregistré transcrit l'audio enregistré, les réunions, les journaux d'appels et plus encore avec attribution du locuteur et horodatage au niveau du mot via l'API Interactions utilisant gemini-3.5-transcribe.

Selon les mesures d'Artificial Analysis, il atteint un taux d'erreur de mots (WER) moyen de 4,0% pour la diffusion en continu et de 2,6% pour les cas d'utilisation non diffusés. Il montre de bonnes performances dans des environnements bruyants réels, capturant avec précision des entités alphanumériques comme les codes postaux et les identifiants de commande. Les performances de Gemini 3.5 Transcribe représentent une avancée majeure par rapport à notre modèle de transcription précédent, Chirp 3, offrant de nouvelles capacités, des taux d'erreur de mots améliorés et une latence nettement meilleure.

Entités clés : Entreprises : Google DeepMind, Google | Personnes : Luke Leonhard