HeadlinesBriefing favicon HeadlinesBriefing.com

Gemini 3.5 Transcribe: Fala para texto preciso

Google DeepMind Blog •
×

Hoje, estamos apresentando o Gemini 3.5 Transcribe, nosso modelo de fala para texto mais preciso até agora, projetado para interações de voz inteligentes. Ao contrário dos modelos convencionais de reconhecimento de fala que lutam com ruído de fundo, jargão complexo e limpeza de disfluência, o Gemini 3.5 Transcribe converte áudio bruto diretamente em texto preciso, polido e formatado.

Em nossos produtos como o aplicativo Gemini e no Android, vimos que os consumidores já estão se beneficiando deste modelo de transcrição com novos recursos de voz como Rambler no Android e no aplicativo Gemini no macOS. Agora, os desenvolvedores podem construir recursos semelhantes com o Gemini 3.5 Transcribe na API Gemini no Google AI Studio e na Plataforma de Agentes Empresariais Gemini.

O modelo está disponível em duas APIs separadas: Streaming em tempo real fornece streaming contínuo bidirecional com latência de menos de um segundo para aplicativos de voz interativos via Live API usando gemini-3.5-transcribe-live. O processamento de áudio pré-gravado transcreve áudio gravado, reuniões, registros de chamadas e mais com atribuição de falante e carimbos de tempo em nível de palavra via API de Interações usando gemini-3.5-transcribe.

Conforme medido pela Artificial Analysis, atinge uma taxa média de erro de palavra (WER) de 4,0% para streaming e 2,6% para casos de uso não streaming. Mostra forte desempenho em ambientes ruidosos do mundo real, capturando com precisão entidades alfanuméricas como códigos postais e IDs de pedido. O desempenho do Gemini 3.5 Transcribe representa um grande avanço em relação ao nosso modelo de transcrição anterior, Chirp 3, oferecendo novos recursos, taxas de erro de palavra melhoradas e latência significativamente melhor.

Entidades-chave: Empresas: Google DeepMind, Google | Pessoas: Luke Leonhard