HeadlinesBriefing favicon HeadlinesBriefing.com

Google Gemini 3.8 TTS: Flash vs Flash-Lite para voz criativa

Google DeepMind Blog •
×

Google DeepMind introduziu dois novos modelos de texto para fala na família Gemini: Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS. Esses modelos transformam a geração de voz de predefinições estáticas para um estúdio criativo dinâmico, permitindo que criadores, desenvolvedores e empresas criem experiências de áudio mais ricas e expressivas. Gemini 3.8 Flash TTS é projetado para direção criativa profunda e design de personagens, permitindo que os usuários gerem vozes personalizadas do zero por meio de prompts em linguagem natural em jogos, audiolivros, podcasts e mídia interativa. Gemini 3.8 Flash-Lite TTS foca na geração de alto volume e custo eficiente, otimizado para dublagem, agentes de voz e conteúdo expressivo com controle fino de tom e ritmo.

Esses modelos expandem a família Gemini Audio, após lançamentos como 3.5 Live Translate, 3.5 Transcribe, 3.8 Live e 3.8 Live Extended Thinking. Os usuários podem escalar de 30 vozes originais para uma biblioteca infinita, acessando mais de 2.000 vozes prontas para produção com ampla cobertura linguística que inclui espanhol mexicano, francês do Quebec e inglês escocês. A replicação de voz é suportada a partir de uma amostra de apenas 30 segundos, respaldada pela verificação de consentimento, marca d'água Synth ID e credenciais C2PA.

Ambos os modelos oferecem controle preciso de desempenho linha por linha, geração de longa duração com mínimo desvio do falante, encenação nativa de cena com dois falantes e explosões vocais escritas para uma textura conversacional realista. As capacidades de remix de voz também estão chegando em breve, permitindo ajuste fino de timbre, tom, ritmo e acento por meio de prompts.

Principais entidades: Empresas: Google DeepMind, Google AI Studio, Google Vids | Pessoas: Alan Cowen

Perguntas frequentes: Quais são as diferenças principais entre Gemini 3.8 Flash TTS e Flash-Lite TTS?

Gemini 3.8 Flash TTS é projetado para direção criativa profunda e design de personagens, permitindo criar vozes personalizadas do zero com controle granular sobre indicações de atuação, ritmo e mudanças de dialeto. Flash-Lite TTS é otimizado para alto volume e escala de custo eficiente, ideal para dublagem, agentes de voz e conteúdo expressivo com controle fino de tom e ritmo.