HeadlinesBriefing favicon HeadlinesBriefing.com

Google Gemini 3.8 TTS: Flash vs Flash-Lite untuk Suara Kreatif

Google DeepMind Blog •
×

Google DeepMind telah memperkenalkan dua model teks-ke-suara baru ke dalam keluarga Gemini: Gemini 3.8 Flash TTS dan Gemini 3.8 Flash-Lite TTS. Model-model ini mengubah pembuatan suara dari preset statik menjadi studio kreatif dinamis yang memungkinkan pembuat, pengembang, dan perusahaan untuk menciptakan pengalaman audio yang lebih kaya dan ekspresif. Gemini 3.8 Flash TTS dirancang untuk arahan kreatif yang mendalam dan desain karakter, memungkinkan pengguna untuk menghasilkan suara kustom dari nol melalui prompt bahasa natural dalam permainan, audiobook, podcast, dan media interaktif. Gemini 3.8 Flash-Lite TTS berfokus pada skala volume tinggi dan biaya efisien, dioptimalkan untuk dubbing, agen suara, dan konten ekspresif dengan kontrol halus atas nada dan ritme.

Model-model ini memperluas keluarga Gemini Audio, mengikuti rilis seperti 3.5 Live Translate, 3.5 Transcribe, 3.8 Live, dan 3.8 Live Extended Thinking. Pengguna dapat meningkatkan skala dari 30 suara asli menjadi perpustakaan tak terbatas, mengakses lebih dari 2.000 suara yang siap produksi dengan cakupan bahasa yang luas termasuk Spanyol Meksiko, Prancis Quebec, dan Inggris Skotlandia. Replikasi suara didukung dari sampel hanya 30 detik, yang didukung oleh verifikasi persetujuan, watermark Synth ID, dan kredensial C2PA.

Kedua model menawarkan kontrol performa baris demi baris yang tepat, pembentukan panjang dengan drift pembicara minimal, penahbunan adegan dua pembicara asli, dan ledakan vokal yang berskript untuk tekstur obrolan yang realistis. Kemampuan remix suara juga akan segera hadir, yang memungkinkan penyesuaian halus atas timber, pitch, pace, dan aksen melalui prompt.

Entitas Utama: Perusahaan: Google DeepMind, Google AI Studio, Google Vids | Orang: Alan Cowen