HeadlinesBriefing favicon HeadlinesBriefing.com

Google Gemini 3.8 TTS: Flash vs Flash-Lite для креативного голоса

Google DeepMind Blog •
×

Google DeepMind представил две новые модели текст-в-речь в семействе Gemini: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Эти модели преобразуют генерацию голоса из статических предустановок в динамичную творческую студию, позволяя создателям, разработчикам и предприятиям создавать более богатые и выразительные аудио-опыты. Gemini 3.8 Flash TTS разработан для глубокой творческой направленности и дизайна персонажей, позволяя пользователям генерировать кастомные голоса с нуля с помощью естественных языковых подсказок в играх, аудиокнигах, подкастах и интерактивных медиа. Gemini 3.8 Flash-Lite TTS ориентирован на высокий объем и экономичную масштабируемость, оптимизирован для дубляжа, голосовых агентов и выразительного контента с точным контролем тона и темпа.

Эти модели расширяют семейство Gemini Audio, следуя релизам вроде 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking. Пользователи могут масштабироваться от 30 исходных голосов до бесконечной библиотеки, получая доступ к более чем 2000 голосам, готовым к производству, с широкой языковой поддержкой, включая мексиканский испанский, кебекский французский и шотландский английский. Репликация голоса поддерживается из образца всего 30 секунд, подкрепленная проверкой согласия, водяным знаком Synth ID и учетными данными C2PA.

Обе модели обеспечивают точное построчное управление производительностью, генерацию длинных форм с минимальным дрейфом говорящего, нативную постановку сцен с двумя говорящими и скриптовые вокальные всплески для реалистичной разговорной текстуры. Возможности ремикса голоса также скоро появятся, позволяя тонко настраивать тембр, высоту тона, темп и акцент через подсказки.

Ключевые сущности: Компании: Google DeepMind, Google AI Studio, Google Vids | Люди: Alan Cowen

Часто задаваемые вопросы: Каковы ключевые различия между Gemini 3.8 Flash TTS и Flash-Lite TTS?

Gemini 3.8 Flash TTS предназначен для глубокой творческой направленности и дизайна персонажей, позволяя создавать кастомные голоса с нуля с гранулярным контролем над актерскими указаниями, темпом и изменениями диалекта. Flash-Lite TTS оптимизирован для высокого объема и экономичной масштабируемости, идеален для дубляжа, голосовых агентов и выразительного контента с точным контролем тона и темпа.