HeadlinesBriefing favicon HeadlinesBriefing.com

谷歌Gemini 3.8 TTS模型:Flash与Flash-Lite对比

Google DeepMind Blog •
×

谷歌DeepMind已向Gemini系列引入两款新型文本转语音模型:Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS。这些模型将语音生成从静态预设转变为动态创意工作室,使创作者、开发者和企业能够打造更丰富、更具表现力的音频体验。Gemini 3.8 Flash TTS专为深度创意指导和角色设计而构建,允许用户通过自然语言提示在游戏、有声书、播客和交互式媒体中从零开始生成自定义声音。Gemini 3.8 Flash-Lite TTS专注于高容量、成本效益的规模化,优化用于配音、语音代理和具有细粒度语调和节奏控制的表达内容。

这些模型扩展了Gemini Audio系列,继承了3.5 Live Translate、3.5 Transcribe、3.8 Live和3.8 Live Extended Thinking等版本。用户可从30种原始声音扩展至无限库,访问超过2000种具备广泛语言覆盖的生产就绪声音,包括墨西哥西班牙语、魁北克法语和苏格兰英语。语音复制仅需30秒样本即可实现,并有同意验证、Synth ID水印和C2PA凭据作为支持。

两款模型均提供精确的逐行性能控制、长格式生成且说话人漂移最小、原生双人场景布置以及脚本化语音爆裂以实现真实的对话质感。语音混音功能也将很快推出,允许通过提示对音色、音高、语速和口音进行微调。

关键实体:公司:Google DeepMind、Google AI Studio、Google Vids | 人物:Alan Cowen

常见问题:Gemini 3.8 Flash TTS和Flash-Lite TTS之间的主要区别是什么?

Gemini 3.8 Flash TTS专为深度创意指导和角色设计而设计,支持从零开始创建自定义声音,并对表演提示、节奏和方言转换具有细粒度控制。Flash-Lite TTS针对高容量、成本效益的规模化进行了优化,适用于配音、语音代理和具有细粒度语调和节奏控制的表达内容。