HeadlinesBriefing favicon HeadlinesBriefing.com

Gemini 3.5 Transcribe:精准语音转文字模型

Google DeepMind Blog •
×

今天,我们推出 Gemini 3.5 Transcribe,这是我们迄今为止最精准的语音转文字模型,专为智能语音交互而设计。与那些在背景噪声、复杂术语和流畅度清理方面表现不佳的传统语音识别模型不同,Gemini 3.5 Transcribe 能将原始音频直接转换为准确、精炼、格式化的文本。

在我们如 Gemini 应用和 Android 等产品中,我们已经看到消费者通过新的语音功能(如 Android 上的 Rambler 和 macOS 上的 Gemini 应用)受益于这一转录模型。现在,开发者可以通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 使用 Gemini 3.5 Transcribe 构建类似的功能。

该模型可通过两个独立的 API 使用:实时流式传输通过 Live API 使用 gemini-3.5-transcribe-live 提供连续的双向流式传输,延迟低于一秒,适用于交互式语音应用。预录音频处理通过 Interactions API 使用 gemini-3.5-transcribe 转录录音、会议、通话记录等,并带有说话人归属和词级时间戳。

根据 Artificial Analysis 的测量,它在流式用例中的平均词错误率(WER)为 4.0%,在非流式用例中为 2.6%。它在嘈杂的真实环境中表现出色,能准确捕获字母数字实体,如邮政编码和订单 ID。Gemini 3.5 Transcribe 的性能代表了我们从之前的转录模型 Chirp 3 的重大进步,提供了新功能、改进的词错误率和显著更低的延迟。

关键实体:公司:Google DeepMind、Google | 人物:Luke Leonhard