HeadlinesBriefing favicon HeadlinesBriefing.com

Gemini 3.5 Transcribe:正確な音声テキスト変換

Google DeepMind Blog •
×

本日、当社はこれまでで最も正確な音声テキスト変換モデルである Gemini 3.5 Transcribe を発表します。これはインテリジェントな音声対話用に設計されています。背景ノイズ、複雑な専門用語、言い淀みのクリーンアップに苦労する従来の音声認識モデルとは異なり、Gemini 3.5 Transcribe は生の音声を正確で洗練されたフォーマット済みテキストに直接変換します。

Gemini アプリや Android などの当社製品では、Android の Rambler や macOS の Gemini アプリなどの新しい音声機能により、消費者がすでにこの文字起こしモデルの恩恵を受けているのを確認しています。現在、開発者は Google AI Studio の Gemini API と Gemini Enterprise Agent Platform で Gemini 3.5 Transcribe を使用して同様の機能を構築できます。

このモデルは、2 つの別々の API で利用できます。リアルタイムストリーミングは、Live API を使用して gemini-3.5-transcribe-live を使用し、インタラクティブな音声アプリ向けにサブ秒のレイテンシーで継続的な双方向ストリーミングを提供します。録音済み音声処理は、Interactions API を使用して gemini-3.5-transcribe を使用し、話者属性と単語レベルのタイムスタンプ付きで、録音済み音声、会議、通話記録などを文字起こしします。

Artificial Analysis の測定によると、ストリーミングでは平均単語誤り率 (WER) 4.0%、非ストリーミングのユースケースでは 2.6% を達成しています。ノイズの多い実環境で強力なパフォーマンスを示し、郵便番号や注文 ID などの英数字エンティティを正確にキャプチャします。Gemini 3.5 Transcribe のパフォーマンスは、以前の文字起こしモデル Chirp 3 からの大きな進歩を表しており、新しい機能、改善された単語誤り率、大幅に優れたレイテンシーを提供します。

主要エンティティ: 企業: Google DeepMind、Google | 人物: Luke Leonhard