HeadlinesBriefing favicon HeadlinesBriefing.com

Meta、20+話者をリアルタイム文字起こし

Engadget •
×

Metaは、Meta Superintelligence Lab(MSI)から最初のリアルタイム音声モデルであるMuse Voice Transcribeを発表しました。このモデルは、20人以上の話者のディクテーションと文字起こしを処理し、複数の言語を同時にシームレスに処理できます。MetaのCEOであるMark Zuckerberg氏は、モデルが話者を区別し、言語を切り替える能力(「コードスイッチング」を含む)を示す例を共有しました。

「モデルはいつ聞くかを決定します。難しい単語では少し長く待ち、簡単な単語ではより速くコミットし、適応的遅延を使用して各トークンを予測し、精度を高めます」とZuckerberg氏は説明しました。「また、ノイズの多い実際の音声にも耐えます。70以上の言語でトレーニングされ(リリース時に25言語が検証済み)、文の途中でのコードスイッチングを処理し、20人以上の話者との1時間のセッションを管理します。」

Metaのリリースは、Google Gemini 3.5 Transcribeの発表から1週間も経たないうちに行われました。GoogleはモデルをAndroidとChromeに統合していますが、Muse Voice Transcribeに関するMetaの計画は不明のままです。現在、このモデルはMetaのMacアプリでのディクテーションを強化し、Muse CodeとMetaのモデルAPIを通じて開発者が利用でき、価格は1,000音声分あたり3ドルです。

これは、コーディングエージェントとオープンウェイトモデルに続く、MSLの最新リリースです。デモはMetaの研究ブログで利用できます。

主要エンティティ:企業:Meta、Google、Muse、MSI | 人物:Mark Zuckerberg、Alexandr Wang

FAQ:Muse Voice Transcribeとは何ですか?

Muse Voice Transcribeは、Meta初のリアルタイム音声認識モデルで、20人以上の話者と複数の言語のディクテーションと文字起こしを同時に処理します。

FAQ Q:Muse Voice Transcribeとは何ですか?

FAQ A:Muse Voice Transcribeは、Meta初のリアルタイム音声認識モデルで、20人以上の話者と複数の言語のディクテーションと文字起こしを同時に処理します。