HeadlinesBriefing favicon HeadlinesBriefing.com

Canto:実世界のディクテーション向け音声モデル

Hacker News •
×

音声認識モデルはクリーンな音声の文字起こしに優れていますが、実際のディクテーションがそのような条件下で行われることはほとんどありません。何百万人もの人々が Wispr Flow を使い、デスクで、会議の合間に、通勤中に、そして混雑したオフィスで、メッセージを送り、メールを書き、コードを書き、アイデアを練っています。彼らはノートパソコンのマイク、イヤホン、ヘッドセットを通して話し、しばしば背景に他の声、音楽、交通音があります。本日、Wispr Advanced Interfaces Lab は、リアルタイムディクテーション向けの最新音声モデル Canto を発表します。

実世界のディクテーションの評価において、Canto は私たちがテストしたすべてのモデルの中で最低の単語誤り率を達成しました。私たちは Canto を Google、Open AI、Assembly AI、Deepgram のモデルと比較しました。Canto は Wispr Advanced Interfaces Lab におけるより広範な研究開発プログラムの最初のモデルです。この記事では、その性能、困難な実世界の条件に対処するためのトレーニング方法、そして次の展開をすでに形作っている研究について共有します。

「本日、Wispr Advanced Interfaces Lab は、リアルタイムディクテーション向けの最新音声モデル Canto を発表します。」 — Ariya Rastrow、CSO、Wispr Flow

実世界の条件で Canto をテストするため、私たちは 2,300 人を超えるユニークな話者による 10 時間の英語 Wispr Flow ディクテーションからなる評価セットを作成し、アプリケーションとユースケースをまたいでランダムにサンプリングしました。過学習を避けるため、トレーニングセットとテストセットの話者を厳密に分離しました。すべてのサンプルは、Wispr のデータ共有設定をオプトインしたユーザーから提供されたもので、この設定により、モデルの評価と改善のためにデータを匿名で使用できます。この設定の詳細については、データ管理に関するドキュメントをご覧ください。

Canto は、私たちの比較におけるモデルの中で最低の単語誤り率(WER)を達成しました。WER は、人間が文字起こしした参照に対する単語の置換、脱落、挿入を測定します(低いほど良い)。

主要なエンティティ:企業:Wispr Flow、Wispr Advanced Interfaces Lab、Google、Open AI、Assembly AI、Deepgram | 人物:Ariya Rastrow

FAQ:Canto とは何ですか?

Canto は、Wispr Advanced Interfaces Lab が発表したリアルタイムディクテーション向けの音声モデルです。実世界のディクテーションでテストされたすべてのモデルの中で最低の単語誤り率を達成しました。

FAQ 質問:Canto とは何ですか?

FAQ 回答:Canto は、Wispr Advanced Interfaces Lab が発表したリアルタイムディクテーション向けの音声モデルです。実世界のディクテーションでテストされたすべてのモデルの中で最低の単語誤り率を達成しました。