HeadlinesBriefing favicon HeadlinesBriefing.com

Canto:面向真实世界听写的语音模型

Hacker News •
×

语音识别模型擅长转写干净的音频,但真实的听写很少发生在这样的条件下。数百万人使用 Wispr Flow 在办公桌前、会议间隙、通勤途中以及繁忙的办公室里发消息、写邮件、写代码、梳理思路。他们通过笔记本电脑麦克风、耳塞和耳机说话,背景中常常还有其他人声、音乐或交通噪音。今天,Wispr Advanced Interfaces Lab 推出 Canto,这是我们最新的实时听写语音模型。

在一项真实世界听写评测中,Canto 在我们测试的所有模型中取得了最低的词错误率。我们将 Canto 与来自 Google、Open AI、Assembly AI 和 Deepgram 的模型进行了比较。Canto 是 Wispr Advanced Interfaces Lab 更广泛的研究与开发项目中的首个模型。在这篇文章中,我们分享它的表现、我们如何训练它应对具有挑战性的真实世界条件,以及已经在塑造下一步方向的研究。

“今天,Wispr Advanced Interfaces Lab 推出 Canto,这是我们最新的实时听写语音模型。”——Ariya Rastrow,Wispr Flow 首席科学官

为了在真实世界条件下测试 Canto,我们创建了一个评测集,由来自 2,300 多名不同说话人的 10 小时英语 Wispr Flow 听写组成,并跨应用程序和用例随机抽样。我们在训练集和测试集的说话人之间实施了严格分离,以避免过拟合。每个样本都来自选择开启 Wispr 数据共享设置的用户,该设置允许以匿名方式使用他们的数据来评估和改进我们的模型。有关此设置的更多信息,请参阅我们的数据控制文档。

Canto 在我们比较的模型中取得了最低的词错误率(WER)。WER 衡量相对于人工转写参考的词语替换、遗漏和插入(越低越好)。

关键实体:公司:Wispr Flow、Wispr Advanced Interfaces Lab、Google、Open AI、Assembly AI、Deepgram | 人物:Ariya Rastrow

FAQ:什么是 Canto?

Canto 是 Wispr Advanced Interfaces Lab 推出的用于实时听写的语音模型。它在所有针对真实世界听写测试的模型中取得了最低的词错误率。

FAQ 问题:什么是 Canto?

FAQ 回答:Canto 是 Wispr Advanced Interfaces Lab 推出的用于实时听写的语音模型。它在所有针对真实世界听写测试的模型中取得了最低的词错误率。