HeadlinesBriefing favicon HeadlinesBriefing.com

Canto: речевая модель для реальной диктовки

Hacker News •
×

Модели распознавания речи отлично справляются с транскрибированием чистого аудио, но реальная диктовка редко происходит в таких условиях. Миллионы людей используют Wispr Flow, чтобы писать сообщения, электронные письма, код и прорабатывать идеи за рабочим столом, между встречами, в дороге и в шумных офисах. Они говорят через микрофоны ноутбуков, наушники-вкладыши и гарнитуры, часто на фоне других голосов, музыки или уличного движения. Сегодня Wispr Advanced Interfaces Lab представляет Canto — нашу новейшую речевую модель для диктовки в реальном времени.

В оценке диктовок в реальных условиях Canto достигла самой низкой частоты ошибок в словах среди всех протестированных нами моделей. Мы сравнили Canto с моделями от Google, Open AI, Assembly AI и Deepgram. Canto — первая модель в более широкой программе исследований и разработок Wispr Advanced Interfaces Lab. В этом посте мы рассказываем, как она работает, как мы обучили её справляться со сложными реальными условиями, и о исследованиях, которые уже формируют то, что будет дальше.

«Сегодня Wispr Advanced Interfaces Lab представляет Canto — нашу новейшую речевую модель для диктовки в реальном времени». — Ariya Rastrow, CSO, Wispr Flow

Чтобы протестировать Canto в реальных условиях, мы создали оценочный набор из 10 часов англоязычных диктовок Wispr Flow от более чем 2 300 уникальных говорящих, случайно выбранных по приложениям и сценариям использования. Мы обеспечили строгое разделение говорящих в обучающем и тестовом наборах, чтобы избежать переобучения. Каждый образец поступил от пользователя, который включил настройку обмена данными Wispr, позволяющую анонимно использовать его данные для оценки и улучшения наших моделей. Дополнительная информация об этой настройке доступна в нашей документации по управлению данными.

Canto достигла самой низкой частоты ошибок в словах (WER) среди моделей в нашем сравнении. WER измеряет замены, пропуски и вставки слов относительно эталона, транскрибированного человеком (чем ниже, тем лучше).

Ключевые сущности: Компании: Wispr Flow, Wispr Advanced Interfaces Lab, Google, Open AI, Assembly AI, Deepgram | Люди: Ariya Rastrow