HeadlinesBriefing favicon HeadlinesBriefing.com

Canto: modelo de fala para ditado real

Hacker News •
×

Os modelos de reconhecimento de fala se destacam na transcrição de áudio limpo, mas o ditado real raramente acontece nessas condições. Milhões usam o Wispr Flow para enviar mensagens, escrever e-mails, programar e trabalhar ideias em mesas, entre reuniões, durante deslocamentos e em escritórios movimentados. Eles falam por microfones de laptop, fones de ouvido e headsets, muitas vezes com outras vozes, música ou trânsito ao fundo. Hoje, o Wispr Advanced Interfaces Lab apresenta o Canto, nosso mais novo modelo de fala para ditado em tempo real.

Em uma avaliação de ditados do mundo real, o Canto alcançou a menor taxa de erro de palavras entre todos os modelos que testamos. Comparamos o Canto com modelos do Google, Open AI, Assembly AI e Deepgram. O Canto é o primeiro modelo de um programa mais amplo de pesquisa e desenvolvimento no Wispr Advanced Interfaces Lab. Neste post, compartilhamos como ele se sai, como o treinamos para lidar com condições desafiadoras do mundo real e a pesquisa que já está moldando o que vem a seguir.

“Hoje, o Wispr Advanced Interfaces Lab apresenta o Canto, nosso mais novo modelo de fala para ditado em tempo real.” — Ariya Rastrow, CSO, Wispr Flow

Para testar o Canto em condições do mundo real, criamos um conjunto de avaliação composto por 10 horas de ditados do Wispr Flow em inglês de mais de 2.300 falantes únicos, amostrados aleatoriamente entre aplicativos e casos de uso. Impusemos uma separação rigorosa entre os falantes dos conjuntos de treino e teste para evitar overfitting. Cada amostra veio de um usuário que optou pela configuração de compartilhamento de dados do Wispr, que permite que seus dados sejam usados anonimamente para avaliar e melhorar nossos modelos. Mais informações sobre essa configuração estão disponíveis na nossa documentação de controles de dados.

O Canto alcançou a menor taxa de erro de palavras (WER) entre os modelos da nossa comparação. O WER mede substituições, omissões e inserções de palavras em relação a uma referência transcrita por humanos (quanto menor, melhor).

Entidades principais: Empresas: Wispr Flow, Wispr Advanced Interfaces Lab, Google, Open AI, Assembly AI, Deepgram | Pessoas: Ariya Rastrow