HeadlinesBriefing favicon HeadlinesBriefing.com

Meta transcreve 20+ falantes em tempo real

Engadget •
×

A Meta apresentou seu primeiro modelo de áudio em tempo real, Muse Voice Transcribe, do Meta Superintelligence Lab (MSI). O modelo pode lidar com ditado e transcrição para mais de 20 falantes e lidar perfeitamente com vários idiomas ao mesmo tempo. O CEO da Meta, Mark Zuckerberg, compartilhou um exemplo demonstrando a capacidade do modelo de distinguir entre falantes e alternar entre idiomas, incluindo "code-switching".

"O modelo decide quando ouvir. Ele espera um pouco mais em palavras difíceis e se compromete mais rápido em palavras fáceis, usando atraso adaptativo para prever cada token e aumentar a precisão", explicou Zuckerberg. "Ele também aguenta áudio real bagunçado — treinado em mais de 70 idiomas (com 25 validados no lançamento), lida com code-switching no meio da frase e gerencia sessões de uma hora com mais de 20 falantes."

O lançamento da Meta segue o Google Gemini 3.5 Transcribe em menos de uma semana. Enquanto o Google está integrando seu modelo no Android e Chrome, os planos da Meta para o Muse Voice Transcribe permanecem incertos. Atualmente, o modelo alimenta o ditado no aplicativo Mac da Meta e está disponível para desenvolvedores via Muse Code e a API de Modelos da Meta, com preço de $3 por 1.000 minutos de áudio.

Esta é a última publicação do MSL, após um agente de codificação e um modelo de pesos abertos. Uma demonstração está disponível no blog de pesquisa da Meta.

Entidades-chave: Empresas: Meta, Google, Muse, MSI | Pessoas: Mark Zuckerberg, Alexandr Wang