HeadlinesBriefing favicon HeadlinesBriefing.com

Meta transcrit 20+ locuteurs en temps réel

Engadget •
×

Meta a présenté son premier modèle audio en temps réel, Muse Voice Transcribe, du Meta Superintelligence Lab (MSI). Le modèle peut gérer la dictée et la transcription pour plus de 20 locuteurs et gérer simultanément plusieurs langues. Le PDG de Meta, Mark Zuckerberg, a partagé un exemple démontrant la capacité du modèle à distinguer les locuteurs et à passer d'une langue à l'autre, y compris le « code-switching ».

« Le modèle décide quand écouter. Il attend un peu plus longtemps sur les mots difficiles et s'engage plus rapidement sur les mots faciles, en utilisant un délai adaptatif pour prédire chaque jeton et augmenter la précision », a expliqué Zuckerberg. « Il tient également sur l'audio réel et désordonné — entraîné sur plus de 70 langues (avec 25 validées au lancement), gère le code-switching en milieu de phrase et gère des sessions d'une heure avec plus de 20 locuteurs. »

La sortie de Meta suit celle de Google Gemini 3.5 Transcribe de moins d'une semaine. Alors que Google intègre son modèle dans Android et Chrome, les plans de Meta pour Muse Voice Transcribe restent flous. Actuellement, le modèle alimente la dictée dans l'application Mac de Meta et est disponible pour les développeurs via Muse Code et l'API de modèles de Meta, au prix de 3 $ pour 1 000 minutes audio.

Il s'agit de la dernière publication de MSL, après un agent de codage et un modèle à poids ouverts. Une démo est disponible sur le blog de recherche de Meta.

Entités clés : Entreprises : Meta, Google, Muse, MSI | Personnes : Mark Zuckerberg, Alexandr Wang

FAQ : Qu'est-ce que Muse Voice Transcribe ?

Muse Voice Transcribe est le premier modèle de perception audio en temps réel de Meta qui gère la dictée et la transcription pour plus de 20 locuteurs et plusieurs langues simultanément.

Question FAQ : Qu'est-ce que Muse Voice Transcribe ?

Réponse FAQ : Muse Voice Transcribe est le premier modèle de perception audio en temps réel de Meta qui gère la dictée et la transcription pour plus de 20 locuteurs et plusieurs langues simultanément.