HeadlinesBriefing favicon HeadlinesBriefing.com

Meta transcribe 20+ hablantes en tiempo real

Engadget •
×

Meta ha presentado su primer modelo de audio en tiempo real, Muse Voice Transcribe, del Laboratorio de Superinteligencia de Meta (MSI). El modelo puede manejar dictado y transcripción para más de 20 hablantes y manejar sin problemas múltiples idiomas a la vez. El CEO de Meta, Mark Zuckerberg, compartió un ejemplo que demuestra la capacidad del modelo para distinguir entre hablantes y cambiar entre idiomas, incluido el "cambio de código".

"El modelo decide cuándo escuchar. Espera un poco más en palabras difíciles y se compromete más rápido en palabras fáciles, usando un retraso adaptativo para predecir cada token y aumentar la precisión", explicó Zuckerberg. "También se mantiene firme en audio real y desordenado: entrenado en más de 70 idiomas (con 25 validados en el lanzamiento), maneja el cambio de código a mitad de frase y gestiona sesiones de una hora con más de 20 hablantes".

El lanzamiento de Meta sigue al de Google Gemini 3.5 Transcribe por menos de una semana. Mientras Google integra su modelo en Android y Chrome, los planes de Meta para Muse Voice Transcribe siguen sin estar claros. Actualmente, el modelo impulsa el dictado en la aplicación de Meta para Mac y está disponible para desarrolladores a través de Muse Code y la API de Modelos de Meta, con un precio de $3 por cada 1,000 minutos de audio.

Esta es la última publicación de MSL, después de un agente de codificación y un modelo de pesos abiertos. Hay una demostración disponible en el blog de investigación de Meta.

Entidades clave: Empresas: Meta, Google, Muse, MSI | Personas: Mark Zuckerberg, Alexandr Wang

Preguntas frecuentes: ¿Qué es Muse Voice Transcribe?

Muse Voice Transcribe es el primer modelo de percepción de audio en tiempo real de Meta que maneja dictado y transcripción para más de 20 hablantes y múltiples idiomas simultáneamente.

Pregunta frecuente Q: ¿Qué es Muse Voice Transcribe?

Pregunta frecuente A: Muse Voice Transcribe es el primer modelo de percepción de audio en tiempo real de Meta que maneja dictado y transcripción para más de 20 hablantes y múltiples idiomas simultáneamente.