HeadlinesBriefing favicon HeadlinesBriefing.com

Meta transkribiert 20+ Sprecher in Echtzeit

Engadget •
×

Meta hat sein erstes Echtzeit-Audiomodell, Muse Voice Transcribe, vom Meta Superintelligence Lab (MSI) vorgestellt. Das Modell kann Diktat und Transkription für mehr als 20 Sprecher verarbeiten und mehrere Sprachen gleichzeitig nahtlos handhaben. Meta-CEO Mark Zuckerberg teilte ein Beispiel, das die Fähigkeit des Modells demonstriert, zwischen Sprechern zu unterscheiden und zwischen Sprachen zu wechseln, einschließlich "Code-Switching".

"Das Modell entscheidet, wann es zuhört. Es wartet bei schwierigen Wörtern etwas länger und verpflichtet sich bei einfachen Wörtern schneller, wobei es adaptive Verzögerung verwendet, um jedes Token vorherzusagen und die Genauigkeit zu erhöhen", erklärte Zuckerberg. "Es hält auch bei chaotischem, echtem Audio stand — trainiert auf über 70 Sprachen (mit 25 beim Start validiert), bewältigt Code-Switching mitten im Satz und verwaltet einstündige Sitzungen mit über 20 Sprechern."

Metas Veröffentlichung folgt Google Gemini 3.5 Transcribe um weniger als eine Woche. Während Google sein Modell in Android und Chrome integriert, bleiben Metas Pläne für Muse Voice Transcribe unklar. Derzeit unterstützt das Modell die Diktierfunktion in Metas Mac-App und ist für Entwickler über Muse Code und Metas Modell-API verfügbar, zum Preis von 3 $ pro 1.000 Audiominuten.

Dies ist die neueste Veröffentlichung von MSL, nach einem Codierungsagenten und einem Open-Weight-Modell. Eine Demo ist auf Metas Forschungsblog verfügbar.

Wichtige Entitäten: Unternehmen: Meta, Google, Muse, MSI | Personen: Mark Zuckerberg, Alexandr Wang