HeadlinesBriefing favicon HeadlinesBriefing.com

Meta transkripsi 20+ pembicara real-time

Engadget •
×

Meta telah memperkenalkan model audio real-time pertamanya, Muse Voice Transcribe, dari Meta Superintelligence Lab (MSI). Model ini dapat menangani dikte dan transkripsi untuk lebih dari 20 pembicara dan menangani banyak bahasa sekaligus dengan mulus. CEO Meta, Mark Zuckerberg, membagikan contoh yang menunjukkan kemampuan model untuk membedakan pembicara dan beralih antar bahasa, termasuk "code-switching".

"Model memutuskan kapan harus mendengarkan. Ia menunggu sedikit lebih lama pada kata-kata sulit dan berkomitmen lebih cepat pada kata-kata mudah, menggunakan penundaan adaptif untuk memprediksi setiap token dan meningkatkan akurasi," jelas Zuckerberg. "Ia juga bertahan pada audio nyata yang berantakan — dilatih pada 70+ bahasa (dengan 25 divalidasi saat peluncuran), menangani code-switching di tengah kalimat, dan mengelola sesi satu jam dengan 20+ pembicara."

Rilis Meta menyusul Google Gemini 3.5 Transcribe kurang dari seminggu. Sementara Google mengintegrasikan modelnya ke Android dan Chrome, rencana Meta untuk Muse Voice Transcribe masih belum jelas. Saat ini, model ini mendukung dikte di aplikasi Mac Meta dan tersedia untuk pengembang melalui Muse Code dan API Model Meta, dengan harga $3 per 1.000 menit audio.

Ini adalah rilis terbaru MSL, setelah agen pengkodean dan model open-weight. Demo tersedia di blog riset Meta.

Entitas Kunci: Perusahaan: Meta, Google, Muse, MSI | Orang: Mark Zuckerberg, Alexandr Wang