HeadlinesBriefing favicon HeadlinesBriefing.com

Gemini 3.5 Transcribe: Ucapan ke Teks Akurat

Google DeepMind Blog •
×

Hari ini, kami memperkenalkan Gemini 3.5 Transcribe, model ucapan-ke-teks kami yang paling akurat hingga saat ini, dirancang untuk interaksi suara yang cerdas. Tidak seperti model pengenalan ucapan konvensional yang kesulitan dengan kebisingan latar belakang, jargon kompleks, dan pembersihan disfluensi, Gemini 3.5 Transcribe mengubah audio mentah langsung menjadi teks yang akurat, dipoles, dan diformat.

Di produk kami seperti aplikasi Gemini dan di Android, kami telah melihat konsumen sudah mendapatkan manfaat dari model transkripsi ini dengan kemampuan suara baru seperti Rambler di Android dan di aplikasi Gemini di macOS. Sekarang, pengembang dapat membangun kemampuan serupa dengan Gemini 3.5 Transcribe di Gemini API di Google AI Studio dan Platform Agen Perusahaan Gemini.

Model ini tersedia melalui dua API terpisah: Streaming real-time menyediakan streaming dua arah berkelanjutan dengan latensi di bawah satu detik untuk aplikasi suara interaktif melalui Live API menggunakan gemini-3.5-transcribe-live. Pemrosesan audio pra-rekaman mentranskripsikan audio yang direkam, rapat, log panggilan, dan lainnya dengan atribusi pembicara dan stempel waktu tingkat kata melalui Interactions API menggunakan gemini-3.5-transcribe.

Seperti yang diukur oleh Artificial Analysis, model ini mencapai Tingkat Kesalahan Kata (WER) rata-rata 4,0% untuk streaming dan 2,6% untuk kasus penggunaan non-streaming. Model ini menunjukkan kinerja yang kuat di lingkungan dunia nyata yang bising, secara akurat menangkap entitas alfanumerik seperti kode pos dan ID pesanan. Kinerja Gemini 3.5 Transcribe mewakili kemajuan besar dari model transkripsi kami sebelumnya, Chirp 3, menawarkan kemampuan baru, tingkat kesalahan kata yang lebih baik, dan latensi yang jauh lebih baik.

Entitas Kunci: Perusahaan: Google DeepMind, Google | Orang: Luke Leonhard