HeadlinesBriefing favicon HeadlinesBriefing.com

Canto: Model Ucapan untuk Dikte Nyata

Hacker News •
×

Model pengenalan ucapan unggul dalam mentranskripsikan audio bersih, tetapi dikte nyata jarang terjadi dalam kondisi seperti itu. Jutaan orang menggunakan Wispr Flow untuk mengirim pesan, menulis email, menulis kode, dan mengembangkan ide di meja kerja, di sela rapat, selama perjalanan, dan di kantor yang sibuk. Mereka berbicara melalui mikrofon laptop, earbud, dan headset, sering kali dengan suara lain, musik, atau lalu lintas di latar belakang. Hari ini, Wispr Advanced Interfaces Lab memperkenalkan Canto, model ucapan terbaru kami untuk dikte waktu nyata.

Dalam evaluasi dikte dunia nyata, Canto meraih tingkat kesalahan kata terendah di antara semua model yang kami uji. Kami membandingkan Canto dengan model dari Google, Open AI, Assembly AI, dan Deepgram. Canto adalah model pertama dalam program riset dan pengembangan yang lebih luas di Wispr Advanced Interfaces Lab. Dalam posting ini, kami berbagi performanya, bagaimana kami melatihnya untuk menangani kondisi dunia nyata yang menantang, dan riset yang sudah membentuk apa yang akan datang berikutnya.

“Hari ini, Wispr Advanced Interfaces Lab memperkenalkan Canto, model ucapan terbaru kami untuk dikte waktu nyata.” — Ariya Rastrow, CSO, Wispr Flow

Untuk menguji Canto dalam kondisi dunia nyata, kami membuat set evaluasi yang terdiri dari 10 jam dikte Wispr Flow berbahasa Inggris dari lebih dari 2.300 pembicara unik, yang diambil secara acak di berbagai aplikasi dan kasus penggunaan. Kami menerapkan pemisahan ketat antara pembicara di set pelatihan dan pengujian untuk menghindari overfitting. Setiap sampel berasal dari pengguna yang mengaktifkan pengaturan berbagi data Wispr, yang memungkinkan datanya digunakan secara anonim untuk mengevaluasi dan meningkatkan model kami. Informasi lebih lanjut tentang pengaturan ini tersedia dalam dokumentasi kontrol data kami.

Canto meraih Tingkat Kesalahan Kata (WER) terendah di antara model dalam perbandingan kami. WER mengukur substitusi, penghilangan, dan penyisipan kata relatif terhadap referensi yang ditranskripsikan manusia (semakin rendah semakin baik).

Entitas Utama: Perusahaan: Wispr Flow, Wispr Advanced Interfaces Lab, Google, Open AI, Assembly AI, Deepgram | Orang: Ariya Rastrow