HeadlinesBriefing favicon HeadlinesBriefing.com

Canto: نموذج صوتي للإملاء الواقعي

Hacker News •
×

تتفوق نماذج التعرف على الكلام في نسخ الصوت النقي، لكن الإملاء الحقيقي نادرًا ما يحدث في تلك الظروف. يستخدم الملايين Wispr Flow لمراسلة الآخرين، وكتابة رسائل البريد الإلكتروني، والبرمجة، والعمل على الأفكار على المكاتب، وبين الاجتماعات، وأثناء التنقل، وفي المكاتب المزدحمة. يتحدثون عبر ميكروفونات الحواسيب المحمولة وسماعات الأذن وسماعات الرأس، غالبًا مع أصوات أخرى أو موسيقى أو حركة مرور في الخلفية. اليوم، يقدّم Wispr Advanced Interfaces Lab نموذج Canto، أحدث نموذج صوتي لدينا للإملاء في الوقت الفعلي.

في تقييم للإملاءات في العالم الواقعي، حقق Canto أدنى معدل خطأ في الكلمات بين جميع النماذج التي اختبرناها. قارنّا Canto بنماذج من Google وOpen AI وAssembly AI وDeepgram. Canto هو أول نموذج في برنامج بحث وتطوير أوسع في Wispr Advanced Interfaces Lab. في هذا المنشور، نشارك كيف يؤدي، وكيف دربناه للتعامل مع الظروف الصعبة في العالم الواقعي، والبحث الذي يشكّل بالفعل ما سيأتي بعد ذلك.

«اليوم، يقدّم Wispr Advanced Interfaces Lab نموذج Canto، أحدث نموذج صوتي لدينا للإملاء في الوقت الفعلي.» — Ariya Rastrow، CSO، Wispr Flow

لاختبار Canto في ظروف العالم الواقعي، أنشأنا مجموعة تقييم تتكون من 10 ساعات من إملاءات Wispr Flow باللغة الإنجليزية من أكثر من 2,300 متحدث فريد، تم أخذ عينات منها عشوائيًا عبر التطبيقات وحالات الاستخدام. فرضنا فصلًا صارمًا بين المتحدثين في مجموعتي التدريب والاختبار لتجنب الإفراط في التخصيص. جاءت كل عينة من مستخدم اختار تفعيل إعداد مشاركة البيانات في Wispr، الذي يسمح باستخدام بياناته بشكل مجهول لتقييم نماذجنا وتحسينها. تتوفر مزيد من المعلومات حول هذا الإعداد في وثائق ضوابط البيانات لدينا.

حقق Canto أدنى معدل خطأ في الكلمات (WER) بين النماذج في مقارنتنا. يقيس WER استبدالات الكلمات وحذفها وإدراجها مقارنةً بمرجع منسوخ بشريًا (الأقل أفضل).

الكيانات الرئيسية: الشركات: Wispr Flow، Wispr Advanced Interfaces Lab، Google، Open AI، Assembly AI، Deepgram | الأشخاص: Ariya Rastrow

الأسئلة الشائعة: ما هو Canto؟

Canto هو نموذج صوتي للإملاء في الوقت الفعلي قدّمه Wispr Advanced Interfaces Lab. حقق أدنى معدل خطأ في الكلمات بين جميع النماذج التي اختُبرت على الإملاءات في العالم الواقعي.

سؤال شائع: ما هو Canto؟

إجابة شائعة: Canto هو نموذج صوتي للإملاء في الوقت الفعلي قدّمه Wispr Advanced Interfaces Lab. حقق أدنى معدل خطأ في الكلمات بين جميع النماذج التي اختُبرت على الإملاءات في العالم الواقعي.