HeadlinesBriefing favicon HeadlinesBriefing.com

Meta ينسخ 20+ متحدثًا في الوقت الفعلي

Engadget •
×

قدمت Meta أول نموذج صوتي في الوقت الفعلي، Muse Voice Transcribe، من مختبر Meta للذكاء الفائق (MSI). يمكن للنموذج التعامل مع الإملاء والنسخ لأكثر من 20 متحدثًا والتعامل بسلاسة مع لغات متعددة في وقت واحد. شارك الرئيس التنفيذي لشركة Meta، مارك زوكربيرغ، مثالًا يوضح قدرة النموذج على التمييز بين المتحدثين والتبديل بين اللغات، بما في ذلك "تبديل الرموز".

"يقرر النموذج متى يستمع. ينتظر لفترة أطول قليلاً على الكلمات الصعبة ويلتزم بشكل أسرع على الكلمات السهلة، باستخدام تأخير تكيفي للتنبؤ بكل رمز وزيادة الدقة،" أوضح زوكربيرغ. "إنه يصمد أيضًا على الصوت الحقيقي الفوضوي — تم تدريبه على أكثر من 70 لغة (مع التحقق من 25 لغة عند الإطلاق)، ويتعامل مع تبديل الرموز في منتصف الجملة، ويدير جلسات تستمر ساعة مع أكثر من 20 متحدثًا."

يأتي إصدار Meta بعد أقل من أسبوع من Google Gemini 3.5 Transcribe. بينما تدمج Google نموذجها في Android وChrome، تظل خطط Meta لـ Muse Voice Transcribe غير واضحة. حاليًا، يعمل النموذج على تشغيل الإملاء في تطبيق Meta لنظام Mac وهو متاح للمطورين عبر Muse Code وواجهة برمجة تطبيقات النماذج من Meta، بسعر 3 دولارات لكل 1000 دقيقة صوتية.

هذا هو أحدث إصدار من MSL، بعد وكيل برمجة ونموذج بأوزان مفتوحة. يتوفر عرض توضيحي على مدونة أبحاث Meta.

الكيانات الرئيسية: الشركات: Meta، Google، Muse، MSI | الأشخاص: مارك زوكربيرغ، ألكسندر وانغ

الأسئلة الشائعة: ما هو Muse Voice Transcribe؟

Muse Voice Transcribe هو أول نموذج إدراك صوتي في الوقت الفعلي من Meta يتعامل مع الإملاء والنسخ لأكثر من 20 متحدثًا ولغات متعددة في وقت واحد.

سؤال شائع: ما هو Muse Voice Transcribe؟

جواب شائع: Muse Voice Transcribe هو أول نموذج إدراك صوتي في الوقت الفعلي من Meta يتعامل مع الإملاء والنسخ لأكثر من 20 متحدثًا ولغات متعددة في وقت واحد.