HeadlinesBriefing favicon HeadlinesBriefing.com

Gemini 3.5 Transcribe: تحويل الكلام إلى نص بدقة

Google DeepMind Blog •
×

اليوم، نقدم Gemini 3.5 Transcribe، وهو نموذجنا الأكثر دقة لتحويل الكلام إلى نص حتى الآن، مصمم للتفاعلات الصوتية الذكية. على عكس نماذج التعرف على الكلام التقليدية التي تواجه صعوبة في الضوضاء الخلفية والمصطلحات المعقدة وتنظيف عدم الطلاقة، يحول Gemini 3.5 Transcribe الصوت الخام مباشرة إلى نص دقيق ومصقول ومنسق.

في منتجاتنا مثل تطبيق Gemini وعلى Android، شهدنا أن المستهلكين يستفيدون بالفعل من هذا النموذج للنسخ مع قدرات صوتية جديدة مثل Rambler على Android وفي تطبيق Gemini على macOS. الآن، يمكن للمطورين بناء قدرات مماثلة مع Gemini 3.5 Transcribe في Gemini API في Google AI Studio ومنصة Gemini Enterprise Agent Platform.

النموذج متاح عبر واجهتي برمجة تطبيقات منفصلتين: البث في الوقت الفعلي يوفر بثًا مستمرًا ثنائي الاتجاه مع زمن استجابة أقل من ثانية لتطبيقات الصوت التفاعلية عبر Live API باستخدام gemini-3.5-transcribe-live. معالجة الصوت المسجل مسبقًا تنسخ الصوت المسجل والاجتماعات وسجلات المكالمات والمزيد مع إسناد المتحدث والطوابع الزمنية على مستوى الكلمة عبر Interactions API باستخدام gemini-3.5-transcribe.

وفقًا لقياسات Artificial Analysis، يحقق متوسط معدل خطأ الكلمات (WER) يبلغ 4.0% للبث و 2.6% لحالات الاستخدام غير البثية. يُظهر أداءً قويًا في البيئات الصاخبة في العالم الحقيقي، ويلتقط بدقة الكيانات الأبجدية الرقمية مثل الرموز البريدية ومعرفات الطلبات. يمثل أداء Gemini 3.5 Transcribe تقدمًا كبيرًا عن نموذج النسخ السابق لدينا، Chirp 3، حيث يقدم قدرات جديدة ومعدلات خطأ كلمات محسنة وزمن استجابة أفضل بشكل ملحوظ.

الكيانات الرئيسية: الشركات: Google DeepMind، Google | الأشخاص: Luke Leonhard