نطلق اليوم Whistle، وهو نموذج مفتوح للتعرف على الكلام مصمم للهواتف المحمولة والأجهزة القابلة للارتداء والروبوتات وأجهزة المنزل الذكي والأنظمة الأوتوماتيكية والمتحكمات الدقيقة. وهو ملف واحد بحجم 16.9 ميغابايت يعمل على المعالج دون أي تبعيات. يُحمَّل في محرك C++ نفسه الذي يستخدمه Needle، ويشارك حاويته وتكميمه، لذا يمكن لملف ثنائي واحد تحويل مقطع صوتي منطوق مباشرة إلى استدعاءات أدوات.
يؤدي Whistle ثلاث مهام بالكامل على الجهاز. يقوم بتفريغ ما يصل إلى 30 ثانية من الصوت أحادي القناة بتردد 16 كيلوهرتز بلغات الإنجليزية والألمانية والفرنسية والإسبانية والإيطالية والهولندية والبولندية، ويكتشف اللغة ما لم تُحدَّد. ويُنتج الطوابع الزمنية للكلمات، مع وقت البداية والنهاية واحتمال كل كلمة، مُحاذاة من انتباه المفكِّك. كما يمكنه إخراج تضمين كلامي، صفاً واحداً لكل إطار مدته 80 ملي ثانية، دون فك ترميز نص. ويصل النموذج إلى أول رمز خلال 11 ملي ثانية.
تتكون البنية من نصفين. تحوّل الواجهة الأمامية الصوت إلى 80 نطاقاً لوغاريتمياً من طيف ميل، وتستخدم جذعاً التفافياً لتقليص 30 ثانية إلى 375 إطاراً. ثم يطبّق المشفِّر ثماني كتل Simple Attention مشتركة مع Needle، مع انتباه غير سببي، بحيث يمكن للإطار عند الثانية 3 أن ينتبه إلى إطار عند الثانية 12. ويستخدم المفكِّك ثماني كتل Laddered Simple Attention بعرض 512، مع انتباه تقاطعي مُبوَّب في كل طبقة يقرأ مخرجات المشفِّر. تُحسب هذه الإسقاطات مرة واحدة لكل مقطع، لذا فإن مسارات البحث الخمسة بالشعاع لا تكلّف سوى خمس ذاكرات تخزين مؤقتة قصيرة للنص بدلاً من خمس مرات مرور على الصوت.
يستخدم فك الترميز خمسة أشعة تُقيَّم باحتمال لوغاريتمي مُطبَّع بالطول. ويعمل تحيّز الكلمات المفتاحية بأتوماتا Aho-Corasick على العبارات التي يزوّد بها المستخدم، ويرفع احتمالها مع تقدم البحث. ويحتوي المفردات على 8,192 جزءاً نصياً إضافةً إلى سبعة رموز للغة، ويُحدّ النص المفرّغ بـ 320 رمزاً.
النموذج متاح أيضاً في بيئة تجريبية داخل المتصفح، حيث لا يغادر الصوت الجهاز أبداً.
المصدر: Hacker News · لخّصه HeadlinesBriefing