HeadlinesBriefing favicon HeadlinesBriefing.com

PSSA: نموذج ذكاء اصطناعي بلغة Rust يهزم المحولات

Hacker News •
×

PSSA (هندسة مساحة الحالة البلاستيكية) هو نموذج لغة صغير مكتوب بلغة Rust من الصفر، دون استخدام PyTorch أو TensorFlow. على عكس المحولات التي تسجل كل زوج من الرموز، فإن PSSA يعالج النص رمزًا رمزيًا عبر طبقة مساحة الحالة المتكررة مع بنك ذاكرة عرضية. على 12.7M رمز من Wiki Text-103، وصل PSSA إلى 3.98 من entropía المتقاطعة للتدريب مقابل 4.43 للمحولات — فجوة قدرها 0.45 nat. على البيانات غير المرئية، سجل PSSA 3.997 مقابل 4.429، مع دقة توقع الرمز التالي 24.1% مقابل 18.0%. استغرق توليد 200 رمز 226ms لـ PSSA مقابل 2,735ms للمحولات — أسرع 12x على وحدة المعالجة المركزية. تشمل الميزات الرئيسية مصفوفات الحالة المستمرة المتعلمّة، وبنك ذاكرة هيبربوليكي بسعة 512 فتحة، وأوزان مرنة مع بوابة مقاومة، وتجميع مغلق الشكل عبر انحدار الحافة. هذه نماذج أولية بحثية بحجم 1.5M معلمة، ليست نماذج إنتاج. تظل جودة النص ضعيفة لكليهما، لكن PSSA يُظهر كفاءة تعلم وسرعة متفوقة.

يختلف التصميم جذريًا عن المحولات: يزداد التكلفة بشكل خطي مع طول التسلسل بدلًا من التربيعي، ولا يتم إعادة قراءة السياق في كل خطوة. يحمل النموذج المتكرر حالة ذات حجم ثابت إلى الأمام، بينما تعيد المحولات قراءة نافذة السياق الكاملة لكل رمز.

يستخدم PSSA جبرًا خطيًا مكتوبًا يدويًا في Rust مع مسار تدريب CUDA وتنفيذ مرجعي لوحدة المعالجة المركزيةスカalar (الفرق الأقصى فيgradient 2.98e-8). يركز المقارنة على كفاءة التعلم، وليس على السلاسة.

الأسئلة الشائعة: كيف يختلف PSSA عن نماذج المحولات؟

يستخدم PSSA طبقة مساحة الحالة المتكررة التي تعالج رمزًا واحدًا في كل مرة بحجم حالة ثابت، وبنك ذاكرة عرضية، وأوزان مرنة تُعاد كتابتها أثناء المعالجة. تسجل المحولات كل زوج من الرموز عبر الانتباه، مما يؤدي إلى نمو تكلفة تربيعي. يتعلم PSSA أسرع، ويولد 12x أسرع على وحدة المعالجة المركزية، ويظهر تعميمًا أفضل على البيانات غير المرئية، على الرغم من أن كلا النموذجين هما نماذج أولية بحثية بحجم 1.5M معلمة وضعف جودة النص.