مراسلة أكتوبر 2026 إلى s@qlabs.sh·الكود·ملخص تنفيذي نقدم أول طريقة من الدرجة الصفرية تنافس الانتشار العكسي في تدريب نماذج اللغة المحولية مسبقًا. يقوم Dust بتشويش التنشيطات (تشويش العقدة) بشكل مستقل عند كل رمز، لذا كل رمز هو عضو افتراضي في التجمع وتقيّم تمريرة أمامية واحدة جميعهم بالتوازي. يقترب Dust بشكل وثيق من الانتشار العكسي عند التجمع الكبير (أي حساب أكبر بكثير) وفي إعدادات متعددة يتجاوزه حتى. هذا يشير إلى أنه في نظام غني بالحساب قد نتمكن من تجاوز الانتشار العكسي. Dust أكثر كفاءة بمراتب من حيث الحجم من ES في فضاء الأوزان. من 1M رمز فصاعدًا، Dust هو في حدود $10^3$ إلى $10^4$ مرة أكثر كفاءة من تنفيذ محول لـ EGGROLL، وهي طريقة ES حديثة، بناءً على استقراءاتنا.
يُعتقد على نطاق واسع أن طرق الدرجة الصفرية لا تتوسع إلى الشبكات الكبيرة. بشكل لافت، نجد أن النماذج الأكبر أكثر كفاءة من حيث التجمع، وليس أقل: نموذج ذو 243M معلمة يتفوق على نموذج أصغر بـ 120 مرة في معظم أحجام التجمع. تتوافق تقديرات التدرج لـ Dust بشكل أفضل مع تقديرات الانتشار العكسي مع نمو التجمع، وتظل متوافقة جيدًا في كل مقياس نختبره، حتى 1B رمز، وهو أمر مشجع للتوسع.
بُني التعلم العميق حول الانتشار العكسي، الخوارزمية الوحيدة لتخصيص الائتمان القادرة على تدريب الشبكات العصبية الحديثة. ومع ذلك، مع زيادة الحساب، قد نفضل خوارزميات أكثر عمومية. الدرس المر (Sutton، 2019) هو أن الطرق العامة التي تتوسع مع الحساب تفوز في النهاية. بالمثل، قد تكون قابلية التفاضل تحيزًا استقرائيًا جيدًا في نظام الحساب المنخفض، لكن في نظام الحساب العالي تحد من مساحة البنية. من المحتمل أن تكون خوارزمية تخصيص ائتمان أكثر مرونة قائمة على البحث خطوة مهمة نحو تعميم أفضل بكثير. نسميها Dust، خوارزمية تحسين من الدرجة الصفرية تشوش التنشيطات.
المصدر: Hacker News · لخّصه HeadlinesBriefing