HeadlinesBriefing favicon HeadlinesBriefing.com

تناظر التباديل يكسر متوسط الشبكات العصبية

Towards Data Science •
×

إذا سبق لك أن حاولت متوسط أوزان الشبكات العصبية عن طريق تدريب نفس البنية مرتين على نفس البيانات، مع تغيير البذرة العشوائية فقط، فمن المحتمل أنك افترضت أن النتيجتين قابلتان للتبادل بشكل أساسي. كلا التشغيلين يتقاربان. كلاهما يصل إلى نفس الخسارة. لذا فأنت تأخذ متوسط متجهي الأوزان، متوقعًا شيئًا جيدًا على الأقل مثل أي منهما بمفرده. المتوسط أسوأ. غالبًا أسوأ بكثير. لم تكن هناك مشاكل أثناء عملية التدريب؛ هذه سمة هيكلية للشبكات العصبية ويمكن استنتاجها مباشرة من خاصية تُعرف بتناظر التباديل.

نفس المبدأ يفسر أيضًا لماذا ينجح دمج النماذج عندما ينجح ويفشل عندما يفشل، وهو سؤال في عام 2026 في قلب هندسة LLM العملية، سواء كان المرء يتعامل مع حساء النماذج أو المتوسط الفيدرالي. فكر في شبكتين مدربتين كجدولين يصفان نفس التقرير، باستثناء أن الأعمدة بترتيب مختلف. "العمود 3" للنموذج A قد يحتوي على ما يسميه النموذج B "العمود 7". كلا الجدولين صحيحان. لكن متوسطهما خلية بخلية دون مواءمة الأعمدة أولاً، فأنت تأخذ متوسط الإيرادات مع عدد الموظفين.

معظم مقدمات الشبكات العصبية تبقى في فضاء الدوال. هذا المقال يبقى في فضاء المعاملات: كيف يبدو مجموعة الحلول الجيدة فعليًا، وما تكلفك هذه الهندسة. النماذج الكلاسيكية مثل الانحدار متعدد الحدود لها دوال أساس ثابتة وخسارة محدبة. الشبكة العصبية تتعلم دوال الأساس نفسها، مما يجعل الخسارة غير محدبة. هذا اللاتحدب هو ثمن القدرة على التكيف. ثبّت الأساس، ونحصل على التحدب. تعلم الأساس، ونفقده. لا يوجد خيار ثالث.