HeadlinesBriefing favicon HeadlinesBriefing.com

حيل إعادة المعلمات: تقليل تباين التدرجات

Towards Data Science •
×

حيلة إعادة المعلمات هي ما يجعل المشفرات التلقائية المتغايرة (VAEs) قابلة للتدريب باستخدام نزول التدرج العشوائي القياسي. تعمل بنقل العشوائية خارج رسم الحساب وتحويل تدرج غير معتاد لتوقع إلى مشتقة عادية لقاعدة السلسلة. VAE هي نموذج توليدي. يقوم المُشفِّر بربط بيانات الإدخال x بتوزيع على متغير كامن z، بينما يقوم فك التشفير بربط z المأخوذة كعينة بإعادة بناء x. ما يجعلها قابلة للتدريب هو هدفها، ELBO (الحد الأدنى للدليل)، أي بديل قابل للتعامل مع الاحتمالية الحقيقية للبيانات، يتكون من حد إعادة بناء وحد ينظم التوزيع الكامن نحو prior بسيط. لتدريب VAE يتضمن تعظيم هذا ELBO باستخدام نزول التدرج، وللقيام بذلك يجب حساب تدرج توقع؛ بدقة أكبر، يجب حساب تدرج جودة إعادة البناء المتوقعة بالنسبة للمتغيرات الكامنة z المأخوذة عشوائياً. يمر هذا المقال عبر تلك المشكلة، والعائلتين الرئيسيتين من مقدرات التدرج المستخدمة لحلها، ولماذا التدرجات المسارية التي يتم الحصول عليها من خلال إعادة المعلمات تميل إلى أن يكون لها تباين أقل بشكل كبير من البديل. مقدر تدرج ذو تباين منخفض ليس مجرد راحة نظرية. في الممارسة، يترجم مباشرة إلى منحنيات تدريب أكثر استقراراً، وتقلبات أقل في الخسارة، وتقارب أسرع، ونماذج نهائية أفضل. هذا بالغ الأهمية للنماذج المعقدة مثل VAEs، والشبكات العصبية البايزية، وعوامل تعلم التعزيز بالتحكم المستمر، حيث يمكن أن تكون إشارة التدريب مضطربة جداً بحيث لا تكون مفيدة. المشكلة: تدرجات التوقعات — لماذا يكسر العينة الانتشار العكسي. إذا أردنا التحسين بالنسبة لـ θ. إذا ظهر θ فقط داخل f، لكانت هذه مشكلة انتشار عكسي قياسية. التعقيد هو أن θ يُعلم التوزيع الذي تُسحب منه z — عملية العينة نفسها تعتمد على θ — لذلك لا يمكننا ببساطة دفع التدرج عبر رسم حسابي ثابت. تقديرات مونت كارلو لـ L(θ) سهلة (ارسم عينات، متوسط f(z))، لكن تقديرات مونت كارلو لـ θ L(θ) ليست تلقائية، لأن الاشتقاق عبر عملية أخذ العينات غير معرف بشكل جيد. هناك طريقتان عامتان للخروج من هذا: مقدر دالة الدرجة (REINFORCE) ومقدر المسار / إعادة المعلمات. كلاهما غير متحيز. يختلفان بشكل كبير في التباين. مقدر دالة الدرجة (REINFORCE): مرن لكنه عالي التباين. الخدعة الكلاسيكية هنا هي هوية مشتقة اللوغاريتم: عند التعويض بهذا في تدرج التوقع نحصل على ما هو الآن توقع مرة أخرى، لذا يمكن تقديره عن طريق أخذ عينات z ~ p_θ ومتوسط f(z)·∂log p_θ(z)/∂θ. هذا هو المقدر خلف REINFORCE في تعلم التعزيز بتدرج السياسة، وهو متعدد الاستخدامات حقاً. يعمل مع z المنفصل ولا يتطلب إعادة معلمات التوزيع. الكيانات الرئيسية: الشركات: Towards Data Science. سؤال متكرر: ما هي حيلة إعادة المعلمات ولماذا تقلل تباين التدرج؟ جواب متكرر: حيلة إعادة المعلمات تنقل العشوائية خارج رسم الحساب، وتحوّل تدرج التوقع إلى مشتقة سلسلة قياسية. هذا يسمح بتدرجات مسارية ذات تباين أقل بشكل كبير مقارنة بمقدرات دالة الدرجة مثل REINFORCE، مما يؤدي إلى تدريب أكثر استقراراً وتقارب أسرع للنماذج مثل VAEs وعوامل تعلم التعزيز بالتحكم المستمر.