HeadlinesBriefing favicon HeadlinesBriefing.com

انفجار التباين في لوغ-سوم-إكسپ: حل أقل مربعات

Hacker News •
×

مهمة شائعة في تعلم الآلة هي تقدير أو تحسين دوال “لوغ-سوم-إكسپ” مع (محتملًا بشكل مستمر) العديد من الحدود مثل $$ log Big( int_{\mathcal{X}} e^{v(x)} dq(x) Big),$$ حيث \(v: \mathcal{X} \to \mathbb{R}\) هو بعض دالة الجهد، و\(q\) هو توزيع احتمالي على المجموعة \(\mathcal{X}\). هذا له العديد من التطبيقات عبر علوم البيانات، غالبًا من خلال تطبيع النماذج الاحتمالية، ولكن أيضًا كتقريب سلس للحد الأقصى، في المحولات عبر مشتقاتها، أو في التعلم المعزز عند استخدام تنظيم الإنتروبيا [19]. أحيانًا يكون المجموعة \(\mathcal{X}\) منتهية (محتملًا كبيرًا) ويمكن إجراء التكامل mediante الجمع الصريح، ولكن غالبًا ما يكون الحساب الدقيق غير ممكن، ويتم استخدام العينة من التوزيع الاحتمالي \(q\) بدلاً من ذلك. الصعوبة الرئيسية تنبع من تباين مثل هذه التقديرات، خاصة عندما يأخذ \(v\) قيمًا كبيرة. في أبسط مثال، لـ \(z_1,\dots,z_n \in \mathbb{R}\) مستقلة وتتبع توزيعًا طبيعيًا بمتوسط \(\mu\) وانحراف معياري \(\sigma^2\), فإن الخطأ النسبي المربع لتقدير \(\mathbb{E}[e^z]\) هو $$\frac{ {\rm var}\big( \frac{1}{n} \sum_{i=1}^n e^{z_i} \big) }{( \mathbb{E}[ e^{z} ])^2} = \frac{1}{n} \frac{ {\rm var}(e^z) }{( \mathbb{E}[ e^{z} ])^2} = \frac{ e^{\sigma^2}-1}{n}.$$ يقترب من الصفر عندما يزداد \(n\) (كما يمكن توقعه من قانون الأعداد الكبيرة)، لكنه ينفجر بشكل أسي عندما يزداد \(\sigma\). حتى أخذ اللوغاريتم لا يغير التباين المتفجر، أي أن ${\rm var}\big( \log \big( \frac{1}{n} \sum_{i=1}^n e^{z_i} \big)\big)$ يمكن أيضًا إظهاره أنه يزداد بشكل تقاربي مشابه في \frac{ e^{\sigma^2}-1}{n} (عندما يكون \(n\) كبيرًا، كما يمكن الحصول عليه من طريقة الدلتا).على الرغم من صعوبة التقدير، فإن دالة لوغ-سوم-إكسپ تأتي مع العديد من الخصائص الجيدة (وهذا هو السبب الذي يجعل الناس يحبونها)؛ أنا على وجه الخصوص أحب حقيقة أن (1) إنها تقريب سلس للحد الأقصى (انظر، على سبيل المثال، هذا المنشور السابق)، و(2) إنها طريقة لتطبيع النماذج الاحتمالية تتكيف مع تقدير الاحتمال الأقصى، خاصة في النماذج الاحتمالية الهرمية، حيث تؤدي افتراضات الاستقلالية (الشرطية) إلى قابلية فصل دوال الخسارة المرتبطة (كما يُستخدم بشكل شامل في النماذج الرسومية الاحتمالية).السؤال الرئيسي الذي أحاول الإجابة عنه في هذا المنشور هو: هل يمكننا الحفاظ على مزايا تحسين دوال لوغ-سوم-إكسپ مع تقليل تعرضنا لعيوبها الحاسوبية/الإحصائية؟ في الطرف الآخر من الطيف يقع انحدار أقل مربعات، مع ميزات معاكسة أساسًا: من الجانب الإيجابي، نحصل على بساطة حسابية وإحصائية بأشكال مختلفة، 예를 المثال، يؤدي إلى تقدير شكلي مغلق للخطوط عبر الجبر الخطي، وهو مبني على حساب اللحظات بتباين ثابت ومتحكم، ويؤدي إلى تحليلات حادة في各种 الإعدادات (التسارع، النزول التدرجي العشوائي، إلخ). انظر، على سبيل المثال، هذا المنشور عن التسارع، وهذا واحد عن المتوسط. من الجانب السلبي، استخدام انحدار أقل مربعات لجميع مشاكل التنبؤ، خاصة مع المخرجات المنفصلة، يخلق بعض الاصطناعات. المثال التقليدي هو التصنيف مع بيانات شرطية غاوسية (مع مصفوفاتcovariance متطابقة)، حيث يواجه انحدار أقل مربعات على المخرجات المشفرة one-hot مشاكل مثل “الإخفاء” (انظر [13، القسم 2.4] والمثال أدناه)، أو خطأ تقريب عالي مقارنة باستخدام انحدار لوجستي متعدد الحدود (المعروف أيضًا باسم انحدار softmax)، لأن ثم لوغاريتمات الاحتمالات الشرطية تكون خطية. هل يمكننا التوفيق بينهما؟ بمعنى آخر، هل انحدار أقل مربعات حقًا هو كل ما أحتاجه؟ (زملائي أحيانًا يسخرون من حبي لانحدار أقل مربعات).لاحظ أن هناك محاولة أخرى (كلاسيكية) لرؤية العالم من خلال أقل مربعات: القيام بذلك في سلسلة من خلال طريقة نيوتن، مما يؤدي في هذا السياق إلى أقل مربعات موزونة بشكل تكراري، لكن هذا هو للحساب فقط، دون تحسين إحصائي. ما نحن بصدد السعي إليه هو أقوى......