HeadlinesBriefing favicon HeadlinesBriefing.com

إطار رياضي لدوائر المحوّلات

Hacker News •
×

تقدم هذه الورقة خطوات أولية نحو عكس هندسة نماذج لغة المحوّلات من خلال القابلية التفسيرية الميكانيكية. بينما يتسع نماذج مثل GPT-3 وLaMDA وCodex وMeena وGopher، يخلق فتحها المفتوح المخاطر الناتجة оفات سلوكيات ضارة غير متوقعة. تهدف القابلية التفسيرية الميكانيكية إلى عكس هندسة الحسابات التفصيلية، على غرار عكس هندسة الثنائيات إلى شفرة مصدر، مما قد يوفر منهجًا نظاميًا لمشاكل الأمان.

يدرس المؤلفون محوّلات الانتباه فقط بطبقتين أو أقل، مقابل 96 طبقة في GPT-3 تبديل بين كتل الانتباه والـMLP. من خلال تصور عمليات المحوّل في إطار رياضي مكافئ، يكتسبون فهمًا كبيرًا للعمليات الداخلية. تشمل النتائج الرئيسية: تنموذج الصفر طبقة إحصاءات bigram يمكن الوصول إليها مباشرة من الأوزان؛ النماذج ذات الطبقة الواحدة مجموعات من نماذج bigram و"skip-trigram" (تسلاسل مثل "A… B C") بجداول يمكن الوصول إليها مباشرة؛ والرؤوس "induction heads" المحددة تفسر التعلم في السياق للنماذج الصغيرة، وتظهر فقط في نماذج بطبقتين من الانتباه على الأقل.

يشمل الإطار مفاهيم مثل الأوزان الافتراضية، والناتج المتبقي كقناة اتصال، والرؤوس الانتباهية الجمعية المستقلة، وحيل توسيع المسار، وتحليل دوائر QK/OV. على الرغم من أن هذه الورقة الأولى لم تُطبق بعد على نماذج أكبر، فإن الأعمال القادمة تُظهر أن الإطار ورؤوس الاستقراء لا يزالان ذو صلة جزئيًا بها للنماذج الأكبر، على الرغم من بقاء عكس الهندسة الكاملة بعيدًا.

كيانات رئيسية: الشركات: GPT-3, LaMDA, Codex, Meena, Gopher

الأسئلة المتكررة: ما هي رؤوس الاستقراء ولماذا هي مهمة؟

رؤوس الاستقراء هي رؤوس انتباه محددة تفسر التعلم في السياق لنماذج محوّلات صغيرة. إنها تظهر فقط في نماذج بطبقتين من الانتباه على الأقل، مما يشير إلى أساس ميكانيكي لكيفية تعلم المحوّلات لنسخ الأنماط وإكمالها من السياق.

FAQ Q: ما هي رؤوس الاستقراء ولماذا هي مهمة؟

FAQ A: رؤوس الاستقراء هي رؤوس انتباه محددة تفسر التعلم في السياق لنماذج محوّلات صغيرة. إنها تظهر فقط في نماذج بطبقتين من الانتباه على الأقل، مما يشير إلى أساس ميكانيكي لكيفية تعلم المحوّلات لنسخ الأنماط وإكمالها من السياق.