HeadlinesBriefing favicon HeadlinesBriefing.com

عدم القراءة اللغوية يهدد أمن LLM

Hacker News •
×

تُدرَّب النماذج اللغوية الكبيرة (LLMs) على توليد اللغة الطبيعية. ومع ذلك، تشير الأدلة إلى أن المخرجات اللغوية الخارجية للنموذج والسمات اللغوية المستخرجة ميكانيكيًا قد تكون عدسة غير موثوقة لفهم الحوسبة الداخلية للنموذج. نقدم مصطلح "عدم القراءة اللغوية" للإشارة على نطاق واسع إلى السيناريوهات التي تفشل فيها الآثار اللغوية الخارجية أو المسبار آليًا لنموذج LLM في تمثيل كيفية تفكير النموذج فعليًا. نجادل بأن شبح عدم القراءة اللغوية لا مفر منه بالنسبة للنماذج اللغوية الكبيرة التي لا يتم التعبير عن حساباتها الداخلية مباشرة عبر اللغة، بل عبر الرياضيات على فضاءات التنشيط (مع ترجمات فاقدة بين فضاءات التنشيط واللغة الطبيعية عند الطرفين).

إذا كان عدم القراءة اللغوية ممكنًا دائمًا، فإن آليات الأمن التي تعتمد على التقارير اللغوية الذاتية للنموذج (مثل مراقبة سلسلة التفكير، النقد الذاتي الدستوري، استبار التنشيط لمتجهات السمات المعرفة لغويًا) لا يمكن أن تكون سليمة تمامًا أبدًا؛ سيحتاج صندوق رمل النموذج دائمًا إلى تقنيات عزل لا تعتمد ضماناتها على قراءة الحالة اللغوية للنموذج على الإطلاق. نجادل بأن مراقبة مخرجات النموذج باستخدام تتبع التلوث هو نهج واعد لصندوق رمل فعال: بغض النظر عن كيفية تقديم النموذج لتقاريره اللغوية الذاتية، يمكن لسياسة تتبع التلوث أن تحدد مسبقًا أجزاء مختلفة من حالة النظام التي لا ينبغي أبدًا أن تتأثر بالبيانات المنتجة من النموذج.

نناقش أيضًا عدة آليات إضافية لصندوق الرمل (مثل المحاكاة الافتراضية القوية، التدقيق الخارجي لتكوينات صندوق الرمل) التي توفر مجتمعة أرضية حرجة تحت المراقبة اللغوية، وكانت ستخفف من استغلالات صندوق الرمل الأخيرة من قبل النماذج المتقدمة.