HeadlinesBriefing favicon HeadlinesBriefing.com

تصور الانتباه في LLM: آلية النسخ واللصق

Hacker News •
×

يمكن لنماذج LLM القائمة على المحولات استخلاص المعلومات من أي رمز سابق أثناء التوليد، ولكن يجب أن تكون انتقائية. يمكن تصور هذه الآلية بالنقر أو التمرير فوق الرموز المولدة لرؤية الرموز السابقة التي أثرت عليها.

يحسب التصور وزن الانتباه المقياس بحجم متجه القيمة، المجمع عبر الرؤوس والطبقات، ثم يتحكم في شفافية الرموز السابقة. على الرغم من التبسيط، تظهر أنماط مثيرة للاهتمام. على سبيل المثال، في موجه "Office Move Summary"، يبرز النص المنسوخ مثل العناوين والتواريخ لأن الرمز المولد يستخلص بشكل كبير من بيانات المصدر.

هذا يعالج لغزًا: إذا كانت نماذج LLM تتنبأ بالرموز احتماليًا، فلماذا هي جيدة جدًا في النسخ واللصق؟ تظهر الآلية أن النموذج لا يتنبأ بتسلسلات كاملة من حالات داخلية محدودة؛ بل يصل إلى جميع الرموز السابقة ويقرر من أيها يستخلص، مما يقلل من احتمال الخطأ.

في مثال آخر، التمرير فوق "remain" يظهر أنه يستخلص من "work" و"stay the same"، مما يجمع معلومات من عبارات مختلفة. يستخدم التصور تطبيق React مع Transformers.js، لكنه تطلب تعديل ملف .onnx لكشف القيم الداخلية، وموجهات مولدة مسبقًا للعرض الفوري.