HeadlinesBriefing favicon HeadlinesBriefing.com

LLM अटेंशन विज़ुअलाइज़ेशन: कॉपी-पेस्ट तंत्र

Hacker News •
×

ट्रांसफॉर्मर-आधारित LLM जनरेशन के दौरान किसी भी पिछले टोकन से जानकारी खींच सकते हैं, लेकिन उन्हें चयनात्मक होना चाहिए। इस तंत्र को जनरेटेड टोकन पर टैप या होवर करके देखा जा सकता है कि कौन से पिछले टोकन ने उन्हें प्रभावित किया।

विज़ुअलाइज़ेशन वैल्यू वेक्टर परिमाण द्वारा स्केल किए गए अटेंशन वेट की गणना करता है, हेड्स और लेयर्स में एकत्रित करता है, फिर पिछले टोकन की अपारदर्शिता को नियंत्रित करता है। सरलीकरण के बावजूद, दिलचस्प पैटर्न उभरते हैं। उदाहरण के लिए, "Office Move Summary" प्रॉम्प्ट में, पते और तारीखें जैसे कॉपी किए गए टेक्स्ट बाहर खड़े होते हैं क्योंकि जनरेटेड टोकन स्रोत डेटा से भारी मात्रा में खींचता है।

यह एक पहेली को संबोधित करता है: यदि LLM संभाव्य रूप से टोकन की भविष्यवाणी करते हैं, तो वे कॉपी-पेस्ट में इतने अच्छे क्यों हैं? तंत्र दिखाता है कि मॉडल सीमित आंतरिक अवस्थाओं से पूरे अनुक्रमों की भविष्यवाणी नहीं करता; यह सभी पिछले टोकन तक पहुंचता है और तय करता है कि किससे खींचना है, जिससे त्रुटि संभावना कम होती है।

एक अन्य उदाहरण में, "remain" पर होवर करने से पता चलता है कि यह "work" और "stay the same" से खींचता है, विभिन्न वाक्यांशों से जानकारी मिलाता है। विज़ुअलाइज़ेशन Transformers.js के साथ एक React ऐप का उपयोग करता है, लेकिन आंतरिक मानों को उजागर करने के लिए .onnx फ़ाइल को संशोधित करना आवश्यक था, और तत्काल देखने के लिए पूर्व-जनरेटेड प्रॉम्प्ट।