HeadlinesBriefing favicon HeadlinesBriefing.com

ट्रांसफॉर्मर सर्किट्स का गणितीय ढांचा

Hacker News •
×

यह पेपर मैकेनिस्टिक इंटर्प्रिटैबिलिटी के माध्यम से ट्रांसफॉर्मर भाषा मॉडल्स के रिवर्स इंजीनियरिंग के प्रारंभिक कदम प्रस्तुत करता है। जब मॉडल्स जैसे GPT-3, LaMDA, Codex, Meena और Gopher स्केल करते हैं, तो उनका खुला स्वरूप अप्रत्याशित हानिकारक व्यवहार के जोखिम पैदा करता है। मैकेनिस्टिक इंटर्प्रिटैबिलिटी विस्तृत गणनाओं के रिवर्स इंजीनियरिंग का प्रयास करती है, जिसकी तुलना बाइनरी को स्रोत कोड में रिवर्स इंजीनियरिंग करने से की जाती है, जो सुरक्षा समस्याओं के लिए व्यवस्थित दृष्टिकोण प्रदान कर सकती है।

लेखक केवल दो परतों या उससे कम परतों वाले ध्यान-केवल ट्रांसफॉर्मर का अध्ययन करते हैं, जो GPT-3 की 96 परतों के साथ ध्यान और MLP ब्लॉक्स के वैकल्पिक होने से भिन्न है। ट्रांसफॉर्मर ऑपरेशन्स को गणितीय रूप से समान ढांचे में अवधारित करके, वे आंतरिक ऑपरेशन्स की महत्वपूर्ण समझ प्राप्त करते हैं। प्रमुख पायलटीज़ में शामिल हैं: शून्य-परत वाले ट्रांसफॉर्मर वज़न से सीधे पहुँच योग्य बिग्राम सांख्यिकी मॉडल करते हैं; एक-परत मॉडल बिग्राम और "स्किप-ट्राइग्राम" (क्रम जैसे "A… B C") मॉडल्स के समूह हैं जिनके सीधे पहुँच योग्य तालिकाएँ हैं; और विशिष्ट "इंडक्शन हेड्स" छोटे मॉडल्स में संदर्भ-में-सीखने की व्याख्या करते हैं, जो केवल कम से कम दो ध्यान परतों वाले मॉडल्स में विकसित होते हैं।

ढांचे में वर्चुअल वज़ट, संचार चैनल के रूप में रेज़िड्यूअल स्ट्रीम, स्वतंत्र जोड़ीय ध्यान हेड्स, पाथ एक्सपेंशन ट्रिक्स और QK/OV सर्किट एनालिसिस जैसी अवधारणाएँ शामिल हैं। हालाँकि यह पहला पेपर अभी तक बड़े मॉडल्स पर लागू नहीं किया गया है, लेकिन आने वाला काम दिखाता है कि ढांचा और इंडक्शन हेड्स बड़े मॉडल्स के लिए आंंशिक रूप से प्रासंगिक रहते हैं, हालाँकि पूरा रिवर्स इंजीनियरिंग अभी दूर है।

मुख्य इकाइयें: कंपनीयाँ: GPT-3, LaMDA, Codex, Meena, Gopher

प्रायिक प्रश्न: इंडक्शन हेड्स क्या हैं और क्यों वे महत्वपूर्ण हैं?

इंडक्शन हेड्स विशिष्ट ध्यान हेड्स हैं जो छोटे ट्रांसफॉर्मर मॉडल्स में संदर्भ-में-सीखने की व्याख्या करते हैं। वे केवल कम से कम दो ध्यान परतों वाले मॉडल्स में विकसित होते हैं, जो यह सुझाव देता है कि ट्रांसफॉर्मर्स पैटर्न को कॉपी और पूरा करने के लिए संदर्भ से कैसे सीखते हैं, इसका एक मैकेनिस्टिक आधार है।

FAQ Q: इंडक्शन हेड्स क्या हैं और क्यों वे महत्वपूर्ण हैं?

FAQ A: इंडक्शन हेड्स विशिष्ट ध्यान हेड्स हैं जो छोटे ट्रांसफॉर्मर मॉडल्स में संदर्भ-में-सीखने की व्याख्या करते हैं। वे केवल कम से कम दो ध्यान परतों वाले मॉडल्स में विकसित होते हैं, जो यह सुझाव देता है कि ट्रांसफॉर्मर्स पैटर्न को कॉपी और पूरा करने के लिए संदर्भ से कैसे सीखते हैं, इसका एक मैकेनिस्टिक आधार है।