HeadlinesBriefing favicon HeadlinesBriefing.com

Transformer Explainer: LLM Transformer मॉडल का दृश्य विवरण

Hacker News •
×

Transformer एक न्यूरल नेटवर्क आर्किटेक्चर है जिसने कृत्रिम बुद्धिमत्ता को मौलिक रूप से बदल दिया है। 2017 के पेपर "Attention is All You Need" में प्रस्तुत, यह OpenAI के GPT, Meta के Llama और Google के Gemini जैसे मॉडलों को शक्ति देता है, और ऑडियो जनरेशन, छवि पहचान, प्रोटीन संरचना भविष्यवाणी और गेम खेलने में लागू किया जाता है। टेक्स्ट-जनरेटिव Transformer स्व-ध्यान का उपयोग करके अगले टोकन की भविष्यवाणी करते हैं, लंबी दूरी की निर्भरताओं को पकड़ते हैं। Transformer Explainer GPT-2 (small) द्वारा संचालित है जिसमें 124 मिलियन पैरामीटर हैं, और यह अत्याधुनिक मॉडलों के साथ आर्किटेक्चरल घटक साझा करता है।

प्रत्येक टेक्स्ट-जनरेटिव Transformer में तीन प्रमुख घटक होते हैं: Embedding टोकन को संख्यात्मक वेक्टर में परिवर्तित करता है जो अर्थपूर्ण अर्थ को पकड़ते हैं; Transformer Block ध्यान तंत्र (Attention Mechanism) (टोकन को संवाद करने की अनुमति देता है) और MLP (प्रत्येक टोकन के प्रतिनिधित्व को परिष्कृत करता है) के साथ इनपुट डेटा को संसाधित और रूपांतरित करता है; Output Probabilities एम्बेडिंग को अगले-टोकन संभावनाओं में बदल देता है।

Embedding "Data visualization empowers users to" जैसे प्रॉम्प्ट को संख्यात्मक प्रतिनिधित्व में परिवर्तित करता है। चरण: 1) Tokenization टेक्स्ट को टोकन में तोड़ता है (GPT-2 में 50,257 अद्वितीय टोकन हैं); 2) Token Embedding प्रत्येक टोकन को 768-आयामी वेक्टर के रूप में दर्शाता है; 3) Positional Encoding; 4) Final Embedding। ये चरण मॉडल को टेक्स्ट संसाधित और उत्पन्न करने में सक्षम बनाते हैं।

प्रमुख संस्थाएँ: कंपनियाँ: OpenAI, Meta, Google