HeadlinesBriefing favicon HeadlinesBriefing.com

Transformer Explainer: شرح مرئي لنموذج LLM Transformer

Hacker News •
×

Transformer هي بنية شبكة عصبية غيّرت الذكاء الاصطناعي جذريًا. قُدّمت في ورقة عام 2017 بعنوان "Attention is All You Need"، وهي تشغّل نماذج مثل GPT من OpenAI وLlama من Meta وGemini من Google، وتُطبَّق في توليد الصوت والتعرف على الصور والتنبؤ ببنية البروتين ولعب الألعاب. تتنبأ نماذج Transformer المولِّدة للنص بالرمز التالي باستخدام الانتباه الذاتي، مما يلتقط التبعيات بعيدة المدى. Transformer Explainer مدعوم بـ GPT-2 (small) مع 124 مليون معامل، ويتشارك المكونات المعمارية مع أحدث النماذج.

كل نموذج Transformer مولِّد للنص له ثلاثة مكونات رئيسية: Embedding يحوّل الرموز إلى متجهات رقمية تلتقط المعنى الدلالي؛ Transformer Block يعالج ويحوّل بيانات الإدخال بآلية الانتباه (Attention Mechanism) (التي تسمح للرموز بالتواصل) وMLP (الذي يصقل تمثيل كل رمز)؛ Output Probabilities يحوّل التضمينات إلى احتمالات الرمز التالي.

Embedding يحوّل موجّهًا مثل "Data visualization empowers users to" إلى تمثيل رقمي. الخطوات: 1) Tokenization يقسّم النص إلى رموز (GPT-2 لديه 50,257 رمزًا فريدًا)؛ 2) Token Embedding يمثّل كل رمز كـمتجه من 768 بُعدًا؛ 3) Positional Encoding؛ 4) Final Embedding. تُمكّن هذه الخطوات النموذج من معالجة النص وتوليده.

الكيانات الرئيسية: الشركات: OpenAI، Meta، Google

الأسئلة الشائعة: ما هو الابتكار الجوهري في نماذج Transformer؟

آلية الانتباه الذاتي، التي تسمح بمعالجة التسلسلات الكاملة والتقاط التبعيات بعيدة المدى بشكل أكثر فعالية من البنى السابقة.

سؤال الأسئلة الشائعة: ما هو الابتكار الجوهري في نماذج Transformer؟

جواب الأسئلة الشائعة: آلية الانتباه الذاتي، التي تسمح بمعالجة التسلسلات الكاملة والتقاط التبعيات بعيدة المدى بشكل أكثر فعالية من البنى السابقة.