HeadlinesBriefing favicon HeadlinesBriefing.com

تسريع LLM 3x: فك الترميز التخميني

ByteByteGo •
×

كل وكيل يعمل بالفعل في حلقة. هندسة الحلقات تضيف حلقة حول الوكيل نفسه، مما تمكنه من تقييم مخرجاته، وإعادة المحاولة عندما يكون العمل دون المستوى، وتحسين تعليماته عندما تتكرر نفس الأخطاء. اليوم، أنت تؤدي هذا الدور: مراجعة العمل، وتشخيص ما حدث خطأ، وإعادة توجيه الوكيل. يوضح هذا المقال كيفية أتمتة هذه العملية بمثال عملي، مع استكشاف أين لا يزال الحكم البشري ضروريًا.

نموذج يحتوي على 70 مليار معلمة يتطلب قراءة حوالي 140 جيجابايت من الأوزان من ذاكرة GPU. على وحدة معالجة رسومات حديثة في مركز بيانات، قد يستغرق هذا النقل عشرات المللي ثانية. الحساب الفعلي المطبق على هذه الأوزان يستغرق جزءًا صغيرًا من ذلك الوقت. هذا يعني أن وحدات الرياضيات في المعالج تظل غير مستخدمة معظم الوقت الذي يستغرقه خطوة توليد الرموز. فك الترميز التخميني هو تقنية تحول هذه السعة غير المستخدمة إلى مخرجات.

نموذج ثانٍ أصغر بكثير ينتج عدة رموز مرشحة مسبقًا. يقوم النموذج الكبير بتقييمها جميعًا في تمريرة أمامية واحدة بدلاً من تمريرة لكل رمز، مما يؤدي إلى توليد أسرع بمقدار 2-3 مرات. والأفضل من ذلك، أن النص المنتج يظل مطابقًا إحصائيًا لمخرجات النموذج الكبير الذي يعمل بمفرده.

توليد النص يعمل رمزًا برمز. يقرأ النموذج كل ما تم إنتاجه حتى الآن، ويحسب توزيع الاحتمالات على مفرداته، ويختار الرمز التالي، ويضيف هذا الرمز إلى الإدخال، ويكرر الدورة. كل دورة تسمى تمريرة أمامية، وكل تمريرة أمامية تمرر الإدخال عبر جميع طبقات النموذج. تستخدم أنظمة الاستدلال الحديثة ذاكرة تخزين مؤقت KV، التي تخزن حالة الانتباه للرموز التي تمت معالجتها بالفعل، مما يقلل العمل داخل كل تمريرة، على الرغم من أن شرط تمريرة واحدة لكل رمز لا يزال قائمًا.

الكيانات الرئيسية: الشركات: ByteByteGo