HeadlinesBriefing favicon HeadlinesBriefing.com

نسيان LLM وموعد روبوت 33 مللي ثانية

Towards Data Science •
×

:تتجاهل معظم أوقات تشغيل استدلال LLM المواعيد النهائية الفيزيائية. يرفض وقت تشغيل جديد مستند إلى CUDA لـ Qwen2.5-Coder-1.5B-Instruct البدء إذا لم يستطع الانتهاء خلال دورة تحكم روبوت تبلغ 33 مللي ثانية، ويطرد ذاكرة KV المؤقتة حسب المعنى (تشابه جيب التمام) بدلاً من العمر، ويستخدم مخزنًا مزدوجًا بدون قفل. يتجنب فيضان VRAM من تدفقات الرؤية المستمرة، ويمنع تفويت مواعيد حلقة التحكم، ويتعامل مع كاميرا 60 هرتز تتفوق على الاستدلال. بُني بالكامل بلغة CUDA مكتوبة يدويًا — بدون cuBLAS أو libtorch — على وحدة معالجة رسومات NVIDIA Hopper سحابية واحدة (sm_90) مع سقف VRAM بسعة 8 جيجابايت تم نمذجته في الكود، ولم يُقس على أجهزة حافة مثل Jetson. تفصل المعمارية الإدراك، والتحكم في القبول، والاستدلال: تغذي الكاميرا مخزنًا مؤقتًا بدون قفل، ويتحقق متحكم القبول من الجدوى مقابل الموعد النهائي 33 مللي ثانية زائد هامش أمان 2 مللي ثانية، ثم يمرر الإطارات إلى محول مكتوب يدويًا. مستودع Github هو https://github.com/Anubhab Banerjee/vla-edge-backend1. تعمل الكاميرا بسرعة 60 هرتز (16.7 مللي ثانية/إطار) ويجب على النموذج اتخاذ القرار والتصرف خلال 33 مللي ثانية — أسرع من ومضة عين بشرية. هذه معمارية، وليست معيارًا قياسيًا.