HeadlinesBriefing favicon HeadlinesBriefing.com

LLM भूलना और रोबोट 33ms डेडलाइन

Towards Data Science •
×

अधिकांश LLM इन्फ्रेंस रनटाइम भौतिक डेडलाइन को नज़रअंदाज़ करते हैं। Qwen2.5-Coder-1.5B-Instruct के लिए एक नया CUDA-आधारित रनटाइम शुरू होने से इनकार कर देता है अगर यह 33ms रोबोट नियंत्रण चक्र के भीतर समाप्त नहीं हो सकता, अर्थ (कोसाइन समानता) द्वारा KV कैश को निष्कासित करता है न कि आयु के अनुसार, और लॉक-फ्री डबल बफर का उपयोग करता है। यह निरंतर विज़न स्ट्रीम से VRAM ओवरफ्लो से बचाता है, कंट्रोल-लूप डेडलाइन मिस को रोकता है, और एक 60Hz कैमरे को संभालता है जो रीजनिंग से तेज़ चलता है। पूरी तरह से हाथ से लिखे CUDA में निर्मित — कोई cuBLAS या libtorch नहीं — एक सिंगल क्लाउड NVIDIA Hopper GPU (sm_90) पर जिसमें कोड में मॉडल की गई 8GB VRAM सीमा है, न कि Jetson जैसे एज डिवाइस पर मापी गई। आर्किटेक्चर धारणा, प्रवेश नियंत्रण और रीजनिंग को अलग करता है: कैमरा लॉक-फ्री बफर में फीड करता है, एक प्रवेश नियंत्रक 33ms डेडलाइन प्लस 2ms सेफ्टी मार्जिन के खिलाफ व्यवहार्यता की जांच करता है, फिर फ्रेम को हाथ से लिखे ट्रांसफॉर्मर को पास करता है। Github रेपो https://github.com/Anubhab Banerjee/vla-edge-backend1 है। कैमरा 60Hz (16.7ms/फ्रेम) पर चलता है और मॉडल को 33ms के भीतर निर्णय लेना और कार्य करना होगा — मानव पलक झपकने से तेज़। यह एक आर्किटेक्चर है, बेंचमार्क नहीं।