HeadlinesBriefing favicon HeadlinesBriefing.com

L L M ভুলে যাওয়া এবং রোবট ৩৩ মিলিসেকেন্ড ডেডলাইন

Towards Data Science •
×

অধিকাংশ LLM ইনফারেন্স রানটাইম ভৌত ডেডলাইন উপেক্ষা করে। Qwen2.5-Coder-1.5B-Instruct-এর জন্য একটি নতুন CUDA-ভিত্তিক রানটাইম শুরু হওয়া থেকে মনা করে যদি এটি ৩৩ মিলিসেকেন্ড রোবট কন্ট্রোল সাইকেলের মধ্যে শেষ করতে না পারে, অর্থ (কোসাইন সাদৃশ্য) দ্বারা KV ক্যাশে বictions করে না বয়স অনুযায়ী, এবং লক-ফ্রি ডাবল বাফার ব্যবহার করে। এটি liên tục ভিশন স্ট্রিম থেকে VRAM ওভারফ্লো রোধ করে, কন্ট্রোল-লুপ ডেডলাইন মিস প্রতিরোধ করে, এবং একটি ৬০ হার্টজ ক্যামেরা হ্যান্ডেল করে যা রিজনিং থেকে দ্রুত চলে। সম্পূর্ণরূপে হাতের লিখা CUDA-তে নির্মিত — কোন cuBLAS বা libtorch নয় — একটি একক ক্লাউড NVIDIA Hopper GPU (sm_90) তে যেখানে কোডে মডেল করা ৮ জিবি VRAM সীমা রয়েছে, জেটসন মতো এজ ডিভাইসে পরিমাপ করা নয়। আর্কিটেকচার ধারণা, ভর্তি নিয়ন্ত্রণ এবং রিজনিং আলাদা করে: ক্যামেরা লক-ফ্রি বাফারে ফিড করে, একটি ভর্তি নিয়ন্ত্রক ৩৩ মিলিসেকেন্ড ডেডলাইন প্লাস ২ মিলিসেকেন্ড সেফটি মার্জিনের বিপক্ষে সম্ভাব্যতা যাচাই করে, তারপর ফ্রেমগুলো হাতের লিখা ট্রান্সফরমারে পাস করে। গিটহাব রেপো হল https://github.com/Anubhab Banerjee/vla-edge-backend1। ক্যামেরা ৬০ হার্টজে (১৬.৭ মিলিসেকেন্ড/ফ্রেম) চলে এবং মডেলকে ৩৩ মিলিসেকেন্ডের মধ্যে সিদ্ধান্ত নিতে এবং কাজ করতে হবে — মানুষের পলক ঝাপকানোর চেয়ে দ্রুত। এটি একটি আর্কিটেকচার, বেঞ্চмар্ক নয়।