HeadlinesBriefing favicon HeadlinesBriefing.com

কম হার্ডওয়্যারে বড় AI মডেল চালানো

ByteByteGo •
×

প্রমাণীকরণ সাধারণত একটি অ্যাপ্লিকেশনের সবচেয়ে পরীক্ষিত না হওয়া অংশ। লাইভ পরিবেশে নেটওয়ার্ক অ্যাক্সেস এবং রিয়াল ক্রেডেনশিয়াল দরকার, আর মকগুলি প্রোডাকশন ভেঙে দেওয়া যুক্তি মিস করে। @workos/emulate কাজের OS API-কে ডেভেলপমেন্ট ও CI-এ লোকালি চালায়। সিড ব্যবহারকারীদের, সংস্থালগুলি, RBAC রোলগুলি এবং SSO কানেকশনগুলি, তারপর Auth Kit লগইন ফ্লোগুলি, সাইনড হুক, টোকেন রিফ্রেশ এবং এরর হ্যান্ডলিং পরীক্ষা করুন। রেসপন্স এবং ইভেন্ট শেপগুলি Work OS Open API স্পেক থেকে আসে, তাই টেস্টগুলি আপনার অ্যাপ্লিকেশন যা প্রোডাকশনে ব্যবহার করে একই পৃষ্ঠার পশ্চাতন ব্যাস ব্যায়াম করে।

একটি ডেভেলপারের কল্পনা করুন যিনি ডেস্কটপ কম্পিউটারে চলমান একটি AI-ভিত্তিক কোডিং অ্যাসিস্ট্যান্ট তৈরি করেন। মডেলটি ডাউনলোড করার জন্য উপলব্ধ, অ্যাপ্লিকেশনটি straightforward, এবং মেশিনটিতে পর্যাপ্ত স্টোরেজ আছে। কিন্তু যখন প্রোগ্রামটি মডেল লোড করার চেষ্টা করে, তখন এটি মেমরি শেষ করে যায়। এটি এমন একটি জায়গা যেখানে স্থানীয় AI ডেভেলপমেন্ট হার্ডওয়্যারের একটি সমস্যা হয়ে ওঠে। বড় AI মডেল ডাউনলোড করা স্বয়ংক্রিয়ভাবে মানে নয় যে আমরা এটি চালিয়ে পারব। যদিও লোড হয়ে যায়, উপযোগী রেসপন্স টাইম নিশ্চিত করা যায় না। কেবল মডেস্ট হার্ডওয়্যারে বড় AI মডেল চালাতে হয় মেমরি ব্যবহার কমাতে, হিসাব কমিয়ে বা কাজটি ধীর হার্ডওয়্যারে স্থানান্তর করতে।

Several techniques help: Quantization gives each weight a smaller representation; Layer-wise offloading moves weights as needed; Mixture of experts uses selected parts per token; Distillation lets a larger model teach a smaller one; Pruning removes less-contributing work; Speculative decoding proposes several tokens before checking. An AI model contains parameters or weights that influence input-to-output mapping. An 8B model has ~8 billion weights organized into layers. Input text is divided into tokens, processed into probabilities for the next token. Inference uses trained weights unchanged, unlike training which requires expensive infrastructure.