HeadlinesBriefing favicon HeadlinesBriefing.com

تشغيل نماذج الذكاء الاصطناعي الكبيرة على برمجيات رخيصة

ByteByteGo •
×

غالبًا ما تكون عملية المصادقة هي الجزء الأقل اختبارًا في تطبيق. تحتاج البيئات الحية إلى وصول الشبكة والمصاديق الحقيقية، بينما يفتقد المحاكيات إلى الأخطاء التي تتسبب في توقف الإنتاج. @workos/emulate يشغل واجهة برمجة تطبيقات نظام العمل محليًا للتطوير والتكامل المستمر. بذرة المستخدمين والمنظمات وأدوار وظائف إدارة الوصول الأدمن (RBAC) واتصالات المصادقة الفردية المفردة (SSO)، ثم اختبار تدفقات تسجيل الدخول الكاملة لحزمة المصادقة، والwebhooks الموقعة، وتحديث الرموز، ومعالجة الأخطاء. تأتي الاستجابات وأشكال الأحداث من مواصفة واجهة برمجة تطبيقات نظام العمل المفتوح، لذا تمارس الاختبارات نفس السطح الذي يستخدمه تطبيقك في الإنتاج.

تخيل مطور يبني مساعد برمجة قائمًا على الذكاء الاصطناعي يعمل على حاسوب مكتبي. النموذج متاح للتنزيل، والتطبيق straightforward، ولديه الآلة مساحة كافية للتخزين. لكن عندما يحاول البرنامج تحميل النموذج، ينتهي بذاكرة الفلاحة. هذا هو المكان حيث يتحول التطوير المحلي للذكاء الاصطناعي إلى مشكلة برمجيةات. تنزيل نموذج ذكاء اصطناعي كبير لا يعني بالضرورة أننا قادرون على تشغيله. حتى لو تم تحميله، لا يضمن زمن الاستجابة المفيد. يمكن تشغيل نموذج ذكاء اصطناعي كبير على برمجيات متوسطة فقط من خلال تقليل استخدام الذاكرة، تقليل الحسابات، أو نقل العمل إلى برمجيات أبطأ.

Several techniques help: Quantization gives each weight a smaller representation; Layer-wise offloading moves weights as needed; Mixture of experts uses selected parts per token; Distillation lets a larger model teach a smaller one; Pruning removes less-contributing work; Speculative decoding proposes several tokens before checking. An AI model contains parameters or weights that influence input-to-output mapping. An 8B model has ~8 billion weights organized into layers. Input text is divided into tokens, processed into probabilities for the next token. Inference uses trained weights unchanged, unlike training which requires expensive infrastructure.