HeadlinesBriefing favicon HeadlinesBriefing.com

مقارنة Ollama و vLLM و SGLang

ByteByteGo •
×

لتشغيل نماذج الأوزان المفتوحة محلياً، تختار الفرق بين Ollama، و vLLM، و SGLang. يتعامل كل محرك مع الطلبات بشكل مختلف. يقوم Ollama بترتيب الطلبات عبر FIFO وتشغيل نماذج GGUF المُكمّأة مسبقاً، وهو الأفضل للتطوير المحلي وأجهزة الكمبيوتر المحمولة عبر واجهة برمجة متوافقة مع OpenAI.

للخدمة ذات الحركة المرورية العالية، يستخدم vLLM التجميع المستمر و Paged Attention لتخزين ذاكرة التخزين المؤقت KV. وهذا يدرج الطلبات الجديدة في مجموعات قيد التشغيل، مما يعظم استخدام وحدة معالجة الرسومات لآلاف المستخدمين المتزامنين. في الوقت نفسه، يستهدف SGLang وكلاء الذكاء الاصطناعي والمحادثات متعددة الأدوار باستخدام مخطط واعٍ بالسابقة ومخزن Radix Attention. ويعيد استخدام سلاسل المطالبة المشتركة بدلاً من إعادة حسابها، مما يحسّن حلقات الأدوات والمخرجات المهيكلة.

بالإضافة إلى ذلك، أعلنت Anthropic عن خطط لتعمية النصوص لتحديد المحتوى الذي أنشأته الذكاء الاصطناعي. عادةً ما تقوم نماذج اللغات الكبيرة بعينات احتمالات الكلمة التالية عشوائياً. مع التعمية، تقيد دالة مفتاحية المرشحين الصالحين بناءً على مفتاح سري والكلمات السابقة. تتحقق عملية الكشف مما إذا كانت كلمات المرشحين تطابق هذا القاعدة عبر النص، وتحسب درجة الذكاء الاصطناعي على الرغم من مخاوف الإنكذاب الخاطئ المستمرة.

الكيانات الرئيسية: شركات: Anthropic، ByteByteGo، GitHub | أشخاص: [PERSON_NAME]

سؤال: كيف تعمل تعمية نصوص الذكاء الاصطناعي؟

تعدل توزيعات احتمالات الكلمة التالية باستخدام مفتاح سري أثناء التوليد، مما يدمج إشارات قابلة للكشف يمكن التحقق منها عن طريق فحص ما إذا كانت الكلمات المولدة تطابق المرشحين الصالحين المحددين مسبقاً عبر النص.