HeadlinesBriefing favicon HeadlinesBriefing.com

Ollama vs vLLM vs SGLang তুলনা

ByteByteGo •
×

স্থানীয়ভাবে ওপেন-ওয়েট মডেল চালানোর জন্য, দলগুলো Ollama, vLLM, এবং SGLang-এর মধ্যে বেছে নেয়। প্রতিটি ইঞ্জিন অনুরোধকে ভিন্নভাবে পরিচালনা করে। Ollama FIFO এর মাধ্যমে অনুরোধগুলো কোয়ুতে রাখে এবং প্রি-কোয়ান্টাইজড GGUF মডেল চালায়, যা OpenAI-সম্পর্কিত API-এর মাধ্যমে স্থানীয় ডেভেলপমেন্ট এবং ল্যাপটপ হার্ডওয়্যারের জন্য সর্বোত্তম।

উচ্চ-ট্রাফিক সার্ভিংয়ের জন্য, vLLM কন্টিনিউয়াস ব্যাচিং এবং Paged Attention ব্যবহার করে KV ক্যাশ সংরক্ষণ করে। এটি নতুন অনুরোধগুলো চলমান ব্যাচে যুক্ত করে, হাজার হাজার একসাথে ব্যবহারকারীদের জন্য GPU ব্যবহার সর্বোচ্চ করে। অন্যদিকে, SGLang প্রিফিক্স-অ্যাওয়ারেড শেডিউলার এবং Radix Attention ক্যাশ সহ AI এজেন্ট এবং মাল্টি-টার্ন চ্যাটের লক্ষ্য করে। এটি পুনরায় গণনা করার পরিবর্তে শেয়ার্ড প্রম্পট প্রিফিক্স পুনঃব্যবহার করে, টুল লুপ এবং কাঠামোগত আউটপুট অপ্টিমাইজ করে।

এছাড়াও, Anthropic AI-জনিত বিষয়বস্তুর শনাক্তকরণের জন্য টেক্সট ওয়াটারমার্কিংয়ের পরিকল্পনা শেয়ার করেছে। LLM সাধারণত পরবর্তী শব্দের সম্ভাবনাগুলো এলোমেলোভাবে নমুনা করে। ওয়াটারমার্কিংয়ের সাথে, একটি কী ফাংশন গোপন কী এবং পূর্ববর্তী শব্দের উপর ভিত্তি করে বৈধ প্রার্থীদের সীমিত করে। ডিটেকশন চেক করে যে প্রার্থী শব্দগুলো পুরো টেক্সটে এই নিয়মের সাথে মেলে কিনা, ধারাবাহিক ভুল নেগেটিভ উদ্বেগের বিরুদ্ধে একটি AI স্কোর গণনা করে।

প্রধান এনটিটি: কোম্পানি: Anthropic, ByteByteGo, GitHub | ব্যক্তি: [PERSON_NAME]

প্রশ্ন: AI টেক্সট ওয়াটারমার্কিং কিভাবে কাজ করে?

এটি জেনারেশনের সময় একটি গোপন কী ব্যবহার করে পরবর্তী শব্দের সম্ভাবনা বন্টন পরিবর্তন করে, যাতে শনাক্তযোগ্য সিগন্যাল এম্বেড করা হয় যা পুরো টেক্সটে জেনারেটেড শব্দগুলো পূর্বনির্ধারিত বৈধ প্রার্থীদের সাথে মেলে কিনা তা পরীক্ষা করে যাচাই করা যায়।