আরে HN, আমরা Anders এবং Tom। আমরা Magnitude তৈরি করছি, এজেন্টদের জন্য একটি ইনফারেন্স ইঞ্জিন যা আপনার হার্ডওয়্যারে যত দ্রুত সম্ভব চালানোর জন্য নিজেকে অপ্টিমাইজ করে। এটি Mac, Linux এবং Windows-এ যেকোনো হার্ডওয়্যারে কাজ করে এবং llama.cpp-এর চেয়ে 2 গুণ দ্রুত।
আমরা দুজনেই সফটওয়্যার ইঞ্জিনিয়ার এবং আগে 4k+ GitHub স্টার এবং 100k+ ডাউনলোড সহ একটি ওপেন সোর্স ব্রাউজার এজেন্ট তৈরি করেছি। আমরা ক্রমবর্ধমানভাবে এটি স্থানীয় মডেলে চালাতে চেয়েছিলাম, কিন্তু দেখেছি যে কোনো ইনফারেন্স ইঞ্জিন আমাদের ব্যবহারের ক্ষেত্রে কাজ করে না।
আজকের ইনফারেন্স ইঞ্জিনগুলো সবাই কর্মক্ষমতার বাণিজ্য করে। সেগুলো হয় ডেটাসেন্টার হার্ডওয়্যারে ব্যাচড ইনফারেন্সের জন্য তৈরি, একক-সেশন কর্মক্ষমতার খরচে (vLLM, SGLang), অথবা নির্দিষ্ট হার্ডওয়্যারের জন্য অপ্টিমাইজ করার পরিবর্তে বিস্তৃত সামঞ্জস্যের জন্য ডিজাইন করা (llama.cpp, Ollama), অথবা নির্দিষ্ট হার্ডওয়্যার বা মডেলের জন্য বিশেষায়িত কিন্তু ইঞ্জিনের সম্পূর্ণতার অভাব (oMLX, ds4)। উপরন্তু, কোনোটি স্থানীয়ভাবে এজেন্ট চালানোর জন্য ডিজাইন করা হয়নি।
Magnitude আপনার হার্ডওয়্যারে সর্বোচ্চ কর্মক্ষমতা এবং স্থানীয় এজেন্ট চালানোর জন্য তৈরি। এতে ডিভাইসে কম্পাইলেশন এবং টিউনিং, সেরা আর্কিটেকচারে ফোকাস, ডায়নামিক মেমরি বরাদ্দ এবং হাইব্রিড পেজড অ্যাটেনশন রয়েছে। এটি সম্পূর্ণ ওপেন সোর্স (Apache 2.0), Rust-এ তৈরি, এবং বেঞ্চমার্ক দেখায় যে llama.cpp-এর তুলনায় Metal-এ 92% দ্রুত ডিকোড এবং CUDA-তে 19% দ্রুত।
Magnitude একটি ডেস্কটপ অ্যাপ হিসেবে আসে যা Pi, OpenCode, Hermes এবং Codex-এর মতো এজেন্টদের সাথে সংযোগ করে। ভবিষ্যত পরিকল্পনার মধ্যে রয়েছে এক্সপার্ট স্ট্রিমিং, কার্নেল কম্পাইলার এবং মাল্টি-ডিভাইস ব্যবহার।