हे HN, हम Anders और Tom हैं। हम Magnitude बना रहे हैं, जो एजेंटों के लिए एक इन्फ्रेंस इंजन है जो आपके हार्डवेयर पर जितनी जल्दी हो सके चलने के लिए खुद को अनुकूलित करता है। यह Mac, Linux और Windows पर किसी भी हार्डवेयर पर काम करता है और llama.cpp से 2 गुना तेज़ है।
हम दोनों सॉफ्टवेयर इंजीनियर हैं और पहले 4k+ GitHub स्टार और 100k+ डाउनलोड के साथ एक ओपन सोर्स ब्राउज़र एजेंट बनाया था। हम तेजी से इसे स्थानीय मॉडल पर चलाना चाहते थे, लेकिन पाया कि कोई भी इन्फ्रेंस इंजन हमारे उपयोग के लिए काम नहीं करता था।
आज के इन्फ्रेंस इंजन सभी प्रदर्शन में समझौता करते हैं। वे या तो डेटासेंटर हार्डवेयर पर बैच इन्फ्रेंस के लिए बनाए जाते हैं, जिससे एकल-सत्र प्रदर्शन की कीमत चुकानी पड़ती है (vLLM, SGLang), या विशिष्ट हार्डवेयर के लिए अनुकूलन के बजाय व्यापक संगतता के लिए डिज़ाइन किए जाते हैं (llama.cpp, Ollama), या विशिष्ट हार्डवेयर या मॉडल के लिए विशेष होते हैं लेकिन इंजन पूर्णता की कमी होती है (oMLX, ds4)। इसके अलावा, कोई भी स्थानीय रूप से एजेंट चलाने के लिए डिज़ाइन नहीं किया गया है।
Magnitude आपके हार्डवेयर पर अधिकतम प्रदर्शन और स्थानीय एजेंट चलाने के लिए बनाया गया है। इसमें डिवाइस पर संकलन और ट्यूनिंग, सर्वोत्तम आर्किटेक्चर पर ध्यान, गतिशील मेमोरी आवंटन और हाइब्रिड पेजेड अटेंशन शामिल है। यह पूरी तरह से ओपन सोर्स (Apache 2.0) है, Rust में बनाया गया है, और बेंचमार्क दिखाते हैं कि llama.cpp की तुलना में Metal पर 92% तेज़ डिकोड और CUDA पर 19% तेज़ है।
Magnitude एक डेस्कटॉप ऐप के रूप में आता है जो Pi, OpenCode, Hermes और Codex जैसे एजेंटों से जुड़ता है। भविष्य की योजनाओं में विशेषज्ञ स्ट्रीमिंग, कर्नेल कंपाइलर और मल्टी-डिवाइस उपयोग शामिल हैं।