Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agents
🇬🇧 English
Hey HN, Anders and Tom here. We're building Magnitude, an inference engine for agents that optimizes itself to run as fast as possible on your hardware. It works on Mac, Linux, and Windows on any hardware and is up to 2x faster than llama.cpp.
We're both software engineers and previously built an open source browser agent to 4k+ GH stars and 100k+ downloads. We increasingly wanted to run it on local models, but found that no inference engine worked for our use case. Inference engines today all make a performance tradeoff.
Magnitude is built for maximum performance on your hardware and running local agents: on-device compilation and tuning, focus on best architectures, dynamic memory allocation, and hybrid paged attention. Magnitude is fully open source (Apache 2.0). We built it in Rust, including a custom GPU kernel runtime and autotuner.
Benchmarked against llama.cpp with Qwen 3.6 35B A3B (4 bit), 64k context, no speculative decoding: Metal (Mac M4 Pro 48 GB) - 92% faster decode (30 tok/s → 57 tok/s), CUDA (DGX Spark) - 19% faster decode (49 tok/s → 58 tok/s). Magnitude ships as a desktop app that you can easily connect with whatever agents you already use.
🇸🇦 العربية
Magnitude: محرك استدلال مفتوح المصدر أسرع حتى مرتين من llama.cpp
مرحبًا Hacker News، أنا Anders وTom. نبني Magnitude، محرك استدلال للوكلاء يحسّن نفسه ليعمل بأسرع ما يمكن على عتادك. يعمل على Mac وLinux وWindows على أي عتاد وهو أسرع حتى مرتين من llama.cpp.
كلانا مهندسا برمجيات، وقد بنينا سابقًا وكيل متصفح مفتوح المصدر حصل على أكثر من 4k نجمة على GitHub وأكثر من 100k تنزيل. أردنا بشكل متزايد تشغيله على نماذج محلية، لكن وجدنا أنه لا يوجد محرك استدلال يعمل لحالتنا. جميع محركات الاستدلال اليوم تقدم تنازلاً في الأداء.
Magnitude مبني لتحقيق أقصى أداء على عتادك وتشغيل وكلاء محليين: تجميع وضبط على الجهاز، التركيز على أفضل البنى، تخصيص الذاكرة الديناميكي، والانتباه المقسّم الهجين. Magnitude مفتوح المصدر بالكامل (Apache 2.0). بنيناه بلغة Rust، بما في ذلك بيئة تشغيل نواة GPU مخصصة ومضبط تلقائي.
مقارنة مع llama.cpp مع Qwen 3.6 35B A3B (4 بت)، سياق 64k، بدون فك ترميز تخميني: Metal (Mac M4 Pro 48 GB) - 92% أسرع في فك الترميز (30 tok/s ← 57 tok/s)، CUDA (DGX Spark) - 19% أسرع في فك الترميز (49 tok/s ← 58 tok/s). يتوفر Magnitude كتطبيق سطح مكتب يمكنك ربطه بسهولة بأي وكلاء تستخدمهم بالفعل.
كيانات رئيسية: شركات: magnitudedev، GitHub، Hacker News | أشخاص: Anders، Tom
الأسئلة الشائعة: ما هو Magnitude؟
Magnitude هو محرك استدلال مفتوح المصدر للوكلاء يحسّن نفسه لعتادك المحدد، مما يوفر أداءً أسرع حتى مرتين من llama.cpp على Apple Silicon أو NVIDIA أو AMD أو CPU.
سؤال شائع: ما هو Magnitude؟
جواب شائع: Magnitude هو محرك استدلال مفتوح المصدر للوكلاء يحسّن نفسه لعتادك المحدد، مما يوفر أداءً أسرع حتى مرتين من llama.cpp على Apple Silicon أو NVIDIA أو AMD أو CPU.
ما هو Magnitude؟
Magnitude هو محرك استدلال مفتوح المصدر للوكلاء يحسّن نفسه لعتادك المحدد، مما يوفر أداءً أسرع حتى مرتين من llama.cpp على Apple Silicon أو NVIDIA أو AMD أو CPU.
🇧🇩 বাংলা
ম্যাগনিটিউড: ওপেন সোর্স ইনফারেন্স ইঞ্জিন যা llama.cpp-এর চেয়ে ২ গুণ দ্রুত
হাই Hacker News, এখানে Anders এবং Tom। আমরা Magnitude তৈরি করছি, এজেন্টদের জন্য একটি ইনফারেন্স ইঞ্জিন যা আপনার হার্ডওয়্যারে যত দ্রুত সম্ভব চালানোর জন্য নিজেকে অপ্টিমাইজ করে। এটি Mac, Linux এবং Windows-এ যেকোনো হার্ডওয়্যারে কাজ করে এবং llama.cpp-এর চেয়ে ২ গুণ দ্রুত।
আমরা দুজনেই সফটওয়্যার ইঞ্জিনিয়ার এবং আগে একটি ওপেন সোর্স ব্রাউজার এজেন্ট তৈরি করেছি যা ৪ হাজারের বেশি GitHub স্টার এবং ১ লাখের বেশি ডাউনলোড পেয়েছে। আমরা ক্রমবর্ধমানভাবে এটি লোকাল মডেলে চালাতে চেয়েছিলাম, কিন্তু দেখেছি যে আমাদের ব্যবহারের জন্য কোনো ইনফারেন্স ইঞ্জিন কাজ করে না। আজকের ইনফারেন্স ইঞ্জিনগুলো সবাই পারফরম্যান্সে আপস করে।
Magnitude আপনার হার্ডওয়্যারে সর্বোচ্চ পারফরম্যান্স এবং লোকাল এজেন্ট চালানোর জন্য তৈরি: ডিভাইসে কম্পাইলেশন এবং টিউনিং, সেরা আর্কিটেকচারে ফোকাস, ডাইনামিক মেমরি বরাদ্দ এবং হাইব্রিড পেজিনেটেড অ্যাটেনশন। Magnitude সম্পূর্ণ ওপেন সোর্স (Apache 2.0)। আমরা এটি Rust-এ তৈরি করেছি, যার মধ্যে কাস্টম GPU কার্নেল রানটাইম এবং অটোটিউনার অন্তর্ভুক্ত।
llama.cpp-এর সাথে Qwen 3.6 35B A3B (৪ বিট), ৬৪k কনটেক্সট, কোনো স্পেকুলেটিভ ডিকোডিং ছাড়া বেঞ্চমার্ক করা হয়েছে: Metal (Mac M4 Pro ৪৮ GB) - ৯২% দ্রুত ডিকোড (৩০ tok/s → ৫৭ tok/s), CUDA (DGX Spark) - ১৯% দ্রুত ডিকোড (৪৯ tok/s → ৫৮ tok/s)। Magnitude একটি ডেস্কটপ অ্যাপ হিসেবে আসে যা আপনি আপনার ইতিমধ্যে ব্যবহৃত যেকোনো এজেন্টের সাথে সহজেই সংযোগ করতে পারেন।
মূল সত্তা: কোম্পানি: magnitudedev, GitHub, Hacker News | ব্যক্তি: Anders, Tom
সাধারণ জিজ্ঞাসা: Magnitude কী?
Magnitude এজেন্টদের জন্য একটি ওপেন সোর্স ইনফারেন্স ইঞ্জিন যা আপনার সঠিক হার্ডওয়্যারের জন্য নিজেকে অপ্টিমাইজ করে, Apple Silicon, NVIDIA, AMD বা CPU-তে llama.cpp-এর চেয়ে ২ গুণ দ্রুত পারফরম্যান্স দেয়।
সাধারণ জিজ্ঞাসা প্রশ্ন: Magnitude কী?
সাধারণ জিজ্ঞাসা উত্তর: Magnitude এজেন্টদের জন্য একটি ওপেন সোর্স ইনফারেন্স ইঞ্জিন যা আপনার সঠিক হার্ডওয়্যারের জন্য নিজেকে অপ্টিমাইজ করে, Apple Silicon, NVIDIA, AMD বা CPU-তে llama.cpp-এর চেয়ে ২ গুণ দ্রুত পারফরম্যান্স দেয়।
Magnitude কী?
Magnitude এজেন্টদের জন্য একটি ওপেন সোর্স ইনফারেন্স ইঞ্জিন যা আপনার সঠিক হার্ডওয়্যারের জন্য নিজেকে অপ্টিমাইজ করে, Apple Silicon, NVIDIA, AMD বা CPU-তে llama.cpp-এর চেয়ে ২ গুণ দ্রুত পারফরম্যান্স দেয়।
🇩🇪 Deutsch
Magnitude: Open-Source-Inferenz-Engine bis zu 2x schneller als llama.cpp
Hallo Hacker News, hier sind Anders und Tom. Wir bauen Magnitude, eine Inferenz-Engine für Agenten, die sich selbst optimiert, um auf Ihrer Hardware so schnell wie möglich zu laufen. Sie funktioniert auf Mac, Linux und Windows auf jeder Hardware und ist bis zu 2x schneller als llama.cpp.
Wir sind beide Softwareentwickler und haben zuvor einen Open-Source-Browser-Agenten mit über 4.000 GitHub-Sternen und über 100.000 Downloads gebaut. Wir wollten ihn zunehmend auf lokalen Modellen ausführen, stellten jedoch fest, dass keine Inferenz-Engine für unseren Anwendungsfall funktionierte. Heutige Inferenz-Engines gehen alle einen Leistungskompromiss ein.
Magnitude ist für maximale Leistung auf Ihrer Hardware und für die Ausführung lokaler Agenten gebaut: On-Device-Kompilierung und -Tuning, Fokus auf beste Architekturen, dynamische Speicherzuweisung und hybride Paged Attention. Magnitude ist vollständig Open Source (Apache 2.0). Wir haben es in Rust gebaut, einschließlich einer benutzerdefinierten GPU-Kernel-Laufzeit und Autotuner.
Im Vergleich zu llama.cpp mit Qwen 3.6 35B A3B (4 Bit), 64k-Kontext, ohne spekulative Dekodierung: Metal (Mac M4 Pro 48 GB) - 92% schnellere Dekodierung (30 tok/s → 57 tok/s), CUDA (DGX Spark) - 19% schnellere Dekodierung (49 tok/s → 58 tok/s). Magnitude wird als Desktop-App geliefert, die Sie einfach mit beliebigen Agenten verbinden können, die Sie bereits verwenden.
Wichtige Entitäten: Unternehmen: magnitudedev, GitHub, Hacker News | Personen: Anders, Tom
Häufig gestellte Fragen: Was ist Magnitude?
Magnitude ist eine Open-Source-Inferenz-Engine für Agenten, die sich für Ihre genaue Hardware optimiert und auf Apple Silicon, NVIDIA, AMD oder CPU bis zu 2x schnellere Leistung als llama.cpp bietet.
FAQ Q: Was ist Magnitude?
FAQ A: Magnitude ist eine Open-Source-Inferenz-Engine für Agenten, die sich für Ihre genaue Hardware optimiert und auf Apple Silicon, NVIDIA, AMD oder CPU bis zu 2x schnellere Leistung als llama.cpp bietet.
Was ist Magnitude?
Magnitude ist eine Open-Source-Inferenz-Engine für Agenten, die sich für Ihre genaue Hardware optimiert und auf Apple Silicon, NVIDIA, AMD oder CPU bis zu 2x schnellere Leistung als llama.cpp bietet.
🇪🇸 Español
Magnitude: motor de inferencia de código abierto hasta 2 veces más rápido que llama.cpp
Hola Hacker News, aquí Anders y Tom. Estamos construyendo Magnitude, un motor de inferencia para agentes que se optimiza para ejecutarse lo más rápido posible en su hardware. Funciona en Mac, Linux y Windows en cualquier hardware y es hasta 2 veces más rápido que llama.cpp.
Ambos somos ingenieros de software y anteriormente construimos un agente de navegador de código abierto con más de 4k estrellas en GitHub y más de 100k descargas. Cada vez queríamos más ejecutarlo en modelos locales, pero descubrimos que ningún motor de inferencia funcionaba para nuestro caso de uso. Los motores de inferencia actuales todos hacen un compromiso de rendimiento.
Magnitude está construido para el máximo rendimiento en su hardware y para ejecutar agentes locales: compilación y ajuste en el dispositivo, enfoque en las mejores arquitecturas, asignación dinámica de memoria y atención paginada híbrida. Magnitude es totalmente de código abierto (Apache 2.0). Lo construimos en Rust, incluyendo un runtime de kernel GPU personalizado y autotuner.
Comparado con llama.cpp con Qwen 3.6 35B A3B (4 bits), contexto de 64k, sin decodificación especulativa: Metal (Mac M4 Pro 48 GB) - 92% más rápido en decodificación (30 tok/s → 57 tok/s), CUDA (DGX Spark) - 19% más rápido en decodificación (49 tok/s → 58 tok/s). Magnitude se distribuye como una aplicación de escritorio que puede conectar fácilmente con los agentes que ya use.
Entidades clave: Empresas: magnitudedev, GitHub, Hacker News | Personas: Anders, Tom
Preguntas frecuentes: ¿Qué es Magnitude?
Magnitude es un motor de inferencia de código abierto para agentes que se optimiza para su hardware exacto, ofreciendo hasta 2 veces más rendimiento que llama.cpp en Apple Silicon, NVIDIA, AMD o CPU.
Pregunta frecuente Q: ¿Qué es Magnitude?
Respuesta frecuente A: Magnitude es un motor de inferencia de código abierto para agentes que se optimiza para su hardware exacto, ofreciendo hasta 2 veces más rendimiento que llama.cpp en Apple Silicon, NVIDIA, AMD o CPU.
¿Qué es Magnitude?
Magnitude es un motor de inferencia de código abierto para agentes que se optimiza para su hardware exacto, ofreciendo hasta 2 veces más rendimiento que llama.cpp en Apple Silicon, NVIDIA, AMD o CPU.
🇫🇷 Français
Magnitude : moteur d'inférence open source jusqu'à 2 fois plus rapide que llama.cpp
Salut Hacker News, ici Anders et Tom. Nous construisons Magnitude, un moteur d'inférence pour agents qui s'optimise pour fonctionner aussi vite que possible sur votre matériel. Il fonctionne sur Mac, Linux et Windows sur n'importe quel matériel et est jusqu'à 2 fois plus rapide que llama.cpp.
Nous sommes tous deux ingénieurs logiciels et avons précédemment construit un agent navigateur open source à plus de 4 000 étoiles GitHub et plus de 100 000 téléchargements. Nous voulions de plus en plus l'exécuter sur des modèles locaux, mais avons constaté qu'aucun moteur d'inférence ne convenait à notre cas d'utilisation. Les moteurs d'inférence actuels font tous un compromis de performance.
Magnitude est conçu pour des performances maximales sur votre matériel et pour exécuter des agents locaux : compilation et réglage sur l'appareil, concentration sur les meilleures architectures, allocation dynamique de la mémoire et attention paginée hybride. Magnitude est entièrement open source (Apache 2.0). Nous l'avons construit en Rust, y compris un runtime de noyau GPU personnalisé et un auto-réglage.
Comparé à llama.cpp avec Qwen 3.6 35B A3B (4 bits), contexte 64k, sans décodage spéculatif : Metal (Mac M4 Pro 48 Go) - 92% de décodage plus rapide (30 tok/s → 57 tok/s), CUDA (DGX Spark) - 19% de décodage plus rapide (49 tok/s → 58 tok/s). Magnitude est livré comme une application de bureau que vous pouvez facilement connecter à tous les agents que vous utilisez déjà.
Entités clés : Entreprises : magnitudedev, GitHub, Hacker News | Personnes : Anders, Tom
FAQ : Qu'est-ce que Magnitude ?
Magnitude est un moteur d'inférence open source pour agents qui s'optimise pour votre matériel exact, offrant des performances jusqu'à 2 fois plus rapides que llama.cpp sur Apple Silicon, NVIDIA, AMD ou CPU.
FAQ Q : Qu'est-ce que Magnitude ?
FAQ A : Magnitude est un moteur d'inférence open source pour agents qui s'optimise pour votre matériel exact, offrant des performances jusqu'à 2 fois plus rapides que llama.cpp sur Apple Silicon, NVIDIA, AMD ou CPU.
Qu'est-ce que Magnitude ?
Magnitude est un moteur d'inférence open source pour agents qui s'optimise pour votre matériel exact, offrant des performances jusqu'à 2 fois plus rapides que llama.cpp sur Apple Silicon, NVIDIA, AMD ou CPU.
🇮🇳 हिन्दी
मैग्निट्यूड: ओपन सोर्स इंफरेंस इंजन जो llama.cpp से 2 गुना तेज़ है
नमस्ते Hacker News, यहाँ Anders और Tom हैं। हम Magnitude बना रहे हैं, जो एजेंटों के लिए एक इंफरेंस इंजन है जो आपके हार्डवेयर पर जितनी जल्दी हो सके चलने के लिए खुद को अनुकूलित करता है। यह Mac, Linux और Windows पर किसी भी हार्डवेयर पर काम करता है और llama.cpp से 2 गुना तेज़ है।
हम दोनों सॉफ्टवेयर इंजीनियर हैं और पहले एक ओपन सोर्स ब्राउज़र एजेंट बना चुके हैं जिसे 4k+ GitHub स्टार और 100k+ डाउनलोड मिले हैं। हम तेजी से इसे स्थानीय मॉडल पर चलाना चाहते थे, लेकिन पाया कि कोई भी इंफरेंस इंजन हमारे उपयोग के लिए काम नहीं करता। आज के इंफरेंस इंजन सभी प्रदर्शन में समझौता करते हैं।
Magnitude आपके हार्डवेयर पर अधिकतम प्रदर्शन और स्थानीय एजेंट चलाने के लिए बनाया गया है: डिवाइस पर संकलन और ट्यूनिंग, सर्वोत्तम आर्किटेक्चर पर ध्यान, गतिशील मेमोरी आवंटन, और हाइब्रिड पेजिनेटेड अटेंशन। Magnitude पूरी तरह से ओपन सोर्स (Apache 2.0) है। हमने इसे Rust में बनाया है, जिसमें कस्टम GPU कर्नेल रनटाइम और ऑटोट्यूनर शामिल हैं।
llama.cpp के साथ Qwen 3.6 35B A3B (4 बिट), 64k संदर्भ, बिना सट्टा डिकोडिंग के बेंचमार्क किया गया: Metal (Mac M4 Pro 48 GB) - 92% तेज़ डिकोड (30 tok/s → 57 tok/s), CUDA (DGX Spark) - 19% तेज़ डिकोड (49 tok/s → 58 tok/s)। Magnitude एक डेस्कटॉप ऐप के रूप में आता है जिसे आप अपने पहले से उपयोग किए जा रहे किसी भी एजेंट से आसानी से जोड़ सकते हैं।
मुख्य संस्थाएँ: कंपनियाँ: magnitudedev, GitHub, Hacker News | लोग: Anders, Tom
अक्सर पूछे जाने वाले प्रश्न: Magnitude क्या है?
Magnitude एजेंटों के लिए एक ओपन सोर्स इंफरेंस इंजन है जो आपके सटीक हार्डवेयर के लिए खुद को अनुकूलित करता है, Apple Silicon, NVIDIA, AMD या CPU पर llama.cpp से 2 गुना तेज़ प्रदर्शन देता है।
अक्सर पूछे जाने वाले प्रश्न Q: Magnitude क्या है?
अक्सर पूछे जाने वाले प्रश्न A: Magnitude एजेंटों के लिए एक ओपन सोर्स इंफरेंस इंजन है जो आपके सटीक हार्डवेयर के लिए खुद को अनुकूलित करता है, Apple Silicon, NVIDIA, AMD या CPU पर llama.cpp से 2 गुना तेज़ प्रदर्शन देता है।
Magnitude क्या है?
Magnitude एजेंटों के लिए एक ओपन सोर्स इंफरेंस इंजन है जो आपके सटीक हार्डवेयर के लिए खुद को अनुकूलित करता है, Apple Silicon, NVIDIA, AMD या CPU पर llama.cpp से 2 गुना तेज़ प्रदर्शन देता है।
🇮🇩 Bahasa Indonesia
Magnitude: Mesin inferensi open source hingga 2x lebih cepat dari llama.cpp
Hai Hacker News, ini Anders dan Tom. Kami membangun Magnitude, mesin inferensi untuk agen yang mengoptimalkan dirinya untuk berjalan secepat mungkin di perangkat keras Anda. Ini bekerja di Mac, Linux, dan Windows pada perangkat keras apa pun dan hingga 2x lebih cepat daripada llama.cpp.
Kami berdua insinyur perangkat lunak dan sebelumnya membangun agen peramban open source hingga 4k+ bintang GitHub dan 100k+ unduhan. Kami semakin ingin menjalankannya pada model lokal, tetapi menemukan bahwa tidak ada mesin inferensi yang cocok untuk kasus penggunaan kami. Mesin inferensi saat ini semuanya membuat trade-off kinerja.
Magnitude dibangun untuk kinerja maksimal di perangkat keras Anda dan menjalankan agen lokal: kompilasi dan penyesuaian di perangkat, fokus pada arsitektur terbaik, alokasi memori dinamis, dan perhatian halaman hibrida. Magnitude sepenuhnya open source (Apache 2.0). Kami membangunnya dalam Rust, termasuk runtime kernel GPU khusus dan autotuner.
Dibandingkan dengan llama.cpp dengan Qwen 3.6 35B A3B (4 bit), konteks 64k, tanpa decoding spekulatif: Metal (Mac M4 Pro 48 GB) - 92% decoding lebih cepat (30 tok/s → 57 tok/s), CUDA (DGX Spark) - 19% decoding lebih cepat (49 tok/s → 58 tok/s). Magnitude hadir sebagai aplikasi desktop yang dapat Anda hubungkan dengan mudah dengan agen apa pun yang sudah Anda gunakan.
Entitas kunci: Perusahaan: magnitudedev, GitHub, Hacker News | Orang: Anders, Tom
Apa itu Magnitude?
Magnitude adalah mesin inferensi open source untuk agen yang mengoptimalkan diri untuk perangkat keras spesifik Anda, memberikan kinerja hingga 2x lebih cepat daripada llama.cpp di Apple Silicon, NVIDIA, AMD, atau CPU.
🇯🇵 日本語
Magnitude: llama.cpp より最大 2 倍高速なオープンソース推論エンジン
Hacker News の皆さん、こんにちは。Anders と Tom です。私たちは、お使いのハードウェアで可能な限り高速に動作するように自己最適化する、エージェント向け推論エンジン Magnitude を構築しています。Mac、Linux、Windows のあらゆるハードウェアで動作し、llama.cpp より最大 2 倍高速です。
私たちはどちらもソフトウェアエンジニアで、以前にオープンソースのブラウザエージェントを構築し、GitHub で 4,000 以上のスターと 100,000 以上のダウンロードを獲得しました。ますますローカルモデルで実行したいと思うようになりましたが、私たちのユースケースに合う推論エンジンはないことに気づきました。今日の推論エンジンはすべてパフォーマンスを犠牲にしています。
Magnitude は、お使いのハードウェアで最大のパフォーマンスを発揮し、ローカルエージェントを実行するために構築されています。デバイス上でのコンパイルとチューニング、最適なアーキテクチャへの注力、動的メモリ割り当て、ハイブリッドページ化アテンションを実現します。Magnitude は完全にオープンソース(Apache 2.0)です。カスタム GPU カーネルランタイムとオートチューナーを含め、Rust で構築しました。
llama.cpp と Qwen 3.6 35B A3B(4 ビット)、64k コンテキスト、投機的デコードなしでベンチマークした結果:Metal(Mac M4 Pro 48 GB)— デコードが 92% 高速(30 tok/s → 57 tok/s)、CUDA(DGX Spark)— デコードが 19% 高速(49 tok/s → 58 tok/s)。Magnitude はデスクトップアプリとして提供され、既に使用している任意のエージェントと簡単に接続できます。
主要エンティティ:企業:magnitudedev、GitHub、Hacker News | 人物:Anders、Tom
よくある質問:Magnitude とは何ですか?
Magnitude は、お使いの正確なハードウェアに自己最適化するエージェント向けのオープンソース推論エンジンで、Apple Silicon、NVIDIA、AMD、CPU で llama.cpp より最大 2 倍高速なパフォーマンスを提供します。
よくある質問 Q:Magnitude とは何ですか?
よくある質問 A:Magnitude は、お使いの正確なハードウェアに自己最適化するエージェント向けのオープンソース推論エンジンで、Apple Silicon、NVIDIA、AMD、CPU で llama.cpp より最大 2 倍高速なパフォーマンスを提供します。
Magnitude とは何ですか?
Magnitude は、お使いの正確なハードウェアに自己最適化するエージェント向けのオープンソース推論エンジンで、Apple Silicon、NVIDIA、AMD、CPU で llama.cpp より最大 2 倍高速なパフォーマンスを提供します。
🇧🇷 Português
Magnitude: mecanismo de inferência de código aberto até 2x mais rápido que llama.cpp
Olá Hacker News, aqui Anders e Tom. Estamos construindo o Magnitude, um mecanismo de inferência para agentes que se otimiza para rodar o mais rápido possível no seu hardware. Funciona em Mac, Linux e Windows em qualquer hardware e é até 2x mais rápido que llama.cpp.
Somos ambos engenheiros de software e anteriormente construímos um agente de navegador de código aberto com mais de 4 mil estrelas no GitHub e mais de 100 mil downloads. Queríamos cada vez mais executá-lo em modelos locais, mas descobrimos que nenhum mecanismo de inferência funcionava para o nosso caso de uso. Os mecanismos de inferência de hoje todos fazem um trade-off de desempenho.
O Magnitude é construído para máximo desempenho no seu hardware e para executar agentes locais: compilação e ajuste no dispositivo, foco nas melhores arquiteturas, alocação dinâmica de memória e atenção paginada híbrida. O Magnitude é totalmente de código aberto (Apache 2.0). Nós o construímos em Rust, incluindo um runtime de kernel GPU personalizado e autotuner.
Comparado com llama.cpp com Qwen 3.6 35B A3B (4 bits), contexto de 64k, sem decodificação especulativa: Metal (Mac M4 Pro 48 GB) - 92% de decodificação mais rápida (30 tok/s → 57 tok/s), CUDA (DGX Spark) - 19% de decodificação mais rápida (49 tok/s → 58 tok/s). O Magnitude é distribuído como um aplicativo de desktop que você pode conectar facilmente com quaisquer agentes que já usa.
Entidades-chave: Empresas: magnitudedev, GitHub, Hacker News | Pessoas: Anders, Tom
Perguntas frequentes: O que é o Magnitude?
O Magnitude é um mecanismo de inferência de código aberto para agentes que se otimiza para o seu hardware exato, oferecendo desempenho até 2x mais rápido que llama.cpp em Apple Silicon, NVIDIA, AMD ou CPU.
Pergunta frequente Q: O que é o Magnitude?
Resposta frequente A: O Magnitude é um mecanismo de inferência de código aberto para agentes que se otimiza para o seu hardware exato, oferecendo desempenho até 2x mais rápido que llama.cpp em Apple Silicon, NVIDIA, AMD ou CPU.
O que é o Magnitude?
O Magnitude é um mecanismo de inferência de código aberto para agentes que se otimiza para o seu hardware exato, oferecendo desempenho até 2x mais rápido que llama.cpp em Apple Silicon, NVIDIA, AMD ou CPU.
🇷🇺 Русский
Magnitude: движок вывода с открытым исходным кодом до 2 раз быстрее llama.cpp
Привет, Hacker News, это Anders и Tom. Мы создаём Magnitude — движок вывода для агентов, который оптимизирует себя для максимально быстрой работы на вашем оборудовании. Он работает на Mac, Linux и Windows на любом оборудовании и до 2 раз быстрее llama.cpp.
Мы оба инженеры-программисты и ранее создали агента браузера с открытым исходным кодом, получившего более 4 тыс. звёзд на GitHub и более 100 тыс. загрузок. Мы всё больше хотели запускать его на локальных моделях, но обнаружили, что ни один движок вывода не подходит для нашего случая. Современные движки вывода все идут на компромисс в производительности.
Magnitude создан для максимальной производительности на вашем оборудовании и для запуска локальных агентов: компиляция и настройка на устройстве, фокус на лучших архитектурах, динамическое распределение памяти и гибридное страничное внимание. Magnitude полностью открыт (Apache 2.0). Мы написали его на Rust, включая пользовательскую среду выполнения GPU-ядер и автотюнер.
По сравнению с llama.cpp с Qwen 3.6 35B A3B (4 бита), контекст 64k, без спекулятивного декодирования: Metal (Mac M4 Pro 48 ГБ) — 92% более быстрое декодирование (30 ток/с → 57 ток/с), CUDA (DGX Spark) — 19% более быстрое декодирование (49 ток/с → 58 ток/с). Magnitude поставляется как настольное приложение, которое вы можете легко подключить к любым агентам, которые уже используете.
Ключевые сущности: Компании: magnitudedev, GitHub, Hacker News | Люди: Anders, Tom
Часто задаваемые вопросы: Что такое Magnitude?
Magnitude — это движок вывода с открытым исходным кодом для агентов, который оптимизируется под ваше конкретное оборудование, обеспечивая до 2 раз более высокую производительность, чем llama.cpp на Apple Silicon, NVIDIA, AMD или CPU.
Вопрос: Что такое Magnitude?
Ответ: Magnitude — это движок вывода с открытым исходным кодом для агентов, который оптимизируется под ваше конкретное оборудование, обеспечивая до 2 раз более высокую производительность, чем llama.cpp на Apple Silicon, NVIDIA, AMD или CPU.
Что такое Magnitude?
Magnitude — это движок вывода с открытым исходным кодом для агентов, который оптимизируется под ваше конкретное оборудование, обеспечивая до 2 раз более высокую производительность, чем llama.cpp на Apple Silicon, NVIDIA, AMD или CPU.
🇨🇳 简体中文
Magnitude:开源推理引擎,比 llama.cpp 快 2 倍
嘿,Hacker News,这里是 Anders 和 Tom。我们正在构建 Magnitude,一个为代理设计的推理引擎,它会在您的硬件上尽可能快地运行。它适用于 Mac、Linux 和 Windows,支持任何硬件,并且比 llama.cpp 快 2 倍。
我们都是软件工程师,之前构建了一个开源浏览器代理,获得了 4k+ GitHub 星标和 100k+ 下载。我们越来越想在其上运行本地模型,但发现没有推理引擎适合我们的用例。如今的推理引擎都在性能上有所取舍。
Magnitude 专为在您的硬件上实现最大性能并运行本地代理而构建:设备端编译和调优、专注于最佳架构、动态内存分配和混合分页注意力。Magnitude 完全开源(Apache 2.0)。我们用 Rust 构建,包括自定义 GPU 内核运行时和自动调优器。
与 llama.cpp 在 Qwen 3.6 35B A3B(4 位)、64k 上下文、无推测解码的情况下进行基准测试:Metal(Mac M4 Pro 48 GB)— 解码速度快 92%(30 tok/s → 57 tok/s),CUDA(DGX Spark)— 解码速度快 19%(49 tok/s → 58 tok/s)。Magnitude 作为桌面应用发布,您可以轻松地将其与您已使用的任何代理连接。
关键实体:公司:magnitudedev、GitHub、Hacker News | 人员:Anders、Tom
常见问题:什么是 Magnitude?
Magnitude 是一个面向代理的开源推理引擎,它会针对您的确切硬件进行优化,在 Apple Silicon、NVIDIA、AMD 或 CPU 上比 llama.cpp 快 2 倍。
常见问题 Q:什么是 Magnitude?
常见问题 A:Magnitude 是一个面向代理的开源推理引擎,它会针对您的确切硬件进行优化,在 Apple Silicon、NVIDIA、AMD 或 CPU 上比 llama.cpp 快 2 倍。
什么是 Magnitude?
Magnitude 是一个面向代理的开源推理引擎,它会针对您的确切硬件进行优化,在 Apple Silicon、NVIDIA、AMD 或 CPU 上比 llama.cpp 快 2 倍。