Salut HN, ici Anders et Tom. Nous construisons Magnitude, un moteur d'inférence pour agents qui s'optimise pour fonctionner aussi vite que possible sur votre matériel. Il fonctionne sur Mac, Linux et Windows sur n'importe quel matériel et est jusqu'à 2 fois plus rapide que llama.cpp.
Nous sommes tous deux ingénieurs logiciels et avons précédemment construit un agent navigateur open source avec plus de 4 000 étoiles GitHub et plus de 100 000 téléchargements. Nous voulions de plus en plus l'exécuter sur des modèles locaux, mais avons constaté qu'aucun moteur d'inférence ne convenait à notre cas d'utilisation.
Les moteurs d'inférence actuels font tous un compromis de performance. Ils sont soit conçus pour l'inférence par lots sur du matériel de centre de données au détriment des performances en session unique (vLLM, SGLang), soit conçus pour une large compatibilité plutôt que pour optimiser un matériel spécifique (llama.cpp, Ollama), soit spécialisés pour un matériel ou des modèles spécifiques mais manquant de complétude (oMLX, ds4). De plus, aucun n'est conçu pour exécuter des agents localement.
Magnitude est conçu pour une performance maximale sur votre matériel et pour exécuter des agents locaux. Il comprend la compilation et l'optimisation sur l'appareil, l'accent sur les meilleures architectures, l'allocation dynamique de mémoire et l'attention paginée hybride. Il est entièrement open source (Apache 2.0), construit en Rust, et les benchmarks montrent jusqu'à 92% plus rapide en décodage sur Metal et 19% plus rapide sur CUDA par rapport à llama.cpp.
Magnitude est distribué comme application de bureau qui se connecte à des agents comme Pi, OpenCode, Hermes et Codex. Les projets futurs incluent le streaming expert, le compilateur de noyaux et l'utilisation multi-appareils.