Hola HN, aquí Anders y Tom. Estamos construyendo Magnitude, un motor de inferencia para agentes que se optimiza para ejecutarse lo más rápido posible en tu hardware. Funciona en Mac, Linux y Windows en cualquier hardware y es hasta 2 veces más rápido que llama.cpp.
Ambos somos ingenieros de software y anteriormente construimos un agente de navegador de código abierto con más de 4k estrellas en GitHub y más de 100k descargas. Cada vez queríamos más ejecutarlo en modelos locales, pero descubrimos que ningún motor de inferencia funcionaba para nuestro caso de uso.
Los motores de inferencia actuales todos hacen un compromiso de rendimiento. O están construidos para inferencia por lotes en hardware de centro de datos a costa del rendimiento de una sola sesión (vLLM, SGLang), o diseñados para una amplia compatibilidad en lugar de optimizar para hardware específico (llama.cpp, Ollama), o especializados para hardware o modelos específicos pero sin completitud de motor (oMLX, ds4). Además, ninguno está diseñado para ejecutar agentes localmente.
Magnitude está construido para el máximo rendimiento en tu hardware y para ejecutar agentes locales. Cuenta con compilación y ajuste en el dispositivo, enfoque en las mejores arquitecturas, asignación dinámica de memoria y atención paginada híbrida. Es completamente de código abierto (Apache 2.0), construido en Rust, y los puntos de referencia muestran hasta un 92% más rápido en decodificación en Metal y 19% más rápido en CUDA en comparación con llama.cpp.
Magnitude se distribuye como una aplicación de escritorio que se conecta con agentes como Pi, OpenCode, Hermes y Codex. Los planes futuros incluyen transmisión experta, compilador de kernels y utilización de múltiples dispositivos.