HeadlinesBriefing favicon HeadlinesBriefing.com

Magnitude: mecanismo de inferência de código aberto

Hacker News •
×

Olá HN, aqui são Anders e Tom. Estamos construindo o Magnitude, um mecanismo de inferência para agentes que se otimiza para rodar o mais rápido possível no seu hardware. Funciona em Mac, Linux e Windows em qualquer hardware e é até 2x mais rápido que o llama.cpp.

Somos ambos engenheiros de software e anteriormente construímos um agente de navegador de código aberto com mais de 4 mil estrelas no GitHub e mais de 100 mil downloads. Queríamos cada vez mais executá-lo em modelos locais, mas descobrimos que nenhum mecanismo de inferência funcionava para o nosso caso de uso.

Os mecanismos de inferência atuais todos fazem um trade-off de desempenho. Ou são construídos para inferência em lote em hardware de data center ao custo do desempenho de sessão única (vLLM, SGLang), ou projetados para ampla compatibilidade em vez de otimizar para hardware específico (llama.cpp, Ollama), ou especializados para hardware ou modelos específicos, mas sem completude de mecanismo (oMLX, ds4). Além disso, nenhum é projetado para executar agentes localmente.

O Magnitude é construído para máximo desempenho no seu hardware e para executar agentes locais. Ele apresenta compilação e ajuste no dispositivo, foco nas melhores arquiteturas, alocação dinâmica de memória e atenção paginada híbrida. É totalmente de código aberto (Apache 2.0), construído em Rust, e benchmarks mostram até 92% mais rápido na decodificação no Metal e 19% mais rápido no CUDA em comparação com o llama.cpp.

O Magnitude é distribuído como um aplicativo de desktop que se conecta a agentes como Pi, OpenCode, Hermes e Codex. Os planos futuros incluem streaming especializado, compilador de kernels e utilização de vários dispositivos.