HeadlinesBriefing HeadlinesBriefing.com

Magnitude: mecanismo de inferência de código aberto até 2x mais rápido que llama.cpp

Hacker News •
×

Olá Hacker News, aqui Anders e Tom. Estamos construindo o Magnitude, um mecanismo de inferência para agentes que se otimiza para rodar o mais rápido possível no seu hardware. Funciona em Mac, Linux e Windows em qualquer hardware e é até 2x mais rápido que llama.cpp.

Somos ambos engenheiros de software e anteriormente construímos um agente de navegador de código aberto com mais de 4 mil estrelas no GitHub e mais de 100 mil downloads. Queríamos cada vez mais executá-lo em modelos locais, mas descobrimos que nenhum mecanismo de inferência funcionava para o nosso caso de uso. Os mecanismos de inferência de hoje todos fazem um trade-off de desempenho.

O Magnitude é construído para máximo desempenho no seu hardware e para executar agentes locais: compilação e ajuste no dispositivo, foco nas melhores arquiteturas, alocação dinâmica de memória e atenção paginada híbrida. O Magnitude é totalmente de código aberto (Apache 2.0). Nós o construímos em Rust, incluindo um runtime de kernel GPU personalizado e autotuner.

Comparado com llama.cpp com Qwen 3.6 35B A3B (4 bits), contexto de 64k, sem decodificação especulativa: Metal (Mac M4 Pro 48 GB) - 92% de decodificação mais rápida (30 tok/s → 57 tok/s), CUDA (DGX Spark) - 19% de decodificação mais rápida (49 tok/s → 58 tok/s). O Magnitude é distribuído como um aplicativo de desktop que você pode conectar facilmente com quaisquer agentes que já usa.

Entidades-chave: Empresas: magnitudedev, GitHub, Hacker News | Pessoas: Anders, Tom

Perguntas frequentes: O que é o Magnitude?

O Magnitude é um mecanismo de inferência de código aberto para agentes que se otimiza para o seu hardware exato, oferecendo desempenho até 2x mais rápido que llama.cpp em Apple Silicon, NVIDIA, AMD ou CPU.

Pergunta frequente Q: O que é o Magnitude?

Resposta frequente A: O Magnitude é um mecanismo de inferência de código aberto para agentes que se otimiza para o seu hardware exato, oferecendo desempenho até 2x mais rápido que llama.cpp em Apple Silicon, NVIDIA, AMD ou CPU.

Fonte: Hacker News · Resumido por HeadlinesBriefing