HeadlinesBriefing favicon HeadlinesBriefing.com

Magnitude:开源推理引擎

Hacker News •
×

嘿,HN,我们是 Anders 和 Tom。我们正在构建 Magnitude,一个针对智能体的推理引擎,它会自我优化,以在您的硬件上尽可能快地运行。它适用于 Mac、Linux 和 Windows 上的任何硬件,速度比 llama.cpp 快 2 倍。

我们都是软件工程师,之前构建了一个开源浏览器智能体,获得了 4k+ GitHub 星标和 100k+ 下载。我们越来越想在其上运行本地模型,但发现没有推理引擎适合我们的用例。

如今的推理引擎都做出了性能权衡。它们要么为数据中心硬件上的批处理推理而构建,牺牲单会话性能(vLLM、SGLang),要么为广泛兼容性而设计,而不是针对特定硬件进行优化(llama.cpp、Ollama),要么针对特定硬件或模型进行专门化,但缺乏引擎完整性(oMLX、ds4)。此外,没有一个是专为本地运行智能体而设计的。

Magnitude 专为在您的硬件上实现最大性能并运行本地智能体而构建。它具备设备端编译和调优、专注于最佳架构、动态内存分配和混合分页注意力。它完全开源(Apache 2.0),用 Rust 构建,基准测试显示,与 llama.cpp 相比,Metal 上的解码速度快 92%,CUDA 上快 19%。

Magnitude 作为桌面应用发布,可与 Pi、OpenCode、Hermes 和 Codex 等智能体连接。未来计划包括专家流式、内核编译器和多设备利用。