嘿,Hacker News,这里是 Anders 和 Tom。我们正在构建 Magnitude,一个为代理设计的推理引擎,它会在您的硬件上尽可能快地运行。它适用于 Mac、Linux 和 Windows,支持任何硬件,并且比 llama.cpp 快 2 倍。
我们都是软件工程师,之前构建了一个开源浏览器代理,获得了 4k+ GitHub 星标和 100k+ 下载。我们越来越想在其上运行本地模型,但发现没有推理引擎适合我们的用例。如今的推理引擎都在性能上有所取舍。
Magnitude 专为在您的硬件上实现最大性能并运行本地代理而构建:设备端编译和调优、专注于最佳架构、动态内存分配和混合分页注意力。Magnitude 完全开源(Apache 2.0)。我们用 Rust 构建,包括自定义 GPU 内核运行时和自动调优器。
与 llama.cpp 在 Qwen 3.6 35B A3B(4 位)、64k 上下文、无推测解码的情况下进行基准测试:Metal(Mac M4 Pro 48 GB)— 解码速度快 92%(30 tok/s → 57 tok/s),CUDA(DGX Spark)— 解码速度快 19%(49 tok/s → 58 tok/s)。Magnitude 作为桌面应用发布,您可以轻松地将其与您已使用的任何代理连接。
关键实体:公司:magnitudedev、GitHub、Hacker News | 人员:Anders、Tom
常见问题:什么是 Magnitude?
Magnitude 是一个面向代理的开源推理引擎,它会针对您的确切硬件进行优化,在 Apple Silicon、NVIDIA、AMD 或 CPU 上比 llama.cpp 快 2 倍。
常见问题 Q:什么是 Magnitude?
常见问题 A:Magnitude 是一个面向代理的开源推理引擎,它会针对您的确切硬件进行优化,在 Apple Silicon、NVIDIA、AMD 或 CPU 上比 llama.cpp 快 2 倍。
来源: Hacker News · 由HeadlinesBriefing整理摘要