HeadlinesBriefing HeadlinesBriefing.com

Magnitude: Mesin inferensi open source hingga 2x lebih cepat dari llama.cpp

Hacker News •
×

Hai Hacker News, ini Anders dan Tom. Kami membangun Magnitude, mesin inferensi untuk agen yang mengoptimalkan dirinya untuk berjalan secepat mungkin di perangkat keras Anda. Ini bekerja di Mac, Linux, dan Windows pada perangkat keras apa pun dan hingga 2x lebih cepat daripada llama.cpp.

Kami berdua insinyur perangkat lunak dan sebelumnya membangun agen peramban open source hingga 4k+ bintang GitHub dan 100k+ unduhan. Kami semakin ingin menjalankannya pada model lokal, tetapi menemukan bahwa tidak ada mesin inferensi yang cocok untuk kasus penggunaan kami. Mesin inferensi saat ini semuanya membuat trade-off kinerja.

Magnitude dibangun untuk kinerja maksimal di perangkat keras Anda dan menjalankan agen lokal: kompilasi dan penyesuaian di perangkat, fokus pada arsitektur terbaik, alokasi memori dinamis, dan perhatian halaman hibrida. Magnitude sepenuhnya open source (Apache 2.0). Kami membangunnya dalam Rust, termasuk runtime kernel GPU khusus dan autotuner.

Dibandingkan dengan llama.cpp dengan Qwen 3.6 35B A3B (4 bit), konteks 64k, tanpa decoding spekulatif: Metal (Mac M4 Pro 48 GB) - 92% decoding lebih cepat (30 tok/s → 57 tok/s), CUDA (DGX Spark) - 19% decoding lebih cepat (49 tok/s → 58 tok/s). Magnitude hadir sebagai aplikasi desktop yang dapat Anda hubungkan dengan mudah dengan agen apa pun yang sudah Anda gunakan.

Entitas kunci: Perusahaan: magnitudedev, GitHub, Hacker News | Orang: Anders, Tom

Sumber: Hacker News · Diringkas oleh HeadlinesBriefing