HeadlinesBriefing HeadlinesBriefing.com

Magnitude: llama.cpp より最大 2 倍高速なオープンソース推論エンジン

Hacker News •
×

Hacker News の皆さん、こんにちは。Anders と Tom です。私たちは、お使いのハードウェアで可能な限り高速に動作するように自己最適化する、エージェント向け推論エンジン Magnitude を構築しています。Mac、Linux、Windows のあらゆるハードウェアで動作し、llama.cpp より最大 2 倍高速です。

私たちはどちらもソフトウェアエンジニアで、以前にオープンソースのブラウザエージェントを構築し、GitHub で 4,000 以上のスターと 100,000 以上のダウンロードを獲得しました。ますますローカルモデルで実行したいと思うようになりましたが、私たちのユースケースに合う推論エンジンはないことに気づきました。今日の推論エンジンはすべてパフォーマンスを犠牲にしています。

Magnitude は、お使いのハードウェアで最大のパフォーマンスを発揮し、ローカルエージェントを実行するために構築されています。デバイス上でのコンパイルとチューニング、最適なアーキテクチャへの注力、動的メモリ割り当て、ハイブリッドページ化アテンションを実現します。Magnitude は完全にオープンソース(Apache 2.0)です。カスタム GPU カーネルランタイムとオートチューナーを含め、Rust で構築しました。

llama.cpp と Qwen 3.6 35B A3B(4 ビット)、64k コンテキスト、投機的デコードなしでベンチマークした結果:Metal(Mac M4 Pro 48 GB)— デコードが 92% 高速(30 tok/s → 57 tok/s)、CUDA(DGX Spark)— デコードが 19% 高速(49 tok/s → 58 tok/s)。Magnitude はデスクトップアプリとして提供され、既に使用している任意のエージェントと簡単に接続できます。

主要エンティティ:企業:magnitudedev、GitHub、Hacker News | 人物:Anders、Tom

よくある質問:Magnitude とは何ですか?

Magnitude は、お使いの正確なハードウェアに自己最適化するエージェント向けのオープンソース推論エンジンで、Apple Silicon、NVIDIA、AMD、CPU で llama.cpp より最大 2 倍高速なパフォーマンスを提供します。

よくある質問 Q:Magnitude とは何ですか?

よくある質問 A:Magnitude は、お使いの正確なハードウェアに自己最適化するエージェント向けのオープンソース推論エンジンで、Apple Silicon、NVIDIA、AMD、CPU で llama.cpp より最大 2 倍高速なパフォーマンスを提供します。

出典: Hacker News · 要約:HeadlinesBriefing