HeadlinesBriefing favicon HeadlinesBriefing.com

Magnitude: オープンソース推論エンジン

Hacker News •
×

やあHN、アンダースとトムです。私たちは、お使いのハードウェア上で可能な限り高速に動作するように自己最適化する、エージェント向け推論エンジン「Magnitude」を構築しています。Mac、Linux、Windowsのあらゆるハードウェアで動作し、llama.cppの最大2倍高速です。

私たちはどちらもソフトウェアエンジニアで、以前にオープンソースのブラウザエージェントを構築し、GitHubで4,000以上のスター、10万以上のダウンロードを獲得しました。ますますローカルモデルで実行したいと思うようになりましたが、私たちのユースケースに合う推論エンジンはないことに気付きました。

今日の推論エンジンはすべて、パフォーマンスのトレードオフを行っています。データセンターのハードウェアでのバッチ推論用に構築され、単一セッションのパフォーマンスを犠牲にしているもの(vLLM、SGLang)、特定のハードウェアに最適化するのではなく広範な互換性を重視して設計されたもの(llama.cpp、Ollama)、特定のハードウェアやモデルに特化しているがエンジンとしての完全性に欠けるもの(oMLX、ds4)です。さらに、ローカルでエージェントを実行するために設計されたものはありません。

Magnitudeは、お使いのハードウェアでの最大パフォーマンスとローカルエージェントの実行のために構築されています。デバイス上でのコンパイルとチューニング、最適なアーキテクチャへの焦点、動的メモリ割り当て、ハイブリッドページドアテンションを備えています。完全にオープンソース(Apache 2.0)で、Rustで構築されており、ベンチマークではllama.cppと比較してMetalで最大92%高速なデコード、CUDAで19%高速であることが示されています。

Magnitudeはデスクトップアプリとして提供され、Pi、OpenCode、Hermes、Codexなどのエージェントと接続します。将来の計画には、エキスパートストリーミング、カーネルコンパイラ、マルチデバイス利用が含まれます。