HeadlinesBriefing favicon HeadlinesBriefing.com

Magnitude: Open-Source-Inferenz-Engine

Hacker News •
×

Hey HN, hier sind Anders und Tom. Wir bauen Magnitude, eine Inferenz-Engine für Agenten, die sich selbst optimiert, um auf Ihrer Hardware so schnell wie möglich zu laufen. Sie funktioniert auf Mac, Linux und Windows auf jeder Hardware und ist bis zu 2x schneller als llama.cpp.

Wir sind beide Softwareentwickler und haben zuvor einen Open-Source-Browser-Agenten mit über 4.000 GitHub-Sternen und über 100.000 Downloads entwickelt. Wir wollten ihn zunehmend auf lokalen Modellen ausführen, stellten jedoch fest, dass keine Inferenz-Engine für unseren Anwendungsfall funktionierte.

Heutige Inferenz-Engines gehen alle einen Kompromiss bei der Leistung ein. Sie sind entweder für Batch-Inferenz auf Rechenzentrumshardware gebaut, auf Kosten der Leistung einzelner Sitzungen (vLLM, SGLang), oder für breite Kompatibilität statt Optimierung auf spezifische Hardware ausgelegt (llama.cpp, Ollama), oder auf spezifische Hardware oder Modelle spezialisiert, aber ohne Engine-Vollständigkeit (oMLX, ds4). Außerdem ist keine davon für den lokalen Betrieb von Agenten ausgelegt.

Magnitude ist für maximale Leistung auf Ihrer Hardware und für den Betrieb lokaler Agenten gebaut. Es bietet Kompilierung und Abstimmung auf dem Gerät, Fokus auf die besten Architekturen, dynamische Speicherzuweisung und hybride Seitenaufmerksamkeit. Es ist vollständig Open Source (Apache 2.0), in Rust gebaut, und Benchmarks zeigen bis zu 92% schnellere Dekodierung auf Metal und 19% schneller auf CUDA im Vergleich zu llama.cpp.

Magnitude wird als Desktop-App geliefert, die sich mit Agenten wie Pi, OpenCode, Hermes und Codex verbindet. Zukünftige Pläne umfassen Experten-Streaming, Kernel-Compiler und Multi-Geräte-Nutzung.