Janus ist eine einzelne Go-Binärdatei, die .gguf-Modelle auf Ihrem Rechner (GPU oder CPU) ausführt und eine Open AI-kompatible API bereitstellt. Kein Python, kein Docker, kein Ollama erforderlich. Verwenden Sie es nach Ihren Wünschen: Rufen Sie es von der Befehlszeile auf (curl, Power Shell, Skripte), verbinden Sie es mit Cursor / Cline / jedem Open AI-Client — dieselben lokalen Modelle, der Workflow, der zu Ihnen passt.
Was Sie erhalten, umfasst lokale Inferenz über llama.cpp über Vulkan (AMD / Intel / NVIDIA) oder CPU-Fallback, eine Open AI-kompatible API mit Endpunkten wie /v1/chat/completions und /v1/models, Hot-Swap von Modellen ohne Neustart, Unterstützung für Denkmodelle mit Aufteilung der Überlegungen, automatische Erkennung von Chat-Vorlagen aus GGUF-Metadaten und null Abhängigkeiten — eine einzige .exe unter Windows.
Anforderungen: Windows 10/11 mit Go 1.22+ und Vulkan-fähiger GPU empfohlen, Linux mit Go 1.22+ und Vulkan oder CPU, oder macOS mit Go 1.22+ und CPU-Backend. Der Speicherplatz umfasst die Modellgröße (oft 2–8 GB pro Modell) plus etwa 50 MB für Janus + llama.dll. Der Schnellstart umfasst das Klonen des Repositorys, das Erstellen mit build.ps1, das Herunterladen einer .gguf-Datei, das Konfigurieren der .env-Datei (z. B. INFERENCE_BACKEND=vulkan, JANUS_MODEL_PATH) und das Ausführen des Servers unter 127.0.0.1:8990.
Das Projektlayout umfasst cmd/janus/ für den Hauptserver, cmd/modelget/ für das Herunterladen von Modellen und internal/engine/ für den llama.cpp Vulkan-Runner. Zu den Fallstricken gehört die Sicherstellung, dass keine verbleibenden Prozesse Port 8990 belegen, der korrekte JANUS_MODEL_PATH und aktualisierte GPU-Treiber.
Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing