HeadlinesBriefing HeadlinesBriefing.com

DwarfStar 4: Lokale Frontier-Inferenz

Hacker News •
×

DS4 · LOKALE FRONTIER-INFERENZ Führen Sie Frontier-Open-Weights lokal mit ds4 aus. Dwarf Star 4 ist eine schmale C-Inferenz-Engine für Maschinen mit hohem Arbeitsspeicher (Mac, CUDA und ROCm). Sie unterstützt Deep Seek V4 und V4.1 Flash, GLM 5.x und Qwen3.8 Flash Next, mit Text- und Vision-Modellen, lokalen APIs, einer CLI und einem nativen Agenten in einem Stack.

UNTERSTÜTZT: DEEPSEEK V4 / V4.1 + GLM 5.x + QWEN3.8 · MIT-LIZENZ· C / METAL / CUDA / ROCM· QWEN AUF 64GB-PRINZIP. Das 284-Milliarden-Parameter-Modell Deep Seek V4 Flash ist ein großes Mixture-of-Experts-Modell. ds4 geht von der entgegengesetzten Einschränkung des Remote-Servings aus. Asymmetrische Quantisierung zielt auf die gerouteten Experten ab, während kritische Pfade erhalten bleiben, was das Modell auf Maschinen mit hohem Arbeitsspeicher praktikabel macht.

Die lokale Engine stellt eine CLI, HTTP-APIs und einen nativen Agenten bereit, die alle denselben Modellzustand und Cache teilen. ds4 ist kein generischer GGUF-Runner; es folgt einer kleinen, opportunistischen Menge von Modellfamilien und validiert jedes unterstützte Layout Ende-zu-Ende. Zu den Kernfunktionen gehören asymmetrische 2-Bit-Quantisierung, KV-Cache als Disk-Bürger und eine Engine mit drei Schnittstellen: ./ds4 für Chat, ./ds4-server für lokale APIs und ./ds4-agent für persistente Codierungssitzungen.

Führen Sie ds4 in drei Schritten aus: Laden Sie das Projekt-GGUF herunter, bauen Sie für Ihr Backend, dann starten Sie die CLI oder den Server. Die Hardware-Abdeckung umfasst Plattformen wie M5 Max, 128 GB, die 34,4 T/S Generierung und 557 T/S Prefill erreichen. ds4-server spricht OpenAI- und Anthropic-ähnliche APIs und ermöglicht es lokalen Codierungsagenten, sich mit Ihrer eigenen Maschine zu verbinden.

Wichtige Entitäten: Unternehmen: Deep Seek, GLM, Qwen, Dwarf Star

Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing