DS4 · INFÉRENCE LOCALE DE POINTE Exécutez des poids ouverts de pointe localement avec ds4. Dwarf Star 4 est un moteur d'inférence C étroit pour les machines Mac haute mémoire, CUDA et ROCm. Il prend en charge Deep Seek V4 et V4.1 Flash, GLM 5.x et Qwen3.8 Flash Next, avec des modèles texte et vision, des API locales, une CLI et un agent natif dans une seule pile.
PRIS EN CHARGE : DEEPSEEK V4 / V4.1 + GLM 5.x + QWEN3.8 · LICENCE MIT· C / METAL / CUDA / ROCM· PRINCIPE QWEN SUR 64GB. Le modèle Deep Seek V4 Flash à 284 milliards de paramètres est un grand modèle de mélange d'experts. ds4 part de la contrainte opposée du service distant. La quantification asymétrique cible les experts routés tout en préservant les chemins critiques, rendant le modèle pratique sur les machines haute mémoire.
Le moteur local expose une CLI, des API HTTP et un agent natif, partageant tous le même état de modèle et le même cache. ds4 n'est pas un exécuteur GGUF générique ; il suit un petit ensemble opportuniste de familles de modèles et valide chaque disposition prise en charge de bout en bout. Les fonctionnalités principales incluent la quantification asymétrique 2 bits, le cache KV comme citoyen du disque, et un moteur avec trois interfaces : ./ds4 pour le chat, ./ds4-server pour les API locales et ./ds4-agent pour les sessions de codage persistantes.
Exécutez ds4 en trois étapes : téléchargez le GGUF du projet, compilez pour votre backend, puis démarrez la CLI ou le serveur. L'adéquation matérielle inclut des plateformes comme M5 Max, 128 Go atteignant 34,4 T/S de génération et 557 T/S de préremplissage. ds4-server parle des API de style OpenAI et Anthropic, permettant aux agents de codage locaux de se connecter à votre propre machine.
Entités clés : Entreprises : Deep Seek, GLM, Qwen, Dwarf Star
Source: Hacker News · Résumé par HeadlinesBriefing