HeadlinesBriefing HeadlinesBriefing.com

Janus serveur LLM local

Hacker News •
×

Janus est un binaire Go unique qui exécute des modèles .gguf sur votre machine (GPU ou CPU) et expose une API compatible Open AI. Pas de Python, pas de Docker, pas d'Ollama requis. Utilisez-le à votre façon : appelez-le depuis la ligne de commande (curl, Power Shell, scripts), branchez-le dans Cursor / Cline / n'importe quel client Open AI — mêmes modèles locaux, le flux de travail qui vous convient.

Ce que vous obtenez inclut l'inférence locale via llama.cpp via Vulkan (AMD / Intel / NVIDIA) ou le repli CPU, une API compatible Open AI avec des endpoints comme /v1/chat/completions et /v1/models, l'échange à chaud de modèles sans redémarrage, le support des modèles de réflexion avec division du raisonnement, la détection automatique du modèle de chat à partir des métadonnées GGUF et zéro dépendance — un seul .exe sur Windows.

Configuration requise : Windows 10/11 avec Go 1.22+ et GPU compatible Vulkan recommandé, Linux avec Go 1.22+ et Vulkan ou CPU, ou macOS avec Go 1.22+ et backend CPU. L'espace disque inclut la taille du modèle (souvent 2–8 Go par modèle) plus environ 50 Mo pour Janus + llama.dll. Le démarrage rapide implique de cloner le dépôt, de compiler avec build.ps1, de télécharger un fichier .gguf, de configurer le fichier .env (par exemple, INFERENCE_BACKEND=vulkan, JANUS_MODEL_PATH) et d'exécuter le serveur sur 127.0.0.1:8990.

La structure du projet inclut cmd/janus/ pour le serveur principal, cmd/modelget/ pour le téléchargement de modèles et internal/engine/ pour l'exécuteur Vulkan de llama.cpp. Les pièges incluent la garantie qu'aucun processus résiduel n'occupe le port 8990, le chemin JANUS_MODEL_PATH correct et les pilotes GPU à jour.

Source: Hacker News · Résumé par HeadlinesBriefing