HeadlinesBriefing HeadlinesBriefing.com

Janus servidor LLM local

Hacker News •
×

Janus es un único binario Go que ejecuta modelos .gguf en su máquina (GPU o CPU) y expone una API compatible con Open AI. No se requiere Python, Docker ni Ollama. Úselo a su manera: llámelo desde la línea de comandos (curl, Power Shell, scripts), conéctelo a Cursor / Cline / cualquier cliente Open AI — los mismos modelos locales, el flujo de trabajo que más le convenga.

Lo que obtiene incluye inferencia local a través de llama.cpp mediante Vulkan (AMD / Intel / NVIDIA) o respaldo de CPU, una API compatible con Open AI con endpoints como /v1/chat/completions y /v1/models, intercambio en caliente de modelos sin reiniciar, soporte para modelos de pensamiento con división de razonamiento, detección automática de plantillas de chat desde metadatos GGUF y cero dependencias — un solo .exe en Windows.

Requisitos: Windows 10/11 con Go 1.22+ y GPU compatible con Vulkan recomendado, Linux con Go 1.22+ y Vulkan o CPU, o macOS con Go 1.22+ y backend de CPU. El espacio en disco incluye el tamaño del modelo (a menudo 2–8 GB por modelo) más aproximadamente 50 MB para Janus + llama.dll. La guía rápida implica clonar el repositorio, compilar con build.ps1, descargar un archivo .gguf, configurar el archivo .env (por ejemplo, INFERENCE_BACKEND=vulkan, JANUS_MODEL_PATH) y ejecutar el servidor en 127.0.0.1:8990.

El diseño del proyecto incluye cmd/janus/ para el servidor principal, cmd/modelget/ para la descarga de modelos e internal/engine/ para el ejecutor Vulkan de llama.cpp. Las dificultades incluyen asegurarse de que no haya procesos residuales ocupando el puerto 8990, la ruta correcta de JANUS_MODEL_PATH y los controladores de GPU actualizados.

Fuente: Hacker News · Resumido por HeadlinesBriefing