HeadlinesBriefing HeadlinesBriefing.com

Janus servidor LLM local

Hacker News •
×

Janus é um único binário Go que executa modelos .gguf em sua máquina (GPU ou CPU) e expõe uma API compatível com Open AI. Sem Python, sem Docker, sem Ollama necessário. Use do seu jeito: chame-o da linha de comando (curl, Power Shell, scripts), conecte-o ao Cursor / Cline / qualquer cliente Open AI — mesmos modelos locais, o fluxo de trabalho que se adequa a você.

O que você obtém inclui inferência local via llama.cpp através de Vulkan (AMD / Intel / NVIDIA) ou fallback para CPU, uma API compatível com Open AI com endpoints como /v1/chat/completions e /v1/models, troca a quente de modelos sem reiniciar, suporte a modelos de pensamento com divisão de raciocínio, detecção automática de template de chat a partir de metadados GGUF e zero dependências — um único .exe no Windows.

Requisitos: Windows 10/11 com Go 1.22+ e GPU compatível com Vulkan recomendado, Linux com Go 1.22+ e Vulkan ou CPU, ou macOS com Go 1.22+ e backend CPU. Espaço em disco inclui o tamanho do modelo (geralmente 2–8 GB por modelo) mais aproximadamente 50 MB para Janus + llama.dll. O início rápido envolve clonar o repositório, compilar com build.ps1, baixar um arquivo .gguf, configurar o arquivo .env (por exemplo, INFERENCE_BACKEND=vulkan, JANUS_MODEL_PATH) e executar o servidor em 127.0.0.1:8990.

O layout do projeto inclui cmd/janus/ para o servidor principal, cmd/modelget/ para download de modelos e internal/engine/ para o executor Vulkan do llama.cpp. As armadilhas incluem garantir que não haja processos residuais ocupando a porta 8990, o caminho correto de JANUS_MODEL_PATH e drivers de GPU atualizados.

Fonte: Hacker News · Resumido por HeadlinesBriefing