HeadlinesBriefing HeadlinesBriefing.com

Janus ローカルLLMサーバー

Hacker News •
×

Janusは単一のGoバイナリで、マシン(GPUまたはCPU)上で.ggufモデルを実行し、Open AI互換のAPIを公開します。Python、Docker、Ollamaは不要です。お好みの方法で使用してください。コマンドライン(curl、Power Shell、スクリプト)から呼び出したり、Cursor / Cline / 任意のOpen AIクライアントに接続したりできます。同じローカルモデルで、あなたに合ったワークフローを実現します。

得られる機能には、llama.cppを介したVulkan(AMD / Intel / NVIDIA)またはCPUフォールバックによるローカル推論、/v1/chat/completionsや/v1/modelsなどのエンドポイントを備えたOpen AI互換API、再起動不要のホットスワップモデル、推論分割を伴う思考モデルサポート、GGUFメタデータからのチャットテンプレート自動検出、ゼロ依存関係(Windowsでは単一の.exe)が含まれます。

要件:Windows 10/11(Go 1.22+、Vulkan対応GPU推奨)、Linux(Go 1.22+、VulkanまたはCPU)、macOS(Go 1.22+、CPUバックエンド)。ディスク容量にはモデルサイズ(多くの場合、モデルあたり2~8 GB)に加え、Janus + llama.dll用に約50 MBが必要です。クイックスタートでは、リポジトリのクローン、build.ps1によるビルド、.ggufファイルのダウンロード、.envファイルの設定(例:INFERENCE_BACKEND=vulkan、JANUS_MODEL_PATH)、127.0.0.1:8990でのサーバー実行を行います。

プロジェクトレイアウトには、メインサーバー用のcmd/janus/、モデルダウンロード用のcmd/modelget/、llama.cpp Vulkanランナー用のinternal/engine/が含まれます。落とし穴としては、ポート8990を占有する残存プロセスがないこと、正しいJANUS_MODEL_PATH、および更新されたGPUドライバーの確認が挙げられます。

出典: Hacker News · 要約:HeadlinesBriefing