GitHub - Niko1221/Strata ermöglicht es Ihnen, ein KI-Modell mit 125 Milliarden Parametern auf Ihrem eigenen Gaming-PC mit einer NVIDIA- oder AMD-Grafikkarte (12 GB VRAM oder mehr) auszuführen. Es ist kostenlos, Open Source und führt Qwen3.8-Flash-Next aus, ein großes, intelligentes KI-Modell, das normalerweise einen Server benötigt. Das Modell chattet, schreibt Code, liest Bilder und arbeitet mit Ihren Apps und Codierungsagenten zusammen, wobei nichts Ihren PC verlässt.
Die Geschwindigkeit wurde auf zwei gewöhnlichen Gaming-PCs gemessen. Auf einer NVIDIA RTX 5070 (12 GB, Ryzen 5 7600, 64 GB RAM) schreibt die Größe Q2_0 Antworten mit 94 Token pro Sekunde und liest Eingabeaufforderungen mit 2.650 Token pro Sekunde. Auf einer AMD RX 9070 XT (16 GB, Ryzen 9 3900 X, 47 GB RAM) schreibt Q2_0 mit 60 Token pro Sekunde und liest mit 1.160 Token pro Sekunde. Eine Karte mit mehr VRAM wie eine RTX 3090 (24 GB) sollte etwa 100-140 Token pro Sekunde schreiben.
Sie benötigen eine Grafikkarte der NVIDIA GeForce RTX 20, 30, 40 oder 50 Serie oder der AMD Radeon RX 7900 XT/XTX, RX 7800 XT/7700 XT, RX 9060 XT, RX 9070/9070 XT, Radeon AI PRO R9700 oder RX 6800/6900 Serie. Sie benötigen außerdem 32 GB RAM oder mehr, etwa 80 GB freien Speicherplatz (SSD empfohlen) und Windows 10/11 oder Linux mit einem aktuellen Grafiktreiber. Der Installer richtet alles andere ein, und zwei oder drei Karten können sich das Modell teilen.
Zur Installation laden Sie Strata herunter und entpacken Sie es (oder git clone). Unter Windows doppelklicken Sie auf START-HERE.bat. Unter Linux führen Sie ./setup.sh im Strata-Ordner aus. Der Installer findet Ihre Karte und richtet die richtige Engine ein, wobei er einige Fragen zur Modellgröße, zum Kontext und zur Bildeingabe stellt. Anschließend lädt er das Modell (ca. 70 GB) herunter und startet es, wobei die Strata-App unter http://127.0.0.1:8080 geöffnet wird.
Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing