GitHub - Niko1221/Strata vous permet d'exécuter un modèle d'IA de 125 milliards de paramètres sur votre propre PC de jeu avec une carte graphique NVIDIA ou AMD (12 Go de VRAM ou plus). Il est gratuit, open source et exécute Qwen3.8-Flash-Next, un grand modèle d'IA intelligent qui nécessite généralement un serveur. Le modèle discute, écrit du code, lit des images et fonctionne avec vos applications et agents de codage, sans que rien ne quitte votre PC.
La vitesse a été mesurée sur deux PC de jeu ordinaires. Sur une NVIDIA RTX 5070 (12 Go, Ryzen 5 7600, 64 Go RAM), la taille Q2_0 écrit les réponses à 94 tokens par seconde et lit les invites à 2 650 tokens par seconde. Sur une AMD RX 9070 XT (16 Go, Ryzen 9 3900 X, 47 Go RAM), Q2_0 écrit à 60 tokens par seconde et lit à 1 160 tokens par seconde. Une carte avec plus de VRAM comme une RTX 3090 (24 Go) devrait écrire environ 100 à 140 tokens par seconde.
Vous avez besoin d'une carte graphique de la série NVIDIA GeForce RTX 20, 30, 40 ou 50, ou de la série AMD Radeon RX 7900 XT/XTX, RX 7800 XT/7700 XT, RX 9060 XT, RX 9070/9070 XT, Radeon AI PRO R9700 ou RX 6800/6900. Vous avez également besoin de 32 Go de RAM ou plus, d'environ 80 Go d'espace disque libre (SSD recommandé) et de Windows 10/11 ou Linux avec un pilote graphique à jour. L'installateur configure tout le reste, et deux ou trois cartes peuvent partager le modèle.
Pour installer, téléchargez Strata et décompressez-le (ou faites git clone). Sous Windows, double-cliquez sur START-HERE.bat. Sous Linux, exécutez ./setup.sh dans le dossier Strata. L'installateur trouve votre carte et configure le bon moteur, en posant quelques questions sur la taille du modèle, le contexte et l'entrée d'image. Il télécharge ensuite le modèle (environ 70 Go) et le démarre, ouvrant l'application Strata à http://127.0.0.1:8080.
Source: Hacker News · Résumé par HeadlinesBriefing