GitHub - Niko1221/Strata le permite ejecutar un modelo de IA de 125 mil millones de parámetros en su propia PC de juegos con una tarjeta gráfica NVIDIA o AMD (12 GB de VRAM o más). Es gratuito, de código abierto y ejecuta Qwen3.8-Flash-Next, un modelo de IA grande e inteligente que normalmente necesita un servidor. El modelo chatea, escribe código, lee imágenes y funciona con sus aplicaciones y agentes de codificación, sin que nada salga de su PC.
La velocidad se midió en dos PC de juegos normales. En una NVIDIA RTX 5070 (12 GB, Ryzen 5 7600, 64 GB RAM), el tamaño Q2_0 escribe respuestas a 94 tokens por segundo y lee indicaciones a 2,650 tokens por segundo. En una AMD RX 9070 XT (16 GB, Ryzen 9 3900 X, 47 GB RAM), Q2_0 escribe a 60 tokens por segundo y lee a 1,160 tokens por segundo. Una tarjeta con más VRAM como una RTX 3090 (24 GB) debería escribir entre 100 y 140 tokens por segundo.
Necesita una tarjeta gráfica de la serie NVIDIA GeForce RTX 20, 30, 40 o 50, o de la serie AMD Radeon RX 7900 XT/XTX, RX 7800 XT/7700 XT, RX 9060 XT, RX 9070/9070 XT, Radeon AI PRO R9700 o RX 6800/6900. También necesita 32 GB de RAM o más, unos 80 GB de espacio libre en disco (se recomienda SSD) y Windows 10/11 o Linux con un controlador de gráficos actualizado. El instalador configura todo lo demás, y dos o tres tarjetas pueden compartir el modelo.
Para instalar, descargue Strata y descomprímalo (o haga git clone). En Windows, haga doble clic en START-HERE.bat. En Linux, ejecute ./setup.sh en la carpeta Strata. El instalador encuentra su tarjeta y configura el motor correcto, haciendo algunas preguntas sobre el tamaño del modelo, el contexto y la entrada de imágenes. Luego descarga el modelo (unos 70 GB) y lo inicia, abriendo la aplicación Strata en http://127.0.0.1:8080.
Fuente: Hacker News · Resumido por HeadlinesBriefing