GitHub - Niko1221/Strata permite que você execute um modelo de IA de 125 bilhões de parâmetros no seu próprio PC gamer com uma placa de vídeo NVIDIA ou AMD (12 GB de VRAM ou mais). É gratuito, de código aberto e executa Qwen3.8-Flash-Next, um grande modelo de IA inteligente que normalmente precisa de um servidor. O modelo conversa, escreve código, lê imagens e funciona com seus aplicativos e agentes de codificação, sem que nada saia do seu PC.
A velocidade foi medida em dois PCs gamer comuns. Em uma NVIDIA RTX 5070 (12 GB, Ryzen 5 7600, 64 GB RAM), o tamanho Q2_0 escreve respostas a 94 tokens por segundo e lê prompts a 2.650 tokens por segundo. Em uma AMD RX 9070 XT (16 GB, Ryzen 9 3900 X, 47 GB RAM), Q2_0 escreve a 60 tokens por segundo e lê a 1.160 tokens por segundo. Uma placa com mais VRAM como uma RTX 3090 (24 GB) deve escrever cerca de 100-140 tokens por segundo.
Você precisa de uma placa de vídeo da série NVIDIA GeForce RTX 20, 30, 40 ou 50, ou da série AMD Radeon RX 7900 XT/XTX, RX 7800 XT/7700 XT, RX 9060 XT, RX 9070/9070 XT, Radeon AI PRO R9700 ou RX 6800/6900. Você também precisa de 32 GB de RAM ou mais, cerca de 80 GB de espaço livre em disco (SSD recomendado) e Windows 10/11 ou Linux com um driver de gráficos atualizado. O instalador configura todo o resto, e duas ou três placas podem compartilhar o modelo.
Para instalar, baixe o Strata e descompacte-o (ou faça git clone). No Windows, clique duas vezes em START-HERE.bat. No Linux, execute ./setup.sh na pasta Strata. O instalador encontra sua placa e configura o motor correto, fazendo algumas perguntas sobre o tamanho do modelo, contexto e entrada de imagem. Em seguida, baixa o modelo (cerca de 70 GB) e o inicia, abrindo o aplicativo Strata em http://127.0.0.1:8080.
Fonte: Hacker News · Resumido por HeadlinesBriefing