GitHub - Niko1221/Strataを使用すると、NVIDIAまたはAMDのグラフィックスカード(12 GB VRAM以上)を搭載した自分のゲーミングPCで、1250億パラメータのAIモデルを実行できます。これは無料でオープンソースであり、通常はサーバーを必要とする大規模でスマートなAIモデルであるQwen3.8-Flash-Nextを実行します。このモデルはチャット、コード作成、画像読み取りを行い、アプリやコーディングエージェントと連携し、データはPCから外部に出ることはありません。
速度は2台の一般的なゲーミングPCで測定されました。NVIDIA RTX 5070(12 GB、Ryzen 5 7600、64 GB RAM)では、Q2_0サイズが毎秒94トークンで回答を書き、毎秒2,650トークンでプロンプトを読み取ります。AMD RX 9070 XT(16 GB、Ryzen 9 3900 X、47 GB RAM)では、Q2_0が毎秒60トークンで書き込み、毎秒1,160トークンで読み取ります。RTX 3090(24 GB)のようなVRAMが多いカードは、毎秒約100〜140トークンを書き込むはずです。
NVIDIA GeForce RTX 20、30、40、50シリーズ、またはAMD Radeon RX 7900 XT/XTX、RX 7800 XT/7700 XT、RX 9060 XT、RX 9070/9070 XT、Radeon AI PRO R9700、RX 6800/6900シリーズのグラフィックスカードが必要です。また、32 GB以上のRAM、約80 GBの空きディスク容量(SSD推奨)、Windows 10/11またはLinuxと最新のグラフィックスドライバーが必要です。インストーラーがその他すべてを設定し、2枚または3枚のカードでモデルを共有できます。
インストールするには、Strataをダウンロードして解凍するか(git clone)、Windowsの場合はSTART-HERE.batをダブルクリックします。Linuxの場合は、Strataフォルダーで./setup.shを実行します。インストーラーがカードを検出し、適切なエンジンを設定し、モデルサイズ、コンテキスト、画像入力に関するいくつかの質問をします。その後、モデル(約70 GB)をダウンロードして起動し、http://127.0.0.1:8080でStrataアプリを開きます。
出典: Hacker News · 要約:HeadlinesBriefing