HeadlinesBriefing favicon HeadlinesBriefing.com

Slotstream menjalankan Qwen3.8-Flash-Next di Mac memori rendah

Hacker News •
×

Slotstream memungkinkan menjalankan model Mixture-of-Experts Qwen3.8-Flash-Next 125 miliar parameter di Mac dengan RAM terbatas dengan streaming ahli model dari SSD. Model memerlukan 104 GB di disk pada presisi 4-bit tetapi berjalan hanya menggunakan sebagian kecil memori tersebut melalui MLX dan Swift. Ia menyediakan API kompatibel Ollama dan didistribusikan sebagai single binary Swift tanpa dependensi Python.

Pada M5 Pro 48 GB, ia mencapai ~12 token/detik dengan penggunaan memori puncak 32 GB di mode otomatis. Persyaratan minimum termasuk Apple Silicon, macOS 14+, dan ~110 GB ruang disk bebas, dengan Mac 512 GB menjadi baseline realistis. Tool termasuk mode 'doctor' untuk mensimulasikan performa di berbagai konfigurasi RAM.

Instalasi via script shell satu baris, dan bobot diunduh pada penggunaan pertama dengan pemeriksaan integritas via hash SHA-256. Operasi pull menggunakan multiple koneksi TCP untuk transfer lebih cepat, dan interupsi aman karena download yang dapat dilanjutkan. Pekerjaan masa depan termasuk implementasi modul MTP untuk speculative decoding.