HeadlinesBriefing favicon HeadlinesBriefing.com

Slotstream ejecuta Qwen3.8-Flash-Next en Macs con poca memoria

Hacker News •
×

Slotstream permite ejecutar el modelo de mezcla de expertos Qwen3.8-Flash-Next de 125 mil millones de parámetros en Macs con RAM limitada mediante la transmisión de expertos del modelo desde el SSD. El modelo requiere 104 GB en disco a precisión de 4 bits, pero se ejecuta utilizando solo una fracción de esa memoria a través de MLX y Swift. Proporciona una API compatible con Ollama y se distribuye como un único binario de Swift sin dependencias de Python.

En un M5 Pro de 48 GB, alcanza ~12 tokens/segundo con un uso máximo de memoria de 32 GB en modo automático. Los requisitos mínimos incluyen Apple Silicon, macOS 14+ y ~110 GB de espacio libre en disco, siendo un Mac de 512 GB la base realista. La herramienta incluye un modo 'doctor' para simular el rendimiento en diferentes configuraciones de RAM.

La instalación se realiza mediante un script de shell de una línea, y los pesos se descargan en el primer uso con comprobaciones de integridad mediante hashes SHA-256. Las operaciones de pull usan múltiples conexiones TCP para transferencias más rápidas, y las interrupciones son seguras gracias a las descargas reanudables. Los trabajos futuros incluyen implementar el módulo MTP para decodificación especulativa.