HeadlinesBriefing favicon HeadlinesBriefing.com

Slotstream roda Qwen3.8-Flash-Next em Macs com pouca memória

Hacker News •
×

Slotstream permite rodar o modelo de mistura de especialistas Qwen3.8-Flash-Next de 125 bilhões de parâmetros em Macs com RAM limitada transmitindo especialistas do modelo do SSD. O modelo requer 104 GB em disco com precisão de 4 bits, mas roda usando apenas uma fração dessa memória via MLX e Swift. Ele fornece uma API compatível com Ollama e é distribuído como um único binário Swift sem dependências Python.

Em um M5 Pro de 48 GB, atinge ~12 tokens/segundo com uso máximo de memória de 32 GB no modo automático. Os requisitos mínimos incluem Apple Silicon, macOS 14+ e ~110 GB de espaço livre em disco, sendo um Mac de 512 GB a base realista. A ferramenta inclui um modo 'doctor' para simular desempenho em diferentes configurações de RAM.

A instalação é via script shell de uma linha, e os pesos são baixados no primeiro uso com verificações de integridade via hashes SHA-256. Operações de pull usam múltiplas conexões TCP para transferências mais rápidas, e interrupções são seguras devido a downloads retomáveis. Trabalhos futuros incluem implementar o módulo MTP para decodificação especulativa.