HeadlinesBriefing favicon HeadlinesBriefing.com

Slotstream exécute Qwen3.8-Flash-Next sur Mac à faible mémoire

Hacker News •
×

Slotstream permet d'exécuter le modèle de mélange d'experts Qwen3.8-Flash-Next de 125 milliards de paramètres sur des Mac à RAM limitée en diffusant les experts du modèle depuis le SSD. Le modèle nécessite 104 Go sur disque à une précision de 4 bits, mais s'exécute en n'utilisant qu'une fraction de cette mémoire via MLX et Swift. Il fournit une API compatible Ollama et est distribué sous forme d'un unique binaire Swift sans dépendances Python.

Sur un M5 Pro de 48 Go, il atteint ~12 tokens/seconde avec une utilisation mémoire maximale de 32 Go en mode automatique. Les exigences minimales incluent Apple Silicon, macOS 14+ et ~110 Go d'espace disque libre, un Mac de 512 Go étant la base réaliste. L'outil inclut un mode 'doctor' pour simuler les performances sur différentes configurations de RAM.

L'installation se fait via un script shell en une ligne, et les poids sont téléchargés à la première utilisation avec des vérifications d'intégrité via des hachages SHA-256. Les opérations de pull utilisent plusieurs connexions TCP pour des transferts plus rapides, et les interruptions sont sûres grâce aux téléchargements reprenables. Les travaux futurs incluent l'implémentation du module MTP pour le décodage spéculatif.