HeadlinesBriefing favicon HeadlinesBriefing.com

Slotstream führt Qwen3.8-Flash-Next auf Macs mit wenig Speicher aus

Hacker News •
×

Slotstream ermöglicht die Ausführung des 125 Milliarden Parameter großen Mixture-of-Experts-Modells Qwen3.8-Flash-Next auf Macs mit begrenztem RAM, indem es Modell-Experten von der SSD streamt. Das Modell erfordert 104 GB auf der Festplatte bei 4-Bit-Präzision, läuft aber über MLX und Swift nur mit einem Bruchteil davon im Speicher. Es stellt eine Ollama-kompatible API bereit und wird als einzelnes Swift-Binary ohne Python-Abhängigkeiten verteilt.

Auf einem 48 GB M5 Pro erreicht es ~12 Tokens/Sekunde bei einer Spitzen-Speichernutzung von 32 GB im Automatikmodus. Mindestanforderungen sind Apple Silicon, macOS 14+ und ~110 GB freier Festplattenspeicher, wobei ein 512 GB Mac die realistische Basislinie darstellt. Das Tool enthält einen 'Doctor'-Modus zur Simulation der Leistung bei verschiedenen RAM-Konfigurationen.

Die Installation erfolgt über ein einzeiliges Shell-Skript, und Gewichte werden beim ersten Gebrauch mit Integritätsprüfungen via SHA-256-Hashes heruntergeladen. Pull-Operationen nutzen mehrere TCP-Verbindungen für schnellere Übertragungen, und Unterbrechungen sind durch fortsetzbare Downloads sicher. Zukünftige Arbeit umfasst die Implementierung des MTP-Moduls für spekulatives Decodieren.