HeadlinesBriefing favicon HeadlinesBriefing.com

Slotstream 在低内存 Mac 上运行 Qwen3.8-Flash-Next

Hacker News •
×

Slotstream 通过从 SSD 流式传输模型专家,使 1250 亿参数的 Qwen3.8-Flash-Next 混合专家模型能够在内存有限的 Mac 上运行。该模型在 4 位精度下占用 104 GB 磁盘空间,但通过 MLX 和 Swift 仅使用其中一小部分内存即可运行。它提供兼容 Ollama 的 API,并作为单个 Swift 二进制文件分发,无需 Python 依赖。在配备 48 GB 内存的 M5 Pro 上,自动模式下可实现约 12 tokens/秒的速度,峰值内存使用量为 32 GB。最低要求包括 Apple Silicon 芯片、macOS 14+ 以及约 110 GB 可用磁盘空间,512 GB 的 Mac 是现实的基准配置。该工具包含“医生”模式,可模拟不同内存配置下的性能。安装通过单行 Shell 脚本完成,首次使用时下载权重并通过 SHA-256 哈希进行完整性校验。拉取操作使用多个 TCP 连接以加快传输,且支持断点续传。未来工作包括实现 MTP 模块以支持推测性解码。