HeadlinesBriefing favicon HeadlinesBriefing.com

ARGODRIVE Deltafin:Kimi K3 2.8T MoE 在 Apple Silicon 上运行

Hacker News •
×

ARGODRIVE Deltafin 在配备 128 GB 内存的 M5 Max MacBook Pro 上运行完整的 Kimi K3(2.8T 参数 MoE,1.45 TB 专家),从四个 SSD 流式加载专家。它在 512 token 的答案上实现 1.00 tok/s 的稳定解码速度,在 128 token 上为 1.13,在 17 token 的提示上为 0.96(上游为 0.68)。诚实的限制:512 token 的提示需要约 6.3 分钟才能生成第一个 token。原因已找到:预填充阶段每层专家被重复读取 8 次;修复计划已制定但尚未实现。有用的发现:一个驱动器提供四驱动器速度的约 52%,两个约 73%,三个约 90%——每层 16 次读取中最慢的驱动器决定速度,而不是总带宽。每个数字都是使用确切提示的一次冷运行;每次运行的日志和放置清单位于 k3-public-bench/ 中。此 gavamedia/deltafin(MIT)的分支包含引擎(见 CREDITS.md)和基准测试工具。测量于 2026-09-08 使用此分支的记录配置(k3-public-bench/env.sh)。结果:0.9232 tok/s 稳定解码(512 tokens),1.0015 tok/s(128 tokens),0.92611 tok/s(17-token 提示,3 次中位数;上游 0.684)。首个 token 时间:512-token 提示约 376 秒。驱动器数量阶梯:一个驱动器约为四驱动器速度的 52%,两个约 73%,三个约 90%(results/SCALING.md)。预填充缓慢的原因及修复:results/PREFILL.md。定义、身份范围、精度:k3-public-bench/README.md。在消费级硬件上尽可能快地运行完整、永不剪枝的 Kimi K3。Deltafin 是一个单一原生二进制文件,没有剪枝或跳过任何内容。K3 决定每个 token,所有 16 个专家,没有捷径。质量规则:K3 自己决定,没有小型草稿模型。上游基准测试在 M1 Max 笔记本电脑上(gavamedia/deltafin,未更改)显示 0.2901 tok/s(3.447 s/token)——比上次更新吞吐量高 1.9%。历史 M1 基准:0.2847 tok/s(2026 年 8 月 2 日),0.2660 tok/s(2026 年 7 月 30 日),0.1311 tok/s(2026 年 7 月 28 日),0.0141 tok/s(2026 年 7 月 27 日)。使命:纯粹、未删减的 K3 质量,速度而不降低模型质量。Deltafin 保留所有 16 个路由专家和完整的 K3 目标作为每个 token 的唯一权威。目标:在运行像 K3 这样的大型模型时榨取每一分效率,所有选项都在桌面上,除了降低质量。这不是产品推销,而是一个推动消费级硬件极限并从尝试中学习的实验。Kimi K3 面向约 16 个节点、总 VRAM 约 4.8 TB 的基础设施。在单个 MacBook 上运行它是一个极端的约束,每一个 1% 的改进都是来之不易的。每一次收益都教会我们一些东西;研究和探索才是重点。并非所有东西都必须是最小可行产品才能打动风投。如果 Deltafin 能帮助前沿模型在 15,000 美元的家庭设置上运行,而不是 2,000,000 美元的基础设施,那对自托管 AI 来说就是有价值的进步。此外,学到的一切都可能有益于……