HeadlinesBriefing favicon HeadlinesBriefing.com

ARGODRIVE Deltafin: Apple Silicon 上の Kimi K3 2.8T MoE

Hacker News •
×

ARGODRIVE Deltafin は、128 GB の M5 Max MacBook Pro 上で完全な Kimi K3(2.8T パラメータの MoE、1.45 TB のエキスパート)を実行し、4 つの SSD からエキスパートをストリーミングします。512 トークンの回答で 1.00 tok/s の安定したデコード、128 トークンで 1.13、17 トークンのプロンプトで 0.96(アップストリーム: 0.68)を達成します。正直な限界: 512 トークンのプロンプトは最初のトークンまで約 6.3 分かかります。原因判明: プリフィルは各層のエキスパートを 8 回再読み込みします。修正は計画済みですが未実装です。有用な発見: 1 台のドライブで 4 台の速度の約 52%、2 台で約 73%、3 台で約 90% — 各層の 16 回の読み取りで最も遅いドライブがペースを決め、総帯域幅ではありません。各数値は正確なプロンプトでの 1 回のコールドランです。実行ごとのログと配置マニフェストは k3-public-bench/ にあります。この gavamedia/deltafin(MIT)のフォークには、エンジン(CREDITS.md を参照)とベンチマーク計測器が含まれています。測定は 2026-09-08 にこのフォークの記録構成(k3-public-bench/env.sh)で行われました。結果: 0.9232 tok/s の安定デコード(512 トークン)、1.0015 tok/s(128 トークン)、0.92611 tok/s(17 トークンのプロンプト、3 回の中央値; アップストリーム 0.684)。最初のトークンまでの時間: 512 トークンのプロンプトで約 376 秒。ドライブ数のはしご: 1 台で 4 台の速度の約 52%、2 台で約 73%、3 台で約 90%(results/SCALING.md)。プリフィルが遅い理由と修正: results/PREFILL.md。定義、アイデンティティの範囲、精度: k3-public-bench/README.md。完全で決して剪定されない Kimi K3 をコンシューマーハードウェアでできるだけ速く実行します。Deltafin は単一のネイティブバイナリで、剪定やスキップはありません。K3 がすべてのトークン、16 のエキスパートすべてを決定し、近道はありません。品質ルール: K3 自身が決定し、小さなドラフトモデルはありません。M1 Max ラップトップでのアップストリームベンチマーク(gavamedia/deltafin、変更なし)は 0.2901 tok/s(3.447 秒/トークン)を示し、前回の更新より 1.9% 高いスループットです。過去の M1 ベンチマーク: 0.2847 tok/s(2026 年 8 月 2 日)、0.2660 tok/s(2026 年 7 月 30 日)、0.1311 tok/s(2026 年 7 月 28 日)、0.0141 tok/s(2026 年 7 月 27 日)。ミッション: 純粋でカットされていない K3 品質、モデル品質を低下させずに速度を実現。Deltafin は 16 のルーティングされたエキスパートすべてと完全な K3 ターゲットをすべてのトークンの唯一の権威として保持します。目標: K3 のような巨大なモデルを実行する際にすべての効率を絞り出すこと。品質を下げる以外のすべてのオプションがテーブルにあります。これは製品の売り込みではなく、コンシューマーハードウェアを押し上げ、試みから学ぶ実験です。Kimi K3 は約 4.8 TB の総 VRAM を持つ 16 ノード規模のインフラストラクチャを対象としています。単一の MacBook で実行することは極端な制約であり、1% の改善ごとに苦労して得られます。各利益は何かを教えてくれます。研究と探求がポイントです。すべてが VC を感動させるための最小限の実行可能な製品である必要はありません。Deltafin が 2,000,000 ドルのインフラストラクチャの代わりに 15,000 ドルのホームセットアップでフロンティアモデルを使えるようにするのに役立つなら、それはセルフホスト AI にとって価値のある進歩です。さらに、学んだすべてが利益になる可能性があります...