HeadlinesBriefing favicon HeadlinesBriefing.com

ARGODRIVE Deltafin: Kimi K3 2.8T MoE auf Apple Silicon

Hacker News •
×

ARGODRIVE Deltafin führt das vollständige Kimi K3 (2,8T-Parameter-MoE, 1,45 TB Experten) auf einem M5 Max MacBook Pro mit 128 GB aus und streamt Experten von vier SSDs. Es erreicht 1,00 tok/s stabile Dekodierung über eine 512-Token-Antwort, 1,13 über 128 Token und 0,96 bei einem 17-Token-Prompt (Upstream: 0,68). Die ehrliche Grenze: Ein 512-Token-Prompt benötigt ~6,3 Minuten bis zum ersten Token.

Ursache gefunden: Prefill liest die Experten jeder Schicht 8 Mal erneut; Fix geplant, aber nicht gebaut. Nützliche Erkenntnisse: Ein Laufwerk liefert ~52 % der Geschwindigkeit von vier, zwei ~73 %, drei ~90 % – das langsamste Laufwerk bei den 16 Lesevorgängen jeder Schicht bestimmt das Tempo, nicht die Gesamtbandbreite. Jede Zahl ist ein kalter Lauf mit dem genauen Prompt; Protokolle und Platzierungsmanifeste befinden sich in k3-public-bench/.

Dieser Fork von gavamedia/deltafin (MIT) enthält die Engine (siehe CREDITS.md) und Benchmark-Instrumente. Messungen am 2026-09-08 mit der Aufzeichnungskonfiguration dieses Forks (k3-public-bench/env.sh). Ergebnisse: 0,9232 tok/s stabile Dekodierung (512 Token), 1,0015 tok/s (128 Token), 0,92611 tok/s (17-Token-Prompt, Median von 3; Upstream 0,684).

Zeit bis zum ersten Token: ~376 s für 512-Token-Prompt. Laufwerksanzahl-Leiter: Ein Laufwerk ~52 % der Geschwindigkeit von vier, zwei ~73 %, drei ~90 % (results/SCALING.md). Warum Prefill langsam ist und Fixes: results/PREFILL.md.

Definitionen, Identitätsumfang, Präzision: k3-public-bench/README.md. Führen Sie das vollständige, nie beschnittene Kimi K3 auf Consumer-Hardware so schnell wie möglich aus. Deltafin ist eine einzelne native Binärdatei, nichts beschnitten oder übersprungen.

K3 entscheidet jedes Token, alle 16 Experten, keine Abkürzungen. Qualitätsregel: K3 entscheidet selbst, keine kleinen Entwurfsmodelle. Upstream-Benchmarks auf M1 Max Laptop (gavamedia/deltafin, unverändert) zeigen 0,2901 tok/s (3,447 s/Token) – 1,9 % höherer Durchsatz als beim letzten Update.

Historische M1-Benchmarks: 0,2847 tok/s (2. August 2026), 0,2660 tok/s (30. Juli 2026), 0,1311 tok/s (28.

Juli 2026), 0,0141 tok/s (27. Juli 2026). Mission: Reine, ungeschnittene K3-Qualität, Geschwindigkeit ohne Reduzierung der Modellqualität.

Deltafin behält alle 16 gerouteten Experten und das vollständige K3-Ziel als alleinige Autorität für jedes Token. Ziel: Jede Effizienz beim Ausführen eines riesigen Modells wie K3 herausholen, alle Optionen auf dem Tisch außer Qualitätsreduzierung. Dies ist kein Produkt-Pitch, sondern ein Experiment, um Consumer-Hardware zu pushen und aus dem Versuch zu lernen.

Kimi K3 zielt auf Infrastruktur im Maßstab von 16 Knoten mit ~4,8 TB aggregiertem VRAM. Es auf einem einzelnen MacBook auszuführen ist eine extreme Einschränkung, und jede 1 %-Verbesserung ist hart erkämpft. Jeder Gewinn lehrt etwas; Forschung und Erkundung sind der Punkt.

Nicht alles muss ein minimal lebensfähiges Produkt sein, um VCs zu beeindrucken. Wenn Deltafin hilft, Frontier-Modelle auf einem 15.000-Dollar-Heimsetup statt einer 2.000.000-Dollar-Infrastruktur nutzbar zu machen, ist das wertvoller Fortschritt für selbst gehostete KI. Außerdem könnte alles Gelernte nutzen...