HeadlinesBriefing favicon HeadlinesBriefing.com

ARGODRIVE Deltafin : Kimi K3 2.8T MoE sur Apple Silicon

Hacker News •
×

ARGODRIVE Deltafin exécute le Kimi K3 complet (MoE de 2,8 T paramètres, 1,45 To d'experts) sur un MacBook Pro M5 Max avec 128 Go, diffusant les experts depuis quatre SSD. Il atteint 1,00 tok/s en décodage stable sur une réponse de 512 jetons, 1,13 sur 128 jetons et 0,96 sur un prompt de 17 jetons (amont : 0,68). La limite honnête : un prompt de 512 jetons prend ~6,3 minutes pour le premier jeton.

Cause trouvée : le préremplissage relit les experts de chaque couche 8 fois ; correctif prévu mais pas construit. Constat utile : un disque donne ~52 % de la vitesse de quatre, deux ~73 %, trois ~90 % — le disque le plus lent dans les 16 lectures de chaque couche fixe le rythme, pas la bande passante totale. Chaque nombre est une exécution à froid avec le prompt exact ; les journaux et manifestes de placement sont dans k3-public-bench/.

Ce fork de gavamedia/deltafin (MIT) inclut le moteur (voir CREDITS.md) et les instruments de benchmark. Mesures du 2026-09-08 avec la configuration de référence de ce fork (k3-public-bench/env.sh). Résultats : 0,9232 tok/s en décodage stable (512 jetons), 1,0015 tok/s (128 jetons), 0,92611 tok/s (prompt de 17 jetons, médiane de 3 ; amont 0,684).

Temps jusqu'au premier jeton : ~376 s pour un prompt de 512 jetons. Échelle du nombre de disques : un disque ~52 % de la vitesse de quatre, deux ~73 %, trois ~90 % (results/SCALING.md). Pourquoi le préremplissage est lent et correctifs : results/PREFILL.md. Définitions, portée d'identité, précision : k3-public-bench/README.md.

Exécutez le Kimi K3 complet, jamais élagué, sur du matériel grand public, aussi vite que possible. Deltafin est un binaire natif unique, rien n'est élagué ou sauté. K3 décide chaque jeton, les 16 experts, sans raccourcis.

Règle de qualité : K3 décide lui-même, pas de petits modèles de brouillon. Les benchmarks amont sur ordinateur portable M1 Max (gavamedia/deltafin, inchangé) montrent 0,2901 tok/s (3,447 s/jeton) — débit 1,9 % supérieur à la dernière mise à jour. Benchmarks M1 historiques : 0,2847 tok/s (2 août 2026), 0,2660 tok/s (30 juillet 2026), 0,1311 tok/s (28 juillet 2026), 0,0141 tok/s (27 juillet 2026).

Mission : qualité K3 pure, non coupée, vitesse sans réduire la qualité du modèle. Deltafin conserve les 16 experts routés et la cible K3 complète comme seule autorité pour chaque jeton. Objectif : extraire chaque efficacité lors de l'exécution d'un modèle énorme comme K3, toutes les options sur la table sauf réduire la qualité.

Ce n'est pas un argumentaire produit mais une expérience pour pousser le matériel grand public et apprendre de la tentative. Kimi K3 cible une infrastructure à l'échelle de 16 nœuds avec ~4,8 To de VRAM agrégée. L'exécuter sur un seul MacBook est une contrainte extrême, et chaque amélioration de 1 % est durement gagnée.

Chaque gain enseigne quelque chose ; la recherche et l'exploration sont le but. Tout ne doit pas être un produit minimal viable pour impressionner les VC. Si Deltafin aide à rendre les modèles de pointe utilisables sur une configuration domestique de 15 000 $ au lieu d'une infrastructure de 2 000 000 $, c'est un progrès valable pour l'IA auto-hébergée.

De plus, tout ce qui est appris pourrait bénéficier...