HeadlinesBriefing favicon HeadlinesBriefing.com

ARGODRIVE Deltafin: Kimi K3 2.8T MoE en Apple Silicon

Hacker News •
×

ARGODRIVE Deltafin ejecuta el Kimi K3 completo (MoE de 2.8T parámetros, 1.45 TB de expertos) en una MacBook Pro M5 Max con 128 GB, transmitiendo expertos desde cuatro SSD. Logra 1.00 tok/s de decodificación estable en una respuesta de 512 tokens, 1.13 en 128 tokens y 0.96 en un prompt de 17 tokens (upstream: 0.68). El límite honesto: un prompt de 512 tokens tarda ~6.3 minutos en el primer token.

Causa encontrada: el prefill relee los expertos de cada capa 8 veces; la corrección está planificada pero no construida. Hallazgos útiles: una unidad da ~52% de la velocidad de cuatro, dos ~73%, tres ~90% — la unidad más lenta en las 16 lecturas de cada capa marca el ritmo, no el ancho de banda total. Cada número es una ejecución en frío con el prompt exacto; los registros y manifiestos de colocación están en k3-public-bench/.

Este fork de gavamedia/deltafin (MIT) incluye el motor (ver CREDITS.md) e instrumentos de benchmark. Mediciones el 2026-09-08 con la configuración de registro de este fork (k3-public-bench/env.sh). Resultados: 0.9232 tok/s de decodificación estable (512 tokens), 1.0015 tok/s (128 tokens), 0.92611 tok/s (prompt de 17 tokens, mediana de 3; upstream 0.684).

Tiempo al primer token: ~376 s para prompt de 512 tokens. Escalera de número de unidades: una unidad ~52% de la velocidad de cuatro, dos ~73%, tres ~90% (results/SCALING.md). Por qué el prefill es lento y correcciones: results/PREFILL.md.

Definiciones, alcance de identidad, precisión: k3-public-bench/README.md. Ejecuta el Kimi K3 completo, nunca podado, en hardware de consumo, lo más rápido posible. Deltafin es un único binario nativo, nada podado u omitido.

K3 decide cada token, los 16 expertos, sin atajos. Regla de calidad: K3 decide por sí mismo, sin modelos de borrador pequeños. Los benchmarks upstream en laptop M1 Max (gavamedia/deltafin, sin cambios) muestran 0.2901 tok/s (3.447 s/token) — 1.9% más de rendimiento que la última actualización.

Benchmarks históricos M1: 0.2847 tok/s (2 de agosto de 2026), 0.2660 tok/s (30 de julio de 2026), 0.1311 tok/s (28 de julio de 2026), 0.0141 tok/s (27 de julio de 2026). Misión: calidad K3 pura y sin cortes, velocidad sin reducir la calidad del modelo. Deltafin mantiene los 16 expertos enrutados y el objetivo K3 completo como única autoridad para cada token.

Objetivo: exprimir cada eficiencia al ejecutar un modelo enorme como K3, todas las opciones sobre la mesa excepto reducir la calidad. Esto no es un discurso de producto sino un experimento para empujar el hardware de consumo y aprender del intento. Kimi K3 apunta a infraestructura a escala de 16 nodos con ~4.8 TB de VRAM agregada.

Ejecutarlo en una sola MacBook es una restricción extrema, y cada mejora del 1% es difícil de ganar. Cada ganancia enseña algo; la investigación y la exploración son el punto. No todo debe ser un producto mínimo viable para impresionar a los VC.

Si Deltafin ayuda a hacer que los modelos frontera sean utilizables en una configuración doméstica de $15,000 en lugar de una infraestructura de $2,000,000, eso es un progreso valioso para la IA autoalojada. Además, todo lo aprendido podría beneficiar...