HeadlinesBriefing favicon HeadlinesBriefing.com

ARGODRIVE Deltafin: Kimi K3 2.8T MoE no Apple Silicon

Hacker News •
×

ARGODRIVE Deltafin executa o Kimi K3 completo (MoE de 2,8T parâmetros, 1,45 TB de especialistas) em um MacBook Pro M5 Max com 128 GB, transmitindo especialistas de quatro SSDs. Ele atinge 1,00 tok/s de decodificação estável em uma resposta de 512 tokens, 1,13 em 128 tokens e 0,96 em um prompt de 17 tokens (upstream: 0,68). O limite honesto: um prompt de 512 tokens leva ~6,3 minutos para o primeiro token.

Causa encontrada: o prefill relê os especialistas de cada camada 8 vezes; correção planejada, mas não construída. Descobertas úteis: uma unidade dá ~52% da velocidade de quatro, duas ~73%, três ~90% — a unidade mais lenta nas 16 leituras de cada camada define o ritmo, não a largura de banda total. Cada número é uma execução a frio com o prompt exato; logs e manifestos de posicionamento estão em k3-public-bench/.

Este fork de gavamedia/deltafin (MIT) inclui o motor (veja CREDITS.md) e instrumentos de benchmark. Medições em 2026-09-08 com a configuração de registro deste fork (k3-public-bench/env.sh). Resultados: 0,9232 tok/s de decodificação estável (512 tokens), 1,0015 tok/s (128 tokens), 0,92611 tok/s (prompt de 17 tokens, mediana de 3; upstream 0,684).

Tempo até o primeiro token: ~376 s para prompt de 512 tokens. Escada de número de unidades: uma unidade ~52% da velocidade de quatro, duas ~73%, três ~90% (results/SCALING.md). Por que o prefill é lento e correções: results/PREFILL.md.

Definições, escopo de identidade, precisão: k3-public-bench/README.md. Execute o Kimi K3 completo, nunca podado, em hardware de consumo, o mais rápido possível. Deltafin é um único binário nativo, nada podado ou pulado.

K3 decide cada token, todos os 16 especialistas, sem atalhos. Regra de qualidade: K3 decide por si mesmo, sem modelos de rascunho pequenos. Benchmarks upstream no laptop M1 Max (gavamedia/deltafin, inalterado) mostram 0,2901 tok/s (3,447 s/token) — 1,9% mais throughput que a última atualização.

Benchmarks M1 históricos: 0,2847 tok/s (2 de agosto de 2026), 0,2660 tok/s (30 de julho de 2026), 0,1311 tok/s (28 de julho de 2026), 0,0141 tok/s (27 de julho de 2026). Missão: qualidade K3 pura, sem cortes, velocidade sem reduzir a qualidade do modelo. Deltafin mantém todos os 16 especialistas roteados e o alvo K3 completo como única autoridade para cada token.

Objetivo: extrair cada eficiência ao executar um modelo enorme como K3, todas as opções na mesa, exceto reduzir a qualidade. Isso não é um pitch de produto, mas um experimento para empurrar hardware de consumo e aprender com a tentativa. Kimi K3 visa infraestrutura na escala de 16 nós com ~4,8 TB de VRAM agregada.

Executá-lo em um único MacBook é uma restrição extrema, e cada melhoria de 1% é difícil de conquistar. Cada ganho ensina algo; pesquisa e exploração são o ponto. Nem tudo precisa ser um produto mínimo viável para impressionar VCs.

Se Deltafin ajudar a tornar modelos de fronteira utilizáveis em uma configuração doméstica de US$ 15.000 em vez de uma infraestrutura de US$ 2.000.000, isso é progresso valioso para IA auto-hospedada. Além disso, tudo o que é aprendido pode beneficiar...