HeadlinesBriefing favicon HeadlinesBriefing.com

ARGODRIVE Deltafin: Kimi K3 2.8T MoE di Apple Silicon

Hacker News •
×

ARGODRIVE Deltafin menjalankan Kimi K3 penuh (MoE 2.8T parameter, 1,45 TB ahli) di MacBook Pro M5 Max dengan 128 GB, streaming ahli dari empat SSD. Ini mencapai 1,00 tok/s decode stabil pada jawaban 512 token, 1,13 pada 128 token, dan 0,96 pada prompt 17 token (hulu: 0,68). Batas jujur: prompt 512 token membutuhkan ~6,3 menit untuk token pertama.

Penyebab ditemukan: prefill membaca ulang ahli setiap lapisan 8 kali; perbaikan direncanakan tetapi belum dibangun. Temuan berguna: satu drive memberikan ~52% dari kecepatan empat drive, dua ~73%, tiga ~90% — drive paling lambat dalam 16 pembacaan setiap lapisan menentukan kecepatan, bukan total bandwidth. Setiap angka adalah satu cold run dengan prompt yang tepat; log per-run dan manifes penempatan ada di k3-public-bench/.

Fork dari gavamedia/deltafin (MIT) ini mencakup mesin (lihat CREDITS.md) dan instrumen benchmark. Pengukuran pada 2026-09-08 dengan konfigurasi catatan fork ini (k3-public-bench/env.sh). Hasil: 0,9232 tok/s decode stabil (512 token), 1,0015 tok/s (128 token), 0,92611 tok/s (prompt 17 token, median dari 3; hulu 0,684).

Waktu ke token pertama: ~376 detik untuk prompt 512 token. Tangga jumlah drive: satu drive ~52% dari kecepatan empat, dua ~73%, tiga ~90% (results/SCALING.md). Mengapa prefill lambat dan perbaikan: results/PREFILL.md.

Definisi, cakupan identitas, presisi: k3-public-bench/README.md. Jalankan Kimi K3 penuh, tidak pernah dipangkas, di perangkat keras konsumen, secepat mungkin. Deltafin adalah satu biner asli, tidak ada yang dipangkas atau dilewati.

K3 memutuskan setiap token, semua 16 ahli, tanpa jalan pintas. Aturan kualitas: K3 memutuskan sendiri, tidak ada model draf kecil. Benchmark hulu di laptop M1 Max (gavamedia/deltafin, tidak berubah) menunjukkan 0,2901 tok/s (3,447 detik/token) — throughput 1,9% lebih tinggi dari pembaruan terakhir.

Benchmark M1 historis: 0,2847 tok/s (2 Agustus 2026), 0,2660 tok/s (30 Juli 2026), 0,1311 tok/s (28 Juli 2026), 0,0141 tok/s (27 Juli 2026). Misi: kualitas K3 murni, tanpa potongan, kecepatan tanpa mengurangi kualitas model. Deltafin mempertahankan semua 16 ahli yang dirutekan dan target K3 penuh sebagai otoritas tunggal untuk setiap token.

Tujuan: memeras setiap efisiensi saat menjalankan model besar seperti K3, semua opsi di atas meja kecuali mengurangi kualitas. Ini bukan pitch produk tetapi eksperimen untuk mendorong perangkat keras konsumen dan belajar dari upaya tersebut. Kimi K3 menargetkan infrastruktur pada skala 16 node dengan ~4,8 TB VRAM agregat.

Menjalankannya di satu MacBook adalah kendala ekstrem, dan setiap peningkatan 1% diperoleh dengan susah payah. Setiap keuntungan mengajarkan sesuatu; penelitian dan eksplorasi adalah intinya. Tidak semuanya harus menjadi produk minimum yang layak untuk mengesankan VC.

Jika Deltafin membantu membuat model frontier dapat digunakan pada pengaturan rumah $15.000 alih-alih infrastruktur $2.000.000, itu adalah kemajuan yang berharga untuk AI yang dihosting sendiri. Selain itu, semua yang dipelajari bisa bermanfaat...