HeadlinesBriefing favicon HeadlinesBriefing.com

ARGODRIVE Deltafin: Apple Silicon पर Kimi K3 2.8T MoE

Hacker News •
×

ARGODRIVE Deltafin 128 GB वाले M5 Max MacBook Pro पर पूर्ण Kimi K3 (2.8T-पैरामीटर MoE, 1.45 TB विशेषज्ञ) चलाता है, चार SSD से विशेषज्ञों को स्ट्रीम करता है। यह 512-टोकन उत्तर पर 1.00 tok/s स्थिर डिकोड, 128 टोकन पर 1.13, और 17-टोकन प्रॉम्प्ट पर 0.96 (अपस्ट्रीम: 0.68) प्राप्त करता है। ईमानदार सीमा: 512-टोकन प्रॉम्प्ट को पहले टोकन तक ~6.3 मिनट लगते हैं। कारण मिला: प्रीफिल प्रत्येक परत के विशेषज्ञों को 8 बार फिर से पढ़ता है; सुधार की योजना बनाई गई है लेकिन बनाई नहीं गई। उपयोगी निष्कर्ष: एक ड्राइव चार-ड्राइव गति का ~52% देता है, दो ~73%, तीन ~90% — प्रत्येक परत की 16 रीड में सबसे धीमी ड्राइव गति निर्धारित करती है, कुल बैंडविड्थ नहीं। हर संख्या सटीक प्रॉम्प्ट के साथ एक ठंडा रन है; प्रति-रन लॉग और प्लेसमेंट मेनिफेस्ट k3-public-bench/ में हैं। gavamedia/deltafin (MIT) का यह फोर्क इंजन (CREDITS.md देखें) और बेंचमार्क उपकरण शामिल करता है। माप 2026-09-08 को इस फोर्क की रिकॉर्ड कॉन्फ़िगरेशन (k3-public-bench/env.sh) के साथ। परिणाम: 0.9232 tok/s स्थिर डिकोड (512 टोकन), 1.0015 tok/s (128 टोकन), 0.92611 tok/s (17-टोकन प्रॉम्प्ट, 3 का माध्यिका; अपस्ट्रीम 0.684)। पहले टोकन का समय: 512-टोकन प्रॉम्प्ट के लिए ~376 सेकंड। ड्राइव-गिनती सीढ़ी: एक ड्राइव ~52% चार-ड्राइव गति का, दो ~73%, तीन ~90% (results/SCALING.md)। प्रीफिल धीमा क्यों है और सुधार: results/PREFILL.md। परिभाषाएँ, पहचान दायरा, सटीकता: k3-public-bench/README.md। उपभोक्ता हार्डवेयर पर पूर्ण, कभी-न-छंटा Kimi K3 चलाएं, जितनी जल्दी हो सके। Deltafin एक एकल देशी बाइनरी है, कुछ भी छंटा या छोड़ा नहीं गया। K3 हर टोकन, सभी 16 विशेषज्ञों का फैसला करता है, कोई शॉर्टकट नहीं। गुणवत्ता नियम: K3 खुद फैसला करता है, कोई छोटे ड्राफ्ट मॉडल नहीं। M1 Max लैपटॉप पर अपस्ट्रीम बेंचमार्क (gavamedia/deltafin, अपरिवर्तित) 0.2901 tok/s (3.447 s/token) दिखाते हैं — पिछले अपडेट से 1.9% अधिक थ्रूपुट। ऐतिहासिक M1 बेंचमार्क: 0.2847 tok/s (2 अगस्त, 2026), 0.2660 tok/s (30 जुलाई, 2026), 0.1311 tok/s (28 जुलाई, 2026), 0.0141 tok/s (27 जुलाई, 2026)। मिशन: शुद्ध, बिना कटा K3 गुणवत्ता, मॉडल गुणवत्ता कम किए बिना गति। Deltafin सभी 16 रूटेड विशेषज्ञों और पूर्ण K3 लक्ष्य को हर टोकन के लिए एकमात्र अधिकार के रूप में रखता है। लक्ष्य: K3 जैसे विशाल मॉडल को चलाते समय हर दक्षता निचोड़ना, गुणवत्ता कम करने के अलावा सभी विकल्प मेज पर। यह एक उत्पाद पिच नहीं है बल्कि उपभोक्ता हार्डवेयर को धकेलने और प्रयास से सीखने का एक प्रयोग है। Kimi K3 ~4.8 TB कुल VRAM के साथ 16 नोड्स के पैमाने पर बुनियादी ढांचे को लक्षित करता है। इसे एकल MacBook पर चलाना एक चरम बाधा है, और हर 1% सुधार कठिन जीता जाता है। हर लाभ कुछ सिखाता है; अनुसंधान और अन्वेषण ही बिंदु है। सब कुछ VC को प्रभावित करने के लिए न्यूनतम व्यवहार्य उत्पाद नहीं होना चाहिए। यदि Deltafin $2,000,000 बुनियादी ढांचे के बजाय $15,000 होम सेटअप पर फ्रंटियर मॉडल को उपयोगी बनाने में मदद करता है, तो यह स्व-होस्टेड AI के लिए सार्थक प्रगति है। साथ ही, सीखी गई हर चीज़ लाभ पहुंचा सकती है...