HeadlinesBriefing favicon HeadlinesBriefing.com

स्थानीय LLM कम क्यों रेंडर करते हैं

Hacker News •
×

हम सभी एक “AMAZEBALLZ” मॉडल डाउनलोड करते हैं और उच्च प्रदर्शन की उम्मीद रखते हैं, लेकिन अक्सर पाते हैं कि हमारा लोकल सेटअप खराब चल रहा है। यह अंतर इनफरेंस के दौरान इम्प्लीमेंटेशन-स्पेसिफिक जोखिमों के कारण होता है। रेफरेंस लैब का हार्डवेयर और सॉफ्टवेयर घर के सेटअप से बहुत अलग होता है। हर GPU जनरेशन अगले टोकन की गणना अलग तरीके से करता है, जिससे प्रकाशित दावों से स्वाभाविक विचलन होता है।

अपने सेटअप की वास्तविक क्षमता मापने के लिए terminal bench, hle, SWEthis, HELLAthat या MMLU-whatever जैसे मानक बेंचमार्क चलाएं। ज़ीरो-शॉट टेस्ट छोड़ दें; एजेंटिक टास्क को लंबे संदर्भ में टूल-कॉलिंग की आवश्यकता होती है। सैंपलर सेटिंग्स को बिल्कुल मैच करें। @wendell ने कहा था, गणित गणित ही रहती है। मॉडल कार्ड के डिफ़ॉल्ट्स का उपयोग करें: आमतौर पर temp 1.0 और top-p 0.95। गलत तापमान लूप बनाता है, जबकि असंगत सैंपलर संभावनाओं को बदल देते हैं, जिससे आउटपुट अजीब लगता है।

गणितीय दृष्टिकोण से, KLD (KL Divergence) ट्रैक करें। लॉगिट्स को प्रायिकता वितरण में बदलें और बेसलाइन से विचलन मापें। कम KLD का मतलब बेहतर समझ नहीं, बल्कि करीबी एलाइनमेंट है। बिना खुले रेफरेंस चेकपॉइंट वाले क्वांटाइज़्ड HF मॉडल पर बहुत कम स्कोर पर भरोसा न करें। पूरे रनटाइम एनवायरनमेंट के बिना कम स्कोर पर फंसें नहीं। प्रतिनिधि टेस्ट चलाएं, चैट टेम्पलेट मैच करें और स्वीकार करें कि आज का हर LLL इंस्टेंस थोड़ा अलग काम करता है।