HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3.8 27B का 4-बिट क्वांटाइज़ेशन

Hacker News •
×

Qwen3.8 27B क्वांटाइज़ेशन के बेंचमार्क दिखाते हैं कि 4-बिट Q4_K_M (17 GB) Terminal-Bench 2.1 और GPQA Diamond पर पूर्ण BF16 प्रदर्शन के बराबर है, RTX 4090 जैसी 24 GB GPU में 64k context tokens के लिए जगह छोड़ते हुए फिट होता है। 2-बिट UD-Q2_K_XL (10.7 GB) में हल्की गिरावट देखी जाती है, जबकि 1-बिट UD-IQ1_S (6.2 GB) GPQA Diamond पर random chance तक गिर जाता है। Effort level (xhigh default) scores को काफी प्रभावित करता है, और best results के लिए ~8k reasoning tokens की आवश्यकता होती है। IFBench दिखाता है कि 2-बिट तक कम करने पर कोई बदलाव नहीं है। Tests में Unsloth quantizations का उपयोग Modal GPUs पर किया गया (~$3,000 cost), जिससे official Qwen results को replicate किया गया। Compression 1-बिट पर एक cliff पर पहुंचता है, जहाँ लंबे reasoning के साथ प्रदर्शन खराब हो जाता है। Q4_K_M consumer hardware के लिए सबसे अच्छा विकल्प है, क्योंकि key benchmarks पर noticeable quality loss नहीं है।