HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3.8 27B-এর 4-bit Quantization

Hacker News •
×

Qwen3.8 27B quantization-এর benchmark দেখায় যে 4-bit Q4_K_M (17 GB) Terminal-Bench 2.1 ও GPQA Diamond-এ full BF16 performance-এর সমান, RTX 4090-এর মতো 24 GB GPU-তে 64k context tokens-এর জন্য জায়গা রেখে ফিট হয়। 2-bit UD-Q2_K_XL (10.7 GB)-এ হাল্কা পতন দেখা যায়, যখন 1-bit UD-IQ1_S (6.2 GB) GPQA Diamond-এ random chance-এ নিচে যায়। Effort level (xhigh default) scores-কে বেশি প্রভাবিত করে, সবচেয়ে ভালো ফলের জন্য ~8k reasoning tokens দরকার। IFBench দেখায় যে 2-bit পর্যন্ত নামলে কোনো পরিবর্তন নেই। Tests-এ Unsloth quantizations ব্যবহার করা হয়েছে Modal GPUs-এ (~$3,000 cost), official Qwen results replicate করে। Compression 1-bit-এ এক cliff-এ পৌঁছে, যেখানে দীর্ঘ reasoning performance-কে খারাপ করে। Q4_K_M consumer hardware-এর জন্য সবচেয়ে উপযুক্ত স্থান, কারণ key benchmarks-এ কোনো noticeable quality loss নেই।