HeadlinesBriefing favicon HeadlinesBriefing.com

4-битное квантование Qwen3.8 27B

Hacker News •
×

Бенчмарки квантования Qwen3.8 27B показывают, что 4-битный Q4_K_M (17 GB) на Terminal-Bench 2.1 и GPQA Diamond соответствует полному BF16, помещается в GPU на 24 GB, например RTX 4090, с запасом под 64k контекстных токенов. 2-битный UD-Q2_K_XL (10,7 GB) показывает небольшое снижение, тогда как 1-битный UD-IQ1_S (6,2 GB) на GPQA Diamond падает до случайного угадывания. Уровень усилий (xhigh по умолчанию) значительно влияет на результаты, для лучших показателей требуется около 8k токенов рассуждений. IFBench не показывает изменений при снижении до 2 бит. В тестах использовались квантования Unsloth на GPU Modal (стоимость около $3 000), воспроизводились официальные результаты Qwen. Сжатие достигает резкого падения на 1 бите, где более длинные рассуждения ухудшают производительность. Q4_K_M остаётся оптимальным вариантом для потребительского оборудования без заметной потери качества на ключевых бенчмарках.