HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen3.8 27B 4 位量化实测

Hacker News •
×

对 Qwen3.8 27B 量化模型的测试显示,4 位 Q4_K_M(17 GB)在 Terminal-Bench 2.1 和 GPQA Diamond 上与完整 BF16 性能相当,可装入 RTX 4090 等 24 GB GPU,并为 64k 上下文令牌留出空间。2 位 UD-Q2_K_XL(10.7 GB)略有下降,而 1 位 UD-IQ1_S(6.2 GB)在 GPQA Diamond 上跌至随机水平。努力程度(默认 xhigh)会显著影响得分,需要约 8k 推理令牌才能获得最佳结果。IFBench 显示,量化降至 2 位时结果没有变化。测试使用 Unsloth 量化模型在 Modal GPU 上运行(成本约 3,000 美元),并复现了官方 Qwen 结果。压缩在 1 位时出现断崖式下降,此时更长的推理反而会降低性能。对于消费级硬件,Q4_K_M 仍是甜点级选择,在关键基准测试中没有可察觉的质量损失。