HeadlinesBriefing favicon HeadlinesBriefing.com

Quantification 4 bits de Qwen3.8 27B

Hacker News •
×

Les tests de quantification de Qwen3.8 27B montrent que Q4_K_M 4 bits (17 GB) égale les performances BF16 complètes sur Terminal-Bench 2.1 et GPQA Diamond, tient dans une GPU de 24 GB comme RTX 4090 avec de la place pour 64k tokens de contexte. UD-Q2_K_XL 2 bits (10,7 GB) affiche de légères baisses, tandis que UD-IQ1_S 1 bit (6,2 GB) chute au hasard sur GPQA Diamond. Le niveau d'effort (xhigh par défaut) influence fortement les scores, environ 8k tokens de raisonnement étant nécessaires pour obtenir les meilleurs résultats.

IFBench ne montre aucun changement jusqu'à 2 bits. Les tests ont utilisé les quantifications Unsloth sur des GPUs Modal (coût d'environ 3 000 dollars), reproduisant les résultats officiels de Qwen. La compression atteint un point de rupture à 1 bit, où un raisonnement plus long aggrave les performances.

Q4_K_M reste le meilleur compromis pour le matériel grand public, sans perte de qualité perceptible sur les benchmarks clés.