HeadlinesBriefing favicon HeadlinesBriefing.com

Cuantización 4 bits de Qwen3.8 27B

Hacker News •
×

Las pruebas de cuantización de Qwen3.8 27B muestran que Q4_K_M de 4 bits (17 GB) iguala el rendimiento BF16 completo en Terminal-Bench 2.1 y GPQA Diamond, cabe en una GPU de 24 GB como RTX 4090 y deja espacio para 64k tokens de contexto. UD-Q2_K_XL de 2 bits (10,7 GB) registra ligeras caídas, mientras que UD-IQ1_S de 1 bit (6,2 GB) cae al azar en GPQA Diamond. El nivel de esfuerzo (xhigh predeterminado) afecta significativamente las puntuaciones y se necesitan unos 8k tokens de razonamiento para obtener los mejores resultados.

IFBench no muestra cambios al bajar hasta 2 bits. Las pruebas usaron cuantizaciones de Unsloth en GPUs de Modal (coste de unos 3.000 dólares), replicando los resultados oficiales de Qwen. La compresión se hunde en 1 bit, donde un razonamiento más largo empeora el rendimiento.

Q4_K_M sigue siendo el punto óptimo para hardware de consumo sin una pérdida de calidad perceptible en las pruebas clave.