HeadlinesBriefing favicon HeadlinesBriefing.com

Quantização 4 bits de Qwen3.8 27B

Hacker News •
×

Os benchmarks de quantização Qwen3.8 27B mostram que Q4_K_M de 4 bits (17 GB) iguala o desempenho BF16 completo no Terminal-Bench 2.1 e GPQA Diamond, cabendo em uma GPU de 24 GB como RTX 4090 com espaço para 64k tokens de contexto. UD-Q2_K_XL de 2 bits (10,7 GB) apresenta pequenas quedas, enquanto UD-IQ1_S de 1 bit (6,2 GB) cai para chance aleatória no GPQA Diamond. O nível de esforço (xhigh padrão) impacta significativamente as pontuações, exigindo cerca de 8k tokens de raciocínio para os melhores resultados.

O IFBench não mostra mudança ao descer até 2 bits. Os testes usaram quantizações Unsloth em GPUs Modal (custo de cerca de US$ 3.000), replicando os resultados oficiais da Qwen. A compressão atinge um ponto crítico em 1 bit, onde raciocínio mais longo piora o desempenho.

Q4_K_M continua sendo o melhor ponto para hardware de consumo, sem perda perceptível de qualidade nos benchmarks principais.