Unsloth merilis Dynamic v3.0 GGUFs, menawarkan akurasi top-1% yang lebih baik dari 10% dibandingkan penyedia lain dengan ukuran model yang sama. Kuantisasi baru Qwen3.8-27B Dynamic v3.0 bekerja dengan sebagian besar mesin inferensi, termasuk llama.cpp dan Unsloth Desktop.
Metodologi menggunakan kumpulan data kalibrasi imatrix berkualitas lebih tinggi, yang disempurnakan untuk kinerja pengkodean ajan, obrolan, dan multibahasa. Perbaikan termasuk pemilihan lapisan yang lebih baik dan teknik kuantisasi tambahan untuk mempertahankan kualitas model. Tim tidak menggunakan QAT atau QAD, bergantung sepenuhnya pada kuantisasi pasca-pelatihan.
Perlu dicatat bahwa 5,1 juta unduhan tercatat dalam hanya 5 hari. Kuantisasi yang lebih kecil di bawah UD-Q2_K_XL (8.37GB dan di bawah) telah menghapus modul MTP untuk menghemat sekitar 500MB ruang disk. Kuantisasi UD-IQ1_S 1-bit berukuran 6.2GB sementara mempertahankan sekitar 72% akurasi top-1%.
Tim juga memperkenalkan Divergence-300 @32 sebagai metrik yang lebih efektif dengan menggunakan 300 contoh yang ditahan untuk dekode argmax greedy pada 32 token. Ini mengukur divergensi KL untuk lebih baik menilai overfitting dan kesamaan output dengan baseline BF16. Hasilnya menunjukkan bahwa kuantisasi UD-3 mencapai hingga 10% akurasi top-1% tambahan di semua tingkat, terutama pada ukuran kuantisasi yang lebih kecil.
Entitas kunci: Perusahaan: Unsloth
Sumber: Hacker News · Diringkas oleh HeadlinesBriefing