Unsloth a publié Dynamic v3.0 GGUFs, offrant plus de 10% de précision top-1% meilleure par rapport aux autres fournisseurs de la même taille de modèle. Les nouveaux quanta Qwen3.8-27B Dynamic v3.0 fonctionnent avec la plupart des moteurs d'inférence, y compris llama.cpp et Unsloth Desktop.
La méthodologie utilise des ensembles de données d'étalonnage imatrix de qualité supérieure, affinés pour les performances en programmation agentique, en discussion et multilingue. Les améliorations comprennent une meilleure sélection de couches et des techniques de quantification supplémentaires pour préserver la qualité du modèle. L'équipe n'utilise pas QAT ou QAD, s'appuyant uniquement sur la quantification post-entraînement.
Il est à noter que 5,1 millions de téléchargements ont été enregistrés en seulement 5 jours. Les quanta plus petits sous UD-Q2_K_XL (8,37 Go et moins) ont supprimé le module MTP pour économiser environ 500 Mo d'espace disque. Le quanta UD-IQ1_S sur 1 bit est de 6,2 Go tout en conservant environ 72% de précision top-1%.
L'équipe a également introduit Divergence-300 @32 comme mesure plus efficace utilisant 300 exemples réservés pour le décodage greedy argmax sur 32 jetons. Cela mesure la divergence de KL pour mieux évaluer le surapprentissage et la similarité de sortie par rapport aux référentiels BF16. Les résultats montrent que les quanta UD-3 atteignent jusqu'à 10% de précision top-1% supplémentaire à tous les niveaux, en particulier pour les tailles de quanta plus petites.
Entités clés : Entreprises : Unsloth
Source: Hacker News · Résumé par HeadlinesBriefing