UnslothはDynamic v3.0 GGUFsをリリースし、同じモデルサイズで他のプロバイダーと比較して10%以上優れたtop-1%精度を提供します。新しいQwen3.8-27B Dynamic v3.0クォントはllama.cppやUnsloth Desktopを含むほとんどの推論エンジンと互換性があります。
この手法は、エージェントコーディング、チャット、および多言語パフォーマンス向けに最適化された、より高品質なimatrix校正データセットを使用します。改善点には、モデル品質を維持するためのより良い層の選択と追加の量子化技術が含まれます。チームはQATやQADを使用せず、純粋にトレーニング後の量子化に依存しています。
注目すべきこととして、わずか5日で510万回のダウンロードが記録されました。UD-Q2_K_XL(8.37GB以下)の小さいクォントは、MTPモジュールを削除して約500MBのディスクスペースを節約しました。1ビットクォントのUD-IQ1_Sは6.2GBでありながら、約72%のtop-1%精度を維持しています。
チームはまた、32トークンにわたる貪欲なargmaxデコーディングのために300個の保持された例を使用して、より効果的なメトリックであるDivergence-300 @32を導入しました。これは、過剰適合とBF16ベースラインとの出力の類似性をより良く測定するためにKLダイバージェンスを測定します。結果によると、UD-3クォントはすべてのレベルで最大10%の追加top-1%精度を達成し、特に小さいクォントサイズで顕著です。
主要エンティティ:会社:Unsloth
出典: Hacker News · 要約:HeadlinesBriefing