Cet article explique comment construire un modèle de décision à l'aide d'un grand modèle de langage (LLM) en contraignant les sorties à un ensemble fixe d'options, telles que A à E. Contrairement aux modèles de langage standards qui génèrent des tokens séquentiellement, les modèles de décision comme Jev supposent des choix fixes et font des prédictions en un seul passage. L'auteur démontre cette technique en utilisant le modèle Qwen/Qwen3-1.7B, en appliquant un décodage contraint pour limiter les sorties à des jetons prédéfinis. En masquant tous les autres éléments du vocabulaire, le modèle ne peut émettre que des options valides, et le jeton ayant la probabilité la plus élevée est sélectionné comme réponse.
Cette approche a été testée sur le jeu de données CommonsenseQA, atteignant une précision de 59,38 % sans fine-tuning. Après un fine-tuning rapide, la précision s'est améliorée à 62,41 %. L'article souligne également une limite : les probabilités des jetons de sortie ne reflètent pas nécessairement une vraie confiance dans la correction, surtout sur les questions ambiguës. L'auteur fournit une implémentation Python complète utilisant Hugging Face Transformers et PyTorch, montrant comment formater les invites, charger les modèles et calculer les probabilités pour chaque option. Cette méthode offre un moyen léger de réutiliser les LLM pour des tâches de raisonnement à choix multiples.
Entités clés : Entreprises : Hugging Face, Qwen
FAQ : Comment le décodage contraint améliore-t-il la prise de décision des LLM ?
Le décodage contraint limite la sortie du modèle à un ensemble prédéfini de jetons (par exemple, A–E), permettant des prédictions en un seul passage. Cela imite les modèles de décision comme Jev et réduit la charge computationnelle en éliminant le besoin de génération itérative de jetons.
Source: Hacker News · Résumé par HeadlinesBriefing