Este artigo explica como construir um modelo de decisão usando um grande modelo de linguagem (LLM) ao restringir as saídas a um conjunto fixo de opções, como A a E. Diferentemente dos modelos de linguagem padrão que geram tokens sequencialmente, os modelos de decisão como Jev assumem opções fixas e fazem previsões em uma única passagem. O autor demonstra essa técnica usando o modelo Qwen/Qwen3-1.7B, aplicando decodificação restrita para limitar as saídas a tokens pré-definidos. Ao mascarar todos os outros itens de vocabulário, o modelo só pode emitir opções válidas, e o token de maior probabilidade é selecionado como resposta.
A abordagem foi testada no conjunto de dados CommonsenseQA, alcançando 59,38% de precisão sem ajuste fino. Após um ajuste fino rápido, a precisão melhorou para 62,41%. O artigo também destaca uma limitação: as probabilidades dos tokens de saída não refletem necessariamente a verdadeira confiança na correção, especialmente em perguntas ambíguas. O autor fornece uma implementação completa em Python usando Hugging Face Transformers e PyTorch, mostrando como formatar prompts, carregar modelos e calcular probabilidades para cada opção. Este método oferece uma maneira leve de reutilizar LLMs para tarefas de raciocínio de múltipla escolha.
Entidades-chave: Empresas: Hugging Face, Qwen
Perguntas frequentes: Como a decodificação restrita melhora a tomada de decisão de LLMs?
A decodificação restrita limita a saída do modelo a um conjunto pré-definido de tokens (por exemplo, A–E), permitindo previsões em uma única passagem. Isso imita modelos de decisão como Jev e reduz a sobrecarga computacional eliminando a necessidade de geração iterativa de tokens.
Fonte: Hacker News · Resumido por HeadlinesBriefing