В этой статье объясняется, как построить модель принятия решений с использованием большой языковой модели (LLM) путем ограничения выходных данных фиксированным набором вариантов, такими как A через E. В отличие от стандартных языковых моделей, которые генерируют токены последовательно, модели принятия решений, такие как Jev, предполагают фиксированный выбор и делают прогнозы за один проход. Автор демонстрирует эту технику, используя модель Qwen/Qwen3-1.7B, применяя ограниченное декодирование для ограничения выходных данных предопределенными токенами. Маскируя все остальные элементы словаря, модель может выдавать только допустимые варианты, и выбирается токен с наибольшей вероятностью как ответ.
Этот подход был протестирован на наборе данных CommonsenseQA, достигнув точности 59,38% без дообучения. После быстрого дообучения точность улучшилась до 62,41%. В статье также отмечается ограничение: вероятности выходных токенов не обязательно отражают истинную уверенность в правильности, особенно на неоднозначных вопросах. Автор предоставляет полную реализацию на Python с использованием Hugging Face Transformers и PyTorch, показывая, как форматировать подсказки, загружать модели и вычислять вероятности для каждого варианта. Этот метод предлагает легкий способ повторного использования LLM для задач многовариантного рассуждения.
Ключевые сущности: Компании: Hugging Face, Qwen
Часто задаваемые вопросы: Как ограниченное декодирование улучшает принятие решений LLM?
Ограниченное декодирование ограничивает выход модели предопределенным набором токенов (например, A–E), обеспечивая однопроходные прогнозы. Это имитирует модели принятия решений типа Jev и снижает вычислительные накладные расходы, устраняя необходимость итеративной генерации токенов.
Источник: Hacker News · Сводку подготовил HeadlinesBriefing