HeadlinesBriefing HeadlinesBriefing 12 languages

Build your own decision model

Hacker News ·

🇬🇧 English

This article explains how to build a decision model using a large language model (LLM) by constraining outputs to a fixed set of options, such as A through E. Unlike standard language models that generate tokens sequentially, decision models like Jev assume fixed choices and make predictions in a single pass. The author demonstrates this technique using the Qwen/Qwen3-1.7B model, applying constrained decoding to limit outputs to predefined tokens. By masking all other vocabulary items, the model can only emit valid options, and the highest probability token is selected as the answer.

The approach was tested on the CommonsenseQA dataset, achieving 59.38% accuracy without fine-tuning. After a quick fine-tune, accuracy improved to 62.41%. The article also highlights a limitation: output token probabilities do not necessarily reflect true confidence in correctness, especially on ambiguous questions. The author provides a full Python implementation using Hugging Face Transformers and PyTorch, showing how to format prompts, load models, and compute probabilities for each option. This method offers a lightweight way to repurpose LLMs for multiple-choice reasoning tasks.

View original article →


🇸🇦 العربية

ابنِ نموذج قرار LLM خاصًا بك باستخدام التشفير المقيد

تشرح هذه المقالة كيفية بناء نموذج قرار باستخدام نموذج لغة كبير (LLM) عن طريق تقييد المخرجات إلى مجموعة ثابتة من الخيارات، مثل أ إلى هـ. على عكس نماذج اللغة القياسية التي تولد الرموز بشكل متسلسل، فإن نماذج القرار مثل جيف تفترض خيارات ثابتة وتجري التنبؤات في مرور واحد. يُظهر المؤلف هذه التقنية باستخدام نموذج Qwen/Qwen3-1.7B، وتطبيق التشفير المقيد لتحديد المخرجات بالرموز المحددة مسبقًا. من خلال إخفاء جميع عناصر المفردات الأخرى، يمكن للنموذج إصدار الخيارات الصالحة فقط، ويتم اختيار الرمز ذي أعلى احتمال كإجابة.

تم اختبار هذا النهج على مجموعة بيانات CommonsenseQA، محققًا دقة تبلغ 59.38% دون ضبط دقيق. بعد ضبط دقيق سريع، تحسنت الدقة إلى 62.41%. تسلط المقالة أيضًا الضوء على قيد: احتمالات رموز الإخراج لا تعكس بالضرورة الثقة الحقيقية في الصواب، خاصةً على الأسئلة الغامضة. يوفر المؤلف تنفيذًا كاملاً بلغة بايثون باستخدام Hugging Face Transformers وPyTorch، يوضح كيفية تنسيق المطالبات، وتحميل النماذج، وحساب الاحتمالات لكل خيار. تقدم هذه الطريقة طريقة خفيفة الوزن لإعادة استخدام LLMs لمهام التفكير متعدد الخيارات.

الكيانات الرئيسية: الشركات: Hugging Face، Qwen

الأسئلة الشائعة: كيف يحسن التشفير المقيد اتخاذ القرار في نماذج LLM؟

التشفير المقيد يحد من مخرجات النموذج إلى مجموعة محددة مسبقًا من الرموز (مثل أ–هـ)، مما يتيح تنبؤات بالمرور الواحد. هذا يحاكي نماذج القرار مثل جيف ويقلل الحمل الحسابي عن طريق إزالة الحاجة إلى توليد الرموز التكراري.

كيف يحسن التشفير المقيد اتخاذ القرار في نماذج LLM؟

التشفير المقيد يحد من مخرجات النموذج إلى مجموعة محددة مسبقًا من الرموز (مثل أ–هـ)، مما يتيح تنبؤات بالمرور الواحد. هذا يحاكي نماذج القرار مثل جيف ويقلل الحمل الحسابي عن طريق إزالة الحاجة إلى توليد الرموز التكراري.

العربية version →


🇧🇩 বাংলা

সীমিত ডিকোডিং দিয়ে আপনার নিজের LLM সিদ্ধান্ত মডেল তৈরি করুন

এই নিবন্ধে ব্যাখ্যা করা হয়েছে যে কীভাবে বড় ভাষা মডেল (LLM) ব্যবহার করে সিদ্ধান্ত মডেল তৈরি করবেন, jonka আউটপুটকে A থেকে E পর্যন্ত স্থায়ী বিকল্পের সেটে সীমিত করে। স্ট্যান্ডার্ড ভাষা মডেলদের বিপরীতে যারা টোকেনকে ক্রমানুসারে তৈরি করে, সিদ্ধান্ত মডেল যেমন Jev স্থায়ী বিকল্প মনে করে এবং একক পাসে ভবিষ্যদ্বাণী করে। লেখক Qwen/Qwen3-1.7B মডেল ব্যবহার করে এই কৌশলটি প্রদর্শন করেন, সীমিত ডিকোডিং প্রয়োগ করে আউটপুটকে পূর্বনির্ধারিত টোকেনে সীমিত করে। সব অন্যান্য শব্দভাণ্ডার আইটেমকে মাস্ক করে, মডেলটি শুধুমাত্র বৈধ বিকল্পগুলি পלט করতে পারে, এবং সর্বোচ্চ সম্ভাব্য টোকেনকে উত্তর হিসেবে নির্বাচন করা হয়।

এই পদ্ধতিটি CommonsenseQA ডেটাসেটে পরীক্ষা করা হয়েছিল, ফাইন-টিউনিং ছাড়াই 59.38% সঠিকতা অর্জন করা হয়েছিল। দ্রুত ফাইন-টিউনিং之后, সঠিকতা 62.41% পর্যন্ত উঠে গেল। নিবন্ধটি একটি সীমাও উজागर করে: আউটপুট টোকেন সম্ভাব্যতাগুলি প্রয়োজনীয়ভাবে সঠিকতায় আস্থার সত্য প্রতিফলন করে না, বিশেষ করে অস্পষ্ট প্রশ্নে। লেখক Hugging Face Transformers এবং PyTorch ব্যবহার করে সম্পূর্ণ Python বাস্তবায়ন প্রদান করেন, যা দেখায় যে কীভাবে প্রম্পট ফরম্যাট করবেন, মডেল লোড করবেন, এবং প্রতিটি বিকল্পের সম্ভাব্যাগুলি গণনা করবেন। এই পদ্ধতিটি LLMsকে বহু-vikalp তর্কের কাজে পুন:ব্যবহার করার জন্য একটি হালকা ওজান উপায় প্রদান করে।

মुख্য entidades: কোম্পানিগুলি: Hugging Face, Qwen

সामान्य প্রশ্ন: সীমিত ডিকোডিং LLM সিদ্ধান্ত-নির্ণয়কে কীভাবে উন্নত করে?

সীমিত ডিকোডিং মডেলের আউটপুটকে পূর্বনির্ধারিত টোকনের সেট (যেমন A–E) সীমিত করে একক-পাস ভবিষ্যদ্বাণী সক্ষম করে। এটি Jev মতো সিদ্ধান্ত মডেলের অনুকরণ করে এবং পুনরাবৃত্তি টোকেন উৎপাদনের প্রয়োজনীয়তা বন্ধ করে গাণিতিক ওভারহেড কমায়।

সীমিত ডিকোডিং LLM সিদ্ধান্ত-নির্ণয়কে কীভাবে উন্নত করে?

সীমিত ডিকোডিং মডেলের আউটপুটকে পূর্বনির্ধারিত টোকনের সেট (যেমন A–E) সীমিত করে একক-পাস ভবিষ্যদ্বাণী সক্ষম করে। এটি Jev মতো সিদ্ধান্ত মডেলের অনুকরণ করে এবং পুনরাবৃত্তি টোকেন উৎপাদনের প্রয়োজনীয়তা বন্ধ করে গাণিতিক ওভারহেড কমায়।

বাংলা version →


🇩🇪 Deutsch

Erstellen Sie Ihr eigenes LLM-Entscheidungsmodell mit beschränkter Decodierung

Dieser Artikel erklärt, wie man ein Entscheidungsmodell mit einem großen Sprachmodell (LLM) erstellt, indem man die Ausgaben auf eine feste Menge von Optionen wie A bis E beschränkt. Im Gegensatz zu Standardsprachmodellen, die Tokens sequentiell generieren, treffen Entscheidungsmodelle wie Jev feste Auswahlentscheidungen und machen Vorhersagen in einem einzigen Durchgang. Der Autor demonstriert diese Technik anhand des Modells Qwen/Qwen3-1.7B, indem er beschränkte Decodierung anwendet, um die Ausgaben auf vordefinierte Tokens zu beschränken. Durch das Maskieren aller anderen Vokabelartikel kann das Modell nur gültige Optionen ausgeben, und der Token mit der höchsten Wahrscheinlichkeit wird als Antwort ausgewählt.

Der Ansatz wurde am CommonsenseQA-Datensatz getestet und erreichte ohne Feinabstimmung eine Genauigkeit von 59,38 %. Nach einer schnellen Feinabstimmung verbesserte sich die Genauigkeit auf 62,41 %. Der Artikel weist außerdem darauf hin, dass die Wahrscheinlichkeiten der Ausgabe-Tokens nicht unbedingt das wahre Vertrauen in die Richtigkeit widerspiegeln, insbesondere bei mehrdeutigen Fragen. Der Autor bietet eine vollständige Python-Implementierung mit Hugging Face Transformers und PyTorch an, die zeigt, wie man Prompts formatiert, Modelle lädt und die Wahrscheinlichkeiten für jede Option berechnet. Diese Methode bietet eine leichte Möglichkeit, LLMs für Mehrfachauswahl-Aufgaben umzufunktionieren.

Wichtige Entitäten: Unternehmen: Hugging Face, Qwen

Häufig gestellte Fragen: Wie verbessert beschränkte Decodierung die Entscheidungsfindung von LLMs?

Beschränkte Decodierung beschränkt die Ausgabe des Modells auf einen vordefinierten Satz von Tokens (z. B. A–E), wodurch Einzel-Durchgang-Vorhersagen ermöglicht werden. Dies ahmt Entscheidungsmodelle wie Jev nach und reduziert den Rechenaufwand, indem es die Notwendigkeit iterativer Token-Generierung eliminiert.

Wie verbessert beschränkte Decodierung die Entscheidungsfindung von LLMs?

Beschränkte Decodierung beschränkt die Ausgabe des Modells auf einen vordefinierten Satz von Tokens (z. B. A–E), wodurch Einzel-Durchgang-Vorhersagen ermöglicht werden. Dies ahmt Entscheidungsmodelle wie Jev nach und reduziert den Rechenaufwand, indem es die Notwendigkeit iterativer Token-Generierung eliminiert.

Deutsch version →


🇪🇸 Español

Construye tu propio modelo de decisión LLM con decodificación restringida

Este artículo explica cómo construir un modelo de decisión utilizando un modelo de lenguaje grande (LLM) al restringir las salidas a un conjunto fijo de opciones, como A a E. A diferencia de los modelos de lenguaje estándar que generan tokens secuencialmente, los modelos de decisión como Jev asumen opciones fijas y hacen predicciones en un solo paso. El autor demuestra esta técnica utilizando el modelo Qwen/Qwen3-1.7B, aplicando decodificación restringida para limitar las salidas a tokens predefinidos. Al enmascarar todos los demás elementos del vocabulario, el modelo solo puede emitir opciones válidas, y se selecciona el token de mayor probabilidad como respuesta.

El enfoque se probó en el conjunto de datos CommonsenseQA, logrando un 59.38% de precisión sin ajuste fino. Después de un ajuste fino rápido, la precisión mejoró a 62.41%. El artículo también destaca una limitación: las probabilidades de los tokens de salida no reflejan necesariamente la verdadera confianza en la corrección, especialmente en preguntas ambiguas. El autor proporciona una implementación completa en Python usando Hugging Face Transformers y PyTorch, mostrando cómo formatear indicaciones, cargar modelos y calcular probabilidades para cada opción. Este método ofrece una forma ligera de reutilizar LLMs para tareas de razonamiento de opción múltiple.

Entidades clave: Empresas: Hugging Face, Qwen

Preguntas frecuentes: ¿Cómo mejora la decodificación restringida la toma de decisiones de LLM?

La decodificación restringida limita la salida del modelo a un conjunto predefinido de tokens (por ejemplo, A–E), permitiendo predicciones en un solo paso. Esto imita a los modelos de decisión como Jev y reduce la carga computacional al eliminar la necesidad de generación iterativa de tokens.

¿Cómo mejora la decodificación restringida la toma de decisiones de LLM?

La decodificación restringida limita la salida del modelo a un conjunto predefinido de tokens (por ejemplo, A–E), permitiendo predicciones en un solo paso. Esto imita a los modelos de decisión como Jev y reduce la carga computacional al eliminar la necesidad de generación iterativa de tokens.

Español version →


🇫🇷 Français

Construisez votre propre modèle de décision LLM avec décodage contraint

Cet article explique comment construire un modèle de décision à l'aide d'un grand modèle de langage (LLM) en contraignant les sorties à un ensemble fixe d'options, telles que A à E. Contrairement aux modèles de langage standards qui génèrent des tokens séquentiellement, les modèles de décision comme Jev supposent des choix fixes et font des prédictions en un seul passage. L'auteur démontre cette technique en utilisant le modèle Qwen/Qwen3-1.7B, en appliquant un décodage contraint pour limiter les sorties à des jetons prédéfinis. En masquant tous les autres éléments du vocabulaire, le modèle ne peut émettre que des options valides, et le jeton ayant la probabilité la plus élevée est sélectionné comme réponse.

Cette approche a été testée sur le jeu de données CommonsenseQA, atteignant une précision de 59,38 % sans fine-tuning. Après un fine-tuning rapide, la précision s'est améliorée à 62,41 %. L'article souligne également une limite : les probabilités des jetons de sortie ne reflètent pas nécessairement une vraie confiance dans la correction, surtout sur les questions ambiguës. L'auteur fournit une implémentation Python complète utilisant Hugging Face Transformers et PyTorch, montrant comment formater les invites, charger les modèles et calculer les probabilités pour chaque option. Cette méthode offre un moyen léger de réutiliser les LLM pour des tâches de raisonnement à choix multiples.

Entités clés : Entreprises : Hugging Face, Qwen

FAQ : Comment le décodage contraint améliore-t-il la prise de décision des LLM ?

Le décodage contraint limite la sortie du modèle à un ensemble prédéfini de jetons (par exemple, A–E), permettant des prédictions en un seul passage. Cela imite les modèles de décision comme Jev et réduit la charge computationnelle en éliminant le besoin de génération itérative de jetons.

Comment le décodage contraint améliore-t-il la prise de décision des LLM ?

Le décodage contraint limite la sortie du modèle à un ensemble prédéfini de jetons (par exemple, A–E), permettant des prédictions en un seul passage. Cela imite les modèles de décision comme Jev et réduit la charge computationnelle en éliminant le besoin de génération itérative de jetons.

Français version →


🇮🇳 हिन्दी

सीमित डिकोडिंग के साथ अपना स्वयं का LLM निर्णय मॉडल बनाएं

इस लेख में समझाया गया है कि कैसे बड़े भाषा मॉडल (LLM) का उपयोग करके निर्णय मॉडल बनाया जाए, जिसके आउटपुट को A से E जैसे निश्चित विकल्पों के सेट तक सीमित करके। मानक भाषा मॉडलों के विपरीत जो टोकन को क्रमिक रूप से उत्पन्न करते हैं, निर्णय मॉडल जैसे Jev निश्चित विकल्प मानते हैं और एक ही पास में भविष्यवाणी करते हैं। लेखक Qwen/Qwen3-1.7B मॉडल का उपयोग करके इस तकनीक का प्रदर्शन करते हैं, सीमित डिकोडिंग लागू करके आउटपुट को पूर्वनिर्धारित टोकन तक सीमित करते हैं। सभी अन्य शब्दावली आइटम्स को मास्क करके, मॉडल केवल वैध विकल्प उत्सर्जित कर सकता है, और उच्चतम संभाव्यता टोकन को उत्तर के रूप में चुना जाता है।

इस दृष्टिकोण को CommonsenseQA डेटासेट पर परीक्षण किया गया, बिना फाइन-ट्यूनिंग के 59.38% सटीकता हासिल की। तेज फाइन-ट्यूनिंग के बाद, सटीकता 62.41% तक बढ़ गई। लेख में एक सीमा भी उजागर की गई है: आउटपुट टोकन संभाव्यताएँ आवश्यक रूप से सही होने के वास्तविक विश्वास को नहीं दर्शाती हैं, विशेष रूप से अस्पष्ट प्रश्नों पर। लेखक Hugging Face Transformers और PyTorch का उपयोग करके पूर्ण Python कार्यान्वयन प्रदान करते हैं, जो दिखाते हैं कि कैसे प्रॉम्प्ट प्रारूपित करें, मॉडल लोड करें, और प्रत्येक विकल्प की संभावनाओं की गणना करें। यह विधि LLMs को बहुविकल्पीय reasoning कार्यों के लिए पुन: उपयोग करने का एक हल्का तरीका प्रदान करती है।

मुख्य इकाइयाँ: कंपनियाँ: Hugging Face, Qwen

अक्सर पूछे जाने वाले प्रश्न: सीमित डिकोडिंग LLM निर्णय-निर्माण में कैसे सुधार लाता है?

सीमित डिकोडिंग मॉडल के आउटपुट को पूर्वनिर्धारित टोकन के सेट (जैसे A–E) तक सीमित करके एकल-पास भविष्यवाणियों को सक्षम बनाता है। यह Jev जैसे निर्णय मॉडल की नकल करता है और पुनरावृत्ति टोकन उत्पादन की आवश्यकता को समाप्त करके गणना ओवरहेड को कम करता है।

सीमित डिकोडिंग LLM निर्णय-निर्माण में कैसे सुधार लाता है?

सीमित डिकोडिंग मॉडल के आउटपुट को पूर्वनिर्धारित टोकन के सेट (जैसे A–E) तक सीमित करके एकल-पास भविष्यवाणियों को सक्षम बनाता है। यह Jev जैसे निर्णय मॉडल की नकल करता है और पुनरावृत्ति टोकन उत्पादन की आवश्यकता को समाप्त करके गणना ओवरहेड को कम करता है।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Bangun Model Keputusan LLM Sendiri dengan Dekoding Terbatas

Artikel ini menjelaskan cara membangun model keputusan menggunakan model bahasa besar (LLM) dengan membatasi output ke sekumpulan pilihan tetap, seperti A hingga E. Berbeda dengan model bahasa standar yang menghasilkan token secara berurutan, model keputusan seperti Jev mengasumsikan pilihan tetap dan membuat prediksi dalam satu kali proses. Penulis menunjukkan teknik ini menggunakan model Qwen/Qwen3-1.7B, dengan menerapkan dekoding terbatas untuk membatasi output pada token yang telah ditentukan sebelumnya. Dengan menyembunyikan semua item kosakata lain, model hanya dapat mengeluarkan pilihan yang valid, dan token dengan probabilitas tertinggi dipilih sebagai jawaban.

Pendekatan ini diuji pada kumpulan data CommonsenseQA, mencapai akurasi 59,38% tanpa fine-tuning. Setelah fine-tuning cepat, akurasi meningkat menjadi 62,41%. Artikel ini juga menyoroti keterbatasan: probabilitas token output tidak selalu mencerminkan kepercayaan yang benar pada kebenaran, terutama pada pertanyaan yang ambigu. Penulis memberikan implementasi Python lengkap menggunakan Hugging Face Transformers dan PyTorch, yang menunjukkan cara memformat prompt, memuat model, dan menghitung probabilitas untuk setiap opsi. Metode ini menawarkan cara ringan untuk menggunakan kembali LLM untuk tugas reasoning pilihan ganda.

Entitas kunci: Perusahaan: Hugging Face, Qwen

Bagaimana dekoding terbatas meningkatkan pengambilan keputusan LLM?

Dekoding terbatas membatasi output model menjadi sekumpulan token yang telah ditentukan sebelumnya (misalnya A–E), memungkinkan prediksi dalam satu kali proses. Ini meniru model keputusan seperti Jev dan mengurangi overhead komputasi dengan menghilangkan kebutuhan untuk pembentukan token berulang-ulang.

Bahasa Indonesia version →


🇯🇵 日本語

制約デコードを使用したLLM意思決定モデルの構築方法

この記事では、出力をAからEなどの固定された選択肢のセットに制限することで、大規模言語モデル(LLM)を使用して意思決定モデルを構築する方法を説明します。標準的な言語モデルがトークンを順次生成するのに対し、Jevなどの意思決定モデルは固定された選択肢を仮定し、1パスで予測を行います。著者は、Qwen/Qwen3-1.7Bモデルを使用してこの技術を実演し、制約デコードを適用して出力を事前に定義されたトークンに制限します。語彙の他のすべての項目をマスクすることで、モデルは有効なオプションのみを出力でき、最高確率のトークンが回答として選択されます。

このアプローチはCommonsenseQAデータセットでテストされ、ファインチューニングなしで59.38%の精度を達成しました。クイックファインチューニング後、精度は62.41%に向上しました。この記事ではまた、出力トークンの確率が必ずしも正解への真の信頼を反映しないという制限点も指摘しています。特にあいまいな質問ではそうなります。著者は、Hugging Face TransformersとPyTorchを使用した完全なPython実装を提供し、プロンプトのフォーマット方法、モデルのロード方法、各オプションの確率の計算方法を示します。この方法は、LLMを多肢選択型推論タスクに軽量に再利用する方法を提供します。

主要エンティティ: 企業: Hugging Face, Qwen

よくある質問: 制約デコードはLLMの意思決定をどのように改善しますか?

制約デコードは、モデルの出力を事前に定義されたトークンのセット(例えばA–E)に制限し、1パス予測を可能にします。これはJevのような意思決定モデルを模倣し、反復トークン生成の必要性をなくすことで計算オーバーヘッドを削減します。

制約デコードはLLMの意思決定をどのように改善しますか?

制約デコードは、モデルの出力を事前に定義されたトークンのセット(例えばA–E)に制限し、1パス予測を可能にします。これはJevのような意思決定モデルを模倣し、反復トークン生成の必要性をなくすことで計算オーバーヘッドを削減します。

日本語 version →


🇧🇷 Português

Construa seu próprio modelo de decisão LLM com decodificação restrita

Este artigo explica como construir um modelo de decisão usando um grande modelo de linguagem (LLM) ao restringir as saídas a um conjunto fixo de opções, como A a E. Diferentemente dos modelos de linguagem padrão que geram tokens sequencialmente, os modelos de decisão como Jev assumem opções fixas e fazem previsões em uma única passagem. O autor demonstra essa técnica usando o modelo Qwen/Qwen3-1.7B, aplicando decodificação restrita para limitar as saídas a tokens pré-definidos. Ao mascarar todos os outros itens de vocabulário, o modelo só pode emitir opções válidas, e o token de maior probabilidade é selecionado como resposta.

A abordagem foi testada no conjunto de dados CommonsenseQA, alcançando 59,38% de precisão sem ajuste fino. Após um ajuste fino rápido, a precisão melhorou para 62,41%. O artigo também destaca uma limitação: as probabilidades dos tokens de saída não refletem necessariamente a verdadeira confiança na correção, especialmente em perguntas ambíguas. O autor fornece uma implementação completa em Python usando Hugging Face Transformers e PyTorch, mostrando como formatar prompts, carregar modelos e calcular probabilidades para cada opção. Este método oferece uma maneira leve de reutilizar LLMs para tarefas de raciocínio de múltipla escolha.

Entidades-chave: Empresas: Hugging Face, Qwen

Perguntas frequentes: Como a decodificação restrita melhora a tomada de decisão de LLMs?

A decodificação restrita limita a saída do modelo a um conjunto pré-definido de tokens (por exemplo, A–E), permitindo previsões em uma única passagem. Isso imita modelos de decisão como Jev e reduz a sobrecarga computacional eliminando a necessidade de geração iterativa de tokens.

Como a decodificação restrita melhora a tomada de decisão de LLMs?

A decodificação restrita limita a saída do modelo a um conjunto pré-definido de tokens (por exemplo, A–E), permitindo previsões em uma única passagem. Isso imita modelos de decisão como Jev e reduz a sobrecarga computacional eliminando a necessidade de geração iterativa de tokens.

Português version →


🇷🇺 Русский

Создайте собственную модель принятия решений LLM с ограниченным декодированием

В этой статье объясняется, как построить модель принятия решений с использованием большой языковой модели (LLM) путем ограничения выходных данных фиксированным набором вариантов, такими как A через E. В отличие от стандартных языковых моделей, которые генерируют токены последовательно, модели принятия решений, такие как Jev, предполагают фиксированный выбор и делают прогнозы за один проход. Автор демонстрирует эту технику, используя модель Qwen/Qwen3-1.7B, применяя ограниченное декодирование для ограничения выходных данных предопределенными токенами. Маскируя все остальные элементы словаря, модель может выдавать только допустимые варианты, и выбирается токен с наибольшей вероятностью как ответ.

Этот подход был протестирован на наборе данных CommonsenseQA, достигнув точности 59,38% без дообучения. После быстрого дообучения точность улучшилась до 62,41%. В статье также отмечается ограничение: вероятности выходных токенов не обязательно отражают истинную уверенность в правильности, особенно на неоднозначных вопросах. Автор предоставляет полную реализацию на Python с использованием Hugging Face Transformers и PyTorch, показывая, как форматировать подсказки, загружать модели и вычислять вероятности для каждого варианта. Этот метод предлагает легкий способ повторного использования LLM для задач многовариантного рассуждения.

Ключевые сущности: Компании: Hugging Face, Qwen

Часто задаваемые вопросы: Как ограниченное декодирование улучшает принятие решений LLM?

Ограниченное декодирование ограничивает выход модели предопределенным набором токенов (например, A–E), обеспечивая однопроходные прогнозы. Это имитирует модели принятия решений типа Jev и снижает вычислительные накладные расходы, устраняя необходимость итеративной генерации токенов.

Как ограниченное декодирование улучшает принятие решений LLM?

Ограниченное декодирование ограничивает выход модели предопределенным набором токенов (например, A–E), обеспечивая однопроходные прогнозы. Это имитирует модели принятия решений типа Jev и снижает вычислительные накладные расходы, устраняя необходимость итеративной генерации токенов.

Русский version →


🇨🇳 简体中文

通过受限解码构建自己的LLM决策模型

本文解释了如何通过将输出限制为固定选项(如A到E)来使用大型语言模型(LLM)构建决策模型。与标准语言模型依次生成标记不同,决策模型(如Jev)假设固定选择并在一次通过中进行预测。作者展示了使用Qwen/Qwen3-1.7B模型的技术,应用受限解码将输出限制为预定义标记。通过屏蔽所有其他词汇项,模型只能发出有效选项,并选择概率最高的标记作为答案。

该方法在CommonsenseQA数据集上进行了测试,未经微调即可达到59.38%的准确率。快速微调后,准确率提高到62.41%。文章还指出了一种限制:输出标记概率不一定反映对正确性的真实信心,尤其是在模糊问题上。作者提供了使用Hugging Face Transformers和PyTorch的完整Python实现,展示了如何格式化提示、加载模型以及计算每个选项的概率。此方法提供了一种轻量级方式,将LLM重新用于多选推理任务。

关键实体:公司:Hugging Face,Qwen

常见问题:受限解码如何改善LLM决策?

受限解码将模型的输出限制在预定义的标记集合(例如A–E),实现单次预测。这模仿了像Jev这样的决策模型,并通过消除迭代标记生成的需求来减少计算开销。

受限解码如何改善LLM决策?

受限解码将模型的输出限制在预定义的标记集合(例如A–E),实现单次预测。这模仿了像Jev这样的决策模型,并通过消除迭代标记生成的需求来减少计算开销。

简体中文 version →