A New Kind of Model for AI Decision-Making?
🇬🇧 English
Type Safe.AI launched its first model, Jev, a System One model that differs from LLMs. While LLMs predict the next token and generate text, System One models evaluate a state and produce structured answers. Jev uses RLCD (Reinforcement Learning for Calibrated Decisions) instead of RLHF, training the model to return decisions and probabilities.
The input is a state—context plus questions. It can be a simple message like "Is it possible for me to change my PIN number?", a JSON object with fields, or an array of messages. Best practice is to use an object with clear field names.
Questions are answered using primitives: Choice for predefined options (e.g., delivery, billing, account access), Score for ordered values (e.g., negative, neutral, positive), and Noul for yes/no. The model returns probabilities for all values, providing confidence levels.
Confidence is crucial for decision-making. For auto-replies, if the model classifies a request with high confidence, it can auto-respond; if uncertain, it can escalate. This makes Jev suited for classification and LLM-as-a-judge tasks.
🇸🇦 العربية
Jev من Type Safe: نموذج قرار ذكاء اصطناعي جديد؟
أطلقت Type Safe.AI نموذجها الأول، Jev، وهو نموذج System One يختلف عن LLMs. بينما تتنبأ LLMs بالرمز التالي وتنشئ نصًا، تقوم نماذج System One بتقييم حالة وإنتاج إجابات منظمة. يستخدم Jev RLCD (التعلم المعزز للقرارات المعايرة) بدلاً من RLHF، مما يدرب النموذج على إرجاع القرارات والاحتمالات.
المدخل هو حالة—سياق بالإضافة إلى أسئلة. يمكن أن يكون رسالة بسيطة مثل "هل من الممكن أن أغير رقم PIN الخاص بي؟"، أو كائن JSON مع حقول، أو مصفوفة من الرسائل. أفضل ممارسة هي استخدام كائن بأسماء حقول واضحة.
يتم الإجابة على الأسئلة باستخدام العناصر الأولية: Choice للخيارات المحددة مسبقًا (مثل التوصيل، الفواتير، الوصول إلى الحساب)، Score للقيم المرتبة (مثل سلبي، محايد، إيجابي)، و Noul لنعم/لا. يعيد النموذج الاحتمالات لجميع القيم، مما يوفر مستويات الثقة.
الثقة حاسمة لاتخاذ القرار. للردود التلقائية، إذا صنف النموذج طلبًا بثقة عالية، يمكنه الرد تلقائيًا؛ إذا كان غير متأكد، يمكنه التصعيد. هذا يجعل Jev مناسبًا لمهام التصنيف و LLM-as-a-judge.
الكيانات الرئيسية: الشركات: Type Safe.AI، OpenAI
كيف تختلف نماذج System One عن LLMs؟
تقوم نماذج System One بتقييم حالة وإنتاج إجابات منظمة مع احتمالات، بينما تتنبأ LLMs بالرمز التالي وتنشئ نصًا حرًا. يستخدمون أساليب تدريب لاحق مختلفة: RLCD للقرارات المعايرة مقابل RLHF لمواءمة تفضيلات البشر.
🇧🇩 বাংলা
Type Safe-এর Jev: একটি নতুন AI সিদ্ধান্ত মডেল?
Type Safe.AI তার প্রথম মডেল, Jev, চালু করেছে, যা একটি System One মডেল যা LLM থেকে আলাদা। যেখানে LLM পরবর্তী টোকেন পূর্বাভাস দেয় এবং টেক্সট তৈরি করে, সেখানে System One মডেল একটি অবস্থা মূল্যায়ন করে এবং কাঠামোগত উত্তর দেয়। Jev RLHF-এর বদলে RLCD (ক্যালিব্রেটেড সিদ্ধান্তের জন্য রিইনফোর্সমেন্ট লার্নিং) ব্যবহার করে, মডেলকে সিদ্ধান্ত এবং সম্ভাবনা ফেরত দিতে প্রশিক্ষণ দেয়।
ইনপুট একটি অবস্থা—প্রসঙ্গ এবং প্রশ্ন। এটি একটি সাধারণ বার্তা হতে পারে যেমন "আমার পক্ষে কি আমার PIN নম্বর পরিবর্তন করা সম্ভব?", ক্ষেত্রসহ একটি JSON অবজেক্ট, বা বার্তার একটি অ্যারে। সর্বোত্তম অনুশীলন হল স্পষ্ট ক্ষেত্র নামসহ একটি অবজেক্ট ব্যবহার করা।
প্রশ্নগুলির উত্তর দেওয়া হয় প্রিমিটিভ ব্যবহার করে: Choice পূর্বনির্ধারিত বিকল্পের জন্য (যেমন, ডেলিভারি, বিলিং, অ্যাকাউন্ট অ্যাক্সেস), Score ক্রমবদ্ধ মানের জন্য (যেমন, নেতিবাচক, নিরপেক্ষ, ইতিবাচক), এবং Noul হ্যাঁ/না-এর জন্য। মডেল সমস্ত মানের জন্য সম্ভাবনা ফেরত দেয়, আত্মবিশ্বাসের স্তর প্রদান করে।
সিদ্ধান্ত গ্রহণের জন্য আত্মবিশ্বাস অত্যন্ত গুরুত্বপূর্ণ। স্বয়ংক্রিয় উত্তরের জন্য, যদি মডেল একটি অনুরোধ উচ্চ আত্মবিশ্বাসের সাথে শ্রেণীবদ্ধ করে, এটি স্বয়ংক্রিয়ভাবে উত্তর দিতে পারে; যদি অনিশ্চিত হয়, এটি এস্কেলেট করতে পারে। এটি Jev-কে শ্রেণীবিভাগ এবং LLM-as-a-judge কাজের জন্য উপযুক্ত করে তোলে।
মূল সত্তা: কোম্পানি: Type Safe.AI, OpenAI
System One মডেলগুলি LLM থেকে কীভাবে আলাদা?
System One মডেলগুলি একটি অবস্থা মূল্যায়ন করে এবং সম্ভাবনাসহ কাঠামোগত উত্তর দেয়, যেখানে LLM পরবর্তী টোকেন পূর্বাভাস দেয় এবং মুক্ত-রূপ টেক্সট তৈরি করে। তারা ভিন্ন পোস্ট-ট্রেনিং পদ্ধতি ব্যবহার করে: ক্যালিব্রেটেড সিদ্ধান্তের জন্য RLCD বনাম মানব পছন্দ সারিবদ্ধকরণের জন্য RLHF।
🇩🇪 Deutsch
Type Safes Jev: Ein neues KI-Entscheidungsmodell?
Type Safe.AI hat sein erstes Modell Jev gestartet, ein System-One-Modell, das sich von LLMs unterscheidet. Während LLMs das nächste Token vorhersagen und Text generieren, bewerten System-One-Modelle einen Zustand und erzeugen strukturierte Antworten. Jev verwendet RLCD (Reinforcement Learning für kalibrierte Entscheidungen) anstelle von RLHF und trainiert das Modell, Entscheidungen und Wahrscheinlichkeiten zurückzugeben.
Die Eingabe ist ein Zustand – Kontext plus Fragen. Es kann eine einfache Nachricht wie „Ist es möglich, dass ich meine PIN-Nummer ändere?“ sein, ein JSON-Objekt mit Feldern oder ein Array von Nachrichten. Best Practice ist die Verwendung eines Objekts mit klaren Feldnamen.
Fragen werden mit Primitiven beantwortet: Choice für vordefinierte Optionen (z. B. Lieferung, Abrechnung, Kontozugriff), Score für geordnete Werte (z. B. negativ, neutral, positiv) und Noul für Ja/Nein. Das Modell gibt Wahrscheinlichkeiten für alle Werte zurück und liefert Konfidenzniveaus.
Konfidenz ist entscheidend für die Entscheidungsfindung. Bei automatischen Antworten kann das Modell, wenn es eine Anfrage mit hoher Konfidenz klassifiziert, automatisch antworten; wenn unsicher, kann es eskalieren. Dies macht Jev geeignet für Klassifizierungs- und LLM-as-a-judge-Aufgaben.
Wichtige Entitäten: Unternehmen: Type Safe.AI, OpenAI
Wie unterscheiden sich System-One-Modelle von LLMs?
System-One-Modelle bewerten einen Zustand und erzeugen strukturierte Antworten mit Wahrscheinlichkeiten, während LLMs das nächste Token vorhersagen und freien Text generieren. Sie verwenden unterschiedliche Post-Training-Ansätze: RLCD für kalibrierte Entscheidungen versus RLHF für die Ausrichtung an menschlichen Präferenzen.
🇪🇸 Español
Jev de Type Safe: ¿Un nuevo modelo de decisión de IA?
Type Safe.AI lanzó su primer modelo, Jev, un modelo de Sistema Uno que difiere de los LLM. Mientras que los LLM predicen el siguiente token y generan texto, los modelos de Sistema Uno evalúan un estado y producen respuestas estructuradas. Jev utiliza RLCD (Aprendizaje por Refuerzo para Decisiones Calibradas) en lugar de RLHF, entrenando al modelo para devolver decisiones y probabilidades.
La entrada es un estado: contexto más preguntas. Puede ser un mensaje simple como "¿Es posible que cambie mi número PIN?", un objeto JSON con campos, o un arreglo de mensajes. La mejor práctica es usar un objeto con nombres de campos claros.
Las preguntas se responden usando primitivas: Choice para opciones predefinidas (por ejemplo, entrega, facturación, acceso a la cuenta), Score para valores ordenados (por ejemplo, negativo, neutral, positivo), y Noul para sí/no. El modelo devuelve probabilidades para todos los valores, proporcionando niveles de confianza.
La confianza es crucial para la toma de decisiones. Para respuestas automáticas, si el modelo clasifica una solicitud con alta confianza, puede responder automáticamente; si no está seguro, puede escalar. Esto hace que Jev sea adecuado para tareas de clasificación y LLM-as-a-judge.
Entidades clave: Empresas: Type Safe.AI, OpenAI
¿En qué se diferencian los modelos de Sistema Uno de los LLM?
Los modelos de Sistema Uno evalúan un estado y producen respuestas estructuradas con probabilidades, mientras que los LLM predicen el siguiente token y generan texto de forma libre. Utilizan enfoques de post-entrenamiento diferentes: RLCD para decisiones calibradas versus RLHF para alineación con preferencias humanas.
🇫🇷 Français
Jev de Type Safe : Un nouveau modèle de décision IA ?
Type Safe.AI a lancé son premier modèle, Jev, un modèle Système Un qui diffère des LLM. Alors que les LLM prédisent le prochain token et génèrent du texte, les modèles Système Un évaluent un état et produisent des réponses structurées. Jev utilise RLCD (Apprentissage par Renforcement pour Décisions Calibrées) au lieu de RLHF, entraînant le modèle à retourner des décisions et des probabilités.
L'entrée est un état—contexte plus questions. Cela peut être un simple message comme « Est-il possible pour moi de changer mon numéro PIN ? », un objet JSON avec des champs, ou un tableau de messages. La meilleure pratique est d'utiliser un objet avec des noms de champs clairs.
Les questions sont répondues à l'aide de primitives : Choice pour les options prédéfinies (par exemple, livraison, facturation, accès au compte), Score pour les valeurs ordonnées (par exemple, négatif, neutre, positif), et Noul pour oui/non. Le modèle retourne des probabilités pour toutes les valeurs, fournissant des niveaux de confiance.
La confiance est cruciale pour la prise de décision. Pour les réponses automatiques, si le modèle classe une demande avec une haute confiance, il peut répondre automatiquement ; s'il est incertain, il peut escalader. Cela rend Jev adapté aux tâches de classification et LLM-as-a-judge.
Entités clés : Entreprises : Type Safe.AI, OpenAI
FAQ : En quoi les modèles Système Un diffèrent-ils des LLM ?
Les modèles Système Un évaluent un état et produisent des réponses structurées avec des probabilités, tandis que les LLM prédisent le prochain token et génèrent du texte libre. Ils utilisent différentes approches de post-entraînement : RLCD pour des décisions calibrées versus RLHF pour l'alignement aux préférences humaines.
FAQ Q : En quoi les modèles Système Un diffèrent-ils des LLM ?
FAQ A : Les modèles Système Un évaluent un état et produisent des réponses structurées avec des probabilités, tandis que les LLM prédisent le prochain token et génèrent du texte libre. Ils utilisent différentes approches de post-entraînement : RLCD pour des décisions calibrées versus RLHF pour l'alignement aux préférences humaines.
En quoi les modèles Système Un diffèrent-ils des LLM ?
Les modèles Système Un évaluent un état et produisent des réponses structurées avec des probabilités, tandis que les LLM prédisent le prochain token et génèrent du texte libre. Ils utilisent différentes approches de post-entraînement : RLCD pour des décisions calibrées versus RLHF pour l'alignement aux préférences humaines.
🇮🇳 हिन्दी
Type Safe का Jev: एक नया AI निर्णय मॉडल?
Type Safe.AI ने अपना पहला मॉडल, Jev, लॉन्च किया, जो एक System One मॉडल है जो LLM से भिन्न है। जहाँ LLM अगले टोकन की भविष्यवाणी करते हैं और टेक्स्ट उत्पन्न करते हैं, वहीं System One मॉडल एक स्थिति का मूल्यांकन करते हैं और संरचित उत्तर देते हैं। Jev RLHF के बजाय RLCD (कैलिब्रेटेड निर्णयों के लिए रीइन्फोर्समेंट लर्निंग) का उपयोग करता है, मॉडल को निर्णय और संभावनाएँ लौटाने के लिए प्रशिक्षित करता है।
इनपुट एक स्थिति है—संदर्भ और प्रश्न। यह एक साधारण संदेश हो सकता है जैसे "क्या मेरे लिए अपना PIN नंबर बदलना संभव है?", फ़ील्ड वाला JSON ऑब्जेक्ट, या संदेशों की एक सरणी। सर्वोत्तम अभ्यास स्पष्ट फ़ील्ड नामों वाले ऑब्जेक्ट का उपयोग करना है।
प्रश्नों का उत्तर प्रिमिटिव्स का उपयोग करके दिया जाता है: Choice पूर्वनिर्धारित विकल्पों के लिए (जैसे, डिलीवरी, बिलिंग, खाता पहुँच), Score क्रमबद्ध मानों के लिए (जैसे, नकारात्मक, तटस्थ, सकारात्मक), और Noul हाँ/नहीं के लिए। मॉडल सभी मानों के लिए संभावनाएँ लौटाता है, जो आत्मविश्वास स्तर प्रदान करता है।
निर्णय लेने के लिए आत्मविश्वास महत्वपूर्ण है। ऑटो-रिप्लाई के लिए, यदि मॉडल किसी अनुरोध को उच्च आत्मविश्वास के साथ वर्गीकृत करता है, तो यह स्वतः उत्तर दे सकता है; यदि अनिश्चित है, तो यह एस्केलेट कर सकता है। यह Jev को वर्गीकरण और LLM-as-a-judge कार्यों के लिए उपयुक्त बनाता है।
मुख्य संस्थाएँ: कंपनियाँ: Type Safe.AI, OpenAI
System One मॉडल LLM से कैसे भिन्न हैं?
System One मॉडल एक स्थिति का मूल्यांकन करते हैं और संभावनाओं के साथ संरचित उत्तर देते हैं, जबकि LLM अगले टोकन की भविष्यवाणी करते हैं और मुक्त-रूप टेक्स्ट उत्पन्न करते हैं। वे अलग पोस्ट-ट्रेनिंग दृष्टिकोणों का उपयोग करते हैं: कैलिब्रेटेड निर्णयों के लिए RLCD बनाम मानव प्राथमिकता संरेखण के लिए RLHF।
🇮🇩 Bahasa Indonesia
Jev dari Type Safe: Model Keputusan AI Baru?
Type Safe.AI meluncurkan model pertamanya, Jev, model System One yang berbeda dari LLM. Sementara LLM memprediksi token berikutnya dan menghasilkan teks, model System One mengevaluasi suatu keadaan dan menghasilkan jawaban terstruktur. Jev menggunakan RLCD (Pembelajaran Penguatan untuk Keputusan Terkalibrasi) alih-alih RLHF, melatih model untuk mengembalikan keputusan dan probabilitas.
Input adalah keadaan—konteks plus pertanyaan. Ini bisa berupa pesan sederhana seperti "Apakah mungkin bagi saya untuk mengubah nomor PIN saya?", objek JSON dengan bidang, atau array pesan. Praktik terbaik adalah menggunakan objek dengan nama bidang yang jelas.
Pertanyaan dijawab menggunakan primitif: Choice untuk opsi yang telah ditentukan (misalnya, pengiriman, penagihan, akses akun), Score untuk nilai terurut (misalnya, negatif, netral, positif), dan Noul untuk ya/tidak. Model mengembalikan probabilitas untuk semua nilai, memberikan tingkat kepercayaan.
Kepercayaan sangat penting untuk pengambilan keputusan. Untuk balasan otomatis, jika model mengklasifikasikan permintaan dengan kepercayaan tinggi, ia dapat merespons otomatis; jika tidak yakin, ia dapat meningkatkan. Ini membuat Jev cocok untuk tugas klasifikasi dan LLM-as-a-judge.
Entitas Kunci: Perusahaan: Type Safe.AI, OpenAI
Bagaimana model System One berbeda dari LLM?
Model System One mengevaluasi suatu keadaan dan menghasilkan jawaban terstruktur dengan probabilitas, sementara LLM memprediksi token berikutnya dan menghasilkan teks bebas. Mereka menggunakan pendekatan pasca-pelatihan yang berbeda: RLCD untuk keputusan terkalibrasi versus RLHF untuk penyelarasan preferensi manusia.
🇯🇵 日本語
Type SafeのJev:新しいAI意思決定モデル?
Type Safe.AIは最初のモデルJevを発表しました。これはLLMとは異なるSystem Oneモデルです。LLMが次のトークンを予測してテキストを生成するのに対し、System Oneモデルは状態を評価し、構造化された回答を生成します。JevはRLHFではなくRLCD(キャリブレーションされた決定のための強化学習)を使用し、モデルに決定と確率を返すよう訓練します。
入力は状態です—コンテキストと質問。それは「PIN番号を変更することは可能ですか?」のような単純なメッセージ、フィールドを持つJSONオブジェクト、またはメッセージの配列です。ベストプラクティスは、明確なフィールド名を持つオブジェクトを使用することです。
質問はプリミティブを使用して回答されます:Choiceは事前定義されたオプション(例:配送、請求、アカウントアクセス)、Scoreは順序付けられた値(例:ネガティブ、ニュートラル、ポジティブ)、Noulははい/いいえです。モデルはすべての値の確率を返し、信頼レベルを提供します。
信頼は意思決定に不可欠です。自動返信の場合、モデルが高い信頼でリクエストを分類すれば、自動応答できます。不確かな場合はエスカレートできます。これによりJevは分類やLLM-as-a-judgeタスクに適しています。
主要エンティティ:企業:Type Safe.AI、OpenAI
FAQ:System OneモデルはLLMとどう違うのですか?
System Oneモデルは状態を評価し、確率を伴う構造化された回答を生成しますが、LLMは次のトークンを予測し、自由形式のテキストを生成します。彼らは異なるポストトレーニングアプローチを使用します:キャリブレーションされた決定のためのRLCD対人間の好みの調整のためのRLHF。
FAQ Q:System OneモデルはLLMとどう違うのですか?
FAQ A:System Oneモデルは状態を評価し、確率を伴う構造化された回答を生成しますが、LLMは次のトークンを予測し、自由形式のテキストを生成します。彼らは異なるポストトレーニングアプローチを使用します:キャリブレーションされた決定のためのRLCD対人間の好みの調整のためのRLHF。
System OneモデルはLLMとどう違うのですか?
System Oneモデルは状態を評価し、確率を伴う構造化された回答を生成しますが、LLMは次のトークンを予測し、自由形式のテキストを生成します。彼らは異なるポストトレーニングアプローチを使用します:キャリブレーションされた決定のためのRLCD対人間の好みの調整のためのRLHF。
🇧🇷 Português
Jev da Type Safe: Um Novo Modelo de Decisão de IA?
A Type Safe.AI lançou seu primeiro modelo, Jev, um modelo Sistema Um que difere dos LLMs. Enquanto os LLMs preveem o próximo token e geram texto, os modelos Sistema Um avaliam um estado e produzem respostas estruturadas. Jev usa RLCD (Aprendizado por Reforço para Decisões Calibradas) em vez de RLHF, treinando o modelo para retornar decisões e probabilidades.
A entrada é um estado—contexto mais perguntas. Pode ser uma mensagem simples como "É possível para mim mudar meu número PIN?", um objeto JSON com campos, ou um array de mensagens. A melhor prática é usar um objeto com nomes de campos claros.
As perguntas são respondidas usando primitivas: Choice para opções predefinidas (por exemplo, entrega, cobrança, acesso à conta), Score para valores ordenados (por exemplo, negativo, neutro, positivo), e Noul para sim/não. O modelo retorna probabilidades para todos os valores, fornecendo níveis de confiança.
A confiança é crucial para a tomada de decisões. Para respostas automáticas, se o modelo classificar uma solicitação com alta confiança, pode responder automaticamente; se incerto, pode escalar. Isso torna Jev adequado para tarefas de classificação e LLM-as-a-judge.
Entidades-chave: Empresas: Type Safe.AI, OpenAI
Como os modelos Sistema Um diferem dos LLMs?
Os modelos Sistema Um avaliam um estado e produzem respostas estruturadas com probabilidades, enquanto os LLMs preveem o próximo token e geram texto livre. Eles usam abordagens de pós-treinamento diferentes: RLCD para decisões calibradas versus RLHF para alinhamento com preferências humanas.
🇷🇺 Русский
Jev от Type Safe: Новая модель принятия решений ИИ?
Type Safe.AI выпустила свою первую модель, Jev, модель System One, которая отличается от LLM. В то время как LLM предсказывают следующий токен и генерируют текст, модели System One оценивают состояние и выдают структурированные ответы. Jev использует RLCD (обучение с подкреплением для калиброванных решений) вместо RLHF, обучая модель возвращать решения и вероятности.
Входные данные — это состояние: контекст плюс вопросы. Это может быть простое сообщение, например «Возможно ли для меня изменить свой PIN-код?», объект JSON с полями или массив сообщений. Лучшая практика — использовать объект с четкими именами полей.
На вопросы отвечают с помощью примитивов: Choice для предопределенных вариантов (например, доставка, выставление счетов, доступ к аккаунту), Score для упорядоченных значений (например, отрицательный, нейтральный, положительный) и Noul для да/нет. Модель возвращает вероятности для всех значений, предоставляя уровни уверенности.
Уверенность имеет решающее значение для принятия решений. Для автоответов, если модель классифицирует запрос с высокой уверенностью, она может ответить автоматически; если не уверена, она может эскалировать. Это делает Jev подходящим для задач классификации и LLM-as-a-judge.
Ключевые сущности: Компании: Type Safe.AI, OpenAI
Чем модели System One отличаются от LLM?
Модели System One оценивают состояние и выдают структурированные ответы с вероятностями, в то время как LLM предсказывают следующий токен и генерируют свободный текст. Они используют разные подходы к пост-обучению: RLCD для калиброванных решений против RLHF для выравнивания по человеческим предпочтениям.
🇨🇳 简体中文
Type Safe的Jev:一种新的AI决策模型?
Type Safe.AI推出了其首个模型Jev,这是一个不同于LLM的系统一模型。LLM预测下一个token并生成文本,而系统一模型评估一个状态并产生结构化答案。Jev使用RLCD(校准决策的强化学习)而非RLHF,训练模型返回决策和概率。
输入是一个状态——上下文加问题。它可以是一条简单消息,如“我有可能更改我的PIN码吗?”,一个包含字段的JSON对象,或一个消息数组。最佳实践是使用具有清晰字段名的对象。
问题通过原语来回答:Choice用于预定义选项(例如,配送、账单、账户访问),Score用于有序值(例如,负面、中性、正面),Noul用于是/否。模型返回所有值的概率,提供置信水平。
置信度对决策至关重要。对于自动回复,如果模型以高置信度对请求进行分类,它可以自动回复;如果不确定,它可以升级。这使得Jev适用于分类和LLM-as-a-judge任务。
关键实体:公司:Type Safe.AI、OpenAI
FAQ:系统一模型与LLM有何不同?
系统一模型评估一个状态并产生带概率的结构化答案,而LLM预测下一个token并生成自由形式的文本。它们使用不同的后训练方法:RLCD用于校准决策,而RLHF用于人类偏好对齐。
FAQ Q:系统一模型与LLM有何不同?
FAQ A:系统一模型评估一个状态并产生带概率的结构化答案,而LLM预测下一个token并生成自由形式的文本。它们使用不同的后训练方法:RLCD用于校准决策,而RLHF用于人类偏好对齐。
系统一模型与LLM有何不同?
系统一模型评估一个状态并产生带概率的结构化答案,而LLM预测下一个token并生成自由形式的文本。它们使用不同的后训练方法:RLCD用于校准决策,而RLHF用于人类偏好对齐。