HeadlinesBriefing favicon HeadlinesBriefing.com

Jev de Type Safe : Nouveau modèle de décision IA ?

Towards Data Science •
×

Type Safe.AI a lancé son premier modèle, Jev, un modèle Système Un qui diffère des LLM. Alors que les LLM prédisent le prochain token et génèrent du texte, les modèles Système Un évaluent un état et produisent des réponses structurées. Jev utilise RLCD (Apprentissage par Renforcement pour Décisions Calibrées) au lieu de RLHF, entraînant le modèle à retourner des décisions et des probabilités.

L'entrée est un état—contexte plus questions. Cela peut être un simple message comme « Est-il possible pour moi de changer mon numéro PIN ? », un objet JSON avec des champs, ou un tableau de messages. La meilleure pratique est d'utiliser un objet avec des noms de champs clairs.

Les questions sont répondues à l'aide de primitives : Choice pour les options prédéfinies (par exemple, livraison, facturation, accès au compte), Score pour les valeurs ordonnées (par exemple, négatif, neutre, positif), et Noul pour oui/non. Le modèle retourne des probabilités pour toutes les valeurs, fournissant des niveaux de confiance.

La confiance est cruciale pour la prise de décision. Pour les réponses automatiques, si le modèle classe une demande avec une haute confiance, il peut répondre automatiquement ; s'il est incertain, il peut escalader. Cela rend Jev adapté aux tâches de classification et LLM-as-a-judge.

Entités clés : Entreprises : Type Safe.AI, OpenAI

FAQ : En quoi les modèles Système Un diffèrent-ils des LLM ?

Les modèles Système Un évaluent un état et produisent des réponses structurées avec des probabilités, tandis que les LLM prédisent le prochain token et génèrent du texte libre. Ils utilisent différentes approches de post-entraînement : RLCD pour des décisions calibrées versus RLHF pour l'alignement aux préférences humaines.

FAQ Q : En quoi les modèles Système Un diffèrent-ils des LLM ?

FAQ A : Les modèles Système Un évaluent un état et produisent des réponses structurées avec des probabilités, tandis que les LLM prédisent le prochain token et génèrent du texte libre. Ils utilisent différentes approches de post-entraînement : RLCD pour des décisions calibrées versus RLHF pour l'alignement aux préférences humaines.