HeadlinesBriefing favicon HeadlinesBriefing.com

Jev vs LLMs : Test de décision IA

Towards Data Science •
×

J'ai testé le Jev de TypeSafe AI sur 3 080 tâches de classification pour comparer la précision, la latence, l'étalonnage et la confiance avec les LLMs. Jev est un modèle System One conçu pour des décisions rapides et structurées comme la classification, le routage et les vérifications de sécurité—contrairement aux LLMs qui génèrent du texte ouvert. Dans un test de 400 éléments de Prior Bench, Jev a obtenu une précision de 95,9 % contre 77,2 % pour les règles par mots-clés. Il a traité les tâches en médiane 0,35 seconde contre 8,83 secondes pour les classificateurs traditionnels.

Sur l'étalonnage de confiance, Jev a montré des erreurs de 0,002 à 0,047 contre 0,078 à 0,163 pour quatre modèles de chat dans le benchmark de Supa Journal. Le test a évalué si les scores de confiance de Jev sont fiables pour des workflows de prise de décision comme le routage de tickets de support ou les appels d'outils d'agents. Les résultats ont montré que Jev était plus précis dans l'ensemble, bien que la confiance s'avère parfois non fiable.

Un modèle de secours a en fait dégradé les performances. Jev excelle lorsque des sorties prédéfinies sont nécessaires, tandis que les LLMs conviennent au raisonnement ouvert.