HeadlinesBriefing favicon HeadlinesBriefing.com

Jev vs LLMs: Prueba de Decisiones IA

Towards Data Science •
×

Probé el Jev de TypeSafe AI en 3,080 tareas de clasificación para comparar precisión, latencia, calibración y confianza con los LLMs. Jev es un modelo System One diseñado para decisiones rápidas y estructuradas como clasificación, enrutamiento y revisiones de seguridad, a diferencia de los LLMs que generan texto abierto. En una prueba de 400 elementos de Prior Bench, Jev logró un 95.9% de precisión frente al 77.2% de las reglas de palabras clave. Procesó tareas en una mediana de 0.35 segundos en comparación con 8.83 segundos para clasificadores tradicionales.

En calibración de confianza, Jev mostró errores de 0.002–0.047 frente a 0.078–0.163 para cuatro modelos de chat en el benchmark de Supa Journal. La prueba evaluó si las puntuaciones de confianza de Jev son confiables para flujos de trabajo de toma de decisiones como enrutamiento de tickets de soporte o llamadas a herramientas de agentes. Los resultados mostraron que Jev fue más preciso en general, aunque la confianza demostró ser poco confiable en algunos escenarios.

Un modelo de respaldo degradó el rendimiento. Jev sobresale cuando se necesitan salidas predefinidas, mientras que los LLMs son adecuados para razonamiento abierto.