HeadlinesBriefing favicon HeadlinesBriefing.com

Jev 对比 LLM:AI 决策测试结果

Towards Data Science •
×

我在 3,080 项分类任务上测试了 TypeSafe AI 的 Jev,以比较其与大语言模型在准确性、延迟、校准和置信度方面的表现。Jev 是一种 System One 模型,专为快速、结构化的决策而设计,如分类、路由和安全检查——与生成开放式文本的大语言模型不同。在一项包含 400 个条目的 Prior Bench 测试中,Jev 的准确率达到 95.9%,而关键词规则仅为 77.2%。它处理任务的中位时间为 0.35 秒,而传统分类器为 8.83 秒。在置信度校准方面,Jev 的误差为 0.002–0.047,而 Supa Journal 基准测试中四个聊天模型的误差为 0.078–0.163。该测试评估了 Jev 的置信度评分在支持工单路由或代理工具调用等决策工作流中是否可靠。结果显示,Jev 在整体上更准确,尽管在某些场景中置信度仍不可靠。一个回退模型实际上降低了性能。在需要预定义输出时,Jev 表现优异,而大语言模型则更适合开放式推理。