只会聊天的 AI 智能体风险很小,因为错误的回答可以直接重新询问。然而,一旦智能体能够调用工具,一次失误就可能意味着邮件被发出或款项被转移。通常的解决办法是在前面再放一个模型来检查第一个模型,但这就像是雇一个实习生去监督另一个实习生。
一个简单的案例说明了这个问题。一位客户因一笔 12 美元的消费被重复扣款两次,于是向 AI 智能体申请退款。智能体选对了工具和客户,却将每笔扣款的金额准备为 120,000 美分,而不是 1,200 美分。客户 ID 有效,数值是整数,架构也接受它,因此看起来一切正常。金额偏差了一百倍,这正是美元被两次转换为美分时常见的错误。一个简单的 500 美元上限可以拦住 1,200 美元的版本,但拦不住这个仍是客户所批准金额十倍的 120 美元错误。
这一差距促使作者关注 Type Safe AI 的 Jev 模型。该模型于 9 月 15 日发布,是该公司所称"系统一模型"(System One Models)的第一款,目前处于早期访问阶段。它不生成文本,而是接收应用状态和一个有界问题,并返回一个带类型的概率性答案,这与普通聊天模型的工作性质不同。输入和输出的防护是其预期用途之一。
作者指出,模式验证能处理结构性错误,却无法处理语义性错误,例如两个地址都有效却把邮件发给了错误的收件人。像 Jev 这样的模型或许适合作为智能体系统中的决策层,不过文章关注的是它应放在哪里、哪些决定不应完全交给它,而非基准测试结果。
来源: Towards Data Science · 由HeadlinesBriefing整理摘要