チャットだけを行うAIエージェントのリスクは小さいものです。誤った回答は、もう一度質問すれば済むからです。しかし、エージェントがツールを呼び出せるようになると、一つの誤りがメールの誤送信や送金の誤操作につながりかねません。よくある対策は、最初のモデルを確認させる二つ目のモデルを前に置くことですが、それは別のインターンを監督させるためにインターンを雇うようなものに思えてきます。
ある単純な事例が問題を示しています。顧客が12ドルの購入で二重に請求され、AIエージェントに返金を依頼しました。エージェントは正しいツールと正しい顧客を選びましたが、請求1件あたり1,200セントではなく、120,000セントの金額を用意しました。顧客IDは有効で、値は整数であり、スキーマも受け入れるため、何も壊れているようには見えません。金額は100倍ずれており、ドルをセントに二度変換したときに生じるような誤りです。500ドルの上限を設ければ1,200ドルの誤りは防げますが、顧客が承認した額の10倍になる120ドルの誤りは防げません。
この隙間を受けて、筆者はType Safe AIのJevモデルに関心を持ちました。Jevは9月15日に、同社が「System One Models」と呼ぶモデル群の最初の一つとして公開されました。現在は早期アクセス段階です。Jevはテキストを生成する代わりに、アプリケーションの状態と限定された質問を受け取り、型付けされた確率的な回答を返します。これは通常のチャットモデルとは異なる役割です。入力と出力のガードレールも想定用途の一つに挙げられています。
筆者は、スキーマ検証は構造的な誤りには対応できても、両方のアドレスが有効でも誤った宛先にメールを送るような意味上の誤りには対応できないと指摘しています。Jevのようなモデルは、エージェントシステムにおける判断層として適しているかもしれません。ただし本記事の焦点は、ベンチマーク結果よりも、それをどこに置くべきか、どの判断を任せるべきではないかにあります。
出典: Towards Data Science · 要約:HeadlinesBriefing