Um agente de IA que apenas conversa oferece pouco risco, já que uma resposta errada pode simplesmente ser pedida novamente. Quando esse agente passa a poder chamar ferramentas, porém, um erro pode significar um e-mail enviado ou um pagamento movimentado, e a solução usual de colocar um segundo modelo à frente para verificar o primeiro começa a parecer contratar um estagiário para supervisionar outro estagiário.
Um caso simples mostra o problema. Um cliente é cobrado duas vezes por uma compra de 12 dólares e pede um reembolso a um agente de IA. O agente escolhe a ferramenta certa e o cliente certo, mas prepara um valor de 120.000 centavos em vez de 1.200 centavos por cobrança. O ID do cliente é válido, o valor é um inteiro e o esquema o aceita, então nada parece quebrado. O valor está errado por um fator de cem, o tipo de erro que surge quando dólares são convertidos em centavos duas vezes. Um teto simples de 500 dólares pegaria a versão de 1.200 dólares, mas não um erro de 120 dólares que ainda é dez vezes o que o cliente aprovou.
Essa lacuna levou o autor ao modelo Jev, da Type Safe AI, lançado em 15 de setembro como o primeiro do que a empresa chama de System One Models. Está em acesso antecipado. Em vez de gerar texto, o Jev recebe o estado da aplicação e uma pergunta delimitada e devolve uma resposta probabilística tipada, uma tarefa diferente da de um modelo de chat comum. Barreiras de proteção para entradas e saídas estão entre seus usos previstos.
O autor observa que a validação de esquema trata erros estruturais, mas não semânticos, como enviar um e-mail ao destinatário errado quando ambos os endereços são válidos. Um modelo como o Jev pode se encaixar como camada de decisão em um sistema de agentes, embora o artigo se concentre em onde ele deve ficar e no que não deve ser deixado a seu cargo, e não em resultados de benchmark.
Fonte: Towards Data Science · Resumido por HeadlinesBriefing