Ein KI-Agent, der nur chattet, birgt wenig Risiko, denn eine falsche Antwort lässt sich einfach erneut anfordern. Sobald der Agent aber Werkzeuge aufrufen kann, kann ein Fehler eine gesendete E-Mail oder eine verschobene Zahlung bedeuten. Die übliche Lösung, ein zweites Modell vorzuschalten, das das erste prüft, wirkt dann wie die Einstellung eines Praktikanten zur Aufsicht über einen anderen Praktikanten.
Ein einfacher Fall zeigt das Problem. Einem Kunden wird ein Kauf über 12 Dollar zweimal abgebucht, und er bittet einen KI-Agenten um eine Erstattung. Der Agent wählt das richtige Werkzeug und den richtigen Kunden, bereitet aber einen Betrag von 120.000 Cent statt 1.200 Cent pro Abbuchung vor. Die Kunden-ID ist gültig, der Wert ist eine Ganzzahl und das Schema akzeptiert ihn, daher wirkt nichts fehlerhaft. Der Betrag ist um den Faktor hundert falsch, wie es entsteht, wenn Dollar zweimal in Cent umgerechnet werden. Eine einfache Obergrenze von 500 Dollar würde die Variante mit 1.200 Dollar abfangen, nicht aber den Fehler über 120 Dollar, der trotzdem das Zehnfache des vom Kunden genehmigten Betrags ist.
Diese Lücke führte den Autor zu Type Safe AIs Modell Jev, das am 15. September als erstes der sogenannten System One Models des Unternehmens veröffentlicht wurde. Es befindet sich in der frühen Zugangsphase. Statt Text zu erzeugen, erhält Jev den Zustand der Anwendung und eine eng begrenzte Frage und liefert eine typisierte probabilistische Antwort, also eine andere Aufgabe als ein gewöhnliches Chatmodell. Schutzmechanismen für Ein- und Ausgaben gehören zu den vorgesehenen Einsatzzwecken.
Der Autor weist darauf hin, dass Schema-Validierung strukturelle, aber nicht inhaltliche Fehler erkennt, etwa wenn eine E-Mail an den falschen Empfänger geht, obwohl beide Adressen gültig sind. Ein Modell wie Jev könnte als Entscheidungsschicht in einem Agentensystem passen, doch der Artikel konzentriert sich darauf, wo es eingesetzt werden sollte und welchen Entscheidungen man es nicht überlassen darf, nicht auf Benchmark-Ergebnisse.
Quelle: Towards Data Science · Zusammengefasst von HeadlinesBriefing