Can TypeSafe's Jev Make AI Agents Safer Without Another LLM?
🇬🇧 English
An AI agent that only chats carries little risk, since a wrong answer can simply be asked again. Once that agent can call tools, however, a mistake can mean a sent email or a moved payment, and the usual fix of placing a second model in front to check the first starts to look like hiring an intern to supervise an intern.
One simple case shows the problem. A customer is charged twice for a $12 purchase and asks an AI agent for a refund. The agent picks the right tool and the right customer, but prepares an amount of 120,000 cents rather than 1,200 cents per charge. The customer ID is valid, the value is an integer, and the schema accepts it, so nothing looks broken. The amount is off by a factor of one hundred, the kind of error that appears when dollars are converted to cents twice. A simple $500 cap would catch the $1,200 version, but not a $120 error that is still ten times what the customer approved.
That gap led the author to Type Safe AI's Jev model, released on September 15 as the first of what the company calls System One Models. It is in early access. Rather than generating text, Jev takes application state and a bounded question and returns a typed probabilistic answer, a different job from a normal chat model. Guardrails for inputs and outputs are among its intended uses.
The author notes that schema validation handles structural errors but not semantic ones, such as emailing the wrong recipient when both addresses are valid. A model like Jev may fit as a decision layer in an agent system, though the article focuses on where it belongs and what it should not be trusted to decide rather than on benchmark results.
🇸🇦 العربية
هل يستطيع Jev من TypeSafe جعل وكلاء الذكاء الاصطناعي أكثر أمانًا؟
الوكيل الذكي الذي يكتفي بالدردشة يحمل مخاطر ضئيلة، لأن الإجابة الخاطئة يمكن ببساطة طلبها مرة أخرى. أما حين يستطيع الوكيل استدعاء الأدوات، فقد يعني الخطأ بريدًا أُرسل أو دفعة نُقلت، ويبدو الحل المعتاد، وهو وضع نموذج ثانٍ أمامه للتحقق من الأول، أشبه بتعيين متدرب لمراقبة متدرب آخر.
توضح حالة بسيطة هذه المشكلة. يُحتسب على عميل رسوم مرتين عن عملية شراء بقيمة 12 دولارًا، فيطلب من وكيل ذكي استرداد المبلغ. يختار الوكيل الأداة الصحيحة والعميل الصحيح، لكنه يُعد مبلغًا قدره 120,000 سنت بدلًا من 1,200 سنت لكل رسم. معرّف العميل صالح، والقيمة عدد صحيح، والمخطط يقبلها، فلا يبدو أن هناك خللًا. المبلغ مختل بمقدار مئة ضعف، وهو خطأ يظهر عادة عند تحويل الدولارات إلى سنتات مرتين. سقف بسيط قدره 500 دولار كان سيوقف نسخة 1,200 دولار، لكنه لن يوقف خطأ 120 دولارًا الذي يبقى عشرة أضعاف ما وافق عليه العميل.
قادت هذه الفجوة الكاتب إلى نموذج Jev من شركة Type Safe AI، الذي أُطلق في 15 سبتمبر بوصفه أول ما تسميه الشركة نماذج النظام الأول (System One Models). وهو حاليًا في مرحلة الوصول المبكر. لا يولّد النموذج نصًا، بل يأخذ حالة التطبيق وسؤالًا محدد النطاق ويعيد إجابة احتمالية مُصنَّفة، وهي مهمة تختلف عن نموذج الدردشة المعتاد. ومن استخداماته المعلنة حواجز الحماية للمدخلات والمخرجات.
يلاحظ الكاتب أن التحقق من المخطط يعالج الأخطاء البنيوية لا الدلالية، مثل إرسال بريد إلى المستلم الخطأ مع صلاحية العنوانين. وقد يناسب نموذج كـ Jev أن يكون طبقة قرار في نظام الوكلاء، غير أن المقال يركز على موضع هذه الطبقة وعلى القرارات التي لا ينبغي الوثوق بها فيها، لا على نتائج اختبارات الأداء.
لماذا لا يكفي التحقق من المخطط للحفاظ على أمان استدعاءات أدوات وكلاء الذكاء الاصطناعي؟
يتحقق التحقق من المخطط من البنية، كأن يكون الحقل عددًا صحيحًا أو أن تكون القائمة موجودة. ولا يستطيع معرفة ما إذا كان الإجراء الصالح يطابق ما طلبه المستخدم فعلًا، كأن يكون مبلغ الاسترداد مختلًا بمقدار مئة ضعف أو أن يُرسل البريد إلى المستلم الخطأ.
🇧🇩 বাংলা
TypeSafe-এর Jev কি AI এজেন্টকে আরও নিরাপদ করতে পারে?
যে AI এজেন্ট শুধু কথা বলে তার ঝুঁকি খুবই কম, কারণ ভুল উত্তর আবার জিজ্ঞেস করা যায়। কিন্তু এজেন্ট যখন টুল ব্যবহার করতে পারে, তখন একটি ভুল মানে পাঠানো ইমেল বা সরানো পেমেন্ট হতে পারে। তখন সাধারণ সমাধান হলো প্রথম মডেলকে যাচাই করার জন্য দ্বিতীয় একটি মডেল বসানো, যা একজন ইন্টার্নকে তদারকি করার জন্য আরেকজন ইন্টার্ন নিয়োগের মতো মনে হয়।
একটি সহজ ঘটনা সমস্যাটি দেখায়। একজন গ্রাহককে 12 ডলারের একটি কেনাকাটার জন্য দুবার চার্জ করা হয় এবং তিনি একটি AI এজেন্টের কাছে রিফান্ড চান। এজেন্ট সঠিক টুল ও সঠিক গ্রাহক বেছে নেয়, কিন্তু প্রতি চার্জের জন্য 1,200 সেন্টের বদলে 120,000 সেন্টের পরিমাণ প্রস্তুত করে। গ্রাহক আইডি বৈধ, মানটি পূর্ণসংখ্যা, এবং স্কিমা তা গ্রহণ করে, তাই কিছুই ভাঙা মনে হয় না। পরিমাণটি একশো গুণ ভুল, যা ডলারকে দুবার সেন্টে রূপান্তর করলে যেমন হয়। 500 ডলারের একটি সাধারণ সীমা 1,200 ডলারের সংস্করণটি ধরতে পারত, কিন্তু 120 ডলারের ভুলটি ধরতে পারত না, যদিও সেটিও গ্রাহকের অনুমোদিত পরিমাণের দশগুণ।
এই ফাঁকটিই লেখককে Type Safe AI-এর Jev মডেলের দিকে নিয়ে যায়, যা 15 সেপ্টেম্বর কোম্পানির "System One Models"-এর প্রথম সংস্করণ হিসেবে প্রকাশিত হয়। এটি এখনও প্রারম্ভিক অ্যাক্সেসে আছে। টেক্সট তৈরি করার বদলে Jev অ্যাপ্লিকেশনের অবস্থা ও একটি সীমাবদ্ধ প্রশ্ন নেয় এবং একটি টাইপড সম্ভাব্যতামূলক উত্তর ফেরত দেয়, যা সাধারণ চ্যাট মডেলের কাজ থেকে আলাদা। ইনপুট ও আউটপুটের জন্য নিরাপত্তা নির্দেশিকা এর উদ্দিষ্ট ব্যবহারের মধ্যে রয়েছে।
লেখক উল্লেখ করেন যে স্কিমা যাচাই কাঠামোগত ভুল ধরে, কিন্তু অর্থগত ভুল ধরে না, যেমন দুটি ঠিকানা বৈধ হলেও ভুল প্রাপককে ইমেল পাঠানো। Jev-এর মতো একটি মডেল এজেন্ট সিস্টেমে সিদ্ধান্ত স্তর হিসেবে উপযুক্ত হতে পারে, যদিও এই নিবন্ধটি বেঞ্চমার্ক ফলাফলের চেয়ে বরং এটি কোথায় বসবে এবং কোন সিদ্ধান্তে এর উপর ভরসা করা উচিত নয়, সেদিকে মনোযোগ দেয়।
AI এজেন্টের টুল কল নিরাপদ রাখতে শুধু স্কিমা যাচাই যথেষ্ট নয় কেন?
স্কিমা যাচাই গঠন পরীক্ষা করে, যেমন কোনো ক্ষেত্র পূর্ণসংখ্যা কিনা বা একটি তালিকা আছে কিনা। একটি বৈধ কাজ ব্যবহারকারী সত্যিই যা চেয়েছিলেন তার সঙ্গে মেলে কিনা, তা এটি বলতে পারে না, যেমন রিফান্ডের পরিমাণ একশো গুণ ভুল হওয়া বা ইমেল ভুল প্রাপকের কাছে যাওয়া।
🇩🇪 Deutsch
Kann Jev von TypeSafe KI-Agenten sicherer machen?
Ein KI-Agent, der nur chattet, birgt wenig Risiko, denn eine falsche Antwort lässt sich einfach erneut anfordern. Sobald der Agent aber Werkzeuge aufrufen kann, kann ein Fehler eine gesendete E-Mail oder eine verschobene Zahlung bedeuten. Die übliche Lösung, ein zweites Modell vorzuschalten, das das erste prüft, wirkt dann wie die Einstellung eines Praktikanten zur Aufsicht über einen anderen Praktikanten.
Ein einfacher Fall zeigt das Problem. Einem Kunden wird ein Kauf über 12 Dollar zweimal abgebucht, und er bittet einen KI-Agenten um eine Erstattung. Der Agent wählt das richtige Werkzeug und den richtigen Kunden, bereitet aber einen Betrag von 120.000 Cent statt 1.200 Cent pro Abbuchung vor. Die Kunden-ID ist gültig, der Wert ist eine Ganzzahl und das Schema akzeptiert ihn, daher wirkt nichts fehlerhaft. Der Betrag ist um den Faktor hundert falsch, wie es entsteht, wenn Dollar zweimal in Cent umgerechnet werden. Eine einfache Obergrenze von 500 Dollar würde die Variante mit 1.200 Dollar abfangen, nicht aber den Fehler über 120 Dollar, der trotzdem das Zehnfache des vom Kunden genehmigten Betrags ist.
Diese Lücke führte den Autor zu Type Safe AIs Modell Jev, das am 15. September als erstes der sogenannten System One Models des Unternehmens veröffentlicht wurde. Es befindet sich in der frühen Zugangsphase. Statt Text zu erzeugen, erhält Jev den Zustand der Anwendung und eine eng begrenzte Frage und liefert eine typisierte probabilistische Antwort, also eine andere Aufgabe als ein gewöhnliches Chatmodell. Schutzmechanismen für Ein- und Ausgaben gehören zu den vorgesehenen Einsatzzwecken.
Der Autor weist darauf hin, dass Schema-Validierung strukturelle, aber nicht inhaltliche Fehler erkennt, etwa wenn eine E-Mail an den falschen Empfänger geht, obwohl beide Adressen gültig sind. Ein Modell wie Jev könnte als Entscheidungsschicht in einem Agentensystem passen, doch der Artikel konzentriert sich darauf, wo es eingesetzt werden sollte und welchen Entscheidungen man es nicht überlassen darf, nicht auf Benchmark-Ergebnisse.
Warum reicht Schema-Validierung nicht aus, um Tool-Aufrufe von KI-Agenten sicher zu halten?
Schema-Validierung prüft die Struktur, etwa ob ein Feld eine Ganzzahl ist oder eine Liste vorhanden ist. Sie kann nicht feststellen, ob eine gültige Aktion dem entspricht, was der Nutzer tatsächlich verlangt hat, etwa einen Erstattungsbetrag, der um den Faktor hundert falsch ist, oder eine E-Mail an den falschen Empfänger.
🇪🇸 Español
¿Puede Jev de TypeSafe hacer más seguros a los agentes de IA?
Un agente de IA que solo chatea conlleva poco riesgo, ya que una respuesta equivocada puede volver a pedirse sin más. Sin embargo, en cuanto ese agente puede llamar a herramientas, un error puede significar un correo enviado o un pago transferido, y la solución habitual de colocar un segundo modelo delante para revisar al primero empieza a parecer como contratar a un becario para supervisar a otro becario.
Un caso sencillo muestra el problema. Un cliente recibe dos cargos por una compra de 12 dólares y pide un reembolso a un agente de IA. El agente elige la herramienta correcta y el cliente correcto, pero prepara un importe de 120 000 centavos en lugar de 1200 centavos por cargo. El ID del cliente es válido, el valor es un entero y el esquema lo acepta, así que nada parece roto. El importe está desviado en un factor de cien, el tipo de error que aparece cuando los dólares se convierten a centavos dos veces. Un tope sencillo de 500 dólares detectaría la versión de 1200 dólares, pero no un error de 120 dólares que sigue siendo diez veces lo que el cliente aprobó.
Esa brecha llevó al autor al modelo Jev de Type Safe AI, lanzado el 15 de septiembre como el primero de lo que la empresa llama System One Models. Está en acceso anticipado. En lugar de generar texto, Jev toma el estado de la aplicación y una pregunta acotada, y devuelve una respuesta probabilística tipada, una tarea distinta a la de un modelo de chat normal. Las salvaguardas para entradas y salidas figuran entre sus usos previstos.
El autor señala que la validación de esquemas maneja errores estructurales pero no semánticos, como enviar un correo al destinatario equivocado cuando ambas direcciones son válidas. Un modelo como Jev podría encajar como capa de decisión en un sistema de agentes, aunque el artículo se centra en dónde debe ubicarse y en qué decisiones no debe confiársele, más que en resultados de pruebas comparativas.
¿Por qué no basta la validación de esquemas para mantener seguras las llamadas a herramientas de los agentes de IA?
La validación de esquemas comprueba la estructura, por ejemplo si un campo es un entero o si existe una lista. No puede determinar si una acción válida coincide con lo que el usuario realmente pidió, como un importe de reembolso desviado en un factor de cien o un correo enviado al destinatario equivocado.
🇫🇷 Français
Le modèle Jev de TypeSafe peut-il rendre les agents IA plus sûrs ?
Un agent IA qui se contente de discuter présente peu de risques, car une mauvaise réponse peut simplement être redemandée. Dès que cet agent peut appeler des outils, en revanche, une erreur peut signifier un e-mail envoyé ou un paiement déplacé, et la solution habituelle, placer un second modèle devant pour vérifier le premier, ressemble à embaucher un stagiaire pour superviser un autre stagiaire.
Un cas simple illustre le problème. Un client est débité deux fois pour un achat de 12 dollars et demande un remboursement à un agent IA. L'agent choisit le bon outil et le bon client, mais prépare un montant de 120 000 cents au lieu de 1 200 cents par débit. L'identifiant client est valide, la valeur est un entier et le schéma l'accepte, donc rien ne semble cassé. Le montant est faussé d'un facteur cent, le type d'erreur qui apparaît lorsque des dollars sont convertis en cents deux fois. Un plafond simple de 500 dollars aurait bloqué la version à 1 200 dollars, mais pas une erreur de 120 dollars qui reste dix fois supérieure à ce que le client avait approuvé.
Cet écart a conduit l'auteur vers le modèle Jev de Type Safe AI, lancé le 15 septembre comme le premier de ce que l'entreprise appelle les System One Models. Il est en accès anticipé. Plutôt que de générer du texte, Jev reçoit l'état de l'application et une question bornée, puis renvoie une réponse probabiliste typée, une tâche différente de celle d'un modèle de chat classique. Les garde-fous pour les entrées et les sorties font partie de ses usages prévus.
L'auteur remarque que la validation de schéma gère les erreurs structurelles mais non sémantiques, comme envoyer un e-mail au mauvais destinataire alors que les deux adresses sont valides. Un modèle comme Jev pourrait trouver sa place comme couche de décision dans un système d'agents, même si l'article s'intéresse surtout à l'endroit où le placer et aux décisions auxquelles il ne faut pas lui faire confiance, plutôt qu'aux résultats de benchmarks.
Pourquoi la validation de schéma ne suffit-elle pas à sécuriser les appels d'outils des agents IA ?
La validation de schéma vérifie la structure, par exemple si un champ est un entier ou si une liste existe. Elle ne peut pas déterminer si une action valide correspond à ce que l'utilisateur a réellement demandé, comme un montant de remboursement faussé d'un facteur cent ou un e-mail envoyé au mauvais destinataire.
🇮🇳 हिन्दी
क्या TypeSafe का Jev AI एजेंट्स को सुरक्षित बना सकता है?
केवल बात करने वाले AI एजेंट से बहुत कम जोखिम होता है, क्योंकि गलत उत्तर को दोबारा पूछा जा सकता है। लेकिन जैसे ही एजेंट को टूल चलाने की अनुमति मिलती है, एक गलती का मतलब भेजा गया ईमेल या स्थानांतरित भुगतान हो सकता है। आम समाधान है कि पहले मॉडल की जाँच के लिए दूसरा मॉडल लगाया जाए, पर यह ऐसा लगता है जैसे एक इंटर्न की निगरानी के लिए दूसरा इंटर्न रखा जा रहा हो।
एक सरल उदाहरण समस्या दिखाता है। एक ग्राहक से 12 डॉलर की खरीद पर दो बार शुल्क लिया गया और उसने AI एजेंट से रिफंड माँगा। एजेंट ने सही टूल और सही ग्राहक चुना, लेकिन हर शुल्क के 1,200 सेंट की जगह 120,000 सेंट की राशि तैयार की। ग्राहक ID मान्य है, मान पूर्णांक है और स्कीमा उसे स्वीकार करता है, इसलिए सब कुछ ठीक दिखता है। राशि सौ गुना गलत है, जो डॉलर को दो बार सेंट में बदलने पर होने वाली गलती जैसी है। 500 डॉलर की सीमा 1,200 डॉलर वाली गलती पकड़ लेती, लेकिन 120 डॉलर की गलती नहीं पकड़ती, जो फिर भी ग्राहक द्वारा स्वीकृत राशि से दस गुना है।
इसी कमी ने लेखक को Type Safe AI के Jev मॉडल तक पहुँचाया, जो 15 सितंबर को कंपनी के "सिस्टम वन मॉडल्स" की पहली कड़ी के रूप में जारी हुआ। यह अभी शुरुआती पहुँच (early access) में है। यह टेक्स्ट बनाने के बजाय एप्लिकेशन की स्थिति और एक सीमित प्रश्न लेता है और एक टाइप्ड संभाव्य उत्तर लौटाता है, जो सामान्य चैट मॉडल से अलग काम है। इनपुट और आउटपुट के लिए सुरक्षा उपाय इसके इच्छित उपयोगों में शामिल हैं।
लेखक का कहना है कि स्कीमा सत्यापन संरचनात्मक गलतियाँ पकड़ता है, पर अर्थ संबंधी गलतियाँ नहीं, जैसे दोनों पते मान्य होने पर भी गलत प्राप्तकर्ता को ईमेल भेजना। Jev जैसा मॉडल एजेंट सिस्टम में निर्णय परत के रूप में उपयोगी हो सकता है, हालाँकि लेख बेंचमार्क परिणामों के बजाय इस पर केंद्रित है कि वह कहाँ फिट बैठता है और किन फैसलों के लिए उस पर भरोसा नहीं करना चाहिए।
AI एजेंट की टूल कॉल्स को सुरक्षित रखने के लिए केवल स्कीमा सत्यापन पर्याप्त क्यों नहीं है?
स्कीमा सत्यापन संरचना जाँचता है, जैसे कोई फ़ील्ड पूर्णांक है या सूची मौजूद है। वह यह नहीं बता सकता कि एक मान्य कार्रवाई वही है जो उपयोगकर्ता ने वास्तव में माँगा था, जैसे रिफंड राशि सौ गुना गलत होना या ईमेल का गलत प्राप्तकर्ता को चले जाना।
🇮🇩 Bahasa Indonesia
Bisakah Jev dari TypeSafe membuat agen AI lebih aman?
Agen AI yang hanya mengobrol membawa risiko kecil, karena jawaban yang salah cukup diminta ulang. Namun begitu agen itu bisa memanggil alat, satu kesalahan bisa berarti email terkirim atau pembayaran berpindah. Solusi umum dengan menempatkan model kedua di depan untuk memeriksa model pertama terasa seperti mempekerjakan magang untuk mengawasi magang lainnya.
Satu kasus sederhana memperlihatkan masalahnya. Seorang pelanggan ditagih dua kali untuk pembelian senilai 12 dolar dan meminta pengembalian dana kepada agen AI. Agen memilih alat yang tepat dan pelanggan yang tepat, tetapi menyiapkan jumlah 120.000 sen, bukan 1.200 sen per tagihan. ID pelanggan valid, nilainya berupa bilangan bulat, dan skema menerimanya, sehingga tidak ada yang tampak rusak. Jumlahnya meleset seratus kali lipat, jenis kesalahan yang muncul ketika dolar dikonversi ke sen dua kali. Batas sederhana 500 dolar akan menangkap versi 1.200 dolar, tetapi tidak kesalahan 120 dolar yang tetap sepuluh kali lipat dari jumlah yang disetujui pelanggan.
Celah itu membawa penulis ke model Jev dari Type Safe AI, yang dirilis pada 15 September sebagai yang pertama dari apa yang disebut perusahaan sebagai System One Models. Model ini masih dalam tahap akses awal. Alih-alih menghasilkan teks, Jev menerima kondisi aplikasi dan pertanyaan yang terbatas, lalu mengembalikan jawaban probabilistik yang bertipe, tugas yang berbeda dari model chat biasa. Pengaman untuk masukan dan keluaran termasuk dalam penggunaan yang dimaksudkan.
Penulis mencatat bahwa validasi skema menangani kesalahan struktural tetapi tidak kesalahan semantik, misalnya mengirim email ke penerima yang salah meski kedua alamat valid. Model seperti Jev bisa cocok sebagai lapisan keputusan dalam sistem agen, meski artikel ini berfokus pada di mana model itu seharusnya ditempatkan dan keputusan apa yang tidak boleh dipercayakan kepadanya, bukan pada hasil benchmark.
Mengapa validasi skema saja tidak cukup untuk menjaga panggilan alat agen AI tetap aman?
Validasi skema memeriksa struktur, misalnya apakah sebuah kolom berupa bilangan bulat atau apakah daftar tersedia. Validasi ini tidak bisa menentukan apakah tindakan yang valid sesuai dengan yang benar-benar diminta pengguna, seperti jumlah pengembalian dana yang meleset seratus kali lipat atau email yang dikirim ke penerima yang salah.
🇯🇵 日本語
TypeSafeのJevはAIエージェントをより安全にできるか?
チャットだけを行うAIエージェントのリスクは小さいものです。誤った回答は、もう一度質問すれば済むからです。しかし、エージェントがツールを呼び出せるようになると、一つの誤りがメールの誤送信や送金の誤操作につながりかねません。よくある対策は、最初のモデルを確認させる二つ目のモデルを前に置くことですが、それは別のインターンを監督させるためにインターンを雇うようなものに思えてきます。
ある単純な事例が問題を示しています。顧客が12ドルの購入で二重に請求され、AIエージェントに返金を依頼しました。エージェントは正しいツールと正しい顧客を選びましたが、請求1件あたり1,200セントではなく、120,000セントの金額を用意しました。顧客IDは有効で、値は整数であり、スキーマも受け入れるため、何も壊れているようには見えません。金額は100倍ずれており、ドルをセントに二度変換したときに生じるような誤りです。500ドルの上限を設ければ1,200ドルの誤りは防げますが、顧客が承認した額の10倍になる120ドルの誤りは防げません。
この隙間を受けて、筆者はType Safe AIのJevモデルに関心を持ちました。Jevは9月15日に、同社が「System One Models」と呼ぶモデル群の最初の一つとして公開されました。現在は早期アクセス段階です。Jevはテキストを生成する代わりに、アプリケーションの状態と限定された質問を受け取り、型付けされた確率的な回答を返します。これは通常のチャットモデルとは異なる役割です。入力と出力のガードレールも想定用途の一つに挙げられています。
筆者は、スキーマ検証は構造的な誤りには対応できても、両方のアドレスが有効でも誤った宛先にメールを送るような意味上の誤りには対応できないと指摘しています。Jevのようなモデルは、エージェントシステムにおける判断層として適しているかもしれません。ただし本記事の焦点は、ベンチマーク結果よりも、それをどこに置くべきか、どの判断を任せるべきではないかにあります。
AIエージェントのツール呼び出しを安全に保つ上で、スキーマ検証だけで十分でないのはなぜですか?
スキーマ検証は、フィールドが整数であるか、リストが存在するかといった構造を確認します。しかし、有効な操作がユーザーが実際に依頼した内容と一致するかどうかは判断できません。たとえば、返金額が100倍ずれている場合や、誤った宛先にメールが送られた場合がそれにあたります。
🇧🇷 Português
O Jev da TypeSafe pode tornar os agentes de IA mais seguros?
Um agente de IA que apenas conversa oferece pouco risco, já que uma resposta errada pode simplesmente ser pedida novamente. Quando esse agente passa a poder chamar ferramentas, porém, um erro pode significar um e-mail enviado ou um pagamento movimentado, e a solução usual de colocar um segundo modelo à frente para verificar o primeiro começa a parecer contratar um estagiário para supervisionar outro estagiário.
Um caso simples mostra o problema. Um cliente é cobrado duas vezes por uma compra de 12 dólares e pede um reembolso a um agente de IA. O agente escolhe a ferramenta certa e o cliente certo, mas prepara um valor de 120.000 centavos em vez de 1.200 centavos por cobrança. O ID do cliente é válido, o valor é um inteiro e o esquema o aceita, então nada parece quebrado. O valor está errado por um fator de cem, o tipo de erro que surge quando dólares são convertidos em centavos duas vezes. Um teto simples de 500 dólares pegaria a versão de 1.200 dólares, mas não um erro de 120 dólares que ainda é dez vezes o que o cliente aprovou.
Essa lacuna levou o autor ao modelo Jev, da Type Safe AI, lançado em 15 de setembro como o primeiro do que a empresa chama de System One Models. Está em acesso antecipado. Em vez de gerar texto, o Jev recebe o estado da aplicação e uma pergunta delimitada e devolve uma resposta probabilística tipada, uma tarefa diferente da de um modelo de chat comum. Barreiras de proteção para entradas e saídas estão entre seus usos previstos.
O autor observa que a validação de esquema trata erros estruturais, mas não semânticos, como enviar um e-mail ao destinatário errado quando ambos os endereços são válidos. Um modelo como o Jev pode se encaixar como camada de decisão em um sistema de agentes, embora o artigo se concentre em onde ele deve ficar e no que não deve ser deixado a seu cargo, e não em resultados de benchmark.
Por que a validação de esquema não basta para manter seguras as chamadas de ferramentas de agentes de IA?
A validação de esquema verifica a estrutura, como se um campo é um inteiro ou se uma lista existe. Ela não consegue determinar se uma ação válida corresponde ao que o usuário realmente pediu, como um valor de reembolso errado por um fator de cem ou um e-mail enviado ao destinatário errado.
🇷🇺 Русский
Может ли Jev от TypeSafe сделать ИИ-агентов безопаснее?
Агент ИИ, который только общается, несет мало риска, ведь неверный ответ можно просто запросить заново. Однако когда агент получает доступ к инструментам, ошибка может означать отправленное письмо или перечисленный платеж, и обычное решение, поставить перед первой моделью вторую для проверки, начинает казаться наймом стажера для контроля другого стажера.
Один простой случай показывает проблему. Клиента дважды списали за покупку на 12 долларов, и он попросил ИИ-агента оформить возврат. Агент выбрал правильный инструмент и правильного клиента, но подготовил сумму 120 000 центов вместо 1 200 центов за каждое списание. Идентификатор клиента действителен, значение является целым числом, и схема его принимает, поэтому ничего не выглядит сломанным. Сумма ошибочна в сто раз, такая ошибка возникает, когда доллары дважды переводятся в центы. Простой лимит в 500 долларов поймал бы версию на 1 200 долларов, но не ошибку на 120 долларов, которая все равно в десять раз больше одобренной клиентом суммы.
Этот пробел привел автора к модели Jev от Type Safe AI, выпущенной 15 сентября как первая из того, что компания называет моделями System One Models. Она пока находится в раннем доступе. Вместо генерации текста Jev получает состояние приложения и ограниченный вопрос и возвращает типизированный вероятностный ответ, что отличается от работы обычной чат-модели. Защита входных и выходных данных входит в число ее заявленных сценариев.
Автор отмечает, что проверка по схеме выявляет структурные ошибки, но не смысловые, например отправку письма неправильному получателю при действительных обоих адресах. Такая модель, как Jev, может подойти как уровень принятия решений в системе агентов, хотя статья посвящена тому, где ее разместить и каким решениям не стоит ее доверять, а не результатам тестирований.
Почему проверки по схеме недостаточно для безопасности вызовов инструментов ИИ-агентов?
Проверка по схеме контролирует структуру, например то, является ли поле целым числом или существует ли список. Она не может определить, соответствует ли допустимое действие тому, что пользователь действительно запросил, например сумме возврата, ошибочной в сто раз, или письму, отправленному неверному получателю.
🇨🇳 简体中文
TypeSafe 的 Jev 能让 AI 智能体更安全吗?
只会聊天的 AI 智能体风险很小,因为错误的回答可以直接重新询问。然而,一旦智能体能够调用工具,一次失误就可能意味着邮件被发出或款项被转移。通常的解决办法是在前面再放一个模型来检查第一个模型,但这就像是雇一个实习生去监督另一个实习生。
一个简单的案例说明了这个问题。一位客户因一笔 12 美元的消费被重复扣款两次,于是向 AI 智能体申请退款。智能体选对了工具和客户,却将每笔扣款的金额准备为 120,000 美分,而不是 1,200 美分。客户 ID 有效,数值是整数,架构也接受它,因此看起来一切正常。金额偏差了一百倍,这正是美元被两次转换为美分时常见的错误。一个简单的 500 美元上限可以拦住 1,200 美元的版本,但拦不住这个仍是客户所批准金额十倍的 120 美元错误。
这一差距促使作者关注 Type Safe AI 的 Jev 模型。该模型于 9 月 15 日发布,是该公司所称"系统一模型"(System One Models)的第一款,目前处于早期访问阶段。它不生成文本,而是接收应用状态和一个有界问题,并返回一个带类型的概率性答案,这与普通聊天模型的工作性质不同。输入和输出的防护是其预期用途之一。
作者指出,模式验证能处理结构性错误,却无法处理语义性错误,例如两个地址都有效却把邮件发给了错误的收件人。像 Jev 这样的模型或许适合作为智能体系统中的决策层,不过文章关注的是它应放在哪里、哪些决定不应完全交给它,而非基准测试结果。
为什么仅靠模式验证不足以保证 AI 智能体的工具调用安全?
模式验证检查的是结构,例如某个字段是否为整数或列表是否存在。它无法判断一个格式合法的操作是否符合用户的真实请求,例如退款金额偏差一百倍,或邮件发给了错误的收件人。