যে AI এজেন্ট শুধু কথা বলে তার ঝুঁকি খুবই কম, কারণ ভুল উত্তর আবার জিজ্ঞেস করা যায়। কিন্তু এজেন্ট যখন টুল ব্যবহার করতে পারে, তখন একটি ভুল মানে পাঠানো ইমেল বা সরানো পেমেন্ট হতে পারে। তখন সাধারণ সমাধান হলো প্রথম মডেলকে যাচাই করার জন্য দ্বিতীয় একটি মডেল বসানো, যা একজন ইন্টার্নকে তদারকি করার জন্য আরেকজন ইন্টার্ন নিয়োগের মতো মনে হয়।
একটি সহজ ঘটনা সমস্যাটি দেখায়। একজন গ্রাহককে 12 ডলারের একটি কেনাকাটার জন্য দুবার চার্জ করা হয় এবং তিনি একটি AI এজেন্টের কাছে রিফান্ড চান। এজেন্ট সঠিক টুল ও সঠিক গ্রাহক বেছে নেয়, কিন্তু প্রতি চার্জের জন্য 1,200 সেন্টের বদলে 120,000 সেন্টের পরিমাণ প্রস্তুত করে। গ্রাহক আইডি বৈধ, মানটি পূর্ণসংখ্যা, এবং স্কিমা তা গ্রহণ করে, তাই কিছুই ভাঙা মনে হয় না। পরিমাণটি একশো গুণ ভুল, যা ডলারকে দুবার সেন্টে রূপান্তর করলে যেমন হয়। 500 ডলারের একটি সাধারণ সীমা 1,200 ডলারের সংস্করণটি ধরতে পারত, কিন্তু 120 ডলারের ভুলটি ধরতে পারত না, যদিও সেটিও গ্রাহকের অনুমোদিত পরিমাণের দশগুণ।
এই ফাঁকটিই লেখককে Type Safe AI-এর Jev মডেলের দিকে নিয়ে যায়, যা 15 সেপ্টেম্বর কোম্পানির "System One Models"-এর প্রথম সংস্করণ হিসেবে প্রকাশিত হয়। এটি এখনও প্রারম্ভিক অ্যাক্সেসে আছে। টেক্সট তৈরি করার বদলে Jev অ্যাপ্লিকেশনের অবস্থা ও একটি সীমাবদ্ধ প্রশ্ন নেয় এবং একটি টাইপড সম্ভাব্যতামূলক উত্তর ফেরত দেয়, যা সাধারণ চ্যাট মডেলের কাজ থেকে আলাদা। ইনপুট ও আউটপুটের জন্য নিরাপত্তা নির্দেশিকা এর উদ্দিষ্ট ব্যবহারের মধ্যে রয়েছে।
লেখক উল্লেখ করেন যে স্কিমা যাচাই কাঠামোগত ভুল ধরে, কিন্তু অর্থগত ভুল ধরে না, যেমন দুটি ঠিকানা বৈধ হলেও ভুল প্রাপককে ইমেল পাঠানো। Jev-এর মতো একটি মডেল এজেন্ট সিস্টেমে সিদ্ধান্ত স্তর হিসেবে উপযুক্ত হতে পারে, যদিও এই নিবন্ধটি বেঞ্চমার্ক ফলাফলের চেয়ে বরং এটি কোথায় বসবে এবং কোন সিদ্ধান্তে এর উপর ভরসা করা উচিত নয়, সেদিকে মনোযোগ দেয়।
উৎস: Towards Data Science · সারাংশ: HeadlinesBriefing