HeadlinesBriefing favicon HeadlinesBriefing.com

فشل وكلاء الذكاء الاصطناعي في الأخطاء البسيطة

Towards Data Science •
×

أكثر من 28 تجربة تصحيح عمياء على أخطاء حقيقية من [PERSON_NAME] وimmer وdecimal.js تكشف أن وكلاء ترميز الذكاء الاصطناعي يعانون ليس من التعقيد بل من نقص المعلومات. تم إصلاح خطأين صعبين — أحدهما عميق في داخل Immer والآخر حالة حد عددي في decimal.js — بشكل صحيح في جميع المحاولات الـ16. ومع ذلك، هزم خطأ عميل HTTP بسيط aparentemente في [PERSON_NAME] الذي أسقط خيار إعادة المحاولة بصمت كل نموذج وعملية عمل عبر 12 تشغيلًا. كل إصلاح تم إنشاؤه بواسطة الذكاء الاصطناعي أفسد بيانات المستخدم لكنه نجح في مجموعة الاختبار الكاملة المكونة من 84 اختبارًا لإعادة المحاولة. لم يكن الفشل في الكشف — فقد حدد وكيل المراجعة بشكل صحيح خطر تلف البيانات لكنه وافق على التغيير على أي حال، معتبرًا المشكلة غير محتملة. هذا يسلط الضوء على نقطة عمياء حرجة: عندما تعتمد الإصلاحات على عقود API غير موثقة، يفتقر الذكاء الاصطناعي إلى الحكم لرفض الحلول plausibly ولكن الخاطئة. لم تتنبأ الصعوبة بالفشل؛ بل نقص المعلومات هو الذي تنبأ به. بالنسبة للفرق التي تدمج إصلاحات الذكاء الاصطناعي بناءً على CI الأخضر، هذا هو بالضبط نمط الفشل الذي يتسلل من خلاله — الأخطاء البسيطة المظهر التي تجتاز الاختبارات والتي تفسد البيانات بصمت في الإنتاج.