وفقًا لدراسة جديدة من جامعة برينستون، فإن وعود الصناعة بتحسين الذكاء الاصطناعي المتكرر بسرعة ربما مبالغ فيها. بقيادة بيتر كيرغيس وساياش كابور، قام الفريق بتقييم قدرة الوكلاء على إجراء أبحاث ذكاء اصطناعي مفتوحة باستخدام منهجية تسمى "التقييم الظلي". طلبوا من كلود أوبوس 4.8 في أنثروبيك الإجابة على أسئلة من أوراق غير منشورة لـ NeurIPS 2026، ممنوت الوكلاء ستة أيام، $3,000 في رصيد API، والوصول إلى بطاقات GPU والويب.
على الرغم من أن الوكلاء أنجزوا بنجاح جوانب الهندسة من الأبحاث — مراجعة الأدليات، تشغيل التجارب، وتجميع النتائج — إلا أنهم فشلوا في إنتاج أعمال قابلة للنشر. رفض المؤلفون الأصليون كلا الورقتين، مشيرين إلى نقص الإبداع، وسوء الحكم، وعدم وجود مساهمات جديدة. قام الوكلاء بإجراء تجارب غريبة، وواجهوا صعوبة في الكتابة، وتعهدوا بمناهج غير واعدة بسرعة جدا.
يعزي كابور هذه الفجوة إلى طرق التدريب الحالية، ملاحظة أن التعلم المعزز يتفوق في المهام القابلة للتحقق منها لكنه يواجه صعوبة في الأبحاث المفتوحة التي تتطلب الحدس والذوق. على الرغم من هذه القيود، يشير الدراسة إلى أن الجداول الزمنية المتوترة لأتمتة أبحاث الذكاء الاصطناعي ربما كانت مبالغ فيها.
تتوافق هذه النتائج مع الملاحظات الداخلية من شركات الذكاء الاصطناعي. مذكر أنثروبيك، جاك كلارد، لاحظ فجوات مشابهة في الإبداع في جهودهم لأتمتة أبحاث الأمان، ووصفها بـ"إشارة سلبية على جداول زمنية قصيرة للتحسين الذاتي المتكرر".
المصدر: MIT Technology Review AI · لخّصه HeadlinesBriefing