HeadlinesBriefing favicon HeadlinesBriefing.com

Terminal-Bench-Science: معيار وكيل الذكاء الاصطناعي للبحث

Hacker News •
×

Terminal-Bench-Science هو معيار يقوده باحثون من جامعة ستانفورد يقيّم وكلاء الذكاء الاصطناعي على سير عمل مستمد من البحث العلمي الحقيقي. تم بناؤه من قبل الفريق وراء Terminal-Bench بالتعاون مع خبراء في المجالات عبر التخصصات العلمية، ويقيس قدرات وكلاء الذكاء الاصطناعي من خلال سير عمل تم تنظيمه من قبل خبراء بدلاً من تمارين الكتب المدرسية.

الإصدار الأول يتضمن 70 مهمة تغطي العلوم الحيوية، والفيزيائية، والأرضية، والرياضية، والهندسية. أقوى نموذج تم تقييمه، Claude Opus 5، يحقق معدل حل بنسبة 30% على Terminal-Bench-Science 0.1. النماذج الأخرى مثل GPT-5.6 Sol Codex وClaude Fable 5 تحقق 22.4% و21.4% على التوالي.

تم تصميم المعيار ليكون مستمرًا، ويتطور جنبًا إلى جنب مع الذكاء الاصطناعي المتقدم من خلال الإصدارات المنتظمة حيث يساهم العلماء بسير عمل جديدة ويحسنون المهام الموجودة. هذا يخلق حلقة تغذية راجعة بين الاحتياجات العلمية وتطوير الذكاء الاصطناعي. الهدف هو دفع تطوير الوكلاء الذين يعملون كمساعدين بحثيين مفيدين، ينفذون سير عمل فنيًا demanding ويحرر العلماء للتركيز على تحديد أسئلة البحث، وتشكيل الفرضيات، وتفسير النتائج.

يقوم Terminal-Bench-Science بتقييم الوكلاء في بيئات واقعية، ويصنع artefacts ملموسة مثل التحليلات، والمحاكاة، والبراهين، والرمز باستخدام اختبارات محددة للمهمة قابلة للتكرار، مما يوفر دليلًا قابلًا للتحقق على القدرة العلمية.

الكيانات الرئيسية: الشركات: Claude Opus 5, GPT-5.6 Sol Codex, Claude Fable 5, Claude Opus 4.8, GPT-5.6 Terra Codex, GLM 5.3, Kimi K3, Grok 4.6, GPT-5.6 Luna Codex | المواقع: جامعة ستانفورد

الأسئلة الشائعة: ما هو Terminal-Bench-Science وكيف يقيّم وكلاء الذكاء الاصطناعي؟

Terminal-Bench-Science هو معيار مستمر يقوده باحثون من جامعة ستانفورد يقيّم وكلاء الذكاء الاصطناعي على 70 سير عمل علمي تم تنظيمه من قبل خبراء عبر تخصصات متعددة، ويصنع artefacts ملموسة باستخدام اختبارات محددة للمهمة قابلة للتكرار لتقديم دليل قابل للتحقق على القدرة.