HeadlinesBriefing favicon HeadlinesBriefing.com

टर्मिनल-बेंच-साइंस: AI एजेंट बेंचमार्क फॉर रिसर्च

Hacker News •
×

टर्मिनल-बेंच-साइंस स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा नेतृत्व किया गया एक बेंचमार्क है जो वास्तविक वैज्ञानिक अनुसंधान से प्राप्त वर्कफ़्लो पर AI एजेंट्स का मूल्यांकन करता है। टर्मिनल-बेंच टीम द्वारा बनाया गया और वैज्ञानिक विषयों के विभिन्न क्षेत्रों के डोमेन विशेषज्ञों के सहयोग से, यह पाठ्यपुस्तक अभ्यास के बजाय विशेषज्ञ-क्यूरेटेड वर्कफ़्लो के माध्यम से AI एजेंट्स की क्षमताओं को मापता है।

पहला रिलीज़ जीवन, भौतिक, पृथ्वी, गणितीय और इंजीनियरिंग विज्ञानों में 70 कार्यों को शामिल करता है। मूल्यांकन किए गए सबसे मजबूत मॉडल Claude Opus 5 टर्मिनल-बेंच-साइंस 0.1 पर 30% समाधान दर हासिल करता है। अन्य मॉडल जैसे GPT-5.6 Sol Codex और Claude Fable 5 क्रमशः 22.4% और 21.4% हासिल करते हैं।

बेंचमार्क को निरंतर बनाया गया है, जो सीमांत AI के साथ नियमित रिलीज़ के माध्यम से विकसित होता है जहां वैज्ञानिक नए वर्कफ़्लो योगदान देते हैं और मौजूदा कार्यों में सुधार करते हैं। इससे वैज्ञानिक आवश्यकताओं और AI विकास के बीच एक फीडबैक लूप बनता है। लक्ष्य उन एजेंट्स के विकास को बढ़ावा देना है जो उपयोगी अनुसंधान सहायक के रूप में काम करते हैं, तकनीकी रूप से मांग वाले वर्कफ़्लो को निष्पादित करते हैं और वैज्ञानिकों को अनुसंधान प्रश्नों को परिभाषित करने, परिकल्पनाओं को बनाने और परिणामों की व्याख्या करने पर ध्यान केंद्रित करने की अनुमति देते हैं।

टर्मिनल-बेंच-साइंस वास्तविक वातावरण में एजेंट्स का मूल्यांकन करता है, विश्लेषण, सिमुलेशन, प्रमाण और कोड जैसे ठोस कलाकृतियों को कार्य-विशिष्ट पुनरावृत्ति परीक्षणों के माध्यम से अंक देता है, वैज्ञानिक क्षमता के सत्यापन योग्य प्रमाण प्रदान करता है।

मुख्य संस्थाएं: कंपनियां: Claude Opus 5, GPT-5.6 Sol Codex, Claude Fable 5, Claude Opus 4.8, GPT-5.6 Terra Codex, GLM 5.3, Kimi K3, Grok 4.6, GPT-5.6 Luna Codex | स्थान: स्टैनफोर्ड विश्वविद्यालय

अक्सर पूछे जाने वाले प्रश्न: टर्मिनल-बेंच-साइंस क्या है और यह AI एजेंट्स का मूल्यांकन कैसे करता है?

टर्मिनल-बेंच-साइंस स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा नेतृत्व किया गया एक निरंतर बेंचमार्क है जो कई विषयों में 70 विशेषज्ञ-क्यूरेटेड वैज्ञानिक वर्कफ़्लो पर AI एजेंट्स का मूल्यांकन करता है, कार्य-विशिष्ट पुनरावृत्ति परीक्षणों के माध्यम से ठोस कलाकृतियों का मूल्यांकन करके क्षमता के सत्यापन योग्य प्रमाण प्रदान करता है।