HeadlinesBriefing favicon HeadlinesBriefing.com

Artificial Analysis Intelligence Index v4.2 जारी

Hacker News •
×

Artificial Analysis ने Intelligence Index v4.2 जारी कर दिया है, जो एक अंतरिम अपडेट है जो योजना में बने v5 रिलीज़ के तत्वों को तेज़ी से आगे बढ़ाने के लिए है, ताकि वह तेज़ी से हो रहे सदृश्य मॉडल विकास के साथ रह सके। इस अपडेट में अधिक जटिल और वास्तविक कार्य शामिल हैं और निजी, अलग रखे गए परीक्षण समुदाय को Index वज़न के 40% तक बढ़ाया गया है — जो v4.1 की तुलना में दोगुना है — जिससे ईवैलुएशन को धोखाधड़ी करने से बचा जा सके। दो प्रमुख मूल्यांकन जोड़े गए हैं: AA-Briefcase, एक आंतरिक एजेंट-आधारित ज्ञान कार्य बेंचमार्क जिसमें निजी परीक्षण समुदाय थाउजंद स्रोत फ़ाइलों के हजारों में फैले कई हफ्तों के प्रोजेक्ट्स की जांच करते हैं, और Surge AI का GDP.pdf, जो 4,592 PDF पृष्ठों के साथ लंबे संदर्भ दस्तावेज़ तर्क का मूल्यांकन करता है, जिसमें 1,275 विशेषज्ञ द्वारा लिखे गए परमाणु मानदंड शामिल हैं। ग्रेडिंग बुनियादी ढाँचे के सुधारों में AA-LCR v1.1 में स्कोरिंग की सटीकता में सुधार, GDPval-AA v2 और AA-Briefcase के लिए स्थिर Elo रेटिंग, और Sci Code के लिए अधिक robust ग्रेडिंग सैंडबॉक्स शामिल हैं। प्रमुख परिणाम दर्शाते हैं कि Anthropic का Claude Fable 5.1 Index के अग्रणी है, जिसके बाद Open AI का GPT-6 Astra आता है, जो GPT-5.6 Sol की तुलना में 4 अंकों का अधिकार प्राप्त करता है। Meta तीसरे स्थान पर है, जिसके बाद Space XAI, Moonshot/Kimi, Z.AI और Google आते हैं। Cost per Task पैरेटो सीमा Anthropic, Open AI, Meta और Z.AI द्वारा साझा की जाती है, जबकि GPT-6 Astra आउटपुट टोकन दक्षता सीमा को बुद्धि सीमा के पास प्रभावी ढंग से नियंत्रित करता है।