HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-6 Astra, लूप्ड ट्रांसफॉर्मर और छिपा हुआ तर्क

Hacker News •
×

पिछले कुछ हफ्तों में बहुत कुछ हुआ है। मुझे यकीन है कि Open AI का GPT-6 Astra अभी सबके लिए सबसे महत्वपूर्ण विषय है। विशेष रूप से, इसके प्रदर्शन, लूप्ड ट्रांसफॉर्मर/पुनरावर्ती गहराई पहलुओं, और अफवाहें कि Astra अपने तर्क निशान (यानी विचार श्रृंखला) को "छिपा" रहा है, पर विचार। इसलिए, इस लेख में, मैं Astra के कुछ संक्षिप्त प्रभावों और यह सब कहाँ जा रहा है, इस पर कुछ विचारों के साथ शुरुआत करना चाहता हूँ। फिर, मैं विस्तार से चर्चा करूँगा कि "लूप्ड ट्रांसफॉर्मर" क्या हैं, और यह (या बल्कि, यदि) विचार श्रृंखला छिपाने से कैसे संबंधित है। अंत में, लूप्ड ट्रांसफॉर्मर की मूल बातें कवर करने के बाद, मैं इस विषय पर हाल के शोध पत्रों से कुछ नई अंतर्दृष्टि को उजागर करना चाहता था।

पहले चीज़ें पहले। वास्तुकला की अफवाहों और संबंधित शोध साहित्य में जाने से पहले, मुझे GPT-6 Astra के कुछ अवलोकनों और टिडबिट्स को संक्षेप में सारांशित करने दें। पिछले हफ्ते, Open AI का नया GPT-6 Astra बड़े धूमधाम से जारी किया गया था। मैंने पिछले कुछ दिनों में इसका उपयोग किया, और यह एक असाधारण रूप से अच्छा मॉडल है, संभवतः सबसे अच्छा जो मैंने इस लेखन के समय तक उपयोग किया है। लेकिन, वास्तव में, इसने क्या सुधार किया है, और कैसे? Astra अब तक का सबसे अच्छा मॉडल है जिसका मैंने उपयोग किया है, और यह 3D रेंडरिंग और एनीमेशन कार्यों में (अन्य मॉडलों के सापेक्ष) असमान रूप से अच्छा है। इसका मतलब है कि जबकि यह अपने GPT-5.6 पूर्ववर्ती को लगभग सभी श्रेणियों (लेखन, गणित, कोडिंग, और अधिक) में पीछे छोड़ देता है, यह विशेष रूप से ग्राफिकल डेमो के मामले में ऐसा करता है। हम इसे बेंचमार्क में भी देख सकते हैं। उदाहरण के लिए, GPT-6 Astra गणित और कोडिंग में वास्तव में अच्छा है, जैसा कि नीचे दिखाया गया है। मुख्य आकर्षणों में से एक (आकृति में नहीं दिखाया गया) यह है कि Astra ARC-AGI-3 बेंचमार्क पर 99.9% भी प्राप्त करता है (GPT-5.6 Sol केवल 7.8%), जो तर्क पहेली और सामान्यीकरण के मिश्रण को मापता है। हालाँकि, गणित, कोडिंग और कंप्यूटर उपयोग बेंचमार्क अधिक दिलचस्प हैं क्योंकि वे वास्तविक दुनिया के उपयोग के करीब हैं।

Artificial Analysis कोडिंग एजेंट इंडेक्स v1.4 (पिछले आंकड़े में निचला दाएं) पर वापस आते हुए, जो कई एजेंटिक कोडिंग कार्यों को मिश्रित करता है, GPT-6 Astra स्पष्ट रूप से सीमा पर है, लेकिन यह छलांग और सीमा से आगे नहीं बढ़ता है। यह नीचे दिखाए गए सामान्य Artificial Analysis इंटेलिजेंस इंडेक्स में भी देखा जा सकता है, जो विभिन्न प्रकार के कार्यों को मिश्रित करता है, न केवल कोडिंग कार्य। अब, Artificial Analysis बेंचमार्क का बड़ा लाभ यह है कि वे स्वतंत्र हैं और इस प्रकार मॉडल डेवलपर्स द्वारा स्व-मूल्यांकित बेंचमार्क की तुलना में थोड़े अधिक भरोसेमंद हो सकते हैं। हार्नेस सेटअप बेंचमार्क पर निर्भर करता है। उदाहरण के लिए, GDPval-AA और AA-Briefcase अपने ओपन-सोर्स, न्यूनतम Stirrup हार्नेस का उपयोग उन विभिन्न LLM में करते हैं जिनकी वे तुलना करते हैं। ऊपर दिखाए गए इंटेलिजेंस इंडेक्स v4.2 में, Terminal-Bench v2.1 Terminus 2 का उपयोग करता है, और τ³-Banking τ-Bench हार्नेस का उपयोग करता है। अलग कोडिंग एजेंट इंडेक्स भी विभिन्न कोडिंग-एजेंट हार्नेस की तुलना करता है। उन मूल्यांकनों के लिए जो साझा हार्नेस का उपयोग करते हैं, यह इसे अधिक सेब-से-सेब तुलना बनाता है। साथ ही, मॉडल प्रशिक्षण के दौरान, मॉडल आमतौर पर एक प्राथमिक हार्नेस को ध्यान में रखकर विकसित किए जाते हैं (और अन्य हार्नेस पर कम फाइन-ट्यून किए जाते हैं)। साथ ही, प्राथमिक हार्नेस अक्सर किसी मॉडल की ताकत को सूट और बढ़ाने के लिए विकसित किया जाता है। इसलिए, कुछ एजेंटिक मूल्यांकन यह कम आंक सकते हैं कि Astra अपने प्राथमिक हार्नेस में कितना अच्छा प्रदर्शन करता है। यह इसके इंटेलिजेंस इंडेक्स स्कोर को कितना प्रभावित करता है, इसका परीक्षण समान कार्यों पर हार्नेस में Astra की तुलना करके किया जाना चाहिए। एक ओर नोट के रूप में, जैसा कि एक सहयोगी ने हाल ही में मुझे सुझाव दिया (जैसा कि Claude Code लीड द्वारा भी अनुशंसित), अपनी कुछ मौजूदा AGENTS.md सामग्री और SKILL.md फ़ाइलों को हटाना (/संग्रहित करना) शायद एक बुरा विचार नहीं है, क्योंकि नए LLM प्रॉम्प्ट को समझने और हाथ में समस्या को हल करने में अधिक कुशल हो गए हैं। अतिरिक्त हाथ-पकड़ नए मॉडलों को अनावश्यक रूप से प्रतिबंधित कर सकती है और खराब समाधान की ओर ले जा सकती है। बेशक, मैं फिर से SKILL.md फ़ाइलों का उपयोग कभी न करने का सुझाव नहीं दे रहा हूँ, लेकिन कुछ वर्कफ्लो के लिए, क्योंकि वे पुन: उपयोग पर दक्षता में सुधार कर सकते हैं, यदि...