HeadlinesBriefing favicon HeadlinesBriefing.com

एआई मॉडल्स इंटेलिजेंस टेस्ट में फ्लॉप

MIT Technology Review AI •
×

पज़ल्स और गेम्स AI विकास के प्रारंभिक दिनों से केंद्रीय रहे हैं। जैसे हम मानव अपने दिमाग को क्रॉसवर्ड या लॉजिक puzzles से चुनौती देते हैं, डेवलपर्स AI मॉडल के प्रगति का मूल्यांकन करने के लिए गेमिंग गैंटलेट का उपयोग कर सकते हैं। 1959 में, IBM कंप्यूटर वैज्ञानिक आर्थर सैमुएल ने "मशीन लर्निंग" शब्द को एक एल्गोरिदम के बारे में वर्णित किया जो चेकर्स खेलना सीख गया। अंतर्राष्ट्रीय शतरंज और चीनी बोर्ड गेम गो भी प्रसिद्ध AI टेस्ट बेड हैं।

मात्र पहेली कौशल के आधार पर, AI ने बहुत कुछ प्रगति की है और तेजी से। 2024 के अंत में, कोलंबिया विश्वविद्यालय के वैज्ञानिकों की टीम ने दिखाया कि भले ही सबसे अच्छे मॉडल infamous New York Times Connections पहेली में से केवल 18% को हल कर पाए; 2025 के शुरुआती समय में, कुछ मॉडल ने उन्हें हर बार लगभग पूरी तरह से हल करने में सक्षम हो गए। लेकिन पहेलियां केवल AI क्षमताओं के अनिवार्य प्रगति को उजागर करने के लिए ही नहीं हैं।

आज के मॉडल अभी भी फँसते हैं: सूक्ष्म परिवर्तनों वाले क्लासिक पहेलियों में वे अक्सर फँस जाते हैं, और विज़ुअल पहेलियाँ विशेष रूप से कमजोरी हैं। यहाँ आपके लिए एक मौका है कि आप उन पहेलियों पर अपने दिमाग का परीक्षण करें जो पहले मॉडल को उलझा चुकी थीं। प्रत्येक पहेली कम से कम एक तरीके में मशीन और मानव cognition के अंतर को उजागर करती है।

स्पेशल रीजनिंग अभी भी एक ऐसी डोमेन है जहाँ मानवों के पास एक बड़ा फायदा है। जब एक पहेली आपको विभिन्न तस्वीरों से एक ही वस्तु के विभिन्न कोणों का निर्धारण करने के लिए कहती है, तो आज के भाषा मॉडल आमतौर पर विज़ुअल इनपुट का विश्लेषण करने की क्षमता रखते हैं, लेकिन ये स्पेशल रीजनिंग पहेलियों पर बुरी तरह फेल होते हैं। सभी बातों के बावजूद, वर्ल्ड मॉडल की मदद से AI के बारे में भौतिक वातावरण को समझने की क्षमता है, लेकिन LLM अभी भी 3D वस्तुओं को manipulating करने में सक्षम नहीं हैं जैसे स्पेशल थिंकर आर्किटेक्ट्स और मैकेनिकल इंजीनियर्स कर सकते हैं।

कुंजी एंटिटीज: कंपनियाँ: IBM | लोग: Vincent Kilbride, Arthur Samuel | स्थान: कोलंबिया विश्वविद्यालय, न्यूयॉर्क टाइम्स, Google, यूनिवर्सिटी ऑफ इलिनॉय अर्बाना-चैम्पेन