HeadlinesBriefing favicon HeadlinesBriefing.com

रीज़निंग प्रीफिल अध्ययन: GPT-5.5 Pro

Hacker News •
×

यह v1.1 GPT-5.5 Pro को शिक्षक के रूप में उपयोग करके रीज़निंग-प्रीफिल प्रयोग को दोहराता है। प्रत्येक 45 समस्याओं (15 STEM, 15 गैर-STEM, 15 सिंथेटिक पहेलियाँ) के लिए, प्रति लक्ष्य मॉडल दो प्रतिक्रियाएँ उत्पन्न की गईं: एक बिना प्रीफिल और एक GPT-5.5 Pro के छिपे तर्क के पहले 1% के साथ प्रीफिल। दृश्य उत्तर स्वतंत्र रूप से उत्पन्न रहा। स्कोर ने मापा कि शिक्षक का दृश्य उत्तर लक्ष्य के उत्तर के पहले 100 टोकन में कितना दिखाई दिया, माध्य यूनिग्राम, बिग्राम और ट्राइग्राम रिकॉल का उपयोग करके।

परिणाम दिखाते हैं कि Deep Seek V4 Flash का डेल्टा -1.17 प्रतिशत अंक था, 27% से गिरकर 26.13% हो गया। Inkling 19.99% से बढ़कर 20.45% (+0.46 pp) हो गया। Kimi K3 31.11% से बढ़कर 35.65% (+4.54 pp) हो गया। Qwen3.8 A95B ने सबसे बड़ा बदलाव दिखाया, 16.79% से 34.97% (+18.18 pp)।

श्रेणी के अनुसार, Qwen का सुधार सिंथेटिक पहेलियों में सबसे मजबूत था (+26.99 pp, 19.26% से 46.24% तक), उसके बाद गैर-STEM (+12.80 pp) और STEM (+14.75 pp)। कुल मिलाकर, Qwen पिछले प्रयोग में Opus 4.8 की ओर मुश्किल से बढ़ा, लेकिन यहाँ GPT-5.5 Pro की ओर महत्वपूर्ण रूप से बढ़ा, यह सुझाव देते हुए कि उसने GPT-5.5 Pro या निकट से संबंधित मॉडल से सीखा हो सकता है। Kimi K3 का GPT-5.5 Pro के साथ सबसे अधिक कच्चा ओवरलैप था, बिना और प्रीफिल दोनों के, हालांकि उसका प्रीफिल लाभ मामूली था।