HeadlinesBriefing favicon HeadlinesBriefing.com

রিজনিং প্রিফিল স্টাডি: GPT-5.5 Pro

Hacker News •
×

এই v1.1 GPT-5.5 Pro কে শিক্ষক হিসেবে ব্যবহার করে একটি রিজনিং-প্রিফিল পরীক্ষা পুনরায় চালায়। 45টি সমস্যার (15টি STEM, 15টি নন-STEM, 15টি সিন্থেটিক ধাঁধা) প্রতিটির জন্য, প্রতি টার্গেট মডেলে দুটি প্রতিক্রিয়া তৈরি করা হয়েছিল: একটি প্রিফিল ছাড়া এবং একটি GPT-5.5 Pro-এর লুকানো রিজনিং-এর প্রথম 1% দিয়ে প্রিফিল করা। দৃশ্যমান উত্তরটি মুক্তভাবে তৈরি ছিল। স্কোর পরিমাপ করে যে শিক্ষকের দৃশ্যমান উত্তরটি টার্গেটের উত্তরের প্রথম 100 টোকেনে কতটা উপস্থিত ছিল, গড় ইউনিগ্রাম, বিগ্রাম এবং ট্রাইগ্রাম রিকল ব্যবহার করে।

ফলাফল দেখায় যে Deep Seek V4 Flash-এর ডেল্টা ছিল -1.17 শতাংশ পয়েন্ট, 27% থেকে 26.13%-এ নেমে। Inkling 19.99% থেকে 20.45% (+0.46 pp) এ উঠেছে। Kimi K3 31.11% থেকে 35.65% (+4.54 pp) এ বেড়েছে। Qwen3.8 A95B সবচেয়ে বড় পরিবর্তন দেখিয়েছে, 16.79% থেকে 34.97% (+18.18 pp)।

বিভাগ অনুসারে, Qwen-এর উন্নতি সিন্থেটিক ধাঁধায় সবচেয়ে শক্তিশালী ছিল (+26.99 pp, 19.26% থেকে 46.24%), তারপর নন-STEM (+12.80 pp) এবং STEM (+14.75 pp)। সামগ্রিকভাবে, Qwen আগের পরীক্ষায় Opus 4.8-এর দিকে খুব কমই সরে গিয়েছিল, কিন্তু এখানে GPT-5.5 Pro-এর দিকে উল্লেখযোগ্যভাবে সরে গেছে, যা ইঙ্গিত দেয় যে এটি GPT-5.5 Pro বা ঘনিষ্ঠভাবে সম্পর্কিত মডেল থেকে শিখেছে। Kimi K3-এর GPT-5.5 Pro-এর সাথে সর্বোচ্চ কাঁচা ওভারল্যাপ ছিল, প্রিফিল ছাড়া এবং সহ উভয় ক্ষেত্রেই, যদিও এর প্রিফিল লাভ ছিল সামান্য।