HeadlinesBriefing favicon HeadlinesBriefing.com

دراسة التعبئة المسبقة للاستدلال: GPT-5.5 Pro

Hacker News •
×

تعيد هذه النسخة v1.1 تشغيل تجربة تعبئة مسبقة للاستدلال باستخدام GPT-5.5 Pro كمعلم. لكل مشكلة من 45 مشكلة (15 STEM، 15 غير STEM، 15 ألغاز اصطناعية)، تم توليد استجابتين لكل نموذج مستهدف: واحدة بدون تعبئة مسبقة وأخرى معبأة مسبقًا بأول 1% من الاستدلال الخفي لـ GPT-5.5 Pro. ظل الجواب المرئي مولّدًا بحرية. قاست الدرجات مقدار ظهور إجابة المعلم المرئية في أول 100 رمز من إجابة الهدف، باستخدام متوسط استدعاء الأحادية والثنائية والثلاثية.

أظهرت النتائج أن Deep Seek V4 Flash كان دلتا -1.17 نقطة مئوية، من 27% إلى 26.13%. ارتفع Inkling من 19.99% إلى 20.45% (+0.46 نقطة مئوية). زاد Kimi K3 من 31.11% إلى 35.65% (+4.54 نقطة مئوية). أظهر Qwen3.8 A95B أكبر تحول، من 16.79% إلى 34.97% (+18.18 نقطة مئوية).

حسب الفئة، كان تحسن Qwen الأقوى في الألغاز الاصطناعية (+26.99 نقطة مئوية، من 19.26% إلى 46.24%)، يليه غير STEM (+12.80 نقطة مئوية) وSTEM (+14.75 نقطة مئوية). بشكل عام، تحرك Qwen بالكاد نحو Opus 4.8 في تجربة سابقة، لكنه تحرك بشكل كبير نحو GPT-5.5 Pro هنا، مما يشير إلى أنه ربما تعلم من GPT-5.5 Pro أو نموذج وثيق الصلة. كان لدى Kimi K3 أعلى تداخل خام مع GPT-5.5 Pro سواء بدون أو مع التعبئة المسبقة، على الرغم من أن مكسبه من التعبئة المسبقة كان متواضعًا.