HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-6 Astra، المحولات الحلقية والاستدلال الخفي

Hacker News •
×

حدث الكثير في الأسابيع القليلة الماضية. أنا متأكد من أن GPT-6 Astra من Open AI هو في مقدمة اهتمامات الجميع الآن. على وجه الخصوص، الأفكار حول أدائه، وجوانب المحول الحلقي/العمق المتكرر، والشائعات التي تفيد بأن Astra "يخفي" أثر الاستدلال الخاص به (أي سلسلة التفكير). لذا، في هذه المقالة، أريد أن أبدأ ببعض الانطباعات الموجزة عن Astra وبعض الأفكار حول أين يتجه كل هذا. بعد ذلك، سأناقش بالتفصيل ما هي "المحولات الحلقية"، وكيف (أو بالأحرى، إذا) يتعلق هذا بإخفاء سلاسل التفكير. أخيرًا، بعد تغطية أساسيات المحول الحلقي، أردت تسليط الضوء على بعض الأفكار الجديدة من الأوراق البحثية الحديثة حول هذا الموضوع.

الأولوية للأهم. قبل الخوض في شائعات البنية والأدبيات البحثية ذات الصلة، دعني ألخص بإيجاز بعض ملاحظات وملاحظات GPT-6 Astra. الأسبوع الماضي، تم إصدار GPT-6 Astra الجديد من Open AI بضجة كبيرة. استخدمته على مدار اليومين الماضيين، وهو نموذج جيد بشكل استثنائي، وربما يكون الأفضل الذي استخدمته حتى كتابة هذه السطور. ولكن ما الذي تحسن بالضبط، وكيف؟ Astra هو أفضل نموذج استخدمته حتى الآن، وهو جيد بشكل غير متناسب في مهام العرض ثلاثي الأبعاد والرسوم المتحركة (بالنسبة للنماذج الأخرى). بهذا، أعني أنه بينما يتفوق على سلفه GPT-5.6 في جميع الفئات تقريبًا (الكتابة والرياضيات والبرمجة والمزيد)، فإنه يفعل ذلك بشكل خاص عندما يتعلق الأمر بالعروض التوضيحية الرسومية. يمكننا رؤية هذا أيضًا في المعايير. على سبيل المثال، GPT-6 Astra جيد حقًا في الرياضيات والبرمجة، كما هو موضح أدناه. أحد أبرز النقاط (غير الموضحة في الشكل) هو أن Astra يحقق أيضًا 99.9% في معيار ARC-AGI-3 (GPT-5.6 Sol فقط 7.8%)، والذي يقيس مزيجًا من حل ألغاز المنطق والتعميم. ومع ذلك، فإن معايير الرياضيات والبرمجة واستخدام الكمبيوتر أكثر إثارة للاهتمام لأنها أقرب إلى الاستخدام في العالم الحقيقي.

بالعودة إلى مؤشر وكيل البرمجة من Artificial Analysis v1.4 (أسفل اليمين في الشكل السابق)، والذي يمزج العديد من مهام البرمجة الوكيلة، فإن GPT-6 Astra بوضوح في الحدود، لكنه لا يتقدم بفارق كبير. يمكن رؤية هذا أيضًا في مؤشر الذكاء العام من Artificial Analysis الموضح أدناه، والذي يمزج أنواعًا مختلفة من المهام، وليس فقط مهام البرمجة. الآن، الميزة الكبيرة لمعايير Artificial Analysis هي أنها مستقلة وبالتالي قد تكون أكثر موثوقية قليلاً من المعايير التي تم تقييمها ذاتيًا من قبل مطوري النماذج. يعتمد إعداد الحزام على المعيار. على سبيل المثال، تستخدم GDPval-AA وAA-Briefcase حزام Stirrup مفتوح المصدر والحد الأدنى عبر نماذج LLM المختلفة التي يقارنونها. في مؤشر الذكاء v4.2 الموضح أعلاه، يستخدم Terminal-Bench v2.1 Terminus 2، ويستخدم τ³-Banking حزام τ-Bench. يقارن مؤشر وكيل البرمجة المنفصل أيضًا بين أحزمة وكيل البرمجة المختلفة. بالنسبة للتقييمات التي تستخدم حزامًا مشتركًا، فإن هذا يجعلها مقارنة أكثر تفاحًا بتفاح. في الوقت نفسه، أثناء تدريب النموذج، يتم تطوير النماذج عادةً مع وضع حزام أساسي واحد في الاعتبار (ويتم ضبطها بدقة أقل على الأحزمة الأخرى). بالإضافة إلى ذلك، غالبًا ما يتم تطوير الحزام الأساسي ليناسب نقاط قوة النموذج ويضخمها. لذلك، قد تقلل بعض التقييمات الوكيلة من تقدير مدى جودة أداء Astra في حزامه الأساسي. مقدار تأثير ذلك على درجة مؤشر الذكاء الخاص به يحتاج إلى اختبار من خلال مقارنة Astra عبر الأحزمة في نفس المهام. كملاحظة جانبية، كما اقترح عليّ زميل مؤخرًا (كما أوصى أيضًا قائد Claude Code)، ربما ليست فكرة سيئة حذف (/أرشفة) بعض محتويات AGENTS.md وملفات SKILL.md الموجودة لديك، حيث أصبحت نماذج LLM الأحدث أكثر كفاءة في فهم المطالبة وحل المشكلة المطروحة. يمكن أن يؤدي التوجيه الإضافي إلى تقييد النماذج الأحدث بشكل غير ضروري ويؤدي إلى حلول أسوأ. بالطبع، لا أقترح عدم استخدام ملفات SKILL.md مرة أخرى أبدًا، ولكن بالنسبة لبعض سير العمل، لأنها يمكن أن تحسن الكفاءة عند إعادة الاستخدام، إذا...