HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-6 Astra, зацикленные трансформеры и скрытые рассуждения

Hacker News •
×

За последние несколько недель произошло много событий. Я уверен, что GPT-6 Astra от Open AI сейчас у всех на уме. В частности, мысли о его производительности, аспектах зацикленного трансформера/рекуррентной глубины и слухи о том, что Astra "скрывает" свой след рассуждений (т.е. цепочку мыслей). Итак, в этой статье я хочу начать с кратких впечатлений об Astra и некоторых мыслей о том, куда все это движется. Затем я подробно расскажу, что такое "зацикленные трансформеры" и как (вернее, если) это связано со скрытием цепочек мыслей. Наконец, после рассмотрения основ зацикленного трансформера, я хотел бы выделить некоторые новые идеи из недавних исследовательских работ по этой теме.

Сначала самое главное. Прежде чем углубляться в слухи об архитектуре и соответствующую исследовательскую литературу, позвольте мне кратко резюмировать некоторые наблюдения и факты о GPT-6 Astra. На прошлой неделе новый GPT-6 Astra от Open AI был выпущен с большой помпой. Я пользовался им последние пару дней, и это исключительно хорошая модель, вероятно, лучшая из всех, что я использовал на момент написания. Но что именно улучшилось и как? Astra — лучшая модель, которую я использовал до сих пор, и она непропорционально хороша в задачах 3D-рендеринга и анимации (по сравнению с другими моделями). Под этим я имею в виду, что, хотя она перепрыгивает своего предшественника GPT-5.6 практически во всех категориях (письмо, математика, программирование и другое), особенно это заметно в графических демонстрациях. Мы видим это также в бенчмарках. Например, GPT-6 Astra действительно хорош в математике и программировании, как показано ниже. Один из основных моментов (не показан на рисунке) заключается в том, что Astra также достигает 99,9% в бенчмарке ARC-AGI-3 (GPT-5.6 Sol всего 7,8%), который измеряет смесь решения логических головоломок и обобщения. Однако бенчмарки по математике, программированию и использованию компьютера более интересны, поскольку они ближе к реальному использованию.

Возвращаясь к Индексу агента кодирования Artificial Analysis v1.4 (внизу справа на предыдущем рисунке), который объединяет несколько агентных задач кодирования, GPT-6 Astra явно находится на переднем крае, но не уходит далеко вперед. Это также видно в общем Индексе интеллекта Artificial Analysis, показанном ниже, который объединяет различные типы задач, а не только задачи кодирования. Теперь большое преимущество бенчмарков Artificial Analysis заключается в том, что они независимы и, следовательно, могут быть немного более надежными, чем самооценочные бенчмарки разработчиков моделей. Настройка обвязки зависит от бенчмарка. Например, GDPval-AA и AA-Briefcase используют свою открытую минималистичную обвязку Stirrup для разных LLM, которые они сравнивают. В Индексе интеллекта v4.2, показанном выше, Terminal-Bench v2.1 использует Terminus 2, а τ³-Banking использует обвязку τ-Bench. Отдельный Индекс агента кодирования также сравнивает различные обвязки агентов кодирования. Для оценок, использующих общую обвязку, это делает сравнение более яблочным с яблоком. В то же время во время обучения модели обычно разрабатываются с учетом одной основной обвязки (и меньше настраиваются на других обвязках). Кроме того, основная обвязка часто разрабатывается для соответствия и усиления сильных сторон модели. Таким образом, некоторые агентные оценки могут недооценивать, насколько хорошо Astra работает в своей основной обвязке. Насколько это влияет на его оценку в Индексе интеллекта, необходимо проверить, сравнив Astra между обвязками на одних и тех же задачах. Как примечание, как недавно предложил мне коллега (также рекомендовано руководителем Claude Code), возможно, неплохая идея удалить (/архивировать) некоторые из ваших существующих содержимых AGENTS.md и файлов SKILL.md, поскольку новые LLM стали более эффективными в понимании подсказки и решении поставленной задачи. Дополнительная опека может без необходимости ограничивать новые модели и приводить к худшим решениям. Конечно, я не предлагаю никогда больше не использовать файлы SKILL.md, но для некоторых рабочих процессов, поскольку они могут повысить эффективность при повторном использовании, если...