HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-6 Astra、循环Transformer与隐藏推理

Hacker News •
×

在过去的几周里发生了很多事情。我相信Open AI的GPT-6 Astra现在一定是大家最关心的话题。特别是关于它的性能、循环Transformer/递归深度方面的思考,以及有传言称Astra在“隐藏”其推理轨迹(即思维链)。因此,在本文中,我想先谈谈对Astra的一些简要印象,以及我对这一切将走向何方的看法。然后,我将详细讨论什么是“循环Transformer”,以及它如何(或者说是否)与隐藏思维链有关。最后,在介绍了循环Transformer的基础知识之后,我想重点介绍一些近期研究论文中关于该主题的新见解。

首先,在深入探讨架构传言和相关研究文献之前,让我简要总结一些关于GPT-6 Astra的观察和花絮。上周,Open AI的新模型GPT-6 Astra隆重发布。在过去的几天里,我使用了它,这是一个非常出色的模型,可能是我迄今为止用过的最好的模型。但具体来说,它改进了什么,又是如何改进的呢?Astra是我目前用过的最好的模型,它在3D渲染和动画任务方面(相对于其他模型)表现得尤为突出。我的意思是,虽然它在几乎所有类别(写作、数学、编码等)上都超越了其前身GPT-5.6,但在图形演示方面尤其如此。我们也可以在基准测试中看到这一点。例如,GPT-6 Astra在数学和编码方面确实很好,如下所示。其中一个亮点(图中未显示)是,Astra在ARC-AGI-3基准测试中达到了99.9%(GPT-5.6 Sol仅为7.8%),该基准测试衡量的是逻辑谜题和泛化的混合能力。然而,数学、编码和计算机使用基准测试更有趣,因为它们更接近实际应用。

回到Artificial Analysis编码代理指数v1.4(上图的右下角),它融合了多个代理编码任务,GPT-6 Astra显然处于前沿,但并没有大幅领先。这也可以从下面显示的通用Artificial Analysis智能指数中看出,该指数融合了不同类型的任务,而不仅仅是编码任务。现在,Artificial Analysis基准测试的一大优势是它们是独立的,因此可能比模型开发者自行评估的基准测试更可信一些。测试环境的设置取决于基准测试。例如,GDPval-AA和AA-Briefcase使用其开源的、最小化的Stirrup测试环境来比较不同的LLM。在上面显示的智能指数v4.2中,Terminal-Bench v2.1使用Terminus 2,而τ³-Banking使用τ-Bench测试环境。单独的编码代理指数也比较了不同的编码代理测试环境。对于使用共享测试环境的评估,这更像是苹果与苹果的比较。同时,在模型训练期间,模型通常主要针对一个主要的测试环境进行开发(并在其他测试环境上微调较少)。此外,主要的测试环境通常是为了适应和放大模型的优势而开发的。因此,一些代理评估可能会低估Astra在其主要测试环境中的表现。这对其智能指数得分有多大影响,需要通过在同一任务上跨测试环境比较Astra来测试。顺便提一下,正如一位同事最近向我建议的(Claude Code负责人也推荐),删除(/归档)你现有的一些AGENTS.md内容和SKILL.md文件可能不是一个坏主意,因为更新的LLM在理解提示和解决问题方面变得更加高效。额外的“手把手”指导可能会不必要地限制新模型,导致解决方案更差。当然,我不是建议永远不再使用SKILL.md文件,但对于某些工作流,因为它们在重复使用时可以提高效率,所以……