HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-6 Astra, Transformadores en Bucle y Razonamiento Oculto

Hacker News •
×

Han pasado muchas cosas en las últimas semanas. Estoy seguro de que el GPT-6 Astra de Open AI es lo más importante para todos en este momento. En particular, las opiniones sobre su rendimiento, los aspectos de transformador en bucle/profundidad recurrente, y los rumores de que Astra está "ocultando" su rastro de razonamiento (es decir, cadena de pensamiento). Así que, en este artículo, quiero comenzar con algunas impresiones breves sobre Astra y algunas reflexiones sobre hacia dónde se dirige todo esto. Luego, discutiré en detalle qué son los "transformadores en bucle" y cómo (o más bien, si) esto se relaciona con ocultar cadenas de pensamiento. Finalmente, después de cubrir los conceptos básicos del transformador en bucle, quería destacar algunas ideas nuevas de artículos de investigación recientes sobre el tema.

Primero lo primero. Antes de entrar en los rumores de arquitectura y la literatura de investigación relacionada, permítanme resumir brevemente algunas observaciones y datos sobre GPT-6 Astra. La semana pasada, el nuevo GPT-6 Astra de Open AI fue lanzado con gran fanfarria. Lo usé durante los últimos días, y es un modelo excepcionalmente bueno, probablemente el mejor que he usado hasta ahora. Pero, ¿qué ha mejorado exactamente y cómo? Astra es el mejor modelo que he usado hasta ahora, y es desproporcionadamente bueno en tareas de renderizado 3D y animación (en relación con otros modelos). Con esto quiero decir que, aunque supera a su predecesor GPT-5.6 en prácticamente todas las categorías (escritura, matemáticas, codificación y más), lo hace especialmente en lo que respecta a demostraciones gráficas. Podemos ver esto también reflejado en los puntos de referencia. Por ejemplo, GPT-6 Astra es realmente bueno en matemáticas y codificación, como se muestra a continuación. Uno de los aspectos destacados (no mostrado en la figura) es que Astra también alcanza un 99.9% en el punto de referencia ARC-AGI-3 (GPT-5.6 Sol solo 7.8%), que mide una mezcla de resolución de acertijos lógicos y generalización. Sin embargo, los puntos de referencia de matemáticas, codificación y uso de computadora son más interesantes porque están más cerca del uso en el mundo real.

Volviendo al Índice de Agente de Codificación de Artificial Analysis v1.4 (abajo a la derecha en la figura anterior), que combina varias tareas de codificación de agentes, GPT-6 Astra está claramente en la frontera, pero no se adelanta a pasos agigantados. Esto también se puede ver en el Índice de Inteligencia general de Artificial Analysis que se muestra a continuación, que combina diferentes tipos de tareas, no solo tareas de codificación. Ahora, la gran ventaja de los puntos de referencia de Artificial Analysis es que son independientes y, por lo tanto, pueden ser un poco más confiables que los puntos de referencia autoevaluados por los desarrolladores de modelos. La configuración del arnés depende del punto de referencia. Por ejemplo, GDPval-AA y AA-Briefcase usan su arnés Stirrup de código abierto y mínimo en los diferentes LLM que comparan. En el Índice de Inteligencia v4.2 que se muestra arriba, Terminal-Bench v2.1 usa Terminus 2, y τ³-Banking usa el arnés τ-Bench. El Índice de Agente de Codificación separado también compara diferentes arneses de agentes de codificación. Para evaluaciones que usan un arnés compartido, esto lo convierte más en una comparación de manzanas con manzanas. Al mismo tiempo, durante el entrenamiento del modelo, los modelos generalmente se desarrollan con un arnés principal en mente (y se ajustan menos en otros arneses). Además, el arnés principal a menudo se desarrolla para adaptarse y amplificar las fortalezas de un modelo. Por lo tanto, algunas de las evaluaciones de agentes podrían subestimar qué tan bien se desempeña Astra en su arnés principal. Cuánto afecta esto a su puntaje en el Índice de Inteligencia necesitaría probarse comparando Astra entre arneses en las mismas tareas. Como nota al margen, como un colega me sugirió recientemente (también recomendado por el líder de Claude Code), tal vez no sea mala idea eliminar (/archivar) algunos de sus contenidos AGENTS.md y archivos SKILL.md existentes, ya que los LLM más nuevos se han vuelto más eficientes para comprender el mensaje y resolver el problema en cuestión. La ayuda adicional podría restringir innecesariamente los modelos más nuevos y conducir a soluciones peores. Por supuesto, no estoy sugiriendo que nunca más use archivos SKILL.md, pero para algunos flujos de trabajo, porque pueden mejorar la eficiencia al reutilizarlos, si...