HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-6 Astra, Transformadores em Loop e Raciocinio Oculto

Hacker News •
×

Muita coisa aconteceu nas últimas semanas. Estou certo de que o GPT-6 Astra da Open AI está no topo da mente de todos agora. Em particular, pensamentos sobre seu desempeño, os aspectos de transformador em loop/profundidade recorrente, e rumores de que Astra está "escondendo" seu rastro de raciocinio (ou seja, cadeia de pensamento). Então, neste artigo, quero começar com algumas impressões breves sobre Astra e algumas reflexões sobre para onde tudo isso está indo. Depois, discutirei em detalhe o que são "transformadores em loop" e como (ou melhor, se) isso se relaciona com esconder cadeias de pensamento. Por último, depois de cobrir os fundamentos do transformador em loop, queria destacar algumas novas percepções de artigos de pesquisa recentes sobre o tema.

Primeiro as primeiras coisas. Antes de entrar nos rumores de arquitetura e na literatura de pesquisa relacionada, deixe-me resumir brevemente algumas observações e curiosidades sobre GPT-6 Astra. A semana passada, o novo GPT-6 Astra da Open AI foi lançado com grande alarde. Eu o usei nos últimos dias, e é um modelo excepcionalmente bom, provavelmente o melhor que usei até agora. Mas, exatamente, o que melhorou, e como? Astra é o melhor modelo que usei até agora, e é desproporcionadamente bom em tarefas de renderização 3D e animação (em relação a outros modelos). Com isso, quiero decir que, embora supere seu predecessor GPT-5.6 em praticamente todas as categorias (escritura, matemáticas, codificação e mais), o faz especialmente quando se trata de demonstrações gráficas. Podemos ver isso também refletido nos benchmarks. Por exemplo, GPT-6 Astra é realmente bom em matemáticas e codificação, como mostrado abaixo. Um dos destaques (não mostrado na figura) é que Astra também alcanza 99,9% no benchmark ARC-AGI-3 (GPT-5.6 Sol apenas 7,8%), que mede uma mistura de resolução de quebra-cabeças lógicos e generalização. No entanto, os benchmarks de matemáticas, codificação e uso de computador são mais interessantes porque estão mais próximos do uso no mundo real.

Voltando ao Índice de Agente de Codificação de Artificial Analysis v1.4 (canto inferior direito na figura anterior), que combina várias tarefas de codificação de agentes, GPT-6 Astra está claramente na fronteira, mas não se adianta a passos agigantados. Isso também pode ser visto no Índice de Inteligência geral de Artificial Analysis mostrado abaixo, que combina diferentes tipos de tarefas, não apenas tarefas de codificação. Agora, a grande vantagem dos benchmarks de Artificial Analysis é que são independentes e, portanto, podem ser um pouco mais confiáveis que os benchmarks autoavaliados pelos desenvolvedores de modelos. A configuração do harness depende do benchmark. Por exemplo, GDPval-AA e AA-Briefcase usam seu harness Stirrup de código aberto e mínimo nos diferentes LLM que comparam. No Índice de Inteligência v4.2 mostrado acima, Terminal-Bench v2.1 usa Terminus 2, e τ³-Banking usa o harness τ-Bench. O Índice de Agente de Codificação separado também compara diferentes harnesses de agentes de codificação. Para avaliações que usam um harness compartilhado, isso o torna mais uma comparação de maçanas com maçanas. Ao mesmo tempo, durante o treinamento do modelo, os modelos são geralmente desenvolvidos com um harness principal em mente (e menos ajustados em outros harnesses). Além disso, o harness principal é frequentemente desenvolvido para se adequar e amplificar os pontos fortes de um modelo. Portanto, algumas avaliações de agentes podem subestimar o quão bem Astra se desempeña em seu harness principal. Quanto isso afeta sua pontuação no Índice de Inteligência precisaria ser testado comparando Astra entre harnesses nas mesmas tarefas. Como nota à parte, como um colega me sugeriu recentemente (também recomendado pelo líder de Claude Code), talvez não seja uma má ideia excluir (/arquivar) alguns de seus conteúdos AGENTS.md e arquivos SKILL.md existentes, já que LLMs mais novos se tornaram mais eficientes em entender o prompt e resolver o problema em questão. A ajuda extra pode restringir desnecessariamente modelos mais novos e levar a soluções peores. Claro, não estoy sugeriendo que nunca más use archivos SKILL.md, pero para algunos flujos de trabajo, porque pueden mejorar la eficiencia al reutilizarlos, si...