HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-6 Astra, transformateurs en boucle et raisonnement caché

Hacker News •
×

Beaucoup de choses se sont passées au cours des dernières semaines. Je suis sûr que le GPT-6 Astra d'Open AI est au centre des préoccupations de tout le monde en ce moment. En particulier, les réflexions sur ses performances, les aspects de transformateur en boucle/profondeur récurrente, et les rumeurs selon lesquelles Astra "cache" sa trace de raisonnement (c'est-à-dire la chaîne de pensée). Donc, dans cet article, je veux commencer par quelques impressions brèves sur Astra et quelques réflexions sur où tout cela mène. Ensuite, je discuterai en détail de ce que sont les "transformateurs en boucle" et comment (ou plutôt, si) cela se rapporte au fait de cacher les chaînes de pensée. Enfin, après avoir couvert les bases du transformateur en boucle, je voulais mettre en évidence quelques nouvelles idées issues de récents articles de recherche sur le sujet.

Premièrement. Avant d'entrer dans les rumeurs d'architecture et la littérature de recherche connexe, permettez-moi de résumer brièvement quelques observations et anecdotes sur GPT-6 Astra. La semaine dernière, le nouveau GPT-6 Astra d'Open AI a été publié avec beaucoup de fanfare. Je l'ai utilisé au cours des deux derniers jours, et c'est un modèle exceptionnellement bon, probablement le meilleur que j'ai utilisé à ce jour. Mais qu'est-ce qui s'est exactement amélioré, et comment ? Astra est le meilleur modèle que j'ai utilisé jusqu'à présent, et il est particulièrement bon dans les tâches de rendu 3D et d'animation (par rapport aux autres modèles). Par là, je veux dire que bien qu'il surpasse son prédécesseur GPT-5.6 dans pratiquement toutes les catégories (écriture, mathématiques, codage, etc.), il le fait surtout en ce qui concerne les démos graphiques. Nous pouvons le voir également reflété dans les benchmarks. Par exemple, GPT-6 Astra est vraiment bon en mathématiques et en codage, comme indiqué ci-dessous. L'un des points forts (non montré dans la figure) est qu'Astra atteint également 99,9 % sur le benchmark ARC-AGI-3 (GPT-5.6 Sol seulement 7,8 %), qui mesure un mélange de résolution d'énigmes logiques et de généralisation. Cependant, les benchmarks de mathématiques, de codage et d'utilisation de l'ordinateur sont plus intéressants car ils sont plus proches de l'utilisation réelle.

Revenant à l'indice d'agent de codage d'Artificial Analysis v1.4 (en bas à droite dans la figure précédente), qui mélange plusieurs tâches de codage agentique, GPT-6 Astra est clairement à la frontière, mais il ne prend pas une avance considérable. Cela peut également être vu dans l'indice d'intelligence général d'Artificial Analysis montré ci-dessous, qui mélange différents types de tâches, pas seulement des tâches de codage. Maintenant, le grand avantage des benchmarks d'Artificial Analysis est qu'ils sont indépendants et peuvent donc être un peu plus fiables que les benchmarks auto-évalués par les développeurs de modèles. La configuration du harnais dépend du benchmark. Par exemple, GDPval-AA et AA-Briefcase utilisent leur harnais Stirrup open source et minimal à travers les différents LLM qu'ils comparent. Dans l'indice d'intelligence v4.2 montré ci-dessus, Terminal-Bench v2.1 utilise Terminus 2, et τ³-Banking utilise le harnais τ-Bench. L'indice d'agent de codage séparé compare également différents harnais d'agent de codage. Pour les évaluations qui utilisent un harnais partagé, cela en fait une comparaison plus pommes avec pommes. En même temps, pendant l'entraînement du modèle, les modèles sont généralement développés avec un harnais principal en tête (et moins affinés sur d'autres harnais). De plus, le harnais principal est souvent développé pour s'adapter et amplifier les forces d'un modèle. Par conséquent, certaines évaluations agentiques pourraient sous-estimer à quel point Astra performe dans son harnais principal. Dans quelle mesure cela affecte son score à l'indice d'intelligence devrait être testé en comparant Astra entre les harnais sur les mêmes tâches. En passant, comme un collègue me l'a récemment suggéré (également recommandé par le responsable de Claude Code), ce n'est peut-être pas une mauvaise idée de supprimer (/archiver) certains de vos contenus AGENTS.md et fichiers SKILL.md existants, car les LLM plus récents sont devenus plus efficaces pour comprendre l'invite et résoudre le problème en question. L'aide supplémentaire pourrait inutilement contraindre les modèles plus récents et conduire à de moins bonnes solutions. Bien sûr, je ne suggère pas de ne plus jamais utiliser de fichiers SKILL.md, mais pour certains flux de travail, car ils peuvent améliorer l'efficacité lors de la réutilisation, si...