HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-6 Astra, Transformers Gelusteerd en Verborgen Redenering

Hacker News •
×

Er is de afgelopen weken veel gebeurd. Ik weet zeker dat Open AI's GPT-6 Astra nu bij iedereen voorop staat. Met name gedachten over de prestaties, de aspecten van de gelusteerde transformer/recursieve diepte, en geruchten dat Astra zijn redeneerspoor (d.w.z. gedachteketen) "verbergt". Dus in dit artikel wil ik beginnen met enkele korte indrukken van Astra en enkele gedachten over waar dit allemaal naartoe gaat. Daarna zal ik in detail bespreken wat "gelusteerde transformers" zijn en hoe (of beter: of) dit verband houdt met het verbergen van gedachteketens. Tot slot, na het behandelen van de basisprincipes van de gelusteerde transformer, wilde ik enkele nieuwe inzichten uit recente onderzoekspapers over dit onderwerp benadrukken.

Eerst het belangrijkste. Voordat ik inga op de architectuurgeruchten en de bijbehorende onderzoeksliteratuur, laat me kort enkele GPT-6 Astra-observaties en weetjes samenvatten. Vorige week werd Open AI's nieuwe GPT-6 Astra met veel tamtam uitgebracht. Ik heb het de afgelopen dagen gebruikt, en het is een uitzonderlijk goed model, waarschijnlijk het beste dat ik tot nu toe heb gebruikt. Maar wat is er precies verbeterd, en hoe? Astra is het beste model dat ik tot nu toe heb gebruikt, en het is onevenredig goed in 3D-rendering- en animatietaken (in vergelijking met andere modellen). Daarmee bedoel ik dat het, hoewel het zijn voorganger GPT-5.6 in vrijwel alle categorieën (schrijven, wiskunde, coderen en meer) overtreft, het vooral doet als het gaat om grafische demo's. We zien dit ook terug in de benchmarks. GPT-6 Astra is bijvoorbeeld echt goed in wiskunde en coderen, zoals hieronder weergegeven. Een van de hoogtepunten (niet getoond in de figuur) is dat Astra ook 99,9% behaalt op de ARC-AGI-3-benchmark (GPT-5.6 Sol slechts 7,8%), die een mix van het oplossen van logische puzzels en generalisatie meet. De benchmarks voor wiskunde, coderen en computergebruik zijn echter interessanter omdat ze dichter bij het echte gebruik liggen.

Terugkomend op de Artificial Analysis Coding Agent Index v1.4 (rechtsonder in de vorige figuur), die verschillende agentische codeertaken combineert, staat GPT-6 Astra duidelijk aan de grens, maar het loopt niet ver vooruit. Dit is ook te zien in de algemene Artificial Analysis Intelligence Index hieronder, die verschillende soorten taken combineert, niet alleen codeertaken. Het grote voordeel van Artificial Analysis-benchmarks is dat ze onafhankelijk zijn en dus misschien iets betrouwbaarder zijn dan zelfgeëvalueerde benchmarks door modelontwikkelaars. De harness-opstelling hangt af van de benchmark. GDPval-AA en AA-Briefcase gebruiken bijvoorbeeld hun open-source, minimale Stirrup-harness voor de verschillende LLM's die ze vergelijken. In de Intelligence Index v4.2 hierboven gebruikt Terminal-Bench v2.1 Terminus 2, en τ³-Banking gebruikt de τ-Bench-harness. De afzonderlijke Coding Agent Index vergelijkt ook verschillende codeer-agent-harnesses. Voor evaluaties die een gedeelde harness gebruiken, maakt dit het meer een appels-met-appels-vergelijking. Tegelijkertijd worden modellen tijdens de training doorgaans ontwikkeld met één primaire harness in gedachten (en minder fijn afgesteld op andere harnesses). Bovendien wordt de primaire harness vaak ontwikkeld om de sterke punten van een model te ondersteunen en te versterken. Sommige agentische evaluaties zouden dus kunnen onderschatten hoe goed Astra presteert in zijn primaire harness. Hoeveel dit zijn Intelligence Index-score beïnvloedt, zou moeten worden getest door Astra over harnesses te vergelijken op dezelfde taken. Als een kanttekening, zoals een collega me onlangs voorstelde (ook aanbevolen door de Claude Code-lead), is het misschien geen slecht idee om enkele van uw bestaande AGENTS.md-inhoud en SKILL.md-bestanden te verwijderen (/archiveren), omdat nieuwere LLM's efficiënter zijn geworden in het begrijpen van de prompt en het oplossen van het probleem. De extra begeleiding zou nieuwere modellen onnodig kunnen beperken en tot slechtere oplossingen kunnen leiden. Natuurlijk suggereer ik niet om nooit meer SKILL.md-bestanden te gebruiken, maar voor sommige workflows, omdat ze bij hergebruik de efficiëntie kunnen verbeteren, als...