Asana hat die Modellkosten um das 76-Fache gesenkt und seinen Browser-Agenten fünfmal schneller gemacht, indem GPT-6 Astra in Codex Experimente auf GPT-6.1 Sol durchführte. Asana unterstützt Kunden dabei, Arbeit über Geschäftsanwendungen hinweg zu automatisieren, und zwar über Stack AI, eine Plattform, die das Unternehmen übernommen hat. Mit Stack AI können Kunden Workflows erstellen, die Websites durchsuchen, Formulare ausfüllen und Informationen sammeln, ohne Code zu schreiben. Im Maßstab von Asana summieren sich kleine Ineffizienzen in diesen Workflows, weshalb sich Stack AI-CTO Frank Hidalgo, Ph D, vorgenommen hat, den Browser-Agenten schneller und günstiger im Betrieb zu machen. Er beauftragte GPT-6 Astra in Codex damit, den Agenten zu untersuchen, Verbesserungen zu testen und die Ergebnisse zu vergleichen. Eine Arbeit, für die er manuell ein bis zwei Monate veranschlagte, dauerte etwa eine Woche.
Die Studie von Asana mit 144 Läufen testete GPT-6.1 Sol und drei weitere Frontier-Modelle. Der optimierte Workflow auf GPT-6.1 Sol kostete im Schnitt geschätzte Modellkosten von 0,47 $ und benötigte etwa vier Minuten pro Lauf, also 76-mal günstiger und fünfmal schneller als das ursprüngliche Produktionssetup auf Model B. Arnab Bose, CPO bei Asana, sagte, die Arbeit zeige, wie ein Ingenieur die Richtung vorgibt, während GPT-6 Astra die Experimente durchführt und die Ergebnisse über Command in die Produktion gelangen.
Die Untersuchung ergab, dass der Agent seine festen Anweisungen und Werkzeugdefinitionen zwischengespeichert hatte, nicht aber den wachsenden Verlauf aus Seitentext und Screenshots, sodass jede Anfrage diesen Verlauf zum vollen Preis erneut übermittelte. Hidalgo testete drei Änderungen: das Caching auf den Browsing-Verlauf auszuweiten, mehr Text zu behalten und Screenshots stapelweise zu entfernen. Die beste Richtlinie ließ Screenshots bis auf 20 anwachsen, bevor nur noch der neueste behalten wurde, sodass der frühere Verlauf länger unverändert blieb.
Jede Konfiguration erfasste sechs Felder für jedes der 32 Bücher aus einem öffentlichen Demokatalog. Anfragen, Datenspuren und Ergebnisse jeder Sitzung wurden in Command protokolliert, sodass das Team die Studie später vollständig prüfen konnte. Aus den Erkenntnissen wurden Tickets, dann Pull Requests, und die Änderungen gingen in die Produktion.
Quelle: OpenAI Blog · Zusammengefasst von HeadlinesBriefing