Asana снизила стоимость моделей в 76 раз и ускорила своего браузерного агента в 5 раз, использовав GPT-6 Astra в Codex для проведения экспериментов на GPT-6.1 Sol. Asana помогает клиентам автоматизировать работу в бизнес-приложениях с помощью Stack AI, платформы, которую компания приобрела. С Stack AI клиенты могут создавать рабочие процессы, которые переходят по сайтам, заполняют формы и собирают информацию, не написав ни строчки кода. В масштабах Asana мелкие неэффективности таких процессов накапливаются, поэтому технический директор Stack AI Frank Hidalgo, Ph D, поставил задачу сделать браузерного агента быстрее и дешевле в работе. Он поручил GPT-6 Astra в Codex изучить агента, протестировать улучшения и сравнить результаты. Работа, которую он оценивал в один-два месяца при выполнении вручную, заняла около недели.
В исследовании Asana, включавшем 144 запуска, тестировались GPT-6.1 Sol и три других передовых модели. Оптимизированный процесс на GPT-6.1 Sol в среднем обходился в 0,47 доллара по оценочной стоимости модели и занимал около четырёх минут на запуск, что в 76 раз дешевле и в 5 раз быстрее исходной производственной конфигурации на Model B. Арнаб Бозе, директор по продуктам Asana, заявил, что работа показала, как инженер задаёт направление, пока GPT-6 Astra проводит эксперименты, а результаты через Command попадают в производство.
Расследование показало, что агент кешировал свои фиксированные инструкции и определения инструментов, но не растущую историю текста страниц и скриншотов, поэтому каждый запрос заново отправлял эту историю по полной цене. Hidalgo проверил три изменения: распространение кеширования на историю просмотров, сохранение большего объёма текста и удаление скриншотов пакетами. Лучшая политика позволяла скриншотам накапливаться до 20, прежде чем оставить только самый свежий, благодаря чему более ранняя история дольше оставалась неизменной.
Каждая конфигурация собирала шесть полей для каждой из 32 книг из общедоступного демонстрационного каталога. Запросы, трассировки данных и результаты каждой сессии фиксировались в Command, чтобы команда могла позже просмотреть исследование целиком. Выводы превратились в тикеты, затем в pull request'ы, а изменения ушли в производство.
Источник: OpenAI Blog · Сводку подготовил HeadlinesBriefing