Asana ha reducido 76 veces los costos de modelo y aceleró 5 veces su agente de navegador, usando GPT-6 Astra en Codex para ejecutar experimentos sobre GPT-6.1 Sol. Asana ayuda a los clientes a automatizar el trabajo en aplicaciones empresariales mediante Stack AI, una plataforma que adquirió. Con Stack AI, los clientes pueden crear flujos de trabajo que navegan por sitios web, completan formularios y recopilan información sin escribir código. A la escala de Asana, las pequeñas ineficiencias de estos flujos se acumulan, así que Stack AI, a cargo de Frank Hidalgo, Ph D, director de tecnología, se propuso hacer que el agente de navegador fuera más rápido y barato de ejecutar. Le indicó a GPT-6 Astra en Codex que investigara el agente, probara mejoras y comparara los resultados. Un trabajo que él estima que habría tomado uno o dos meses a mano se completó en alrededor de una semana.
El estudio de 144 ejecuciones de Asana probó GPT-6.1 Sol y otros tres modelos de frontera. El flujo optimizado sobre GPT-6.1 Sol promedió 0,47 $ en costos estimados de modelo y unos cuatro minutos por ejecución, 76 veces más barato y 5 veces más rápido que la configuración de producción original sobre el Modelo B. Arnab Bose, director de producto de Asana, dijo que el trabajo mostró cómo un ingeniero puede marcar la dirección mientras GPT-6 Astra ejecuta los experimentos y los resultados pasan por Command hasta producción.
La investigación encontró que el agente almacenaba en caché sus instrucciones fijas y definiciones de herramientas, pero no el historial creciente de texto de página y capturas de pantalla, por lo que cada solicitud reenviaba ese historial a precio completo. Hidalgo probó tres cambios: extender el caché al historial de navegación, conservar más texto y eliminar capturas de pantalla por lotes. La mejor política permitió acumular hasta 20 capturas antes de reducirlas a la más reciente, manteniendo el historial anterior sin cambios durante más tiempo.
Cada configuración recopiló seis campos de cada uno de 32 libros de un catálogo de demostración público. Las solicitudes, trazas de datos y resultados de cada sesión quedaron registrados en Command, de modo que el equipo pudo revisar el estudio después. Los hallazgos se convirtieron en tickets, luego en pull requests, y los cambios pasaron a producción.
Fuente: OpenAI Blog · Resumido por HeadlinesBriefing