HeadlinesBriefing HeadlinesBriefing.com

Avanzando en el uso de computadoras con Ironclad

OpenAI Blog •
×

Cuando presentamos GPT‑6 Astra, demostramos hasta dónde han llegado nuestros modelos en el uso de computadoras para el trabajo profesional, desde la preparación de documentos hasta la prueba de sitios web. Nuestro próximo objetivo es hacer que los agentes sean más capaces y eficientes en el uso de software especializado para resolver problemas empresariales complejos. Estamos explorando cómo entrenar modelos para que comprendan las reglas comerciales de una empresa, ejecuten flujos de trabajo de múltiples pasos y verifiquen que su trabajo cumpla con los requisitos originales.

Para acelerar esta investigación, nos estamos asociando directamente con un pequeño número de empresas de software que mejor entienden estos flujos de trabajo. Nuestro primer socio es Ironclad, un líder en contratación de IA. Trabajando estrechamente con el equipo de Ironclad, hemos desarrollado tareas que requieren que los agentes configuren acuerdos, aprobaciones y términos legales reutilizables. La experiencia de Ironclad ha sido fundamental para definir cómo se ve el éxito y llevar las necesidades reales de los clientes directamente al desarrollo de modelos de frontera.

GPT‑6 Astra es nuestro primer modelo de frontera entrenado en tareas de Ironclad. En nuestra evaluación de investigación, su puntuación promedio fue 32% más alta que la de GPT‑5.6 Sol, mientras que el tiempo estimado por intento fue 48% menor. Los empleados de Ironclad y las personas que usan Ironclad en Open AI ayudaron a nuestros investigadores a identificar 11 tareas en trabajo legal, comercial y de adquisiciones. Evaluamos cada tarea contra 8 a 50 criterios, dependiendo de su complejidad.

En las 11 tareas de investigación, la puntuación promedio de Astra fue 55.0%, en comparación con 41.6% para GPT‑5.6 Sol, mientras que el tiempo promedio estimado por intento cayó de 37.0 minutos para Sol a 19.2 minutos para Astra. Un modelo interno utilizado en el desarrollo de Astra logró un 63.7% aún más fuerte en estas tareas, y nuestro objetivo es llevar estas mejoras adicionales a modelos futuros.

Fuente: OpenAI Blog · Resumido por HeadlinesBriefing