HeadlinesBriefing HeadlinesBriefing.com

Avançando o uso do computador com a Ironclad

OpenAI Blog •
×

Quando apresentamos o GPT‑6 Astra, demonstramos o quanto nossos modelos avançaram no uso de computadores para trabalho profissional, desde a preparação de documentos até o teste de sites. Nosso próximo objetivo é tornar os agentes mais capazes e eficientes no uso de software especializado para resolver problemas complexos de negócios. Estamos explorando como treinar modelos para entender as regras de negócios de uma empresa, executar fluxos de trabalho de várias etapas e verificar se seu trabalho atende aos requisitos originais.

Para acelerar esta pesquisa, estamos fazendo parceria diretamente com um pequeno número de empresas de software que entendem melhor esses fluxos de trabalho. Nosso primeiro parceiro é a Ironclad, líder em contratação de IA. Trabalhando em estreita colaboração com a equipe da Ironclad, desenvolvemos tarefas que exigem que os agentes configurem acordos, aprovações e termos legais reutilizáveis. A experiência da Ironclad foi fundamental para definir como é o sucesso e trazer as necessidades reais dos clientes diretamente para o desenvolvimento de modelos de fronteira.

O GPT‑6 Astra é nosso primeiro modelo de fronteira treinado em tarefas da Ironclad. Em nossa avaliação de pesquisa, sua pontuação média foi 32% maior que a do GPT‑5.6 Sol, enquanto o tempo estimado por tentativa foi 48% menor. Funcionários da Ironclad e pessoas que usam a Ironclad na Open AI ajudaram nossos pesquisadores a identificar 11 tarefas nos trabalhos jurídico, comercial e de compras. Avaliamos cada tarefa contra 8 a 50 critérios, dependendo de sua complexidade.

Nas 11 tarefas de pesquisa, a pontuação média do Astra foi de 55,0%, em comparação com 41,6% para o GPT‑5.6 Sol, enquanto o tempo médio estimado por tentativa caiu de 37,0 minutos para o Sol para 19,2 minutos para o Astra. Um modelo interno usado no desenvolvimento do Astra alcançou impressionantes 63,7% nessas tarefas, e pretendemos trazer esses ganhos adicionais para modelos futuros.

Fonte: OpenAI Blog · Resumido por HeadlinesBriefing