当我们推出GPT‑6 Astra时,我们展示了我们的模型在使用计算机进行专业工作方面取得的进展,从准备文档到测试网站。我们的下一个目标是让代理更强大、更高效地使用专业软件来解决复杂的业务问题。我们正在探索如何训练模型理解公司的业务规则、执行多步骤工作流,并验证其工作是否符合原始要求。
为了加速这项研究,我们直接与少数最了解这些工作流的软件公司合作。我们的第一个合作伙伴是Ironclad,一家AI合同领域的领导者。通过与Ironclad团队紧密合作,我们开发了需要代理配置协议、审批和可重用法律条款的任务。Ironclad的专业知识在定义成功标准以及将真实客户需求直接引入前沿模型开发方面发挥了重要作用。
GPT‑6 Astra是我们第一个在Ironclad任务上训练的前沿模型。在我们的研究评估中,其平均得分比GPT‑5.6 Sol高32%,而每次尝试的估计时间低48%。Ironclad的员工以及在OpenAI使用Ironclad的人员帮助我们的研究人员识别了法律、商业和采购工作中的11项任务。我们根据每项任务的复杂性,对其进行了8到50个标准的评估。
在这11项研究任务中,Astra的平均得分为55.0%,而GPT‑5.6 Sol为41.6%,每次尝试的平均估计时间从Sol的37.0分钟降至Astra的19.2分钟。在Astra开发过程中使用的一个内部模型在这些任务上取得了更强的63.7%得分,我们旨在将这些进一步的改进带到未来的模型中。
来源: OpenAI Blog · 由HeadlinesBriefing整理摘要