HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI第三方评估原则

OpenAI Blog •
×

前沿AI实验室在安全地训练、评估和部署模型方面承担着巨大的责任。第三方评估是平衡这一责任、扩大AI安全意见输入机会、让世界了解情况、并使实验室对明确且独立支持的安全声明负责的关键部分。作为我们努力跟上前沿步伐的一部分,OpenAI致力于支持独立评估,在训练、评估和部署方面提供深度访问权限。这种访问应使评估者能够挑战我们的假设,识别我们可能遗漏的风险,并就我们保障措施的有效性得出自己的结论。

我们长期以来在模型开发和部署过程的各个阶段与第三方评估者合作。我们还将第三方评估纳入我们的准备框架实践,并支持倡导更严格和更负责任的流程的组织和立法。在这些合作中,我们提供了深度访问形式,包括有关我们技术保障措施的信息、可见的思维链访问,以及前所未有的机密数据和内部部署访问水平,用于事件响应和监控红队测试。此处分享的优先事项和原则侧重于我们与私营和非营利部门的独立评估组织在技术安全评估方面的合作。它们补充了我们与政府在测试和评估方面的工作,在这些工作中,不同的角色和责任可能需要不同的方法。

使这些评估有效需要强有力的独立性机制、科学严谨性、稳健的安全实践和明确的责任。实验室有责任在保护敏感信息的同时实现有意义的审查。实验室和独立评估者共同承担做好这件事的责任,并应在安全和安保实践方面遵循共同的国际标准运作。下面,我们提出四个需要深入评估的优先领域,以及严谨、安全和独立工作的原则。

评估的优先领域:第三方评估在解决特定的、重要的问题时最为有用:证据是否支持实验室的安全案例和安全声明?评估是否充分测试了它们旨在衡量的风险?保障措施在现实条件下是否有效?此处描述的评估旨在根据所审查的安全问题采取不同的形式。我们期望在不同时间段内并行支持多项评估,有些持续数周,有些持续数月。虽然第三方评估也可以成为部署前工作的一部分,并可能为部署决策提供信息,但此处描述的工作通常是长期的且与发布无关——侧重于随时间深入审查特定的安全声明。在我们的优先领域和原则中,我们提到了安全声明和安全案例。我们对这些术语的含义如下:我们提出四个需要深入评估的优先领域,以及严谨、安全和独立工作的原则。安全案例的独立评估,涵盖训练、评估、内部部署和外部部署。安全案例的评估需要对齐、控制方法(如监控)、网络安全、生物和化学滥用以及红队测试方面的专业知识。安全案例由包括训练、能力评估和保障措施在内的声明组成,可以整体或部分进行评估(见下文优先事项2和3)。多个评估者可能需要根据各自的专业知识审查案例的不同部分。他们的评估应共同回答以下问题:训练、评估和部署的安全案例证据是否得到证实?安全案例的条件在训练、评估期间是否得到遵守...

FAQ问题:OpenAI对第三方评估的优先事项是什么?

FAQ回答:OpenAI提出四个需要深入评估的优先领域,以及严谨、安全和独立工作的原则。这些包括对涵盖训练、评估、内部部署和外部部署的安全案例进行独立评估。