HeadlinesBriefing HeadlinesBriefing.com

网络风险下模型开发节奏调整

OpenAI Blog •
×

近期两起事件凸显了强大AI系统带来的日益增长的风险:Open AI与Hugging Face事件以及我们即将推出的模型Astra可能达到我们准备就绪框架下的关键网络安全能力阈值。这些发展,连同快速的内部研究进展,加急了我们在所有训练阶段加强监控、对齐和 containment 保障的紧迫性。

随着模型变得更加强大,其相关风险也随之增加。我们暂时减慢了扩展步伐,包括暂停为期两周的强化学习(RL)训练,以强化研究环境、红队系统并扩展监控覆盖范围。在我们进行更小规模的训练和评估以验证保障措施和建立对齐证据期间,我们最大的前沿RL运行仍处于暂停状态。

我们现在要求在整个训练过程中提供更强的对齐行为证据,这建立在正在进行的研究和评估基础上。即将到来的模型所释放的信号清楚地表明,我们需要超越当前准备就绪框架的更广泛的方法。以下是我们对研究流程和基础设施所做的调整,以及仍在进行的工作。

我们的方法建立在三个互相增强的保障措施之上:监控、对齐和安全。我们将这些措施应用于研究和部署过程中,并根据每个模型的能力、运行环境和风险等级进行调整。获得更强网络安全能力的前沿模型需要提高训练和评估环境的安全标准。

来源: OpenAI Blog · 由HeadlinesBriefing整理摘要