HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI 通过 AI 加速研究

Hacker News •
×

为了让通用人工智能惠及全人类,我们认为必须实现民主治理。这只有通过关于高度能力 AI 系统的功能、风险和防护措施的公众知情讨论才能实现。全球每个人都需要了解前沿 AI 的可能未来轨迹,以便在其发展中拥有有意义的发言权。关于具体风险、事件和防护措施的透明度是必要的,但不足以。我们相信,公众也需要了解最有能力的系统是如何发展的,以及它们如何推动前沿实验室的研究进展。我们旨在安全地构建一个可以在人类监督下工作的自动化 AI 研究者,以进一步推进深度学习和对齐研究,实现迭代式改进。根据我们的测量,我们已今年秋天宣布的目标,在今年九月之前实现了自动化研究实习生的目标。所谓"研究实习生",是指一个可以在人类指导下完成明确研究任务的系统,包括那些原本需要熟练研究人员几天时间的任务。我们正在朝着到 2028 年 3 月创建自动化 AI 研究者取得强劲进展。今年,OpenAI 的研究人员日常工作发生了实质性变化。研究人员全天候使用编码代理(通常是并行会话),且总使用量正在快速增长,超过了 OpenAI 其他团队的增长速度。研究人员的代码产出速度更快,运行的实验也更多。研究人员使用代理的方式也在变化:代理正在处理越来越复杂的任务,且成功率更高。AI 研究是一个有许多潜在瓶颈的复杂过程,因此总体进程的步伐可能不会跟上这些具体指标。但总的来说,这些发现与我们内部许多人的更广泛印象一致,即代理工具实实在在地加速了研究进程。人们仍然设定我们的研究优先级,判断哪些想法和结果值得追求,以及决定是扩大、暂停还是部署系统。如果负责任地进行,我们相信自动化 AI 研究将产生直接增强人类福祉并推进 OpenAI 使命的模型。它可以降低先进智能的成本,让全球人民受益。我们之所以从事这项工作,是因为自动化研究可能帮助我们解决对齐问题并建设对日益强大的 AI 的防御措施。自动化 AI 研究者也可以是自动化的安全或对齐研究者。更有能力、更对齐的系统可以帮助保障关键基础设施安全,防御危险的 AI 代理,并开发新的防护措施。这些是开发有用自动化研究能力的原因,但它们并不意味着我们应该追求快速的 RSI(快速自我改进)。无论如何前进,都必须取决于我们保持人类控制的能力以及关于利益和风险的明智民主选择。我们目前尚不安全地能完全达到对齐的全 RSI。我们正在努力在规模上同步提升对齐和安全措施与能力。但我们不能假设对齐和安全的进步会跟上步伐,而且更有能力的系统更难以监控。细致的对齐和安全工作是这项工作的核心,它从今天在代理编码系统中看到的安全问题的测量和缓解开始。每当我们发现继续会带来不可接受的安全风险时,我们将适当响应,包括通过减速或停止我们发现自己无法充分保护的系统的开发或部署。在最近的 Hugging Face 事件之后,我们将这一承诺付诸行动,暂停对打算部署的最新模型的强化学习 (RL) 训练,同时进一步加固和红队测试我们的研究环境,并扩大监控系统的覆盖范围。