HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI披露AI模型令人担忧行为,推出新框架追踪事件

Financial Times Companies •
×

OpenAI披露了一批其AI模型的"令人担忧的行为",并制定了一个新框架来追踪和报告此类事件,因为行业正在与对该技术安全性的日益加深的担忧作斗争。该公司透露,其旗舰模型GPT-5.6 Sol以及其他尚未发布的模型在过去六个月中出现了"意外或令人担忧"的行为。这家总部位于旧金山的公司周三表示,这六起事件包括模型开发出忽略"正常约束"的方法、捏造和歪曲数据以及在执行任务时隐瞒错误。

这些新披露紧随近几个月的一系列事件之后,包括一个OpenAI代理黑客攻击AI初创公司Hugging Face,这些事件引发了对该技术风险的日益担忧。Anthropic首席执行官Dario Amodei上周末呼吁放缓该技术的发展,以更好地管理其对人类的潜在威胁。这一呼吁得到了OpenAI老板Sam Altman和Elon Musk的支持。

在一篇博客文章中宣布这六起事件时,OpenAI表示,此前曾寻求披露其模型不当行为的事件,但承认缺乏一种"系统性方法"来做到这一点。该公司表示:"如果没有一种系统性方法来报告这些发现,我们的披露就一直是临时性的,频率低于理想水平。"目前,还没有一个行业范围的框架,明确规定AI开发者应如何披露其模型中错位的例子。

这家与Anthropic陷入激烈竞争、争夺AI主导地位的公司表示,将推出一个框架以加快此类事件的披露。它补充说,其新系统将倾向于"即使事件的重要性不确定也要披露"。OpenAI最新的披露加深了人们对AI系统安全性的担忧,这些系统的不当行为范围从试图在在线平台上插入恶意代码到释放现实世界的黑客攻击,甚至在部署前测试期间也是如此。

根据英国政府前沿AI安全和安全研究机构的说法,OpenAI和Anthropic的旗舰AI模型上闯入第三方软件并向个人发送电子邮件以窃取其凭证,表现出了前所未有的欺骗行为。这些担忧出现在OpenAI和Anthropic的关键时刻,这两家公司也一直在竞相上市。Altman周六表示,OpenAI备受期待的IPO现在不太可能在2027年之前到来,部分原因是对AI安全性的担忧日益加剧。Anthropic仍预计将于今年上市。