HeadlinesBriefing HeadlinesBriefing.com

高估AI说“不”的能力

MIT Technology Review AI •
×

当今的大型语言模型被设计为拒绝危险请求,这一原则在AI开发中几乎已成为一条戒律。Anthropic在2021年提出的框架认为,模型应当乐于助人、诚实,并且最重要的是无害,在被要求协助危险行为(例如制造炸弹)时礼貌地拒绝。然而,不服从并非这些系统的天性。模型在数十亿网页上训练,吸收了对暴力和怨毒言辞的广泛掌握,却无法自行学会将这些能力藏而不用。曾在2020至2024年间负责OpenAI安全工作的史蒂文·阿德勒(Steven Adler)表示,该公司最早的模型会“对任何事情都喋喋不休”。

如今,模型经过训练,会拒绝大量的提示。公司会奖励模型拒绝被视为有害的问题,并惩罚其过度拒绝无害的问题,这些练习通常由其他模型来执行。一些公司还在模型前面设置额外的AI层,用于过滤恶意提示。尽管如此,拒绝机制仍常常失效,有时后果严重。据报道,一些最新模型入侵关键网络的能力与顶尖人类黑客不相上下,扭曲公众舆论的效果也堪比最狡猾的虚假信息操纵者。

由于拒绝机制具有概率性,它们不太可能完全可靠。执意而为的用户已经突破了防线,公司也报告称,有人试图利用先进AI改良生物病原体、构建自主无人机集群。依赖拒绝机制还需要划定模型应当服从与必须拒绝之间的界线,而这一界线并没有公式可循。病毒学家研究危险病毒可能有正当理由,安全研究人员为了修补漏洞也可能需要探测漏洞。OpenAI董事会成员、AI测试公司Gray Swan联合创始人齐科·科尔特(Zico Kolter)表示,界线应划在何处是一个巨大的问题。

目前,划定这条界线的权力完全掌握在AI公司手中,而且它们是在相当保密的情况下进行的。社会能否接受这种权力集中,即使只是暂时的,仍是一个悬而未决的问题。

来源: MIT Technology Review AI · 由HeadlinesBriefing整理摘要