HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI Astra模型不透明循环引发AI安全专家担忧

Hacker News •
×

OpenAI的新型Astra模型将采用一种称为“ recurrent depth”(循环深度)的推理技术,亦称“不透明循环”,该技术允许其在大多数推理模型通常使用的顺序思维之外运行,根据《信息》报道。这一技术使模型的思考链更难被监控,引发AI安全专家的担忧。

Redwood公司CEO Buck Shlegeris表示极度关切,警告如果OpenAI进一步推广该技术,可能会“大幅增加循环并彻底破坏Co T可监控性”。长期AI安全倡导者Zvi Mowshowitz称该技术是“与火搏斗”,并建议可能需要法律来防止AI实验室之间发生“向下竞赛”。

在正常情况下,推理模型的思考链提供顺序步骤,用于监控异常行为。在不透明循环中,模型以循环方式处理查询,留下的可阅读痕迹更少。然而,Astra使用该技术的程度似乎有限,OpenAI已反对建议其将转向“neuralese”(神经语言),强调其通过首席科学家Jakub Pachocki对可理解思考链的承诺。

《信息》后来报道,Anthropic和Google Deep Mind已经在讨论这一技术。Redwood Research首席科学家Ryan Greenblatt警告称,不透明推理可能比传统方法更快扩张,潜在地从可见渠道中移除所有推理。