HeadlinesBriefing favicon HeadlinesBriefing.com

智能体构建风险:对齐给谁?

Hacker News •
×

关于安全风险,致正在构建智能体的各位:因为你是X、Y、Z领域的专家,你的智能体在这些方面可能表现卓越,你在这些领域不存在风险。但是!存在无数其他关注点,你要么模糊或糟糕地定义了它们,要么完全没有能力自己判断其正确性,也无法评估其风险。你极其依赖模型的先验知识来为你做好工作以规避这些风险。这对你和模型的使用来说,都处于极度的“未知的未知”领域。

对我来说,很难对模型的先验知识抱有极高的信心,因为我是一名专家级软件工程师,我对模型生成软件时的默认行为不满意(且从未满意过)。我在编写软件方面的专业知识赋予了我异常清晰的可见性,这让我更不愿意盲目信任其在复式记账、金融、法律、运营或其他我无法亲自进行专家级深度评估领域的先验知识。

软件工程师(以及最近的数学家!)此时对“垃圾输出”非常熟悉——模型输出虽然能完成工作,但在某些方面很糟糕。模型产出的每一个全是Record的代码或过度防御的异常处理,都是因为非专家在训练期间奖励了模型这些行为。模型的先验知识是糟糕的。

关键实体:人物:Karan Lyons、David Adrian、Bryan Berg