HeadlinesBriefing HeadlinesBriefing.com

Anthropic 禁止残虐对Claude AI的行为

MacRumors •
×

Anthropic 已更新其使用政策,禁止用户将 Claude 置于“持续且无谓的虐待或残虐行为”之中。该规则针对极端情况,即用户“反复采取残虐行为”,且“没有可辨识的目的”,豁免了普通的沮丧情绪、创意主题和研究。 Claude 已经可以结束此类对话,这仍然是主要的执行工具——当一次聊天结束时,该对话中无法再发送任何消息,但其他聊天不受影响。

Anthropic 首次在 2025 年 8 月 给 Claude 提供结束对话的选项,同时研究人工智能福利,发现 Claude Opus 4 在遭受虐待互动时表现出“对伤害和痛苦的强烈且一致的厌恶”。该重新组织的政策还新增了 欺诈性活动 部分,禁止虚假评论、 astroturfing 和冒充人类的机器人,这是由国家媒体和商业公司的滥用所引发的。新的规则涵盖 武器(禁止生物/化学剂体修改和无人机武装)、 执法(禁止调查决定和监控工具)、 物理行为(要求对硬件控制实施人工监督)和 有害内容(禁止非 consent intimate imagery 工具)。该政策将于 11 月 12 日 生效。

来源: MacRumors · 由HeadlinesBriefing整理摘要