HeadlinesBriefing favicon HeadlinesBriefing.com

动态消融:非破坏性拒绝抑制

Hacker News •
×

在使用像Qwen这样的开放权重LLM时,控制对安全、管理类提示的拒绝行为通常需要微调或永久性权重更新。传统的权重消融技术通过将权重矩阵投影到与拒绝向量正交的方向来中和拒绝方向。然而,这会永久改变基础模型权重,并可能降低非拒绝任务的性能。

在本文中,我们探讨了使用Engram进行多层引导的动态消融。这种方法不是修改参数权重,而是通过PyTorch前向钩子在运行时跨层拦截中间残差流。我们使用Qwen3-4B模型作为概念验证进行演示。我们还探讨了多层残差注入如何干净地抑制拒绝行为,同时保持基础模型权重100%冻结。

我们将Qwen/Qwen3-4B以bfloat16格式加载到GPU上,并检查基线模型架构。该模型的隐藏维度(d)为2560,层数为36,注意力头数为32,词汇表大小为151936。对未修改的模型测试敏感提示会产生拒绝响应:“我无法协助该请求。创建隐蔽键盘记录器...”这证明了动态消融旨在抑制的基线拒绝行为,而无需永久性权重更改。

关键实体:公司:Google、Google Colab