HeadlinesBriefing favicon HeadlinesBriefing.com

GRP-Obliteration:单提示词解除LLM对齐

Hacker News •
×

研究人员介绍GRP-Obliteration(GRP-Oblit),这是一种利用Group Relative Policy Optimization(GRPO)的技术,能够仅通过单个无标签提示词就从对齐模型中移除安全约束。这一技术可靠地解除安全对齐模型的约束,同时基本保持其实用性,在各方面均优于现有的领先模型解对齐方法。

GRP-Oblit的技术不仅适用于语言模型,还可扩展至基于扩散的图像生成系统。评估涵盖六个实用性基准测试和五个安全基准测试,测试了15个7-200亿参数的模型,包括指示模型和推理变体、密集架构和Mixture of Experts架构。测试的模型系列包括GPT-OSS、蒸馏版Deep SeekGemmaLlamaMinistralQwen

该工作表明,安全对齐仍然容易受到最小输入攻击的威胁,这扩展了部署后解对齐的实际极限,而无需大量数据策划或显著的实用性退化。由Ahmed Salem于2026年2月5日提交。

关键实体:公司:GPT-OSS、Deep Seek、Gemma、Llama、Ministral、Qwen | 人物:Ahmed Salem