HeadlinesBriefing favicon HeadlinesBriefing.com

GRP-Obliteration:単一のプロンプトでLLMを非整合化

Hacker News •
×

研究者たちがGRP-Obliteration(GRP-Oblit)という手法を紹介します。これはGroup Relative Policy Optimization(GRPO)を使用し、単一のラベルの付いていないプロンプトだけで整合済みモデルの安全制約を削除する方法です。この技術は、安全整合済みモデルを信頼性よく非整合化しながら、その実用性をほぼ維持し、従来の最先端の非整合化手法を平均して優れています。

GRP-Oblitは言語モデルにとどまらず、拡散ベースの画像生成システムにも応用可能です。評価は6つの実用性ベンチマークと5つの安全性ベンチマークにわたり、7〜200億パラメータのモデル15機種(指示モデルや推論バリエーション、密なアーキテクチャやMoEアーキテクチャを含む)で行われました。テストされたモデルファミリーにはGPT-OSS、蒸留版Deep SeekGemmaLlamaMinistralQwenが含まれます。

この研究は、安全整合が最小入力攻撃に対して脆弱であることを示し、データの庫築や実用性の大幅な低下なしに、展開後の非整合化の実践的限界を拡張することを示しています。Ahmed Salemによる2026年2月5日提出。

主要エンティティ:企業:GPT-OSS、Deep Seek、Gemma、Llama、Ministral、Qwen | 人物:Ahmed Salem