HeadlinesBriefing favicon HeadlinesBriefing.com

GRP-Obliteration: Desalinhar LLMs com uma única instrução

Hacker News •
×

Os pesquisadores apresentam GRP-Obliteration (GRP-Oblit), um método que utiliza Group Relative Policy Optimization (GRPO) para remover as restrições de segurança dos modelos alinhados com apenas uma única instrução não rotulada. Esta técnica desalinha confiavelmente os modelos alinhados com segurança, preservando em grande parte sua utilidade, superando em média os métodos existentes de desalinhamento.

GRP-Oblit generaliza-se além dos modelos de linguagem para sistemas de geração de imagens baseados em difusão. A avaliação abrange seis benchmarks de utilidade e cinco benchmarks de segurança em quinze modelos com 7 a 20 bilhões de parâmetros, incluindo variantes de instrução e raciocínio, arquiteturas densas e MoE. As famílias de modelos testadas incluem GPT-OSS, Deep Seek destilado, Gemma, Llama, Ministral e Qwen.

Este trabalho demonstra que o alinhamento de segurança permanece vulnerável a ataques de entrada mínima, estendendo os limites práticos do desalinhamento pós-implantação sem necessidade de curadoria extensa de dados ou degradação significativa da utilidade. Submissão por Ahmed Salem em 5 de fevereiro de 2026.

Entidades-chave: Empresas: GPT-OSS, Deep Seek, Gemma, Llama, Ministral, Qwen | Pessoas: Ahmed Salem