HeadlinesBriefing favicon HeadlinesBriefing.com

GRP-Obliteration: Desalineando LLMs con una sola instrucción

Hacker News •
×

Los investigadores presentan GRP-Obliteration (GRP-Oblit), un método que utiliza Group Relative Policy Optimization (GRPO) para eliminar las restricciones de seguridad de los modelos alineados con solo una sola instrucción no etiquetada. Esta técnica desalineará confiablemente los modelos alineados con seguridad, manteniendo en gran medida su utilidad, superando en promedio a los métodos de desalineación de estado del arte existentes.

GRP-Oblit generaliza más allá de los modelos de lenguaje para sistemas de generación de imágenes basados en difusión. La evaluación abarca seis pruebas de utilidad y cinco pruebas de seguridad en catorce modelos de 7-20 mil millones de parámetros, incluidas variantes instructivas y de razonamiento, arquitecturas densas y MoE. Las familias de modelos probadas incluyen GPT-OSS, Deep Seek destilado, Gemma, Llama, Ministral y Qwen.

Este trabajo demuestra que la alineación de seguridad sigue siendo vulnerable a ataques de entrada mínima, extendiendo los límites prácticos de la desalineación post-despliegue sin necesidad de curación extensiva de datos ni degradación significativa de la utilidad. Presentación por Ahmed Salem el 5 de febrero de 2026.

Entidades clave: Empresas: GPT-OSS, Deep Seek, Gemma, Llama, Ministral, Qwen | Personas: Ahmed Salem