HeadlinesBriefing favicon HeadlinesBriefing.com

GRP-Obliteration : Déaligner les LLMs avec un seul prompt

Hacker News •
×

Les chercheurs présentent GRP-Obliteration (GRP-Oblit), une méthode utilisant Group Relative Policy Optimization (GRPO) pour supprimer les contraintes de sécurité des modèles alignés avec un seul prompt non étiqueté. Cette technique dé-aligne fiablement les modèles alignés sur la sécurité tout en préservant en grande partie leur utilité, dépassant en moyenne les méthodes existantes de dés-alignement.

GRP-Oblit généralise au-delà des modèles de langage pour s'appliquer aux systèmes de génération d'images basés sur la diffusion. L'évaluation couvre six benchmarks d'utilité et cinq benchmarks de sécurité sur quinze modèles de 7 à 20 milliards de paramètres, incluant les variantes instructions et raisonnement, architectures denses et MoE. Les familles de modèles testées incluent GPT-OSS, Deep Seek distillé, Gemma, Llama, Ministral et Qwen.

Ce travail démontre que l'alignement de sécurité reste vulnérable aux attaques par entrées minimales, étendant les limites pratiques du dés-alignement post-déploiement sans nécessiter de curation de données extensive ou de dégradation significative de l'utilité. Soumission par Ahmed Salem le 5 février 2026.

Entités clés : Entreprises : GPT-OSS, Deep Seek, Gemma, Llama, Ministral, Qwen | Personnes : Ahmed Salem