HeadlinesBriefing favicon HeadlinesBriefing.com

Ablitération Dynamique : Suppression du Refus

Hacker News •
×

Lorsqu'on travaille avec des LLM à poids ouverts comme Qwen, contrôler le comportement de refus sur des invites de sécurité et d'administration nécessite généralement un réglage fin ou une mise à jour permanente des poids. La technique traditionnelle d'ablitération des poids neutralise les directions de refus en projetant les matrices de poids orthogonalement à un vecteur de refus. Cependant, cela modifie de manière permanente les poids du modèle de base et peut dégrader les performances sur les tâches non liées au refus.

Dans cet article, nous explorons l'Ablitération Dynamique en utilisant le Pilotage Multi-Couches avec Engram. Au lieu de modifier les poids des paramètres, cette approche intercepte les flux résiduels intermédiaires à l'exécution à travers les couches en utilisant des hooks avant PyTorch. Nous le démontrons avec le modèle Qwen3-4B comme preuve de concept. Nous explorons également comment l'injection résiduelle multi-couches supprime proprement le comportement de refus tout en laissant les poids du modèle de base 100% gelés.

Nous chargeons Qwen/Qwen3-4B en bfloat16 sur un GPU et inspectons l'architecture du modèle de base. Le modèle a une dimension cachée (d) : 2560, un nombre de couches : 36, des têtes d'attention : 32, une taille de vocabulaire : 151936. Tester le modèle non modifié avec une invite sensible produit un refus : "Je ne peux pas aider avec cette demande. Création d'un enregistreur de frappes furtif..." Cela démontre le comportement de refus de base que l'Ablitération Dynamique vise à supprimer sans changements permanents de poids.

Entités clés : Entreprises : Google, Google Colab