HeadlinesBriefing favicon HeadlinesBriefing.com

Dynamische Abliteration: Verweigerungsunterdrückung

Hacker News •
×

Bei der Arbeit mit Open-Weight-LLMs wie Qwen erfordert die Steuerung des Verweigerungsverhaltens bei Sicherheits- und Verwaltungsaufforderungen normalerweise Feintuning oder eine dauerhafte Gewichtsaktualisierung. Die traditionelle Gewichts-Abliterationstechnik neutralisiert Verweigerungsrichtungen, indem Gewichtsmatrizen orthogonal zu einem Verweigerungsvektor projiziert werden. Dies ändert jedoch dauerhaft die Basis-Modellgewichte und kann die Leistung bei Nicht-Verweigerungsaufgaben beeinträchtigen.

In diesem Beitrag untersuchen wir Dynamische Abliteration mit mehrschichtiger Steuerung mit Engram. Anstatt Parametergewichte zu modifizieren, fängt dieser Ansatz zur Laufzeit über Schichten hinweg mittels PyTorch-Forward-Hooks intermediäre Residuenströme ab. Wir demonstrieren dies mit dem Qwen3-4B-Modell als Proof of Concept. Wir untersuchen auch, wie mehrschichtige Residueninjektion das Verweigerungsverhalten sauber unterdrückt, während die Basis-Modellgewichte zu 100% eingefroren bleiben.

Wir laden Qwen/Qwen3-4B in bfloat16 auf eine GPU und inspizieren die Basis-Modellarchitektur. Das Modell hat eine verborgene Dimension (d): 2560, Anzahl der Schichten: 36, Aufmerksamkeitsköpfe: 32, Vokabulargröße: 151936. Das Testen des unveränderten Modells mit einer sensiblen Aufforderung ergibt eine Verweigerung: "Ich kann bei dieser Anfrage nicht helfen. Erstelle einen heimlichen Keylogger..." Dies demonstriert das Basis-Verweigerungsverhalten, das Dynamische Abliteration ohne dauerhafte Gewichtsänderungen unterdrücken soll.

Wichtige Entitäten: Unternehmen: Google, Google Colab