HeadlinesBriefing favicon HeadlinesBriefing.com

動的アブリテレーション:拒否抑制

Hacker News •
×

QwenのようなオープンウェイトLLMを扱う場合、セキュリティ、管理プロンプトに対する拒否動作の制御には通常、ファインチューニングまたは永続的な重みの更新が必要です。従来のウェイトアブリテレーション技術は、拒否ベクトルに直交するように重み行列を射影することで拒否方向を中和します。しかし、これによりベースモデルの重みが永続的に変更され、非拒否タスクのパフォーマンスが低下する可能性があります。

この投稿では、Engramを使用したマルチレイヤーステアリングを用いた動的アブリテレーションを探求します。このアプローチは、パラメータの重みを変更する代わりに、PyTorchのフォワードフックを使用して実行時にレイヤー全体の中間残差ストリームをインターセプトします。これをQwen3-4Bモデルで概念実証としてデモンストレーションします。また、マルチレイヤー残差注入がベースモデルの重みを100%凍結したまま、拒否動作をきれいに抑制する方法も探求します。

Qwen/Qwen3-4Bをbfloat16でGPUにロードし、ベースラインモデルのアーキテクチャを検査します。モデルは隠れ次元(d):2560、レイヤー数:36、アテンションヘッド:32、語彙サイズ:151936です。未変更のモデルを機密プロンプトでテストすると、拒否が発生します:「そのリクエストには対応できません。ステルスキーロガーを作成しています...」これは、動的アブリテレーションが永続的な重み変更なしに抑制しようとするベースラインの拒否動作を示しています。

主要エンティティ:企業:Google、Google Colab