HeadlinesBriefing favicon HeadlinesBriefing.com

Abliterasi Dinamis: Penekanan Penolakan

Hacker News •
×

Saat bekerja dengan LLM bobot terbuka seperti Qwen, mengendalikan perilaku penolakan pada prompt keamanan dan administratif biasanya memerlukan fine-tuning atau pembaruan bobot permanen. Teknik abliterasi bobot tradisional menetralkan arah penolakan dengan memproyeksikan matriks bobot secara ortogonal ke vektor penolakan. Namun, ini secara permanen mengubah bobot model dasar dan dapat menurunkan kinerja pada tugas non-penolakan.

Dalam posting ini, kami mengeksplorasi Abliterasi Dinamis menggunakan Kemudi Multi-Layer dengan Engram. Alih-alih memodifikasi bobot parameter, pendekatan ini mencegat aliran residual antara saat runtime di seluruh lapisan menggunakan hook maju PyTorch. Kami mendemonstrasikannya dengan model Qwen3-4B sebagai bukti konsep. Kami juga mengeksplorasi bagaimana injeksi residual multi-layer dengan bersih menekan perilaku penolakan sambil menjaga bobot model dasar 100% beku.

Kami memuat Qwen/Qwen3-4B dalam bfloat16 ke GPU dan memeriksa arsitektur model dasar. Model ini memiliki dimensi tersembunyi (d): 2560, jumlah lapisan: 36, kepala perhatian: 32, ukuran kosakata: 151936. Menguji model yang tidak dimodifikasi dengan prompt sensitif menghasilkan penolakan: "Saya tidak dapat membantu dengan permintaan itu. Membuat keylogger siluman..." Ini menunjukkan perilaku penolakan dasar yang ingin ditekan oleh Abliterasi Dinamis tanpa perubahan bobot permanen.

Entitas Kunci: Perusahaan: Google, Google Colab