HeadlinesBriefing favicon HeadlinesBriefing.com

GRP-Obliteration: Menyindarikan LLM dengan Satu Prompt Saja

Hacker News •
×

Peneliti memperkenalkan GRP-Obliteration (GRP-Oblit), suatu metode yang menggunakan Group Relative Policy Optimization (GRPO) untuk menghapus batasan keamanan dari model yang sudah di-alignkan hanya dengan satu prompt tidak bertanda. Teknik ini dapat mengembalikan model yang di-alignkan keamana dengan andal, sambil tetap mempertahankan kegunaannya secara besar-besaran, dan secara rata-rata melebihi metode pengembalian tidak sejalan (unalignment) terdahulu yang ada.

GRP-Oblit dapat digeneralisasi di luar model bahasa untuk sistem pembuatan gambar berbasis difusi. Evaluasi mencakup enam benchmark kegunaan dan lima benchmark keamanan pada lima belas model dengan 7 hingga 20 miliar parameter, termasuk varian instruksi dan penalaran, arsitektur padat dan MoE. Keluarga model yang diuji meliputi GPT-OSS, Deep Seek distilasi, Gemma, Llama, Ministral, dan Qwen.

Karya ini menunjukkan bahwa penyelarasan keamanan masih rentan terhadap serangan input minimal, memperpanjang batas praktis pengembalian tidak sejalan pasca-penyebaran tanpa perlu kuratori data yang luas atau degradasi kegunaan yang signifikan. Penyerahan oleh Ahmed Salem pada 5 Februari 2026.

Entitas Kunci: Perusahaan: GPT-OSS, Deep Seek, Gemma, Llama, Ministral, Qwen | Orang: Ahmed Salem