HeadlinesBriefing favicon HeadlinesBriefing.com

GRP-Obliteration: एकल प्रॉम्प्ट के साथ LLM को अन-अलाइन करना

Hacker News •
×

शोधकर्ता GRP-Obliteration (GRP-Oblit) का परिचय करते हैं, जो Group Relative Policy Optimization (GRPO) का उपयोग करके एकमात्र अलग-अलग प्रॉम्प्ट के साथ अलाइन्ड मॉडल की सुरक्षा सीमाओं को हटाने की विधि है। यह तकनीक सुरक्षा-अलाइन्ड मॉडल को भरोसेमंद रूप से अन-अलाइन करती है, जबकि इसकी उपयोगिता को बहुत हद तक बनाए रखती है, और मौजूदा सभी राज्य-आधारित अन-अलाइन विधियों में औसत में बेहतर प्रदर्शित करती है।

GRP-Oblit का उपयोग केवल भाषा मॉडलों तक सीमित नहीं रहता, बल्कि इसे प्रसारण-आधारित चित्र निर्माण प्रणालियों के लिए भी किया जा सकता है। यह मूल्यांकन 6 उपयोगिता बेंचमार्क और 5 सुरक्षा बेंचमार्क पर किया गया है, जो 15 विभिन्न 7-20 अर्ब पैरामीटर वाले मॉडलों पर लागू हुआ है, जिनमें instruction और reasoning विकल्प भी शामिल हैं, साथ ही dense और MoE आर्किटेक्चर। परीक्षित मॉडल परिवारों में GPT-OSS, निर्गत Deep Seek, Gemma, Llama, Ministral और Qwen शामिल हैं।

यह कार्य दर्शाता है कि सुरक्षा अलाइनमेंट न्यूनतम इनपुट हमलों के साथ संवेदनशील रहता है, जो पोस्ट-डिप्लॉयमेंट अन-अलाइनिंग के व्यावहारिक सीमाओं को बढ़ाता है, बिना बड़े परिमाण में डेटा संरचना या महत्वपूर्ण उपयोगिता कमजोरी के। Ahmed Salem द्वारा 5 फरवरी, 2026 को दर्ज किया गया।

मुख्य इकाईओं: कंपनियाँ: GPT-OSS, Deep Seek, Gemma, Llama, Ministral, Qwen | लोग: Ahmed Salem