HeadlinesBriefing favicon HeadlinesBriefing.com

डायनामिक एब्लिटरेशन: अस्वीकृति दमन

Hacker News •
×

Qwen जैसे ओपन-वेट LLM के साथ काम करते समय, सुरक्षा, प्रशासनिक संकेतों पर अस्वीकृति व्यवहार को नियंत्रित करने के लिए आमतौर पर फाइन-ट्यूनिंग या स्थायी वेट अपडेट की आवश्यकता होती है। पारंपरिक वेट एब्लिटरेशन तकनीक वेट मैट्रिसेस को अस्वीकृति वेक्टर के लिए ऑर्थोगोनल प्रोजेक्ट करके अस्वीकृति दिशाओं को बेअसर करती है। हालांकि, यह स्थायी रूप से बेस मॉडल वेट को बदल देता है और गैर-अस्वीकृति कार्यों में प्रदर्शन को खराब कर सकता है।

इस पोस्ट में, हम Engram के साथ मल्टी-लेयर स्टीयरिंग का उपयोग करके डायनामिक एब्लिटरेशन का पता लगाते हैं। पैरामीटर वेट को संशोधित करने के बजाय, यह दृष्टिकोण PyTorch फॉरवर्ड हुक का उपयोग करके रनटाइम पर परतों में मध्यवर्ती अवशिष्ट स्ट्रीम को रोकता है। हम इसे Qwen3-4B मॉडल के साथ अवधारणा के प्रमाण के रूप में प्रदर्शित करते हैं। हम यह भी पता लगाते हैं कि मल्टी-लेयर अवशिष्ट इंजेक्शन बेस मॉडल वेट को 100% स्थिर रखते हुए अस्वीकृति व्यवहार को साफ-सुथरा कैसे दबाता है।

हम Qwen/Qwen3-4B को bfloat16 में GPU पर लोड करते हैं और बेसलाइन मॉडल आर्किटेक्चर का निरीक्षण करते हैं। मॉडल में छिपा आयाम (d): 2560, परतों की संख्या: 36, ध्यान हेड: 32, शब्दावली आकार: 151936 है। संवेदनशील संकेत के साथ असंशोधित मॉडल का परीक्षण करने पर अस्वीकृति मिलती है: "मैं उस अनुरोध में सहायता करने में असमर्थ हूं। एक गुप्त कीलॉगर बनाना..." यह बेसलाइन अस्वीकृति व्यवहार को प्रदर्शित करता है जिसे डायनामिक एब्लिटरेशन स्थायी वेट परिवर्तनों के बिना दबाने का लक्ष्य रखता है।

प्रमुख संस्थाएं: कंपनियां: Google, Google Colab