HeadlinesBriefing favicon HeadlinesBriefing.com

ডাইনামিক অ্যাব্লিটারেশন: প্রত্যাখ্যান দমন

Hacker News •
×

Qwen-এর মতো ওপেন-ওয়েট LLM-এর সাথে কাজ করার সময়, নিরাপত্তা, প্রশাসনিক প্রম্পটে প্রত্যাখ্যান আচরণ নিয়ন্ত্রণের জন্য সাধারণত ফাইন-টিউনিং বা স্থায়ী ওজন আপডেট প্রয়োজন। ঐতিহ্যবাহী ওজন অ্যাব্লিটারেশন কৌশল প্রত্যাখ্যান ভেক্টরের সাথে অর্থোগোনালভাবে ওজন ম্যাট্রিক্স প্রজেক্ট করে প্রত্যাখ্যান দিকগুলিকে নিরপেক্ষ করে। তবে, এটি স্থায়ীভাবে বেস মডেল ওজন পরিবর্তন করে এবং অ-প্রত্যাখ্যান কাজগুলিতে কর্মক্ষমতা হ্রাস করতে পারে।

এই পোস্টে, আমরা এনগ্রামের সাথে মাল্টি-লেয়ার স্টিয়ারিং ব্যবহার করে ডাইনামিক অ্যাব্লিটারেশন অন্বেষণ করি। প্যারামিটার ওজন পরিবর্তন করার পরিবর্তে, এই পদ্ধতিটি PyTorch ফরোয়ার্ড হুক ব্যবহার করে রানটাইমে স্তরগুলির মধ্যে মধ্যবর্তী অবশিষ্ট স্ট্রিমগুলিকে আটকায়। আমরা এটি Qwen3-4B মডেলের সাথে ধারণার প্রমাণ হিসাবে প্রদর্শন করি। আমরা আরও অন্বেষণ করি যে কীভাবে মাল্টি-লেয়ার অবশিষ্ট ইনজেকশন বেস মডেল ওজন 100% স্থির রেখে প্রত্যাখ্যান আচরণকে পরিষ্কারভাবে দমন করে।

আমরা Qwen/Qwen3-4B-কে bfloat16-এ GPU-তে লোড করি এবং বেসলাইন মডেল আর্কিটেকচার পরিদর্শন করি। মডেলটির লুকানো মাত্রা (d): 2560, স্তরের সংখ্যা: 36, মনোযোগ হেড: 32, শব্দভান্ডারের আকার: 151936। সংবেদনশীল প্রম্পটের সাথে অপরিবর্তিত মডেল পরীক্ষা করলে প্রত্যাখ্যান পাওয়া যায়: "আমি সেই অনুরোধে সহায়তা করতে অক্ষম। একটি গোপন কীলগার তৈরি করা..." এটি বেসলাইন প্রত্যাখ্যান আচরণ প্রদর্শন করে যা ডাইনামিক অ্যাব্লিটারেশন স্থায়ী ওজন পরিবর্তন ছাড়াই দমন করার লক্ষ্য রাখে।

মূল সত্তা: কোম্পানি: Google, Google Colab