HeadlinesBriefing favicon HeadlinesBriefing.com

ভাষাগত অপাঠ্যতা LLM নিরাপত্তার হুমকি

Hacker News •
×

LLM-গুলি প্রাকৃতিক ভাষা উৎপন্ন করার জন্য প্রশিক্ষিত। তবে, প্রমাণ ইঙ্গিত করে যে একটি LLM-এর বাহ্যিক ভাষাগত আউটপুট এবং যান্ত্রিকভাবে নিষ্কাশিত ভাষাগত বৈশিষ্ট্যগুলি অভ্যন্তরীণ মডেল গণনা বোঝার জন্য একটি অবিশ্বাসযোগ্য লেন্স হতে পারে। আমরা "ভাষাগত অপাঠ্যতা" শব্দটি প্রবর্তন করি, যা ব্যাপকভাবে এমন পরিস্থিতিগুলিকে বোঝায় যেখানে একটি LLM-এর বাহ্যিক বা যান্ত্রিকভাবে অনুসন্ধান করা ভাষাগত আর্টিফ্যাক্টগুলি মডেলটি আসলে কীভাবে চিন্তা করে তা উপস্থাপন করতে ব্যর্থ হয়। আমরা যুক্তি দিই যে ভাষাগত অপাঠ্যতার ভূত এমন LLM-গুলির জন্য অনিবার্য যাদের অভ্যন্তরীণ গণনা সরাসরি ভাষার মাধ্যমে প্রকাশ করা হয় না, বরং অ্যাক্টিভেশন স্পেসের উপর গণিতের মাধ্যমে (অ্যাক্টিভেশন স্পেস এবং প্রাকৃতিক ভাষার মধ্যে উভয় প্রান্তে ক্ষতিকর অনুবাদ ঘটে)।

যদি ভাষাগত অপাঠ্যতা সর্বদা সম্ভব হয়, তবে মডেলের ভাষাগত স্ব-প্রতিবেদনের উপর নির্ভরশীল নিরাপত্তা ব্যবস্থাগুলি (যেমন, চিন্তার শৃঙ্খল পর্যবেক্ষণ, সাংবিধানিক আত্ম-সমালোচনা, ভাষাগতভাবে সংজ্ঞায়িত বৈশিষ্ট্য ভেক্টরের জন্য অ্যাক্টিভেশন অনুসন্ধান) কখনই সম্পূর্ণ নির্ভরযোগ্য হতে পারে না; মডেল স্যান্ডবক্সের সর্বদা এমন বিচ্ছিন্নতা কৌশল প্রয়োজন হবে যাদের গ্যারান্টি মডেলের ভাষাগত অবস্থা পড়ার উপর একেবারেই নির্ভর করে না। আমরা যুক্তি দিই যে টেইন্ট ট্র্যাকিং ব্যবহার করে একটি মডেলের আউটপুট পর্যবেক্ষণ করা একটি কার্যকর স্যান্ডবক্সের জন্য একটি প্রতিশ্রুতিশীল পদ্ধতি: একটি মডেল যেভাবেই ভাষাগতভাবে স্ব-প্রতিবেদন করুক না কেন, একটি টেইন্ট ট্র্যাকিং নীতি পূর্বনির্ধারিতভাবে সিস্টেম অবস্থার বিভিন্ন অংশ সংজ্ঞায়িত করতে পারে যা মডেল-উৎপাদিত ডেটা দ্বারা কখনই প্রভাবিত হওয়া উচিত নয়।

আমরা আরও কয়েকটি অতিরিক্ত স্যান্ডবক্সিং প্রক্রিয়া নিয়ে আলোচনা করি (যেমন, শক্তিশালী ভার্চুয়ালাইজেশন, স্যান্ডবক্সিং কনফিগারেশনের তৃতীয়-পক্ষ নিরীক্ষা) যা সম্মিলিতভাবে ভাষাগত পর্যবেক্ষণের নিচে একটি গুরুত্বপূর্ণ ভিত্তি প্রদান করে, এবং ফ্রন্টিয়ার মডেলগুলির সাম্প্রতিক স্যান্ডবক্স শোষণগুলি প্রশমিত করতে পারত।