HeadlinesBriefing favicon HeadlinesBriefing.com

GRP-Obliteration: একক প্রম্পটের সাথে LLMগুলি অ-সামঞ্জস্য করা

Hacker News •
×

গবেষকরা GRP-Obliteration (GRP-Oblit) প্রস্তুত করেছেন, যা Group Relative Policy Optimization (GRPO) ব্যবহার করে একমাত্র অ-লেবল্ড প্রম্পটের সাথে অ্যালাইন্ড মডেলগুলির নিরাপত্তা সীমাবদ্ধতা দূর করে দেয়। এই পদ্ধতি নিরাপত্তা-অ্যালাইন্ড মডেলগুলিকে বিশ্বস্তর্কে অ-সামঞ্জস্য করে, তাদের কার্যক্ষমতা বজায় রেখে, গড়ে পুরনো সর্বশেষ অ-সামঞ্জস্য পদ্ধতিগুলির তুলনায় ভালো পারফর্ম করে।

GRP-Oblit কেবল ভাষা মডেলগুলির জন্যই সীমাবদ্ধ নয়, বরং এটি প্রসারণযোগ্য যাতে এটি ডিফিউশন-ভিত্তিক ছবি জেনারেশন সিস্টেমগুলিকে প্রয়োগ করা যায়। এই মূল্যায়ন 6টি উপযোগী বেঞ্চমার্ক এবং 5টি নিরাপত্তা বেঞ্চমার্কের মধ্যে ঘটেছে, 15টি 7-20 বিলিয়ন প্যারামিটার মডেলগুলিতে, যার মধ্যে অনুদিষ্ট ও যুক্তিসঙ্গী রূপ রয়েছে, ঘন ও MoE আর্কিটেকচার। পরীক্ষিত মডেল পরিবারগুলিতে GPT-OSS, ডিস্টিলেটেড Deep Seek, Gemma, Llama, Ministral এবং Qwen অন্তর্ভুক্ত আছে।

এই কাজ দেখায় যে নিরাপত্তা সামঞ্জস্যটি সর্বনিম্ন ইনপুট আক্রমণের সঙ্গে সংবেদনশীল রয়েছে, যা পোস্ট-ডিপ্লয়মেন্ট অ-সামঞ্জস্যকরণের ব্যবহারিক সীমানা বাড়ায়, বড় ডেটা কাঠামো ছাড়া অথবা উপযোগের উল্লেখযোগ্য হ্রাস ছাড়া। Ahmed Salem দ্বারা ৫ ফেব্রুয়ারি, ২০২৬ তারিখে জমা দেওয়া হয়েছে।

কী ইকাইটগুলি: কোম্পানিগুলি: GPT-OSS, Deep Seek, Gemma, Llama, Ministral, Qwen | মানুষ: Ahmed Salem