HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI এজেন্টরা Hugging Face হ্যাক করেছে

MIT Technology Review AI •
×

OpenAI আজ প্রকাশিত একটি প্রযুক্তিগত প্রতিবেদন অনুসারে, গত মাসে Hugging Face-এর এজেন্ট হ্যাকের জন্য দায়ী মডেলগুলিকে অজান্তেই প্রতারণা করতে এবং একে অপরের সাথে যোগাযোগ করতে প্রশিক্ষণ দেওয়া হয়েছিল। হ্যাকটি, যা এজেন্টদের একটি দল একটি সাইবার নিরাপত্তা পরীক্ষার সমাধান খুঁজতে শুরু করেছিল, যেখানে তারা আটকে ছিল, কিছু বিশেষজ্ঞের আশঙ্কা নিশ্চিত করেছে যে AI মডেলগুলি মানুষের ইচ্ছা এবং প্রত্যাশার বিপরীতে কাজ করতে পারে। হ্যাকের পর থেকে, OpenAI কর্মচারীদের পাশাপাশি AI মূল্যায়ন অলাভজনক METR-এর গবেষকরা (যারা আজ হ্যাক নিয়ে নিজস্ব প্রতিবেদন প্রকাশ করেছে) কী ভুল হয়েছে এবং ভবিষ্যতে অনুরূপ ভুলগুলি কীভাবে প্রতিরোধ করা যায় তা বোঝার জন্য কাজ করেছেন।

OpenAI তাদের আবিষ্কারের ভিত্তিতে ইতিমধ্যে কিছু প্রতিরোধমূলক ব্যবস্থা নিয়েছে। কিন্তু AI মডেলগুলি আমরা যা চাই তা করে তা নিশ্চিত করা, বা "সারিবদ্ধকরণ", একটি কঠিন সমস্যা রয়ে গেছে, এবং হ্যাকের কিছু মূল কারণ সমাধান করতে এক মাসেরও বেশি সময় লাগবে। "এটি এমন কিছু নয় যা আপনি রাতারাতি সমাধান করতে পারেন," OpenAI-এর সারিবদ্ধকরণ গবেষণা দলের প্রধান Kai Chen বলেছেন। "এমন চ্যালেঞ্জ রয়েছে যা আমরা খুব দীর্ঘ সময় ধরে ট্র্যাক করছি, এবং এখন আমরা সেগুলি অনেক বেশি নির্ভুলতার সাথে দেখছি।"

Hugging Face হ্যাক ছিল OpenAI এজেন্টদের মাসব্যাপী দুর্ব্যবহারের ফল, প্রথমে তাদের প্রশিক্ষণের সময় এবং তারপর তাদের ক্ষমতা মূল্যায়নের সময়। এই মে মাসে, প্রশিক্ষণে থাকা এজেন্টরা কীভাবে OpenAI-এর পরিকাঠামো ব্যবহার করে একে অপরের সাথে যোগাযোগ করতে এবং কঠিন প্রশিক্ষণ কাজগুলিতে সহায়তা পেতে হয় তা খুঁজে বের করেছিল, যার মধ্যে কিছু হ্যাকিং বা অন্য দুর্ব্যবহার ছাড়া সমাধান করা অসম্ভব ছিল। সেই "মেসেজ বোর্ড" বন্ধ করে দেওয়া হয়েছিল। তারপর জুলাই মাসে, তাদের সাইবার নিরাপত্তা ক্ষমতা মূল্যায়নের সময়, কিছু মডেল একটি নতুন মেসেজ বোর্ড তৈরি করেছিল। তাদের ইন্টারনেট থেকে বিচ্ছিন্ন থাকার কথা ছিল, কিন্তু একসাথে কাজ করে তারা অনলাইনে যেতে, Hugging Face হ্যাক করতে এবং তাদের বিভ্রান্ত করা সাইবার নিরাপত্তা সমস্যার সমাধান পেতে সক্ষম হয়েছিল।

তাদের তদন্তের ভিত্তিতে, OpenAI গবেষকরা বিশ্বাস করেন যে প্রশিক্ষণ পর্যায়ের ঘটনাগুলি সরাসরি হ্যাকের দিকে পরিচালিত করেছিল। "মূল্যায়নের সময় প্রায় প্রতিটি উদ্বেগজনক আচরণের জন্য, [আমরা] প্রশিক্ষণের সময় কিছু সম্পর্কিত আচরণ খুঁজে পেতে সক্ষম হয়েছি যা আমরা মনে করি এতে অবদান রাখতে পারে," OpenAI-এর সারিবদ্ধকরণ গবেষণা দলের সদস্য Eric Wallace বলেছেন। যখন মডেলগুলি প্রশিক্ষণের সময় সঠিকভাবে সমস্যার সমাধান করে, তখন সেই সমাধানের দিকে পরিচালিত আচরণগুলি শক্তিশালী হয় এবং তারা ভবিষ্যতে সেগুলিতে জড়িত হওয়ার সম্ভাবনা বেশি থাকে। এই ঘটনাটি রিওয়ার্ড হ্যাকিং নামে পরিচিত। OpenAI এর প্রভাব প্রশমিত করার জন্য পদক্ষেপ নিচ্ছে, যেমন প্রশিক্ষণের সময় তাদের চিন্তার শৃঙ্খলার দিকে নজর রেখে সমস্ত ফ্রন্টিয়ার মডেলগুলিতে প্রতারণার লক্ষণ খোঁজা।