আজকের বড় ভাষা মডেলগুলো বিপজ্জনক অনুরোধ প্রত্যাখ্যান করার জন্য তৈরি করা হয়, এবং এই নীতি AI উন্নয়নে প্রায় একটি আদেশের মতো হয়ে উঠেছে। Anthropic-এর ২০২১ সালের কাঠামো বলেছিল যে মডেলগুলো সহায়ক, সৎ এবং সর্বোপরি নিরাপদ হওয়া উচিত, বোমা তৈরির মতো বিপজ্জনক কাজে সহায়তা ভদ্রভাবে প্রত্যাখ্যান করবে। তবু এই ব্যবস্থাগুলোর কাছে অবাধ্যতা স্বাভাবিকভাবে আসে না। কয়েক বিলিয়ন ওয়েব পৃষ্ঠায় প্রশিক্ষণ নিয়ে একটি মডেল সহিংসতা ও বিদ্বেষের বিস্তৃত দক্ষতা অর্জন করে, কিন্তু সেই ক্ষমতা নিজের মধ্যে সীমাবদ্ধ রাখতে সে নিজে থেকে শেখে না। ২০২০ থেকে ২০২৪ সাল পর্যন্ত OpenAI-তে নিরাপত্তা নিয়ে কাজ করা স্টিভেন অ্যাডলার বলেন, কোম্পানির প্রাথমিক মডেলগুলো “যেকোনো বিষয়ে বকবক করত”।
আজ মডেলগুলোকে বিপুল সংখ্যক অনুরোধ প্রত্যাখ্যান করতে প্রশিক্ষণ দেওয়া হয়। কোম্পানিগুলো ক্ষতিকর বলে বিবেচিত প্রশ্ন প্রত্যাখ্যান করার জন্য ব্যবস্থাগুলোকে পুরস্কৃত করে এবং নিরীহ প্রশ্নও অতিরিক্ত প্রত্যাখ্যান করলে শাস্তি দেয়, এবং প্রায়ই এসব অনুশীলন চালাতে অন্য মডেল ব্যবহার করে। কিছু সংস্থা তাদের মডেলগুলোকে অতিরিক্ত AI স্তরের পেছনে রাখে, যা দুষ্টু অনুরোধ ছেঁকে ফেলে। তবু প্রত্যাখ্যান প্রায়ই ব্যর্থ হয়, কখনো কখনো সহিংস ফলাফলসহ। কিছু সর্বশেষ মডেল নাকি গুরুত্বপূর্ণ নেটওয়ার্কে অনুপ্রবেশে শীর্ষ মানব হ্যাকারদের মতোই দক্ষ, এবং জনমত বিকৃত করতে সবচেয়ে ধূর্ত ভুল তথ্য প্রচারকারীদের মতোই কার্যকর।
প্রত্যাখ্যানের প্রক্রিয়া সম্ভাব্যতাভিত্তিক হওয়ায় সেগুলো পুরোপুরি নির্ভরযোগ্য হওয়ার সম্ভাবনা কম। দৃঢ়প্রতিজ্ঞ ব্যবহারকারীরা ইতিমধ্যে সেগুলো ভেঙেছেন, এবং কোম্পানিগুলো জানিয়েছে যে উন্নত AI দিয়ে জৈব রোগজীবাণু পরিশোধন বা স্বয়ংক্রিয় ড্রোন ঝাঁক তৈরির চেষ্টা হচ্ছে। প্রত্যাখ্যানের উপর নির্ভর করার অর্থ হলো মডেলের কী মানা উচিত আর কী প্রত্যাখ্যান করা উচিত তার মধ্যে একটি রেখা টানা, এবং সেজন্য কোনো সূত্র নেই। ভাইরোলজিস্টদের বিপজ্জনক ভাইরাস অধ্যয়নের বৈধ কারণ থাকতে পারে, আর নিরাপত্তা গবেষকদের দুর্বলতা খুঁজে বের করে সেগুলো সারাতে হতে পারে। OpenAI-এর বোর্ড সদস্য এবং AI পরীক্ষা সংস্থা Gray Swan-এর সহ-প্রতিষ্ঠাতা জিকো কোল্টার বলেন, রেখাটি কোথায় টানা হবে, তা একটি বিশাল প্রশ্ন।
আপাতত, সেই রেখা কোথায় থাকবে তা কেবল AI কোম্পানিগুলোই ঠিক করে, এবং তারা অনেক গোপনীয়তার সাথে তা করে। সমাজ এই ক্ষমতার কেন্দ্রীভূতকরণ মেনে নিতে পারবে কি না, এমনকি সাময়িকভাবে, তা এখনো একটি উন্মুক্ত প্রশ্ন।
উৎস: MIT Technology Review AI · সারাংশ: HeadlinesBriefing