HeadlinesBriefing favicon HeadlinesBriefing.com

ডাবল-ব্লাইন্ড AI মূল্যায়ন

Google DeepMind Blog •
×

AI বেঞ্চমার্ক ফলাফল তির্যক হতে পারে যদি মডেলগুলি পরীক্ষার প্রশ্ন আগে থেকেই দেখে, এই সমস্যাটি বেঞ্চমার্ক দূষণ নামে পরিচিত। এটি মোকাবেলার জন্য, Google DeepMind একটি মালিকানাধীন সীমান্ত মডেলের বিশ্বের প্রথম ডাবল-ব্লাইন্ড মূল্যায়ন পাইলট করছে। এই পদ্ধতি বাহ্যিক মূল্যায়নকে একটি ক্রিপ্টোগ্রাফিক 'বাক্সে' রাখে যাতে পরীক্ষার আগে সেগুলি কর্মক্ষমতা অপ্টিমাইজ করতে ব্যবহার না করা যায়।

Google সিঙ্গাপুর AI নিরাপত্তা ইনস্টিটিউট, OpenMined, AVERI এবং MLCommons-এর সাথে অংশীদারিত্ব করছে একটি গোপনীয়তা-সংরক্ষণ পরিবেশে গোপনীয় বেঞ্চমার্কের বিরুদ্ধে Gemini Flash Lite মডেল পরীক্ষা করতে। এটি মডেলকে প্রশ্নে 'উঁকি দেওয়া' থেকে বিরত রেখে মূল্যায়নের অখণ্ডতা বাড়ায়।

পূর্বে, বাহ্যিক অংশীদাররা পরীক্ষার প্রম্পট গোপন রাখতে শূন্য-লগিং প্রোটোকল এবং চুক্তিভিত্তিক সুরক্ষা ব্যবহার করত। প্রযুক্তিগত এবং ক্রিপ্টোগ্রাফিক সুরক্ষা যোগ করা একটি বড় পদক্ষেপ। নীতি নির্ধারক, গবেষক এবং উদ্যোগগুলির মডেলের প্রকৃত ক্ষমতা এবং নিরাপত্তা সঠিকভাবে প্রতিফলিত করার জন্য বিশ্বস্ত বেঞ্চমার্ক প্রয়োজন।

মূল সত্তা: কোম্পানি: Google DeepMind, OpenMined, MLCommons | অবস্থান: সিঙ্গাপুর