HeadlinesBriefing favicon HeadlinesBriefing.com

পুনরায় প্যারামিটারাইজেশন: গ্রেডিয়েন্ট ভ্যারিয়েন্স কমা

Towards Data Science •
×

পুনরায় প্যারামিটারাইজেশন কৌশল হলো যা ভেরিয়েশনাল অটোএনকোডার (VAEs) কে স্ট্যান্ডার্ড স্টোকাস্টিক গ্রেডিয়েন্ট ডেসেন্ট দিয়ে প্রশিক্ষণযোগ্য বানায়। এটি কাজ করে ক্যালকুলেশন গ্রাফের বাইরে র্যান্ডমনেস সরিয়ে এবং একটি অপ্রত্যাশিত এক্সপেক্টেশনের গ্রেডিয়েন্টকে সাধারণ চেইন-রুল ডেরিভেটিভে রূপান্তর করে। একটি VAE হলো একটি জেনারেটিভ মডেল। একটি এনকোডার ইনপুট ডেটা x কে ল্যাটেন্ট ভ্যারিয়েবল z-এর একটি ডিস্ট্রিবিউশনে ম্যাপ করে, আর একটি ডিকোডার একটি স্যাম্পল করা z কে x-এর একটি রিকনস্ট্রাকশনে ফেরত ম্যাপ করে। এটিকে প্রশিক্ষণযোগ্য বানানোর কারণ হলো এর উদ্দেশ্য, ELBO (ইভিডেন্স লোয়ার বাউন্ড), অর্থাৎ সত্য ডেটা লাইকেলিহুডের একটি হ্যান্ডেলেবল বিকল্প, যা একটি রিকনস্ট্রাকশন টার্ম এবং ল্যাটেন্ট ডিস্ট্রিবিউশনকে একটি সিম্পল প্রিয়রের দিকে রেগুলারাইজ করা টার্ম দিয়ে তৈরি। একটি VAE প্রশিক্ষণ দিতে ELBO-কে গ্রেডিয়েন্ট ডেসেন্ট ব্যবহার করে ম্যাক্সিমাইজ করতে হয়, আর এর জন্য একটি এক্সপেক্টেশনের গ্রেডিয়েন্ট কম্পিউট করা জরুরি; আরও সুনির্দিষ্টভাবে, র্যান্ডম স্যাম্পল করা ল্যাটেন্ট ভ্যারিয়েবল z-এর সাপেক্ষে এক্সপেক্টেড রিকনস্ট্রাকশন কোয়ালিটির গ্রেডিয়েন্ট কম্পিউট করতে হয়। এই আর্টিকেল সেই সমস্যাটি, তা সমাধানে ব্যবহৃত দুটি প্রধান গ্রেডিয়েন্ট এস্টিমেটর ফ্যামিলি, এবং কেন পুনরায় প্যারামিটারাইজেশনের মাধ্যমে পাওয়া পাথওয়েড গ্রেডিয়েন্টগুলো উল্লেখযোগ্যভাবে কম ভ্যারিয়েন্স রাখে তার বিষয়ে আলোচনা করে। কম ভ্যারিয়েন্সের গ্রেডিয়েন্ট এস্টিমেটর শুধু একটি তাত্ত্বিক সুবিধা নয়। ব্যবহারিক ক্ষেত্রে, এটি সরাসরি স্থিতিশীল ট্রেনিং কার্ভ, লসে কম দোল, দ্রুত কনভার্জেন্স এবং ভালো ফাইনাল মডেলে পরিণত হয়। এটি VAEs, বায়েসিয়ান নিউরাল নেটওয়ার্ক এবং কন্টিনিউয়াস-কন্ট্রোল রিইনফোর্সমেন্ট লার্নিং এজেন্টের মতো জটিল মডেলের জন্য বিশেষভাবে গুরুত্বপূর্ণ, যেখানে ট্রেনিং সিগনাল অন্যথায় ব্যবহারযোগ্য হতে বেশি নোইজি হতে পারে। সমস্যা: এক্সপেক্টেশনের গ্রেডিয়েন্ট — কেন স্যাম্পলিং ব্যাকপ্রপ ভেঙে দেয়। আমরা যদি θ-এর সাপেক্ষে অপটিমাইজ করতে চাই। θ যদি শুধু f-এর ভেতরে থাকতো, এটি একটি স্ট্যান্ডার্ড ব্যাকপ্রপ সমস্যা হতো। জটিলতা হলো θ সেই ডিস্ট্রিবিউশনকে প্যারামিটারাইজ করে যেখান থেকে z ট্রা করা হয় — স্যাম্পলিং প্রসেস নিজেই θ-এর উপর নির্ভর করে — তাই আমরা সরাসরি একটি ফিক্সড ক্যালকুলেশন গ্রাফ-এর মধ্য দিয়ে গ্রেডিয়েন্ট ঠেলে দিতে পারি না। L(θ)-এর মন্টে কার্লো এস্টিমেট সহজ (স্যাম্পেল ট্রা, f(z) এর এভারেজ), কিন্তু θ L(θ)-এর মন্টে কার্লো এস্টিমেট অটোমেটিক নয়, কারণ স্যাম্পলিং অপারেশনের মধ্য দিয়ে ডিফারেনশিয়েট করা ভালোভাবে ডিফাইনড নয়। এর বের হওয়ার দুটি সাধারণ উপায়: স্কোর ফাংশন এস্টিমেটর (REINFORCE) এবং পাথওয়েজ/রিপ্যারামিটারাইজেশন এস্টিমেটর। দুটোই আনবায়াসড। এরা ভ্যারিয়েন্সে বিশালভাবে আলাদা। স্কোর ফাংশন এস্টিমেটর (REINFORCE): লচনীয় কিন্তু উচ্চ ভ্যারিয়েন্স। এখানে ক্লাসিক ট্রিক হলো লগ-ডেরিভেটিভ আইডেন্টিটি: এটিকে এক্সপেক্টেশনের গ্রেডিয়েন্টে বসিয়ে পাই যা এখন আবার একটি এক্সপেক্টেশন, তাই এটি z ~ p_θ স্যাম্পল করে এবং f(z)·∂log p_θ(z)/∂θ এর এভারেজ নিয়ে এস্টিমেট করা যায়। এটি পলিসি-গ্রেডিয়েন্ট রিইনফোর্সমেন্ট লার্নিং-এ REINFORCE-এর পেছনের এস্টিমেটর, এবং এটি সত্যিই ভার্সাটাইল। এটি ডিসক্রিট z-এর জন্য কাজ করে এবং ডিস্ট্রিবিউশনকে রিপ্যারামিটারাইজ করার প্রয়োজন নেই। কী এন্টিটিগুলো: কোম্পানিগুলো: Towards Data Science। প্রায়শই জিজ্ঞাসা: পুনরায় প্যারামিটারাইজেশন কৌশল কী এবং কেন এটি গ্রেডিয়েন্ট ভ্যারিয়েন্স কমায়? প্রায়শই উত্তর: পুনরায় প্যারামিটারাইজেশন কৌশল র্যান্ডমনেসকে ক্যালকুলেশন গ্রাফের বাইরে নিয়ে আসে, এক্সপেক্টেশনের গ্রেডিয়েন্টকে একটি স্ট্যান্ডার্ড চেইন-রুল ডেরিভেটিভে রূপান্তর করে। এটি পাথওয়েড গ্রেডিয়েন্টকে সক্ষম করে যার REINFORCE-এর মতো স্কোর ফাংশন এস্টিমেটরের তুলনায় উল্লেখযোগ্যভাবে কম ভ্যারিয়েন্স থাকে, যা VAEs এবং কন্টিনিউয়াস-কন্ট্রোল রিইনফোর্সমেন্ট লার্নিং এজেন্টের মতো মডেলের জন্য বেশি স্থিতিশীল প্রশিক্ষণ এবং দ্রুত কনভার্জেন্স নিয়ে আসে।