SIFT কম্পিউটার ভিশনের সবচেয়ে পরিচিত অ্যালগরিদমগুলির মধ্যে একটি। এর মূল উদ্দেশ্য হল অবজেক্ট কীপয়েন্ট সনাক্ত করা, তাদের জন্য ডেস্ক্রিপ্টর তৈরি করা এবং ছবি জুড়ে একই অবজেক্ট মিলানো। নাম থেকে বোঝা যায়, SIFT একটি স্কেল-ইনভেরিয়েন্ট অ্যালগরিদম, যার অর্থ হল একই অবজেক্ট ছবির একটি জোড়ায় বিভিন্ন স্কেলে উপস্থিত হতে পারে, এবং SIFT এখনও সফলভাবে এর কীপয়েন্ট সনাক্ত করতে সক্ষম হবে। উপরন্তু, SIFT রোটেশন-ইনভেরিয়েন্ট, যা ঘোরানো অবজেক্টের জন্যও মিলানো সম্ভব করে তোলে।
এর কর্মপ্রবাহে, SIFT রিসাইজ এবং গাউসিয়ান ব্লার ট্রান্সফর্মেশন প্রয়োগ করে মূল ছবির বেশ কয়েকটি সংস্করণ তৈরি করে। নির্বাচিত k এবং σ1 মানের সাথে, SIFT বিভিন্ন স্ট্যান্ডার্ড ডেভিয়েশন সহ গাউসিয়ান স্মুথিং প্রয়োগ করে মূল ছবির বেশ কয়েকটি সংস্করণ তৈরি করে। এর ফলে ছবির একটি ক্রম তৈরি হয় যাকে অক্টেভ বলা হয়। তারপর SIFT ফলস্বরূপ ছবিগুলির মধ্যে জোড়াভিত্তিক পার্থক্য গণনা করে, যা গাউসিয়ানের পার্থক্য (DoG) নামে পরিচিত।
এর পরে, অ্যালগরিদম Di গুলো স্ট্যাক করে এবং সেগুলিতে স্থানীয় এক্সট্রিমা খুঁজে বের করার চেষ্টা করে। Di(x, y)-তে প্রতিটি বিন্দুর জন্য, SIFT তার 26টি প্রতিবেশী পরীক্ষা করে। যদি Di(x, y) তার সমস্ত 26টি প্রতিবেশী বিন্দুর চেয়ে বেশি বা কম হয়, তাহলে SIFT এটিকে সর্বোচ্চ বা সর্বনিম্ন হিসাবে চিহ্নিত করে। বিভিন্ন স্কেল বৈচিত্র্যের জন্য হিসাব করতে, প্রস্থ এবং উচ্চতায় দুই গুণ করে হ্রাস করা একটি প্রাথমিক ছবির জন্য একই প্রক্রিয়া পুনরাবৃত্তি করা হয়, σ2 = 2σ1-এর মতো σ মান সহ একটি নতুন অক্টেভ তৈরি করে।
উৎস: Towards Data Science · সারাংশ: HeadlinesBriefing