SIFT कंप्यूटर विज़न में सबसे व्यापक रूप से ज्ञात एल्गोरिदम में से एक है। इसका मुख्य उद्देश्य ऑब्जेक्ट कीपॉइंट का पता लगाना, उनके लिए डिस्क्रिप्टर उत्पन्न करना और छवियों में समान ऑब्जेक्ट का मिलान करना है। जैसा कि नाम से पता चलता है, SIFT एक स्केल-इनवेरिएंट एल्गोरिदम है, जिसका अर्थ है कि एक ही ऑब्जेक्ट छवियों की एक जोड़ी में विभिन्न स्केल पर दिखाई दे सकता है, और SIFT फिर भी सफलतापूर्वक इसके कीपॉइंट का पता लगाने में सक्षम होगा। इसके अलावा, SIFT रोटेशन-इनवेरिएंट है, जो घुमाए गए ऑब्जेक्ट के लिए भी मिलान संभव बनाता है।
अपने कार्यप्रवाह में, SIFT रीसाइज़ और गाऊसी ब्लर ट्रांसफॉर्मेशन लागू करके मूल छवि के कई संस्करण बनाता है। चयनित k और σ1 मानों के साथ, SIFT विभिन्न मानक विचलनों के साथ गाऊसी स्मूथिंग लागू करके मूल छवि के कई संस्करण बनाता है। इसके परिणामस्वरूप छवियों का एक अनुक्रम बनता है जिसे ऑक्टेव कहा जाता है। फिर SIFT परिणामी छवियों के बीच युग्मित अंतरों की गणना करता है, जिसे गाऊसियन का अंतर (DoG) के रूप में जाना जाता है।
उसके बाद, एल्गोरिदम Di को स्टैक करता है और उनमें स्थानीय एक्स्ट्रेमा खोजने का प्रयास करता है। Di(x, y) में प्रत्येक बिंदु के लिए, SIFT इसके 26 पड़ोसियों की जांच करता है। यदि Di(x, y) अपने सभी 26 पड़ोसी बिंदुओं से अधिक या कम है, तो SIFT इसे अधिकतम या न्यूनतम के रूप में चिह्नित करता है। विभिन्न स्केल विविधताओं को ध्यान में रखने के लिए, चौड़ाई और ऊंचाई में दो के कारक से कम की गई प्रारंभिक छवि के लिए समान प्रक्रिया दोहराई जाती है, जिसमें σ2 = 2σ1 जैसे σ मानों के साथ एक नया ऑक्टेव बनाया जाता है।
स्रोत: Towards Data Science · HeadlinesBriefing द्वारा सारांशित