SIFT est l'un des algorithmes les plus connus en vision par ordinateur. Son objectif principal consiste à détecter les points clés des objets, à générer des descripteurs pour ceux-ci et à faire correspondre les mêmes objets à travers les images. Comme son nom l'indique, SIFT est un algorithme invariant à l'échelle, ce qui signifie que le même objet peut apparaître à différentes échelles dans une paire d'images, et SIFT sera toujours capable de détecter ses points clés avec succès. De plus, SIFT est invariant à la rotation, ce qui rend également possible la correspondance pour les objets tournés.
Dans son flux de travail, SIFT construit plusieurs versions de l'image originale en appliquant des transformations de redimensionnement et de flou gaussien. Avec des valeurs choisies de k et σ1, SIFT construit plusieurs versions de l'image originale en appliquant un lissage gaussien avec différents écarts types. Cela donne une séquence d'images appelée octave. Ensuite, SIFT calcule les différences par paires entre les images résultantes, connues sous le nom de différence de gaussiennes (DoG).
Après cela, l'algorithme empile les Di et tente de trouver des extrema locaux en eux. Pour chaque point dans Di(x, y), SIFT examine ses 26 voisins. Si Di(x, y) est supérieur ou inférieur à tous ses 26 points voisins, SIFT le marque comme un maximum ou un minimum. Pour tenir compte des différentes variations d'échelle, le même processus est répété pour une image initiale réduite en largeur et en hauteur d'un facteur deux, construisant une nouvelle octave avec des valeurs σ comme σ2 = 2σ1.
FAQ : Quel est l'objectif principal de l'algorithme SIFT ?
L'objectif principal de l'algorithme SIFT consiste à détecter les points clés des objets, à générer des descripteurs pour ceux-ci et à faire correspondre les mêmes objets à travers les images.
Source: Towards Data Science · Résumé par HeadlinesBriefing