HeadlinesBriefing favicon HeadlinesBriefing.com

Parcours de l'article CBAM : Mécanisme d'attention double

Towards Data Science •
×

Cet article passe en revue et implémente l'article CBAM (Module d'Attention de Bloc Convolutif) de Woo et al. [1]. Publié en 2018, CBAM améliore la qualité des caractéristiques des CNN grâce à un mécanisme d'attention double, antérieur au Vision Transformer (ViT) introduit en 2020. Il reste pertinent grâce à sa conception légère, adapté aux déploiements à faible consommation.

CBAM améliore SENet (Réseau de Compression et d'Excitation) en ajoutant une attention spatiale. Alors que SENet applique l'attention uniquement sur les canaux, CBAM introduit deux sous-modules : le Module d'Attention de Canal (CAM) et le Module d'Attention Spatiale (SAM). CAM utilise à la fois le pooling moyen global et le pooling max global, suivi d'un MLP partagé avec un taux de réduction, pour générer des poids de canal. SAM applique le pooling max et le pooling moyen sur les canaux, puis une couche de convolution pour produire une carte d'attention spatiale.

La sortie raffinée conserve les dimensions du tenseur d'entrée (C×H×W), permettant une intégration transparente dans n'importe quelle architecture de backbone. L'implémentation est démontrée avec PyTorch, fournissant un guide pratique pour appliquer ce mécanisme d'attention double aux tâches de vision par ordinateur.

Entités clés : Entreprises : Towards Data Science | Personnes : Woo et al.

FAQ : En quoi CBAM diffère-t-il de SENet en termes de mécanismes d'attention ?

CBAM étend SENet en ajoutant un Module d'Attention Spatiale (SAM) alongside le Module d'Attention de Canal (CAM), permettant un pondération spatiale au niveau des pixels en plus de la pondération par canal.