HeadlinesBriefing favicon HeadlinesBriefing.com

Recorrido por el artículo CBAM: Mecanismo de Doble Atención

Towards Data Science •
×

Este artículo revisa e implementa el artículo CBAM (Módulo de Atención de Bloque Convolucional) de Woo et al. [1]. Publicado en 2018, CBAM mejora la calidad de las características de CNN mediante un mecanismo de atención dual, precediendo al Vision Transformer (ViT) introducido en 2020. Permanece relevante debido a su diseño ligero, lo que lo hace adecuado para despliegues de bajo consumo.

CBAM mejora a SENet (Red de Excitación y Compresión) al añadir atención espacial. Mientras que SENet aplica atención solo a través de los canales, CBAM introduce dos submódulos: el Módulo de Atención de Canal (CAM) y el Módulo de Atención Espacial (SAM). CAM utiliza tanto el promedio global de agrupamiento como el máximo global de agrupamiento, seguido por un MLP compartido con una relación de reducción, para generar pesos de canal. SAM aplica agrupamiento máximo y promedio a través de los canales, luego una capa convolucional para producir un mapa de atención espacial.

La salida refinada conserva las dimensiones del tensor de entrada (C×H×W), permitiendo una integración fluida en cualquier arquitectura de columna vertebral. La implementación se demuestra utilizando PyTorch, proporcionando una guía práctica para aplicar este mecanismo de doble atención a tareas de visión por computadora.

Entidades clave: Empresas: Towards Data Science | Personas: Woo et al.

Preguntas frecuentes: ¿En qué se diferencia CBAM de SENet en los mecanismos de atención?

CBAM extiende SENet añadiendo un Módulo de Atención Espacial (SAM) junto al Módulo de Atención de Canal (CAM), permitiendo un ponderado espacial a nivel de píxel además del ponderado por canal.