HeadlinesBriefing favicon HeadlinesBriefing.com

Walkthrough do Artigo CBAM: Mecanismo de Atenção Dupla

Towards Data Science •
×

Este artigo revisa e implementa o artigo CBAM (Módulo de Atenção de Bloco Convolucional) de Woo et al. [1]. Publicado em 2018, o CBAM melhora a qualidade das características de CNN por meio de um mecanismo de atenção dupla, antecedendo o Vision Transformer (ViT) introduzido em 2020. Permanece relevante devido ao seu design leve, adequado para implantações de baixa potência.

O CBAM aprimora o SENet (Rede de Squeeze-and-Excitation) adicionando atenção espacial. Enquanto o SENet aplica atenção apenas entre canais, o CBAM introduz dois submódulos: o Módulo de Atenção de Canal (CAM) e o Módulo de Atenção Espacial (SAM). O CAM utiliza tanto o pooling médio global quanto o pooling máximo global, seguido por um MLP compartilhado com uma razão de redução, para gerar pesos de canal. O SAM aplica pooling máximo e médio entre canais, seguido por uma camada convolucional para produzir um mapa de atenção espacial.

A saída refinada mantém as dimensões do tensor de entrada (C×H×W), permitindo uma integração perfeita em qualquer arquitetura de backbone. A implementação é demonstrada usando PyTorch, fornecendo um guia prático para aplicar esse mecanismo de atenção dupla em tarefas de visão computacional.

Entidades-chave: Empresas: Towards Data Science | Pessoas: Woo et al.

Perguntas frequentes: Como o CBAM difere do SENet em mecanismos de atenção?

O CBAM estende o SENet adicionando um Módulo de Atenção Espacial (SAM) junto ao Módulo de Atenção de Canal (CAM), permitindo ponderação espacial em nível de pixel além da ponderação por canal.