HeadlinesBriefing favicon HeadlinesBriefing.com

Walkthrough Paper CBAM: Mekanisme Perhatian Ganda

Towards Data Science •
×

Artikel ini meninjau dan mengimplementasikan paper CBAM (Modul Perhatian Blok Konvolusi) oleh Woo et al. [1]. Diterbitkan pada 2018, CBAM meningkatkan kualitas fitur CNN melalui mekanisme perhatian ganda, yang hadir sebelum Vision Transformer (ViT) yang diperkenalkan pada 2020. Ia tetap relevan karena desainnya yang ringan, membuatnya sesuai untuk penerapan daya rendah.

CBAM meningkatkan SENet (Jaringan Squeeze-and-Excitation) dengan menambahkan perhatian spasial. Sementara SENet menerapkan perhatian hanya di seluruh saluran, CBAM memperkenalkan dua sub-modul: Modul Perhatian Saluran (CAM) dan Modul Perhatian Spasial (SAM). CAM menggunakan kedua global average-pooling dan global max-pooling, diikuti oleh MLP yang dibagikan dengan rasio pengurangan, untuk menghasilkan bobot saluran. SAM menerapkan max-pooling dan average-pooling di seluruh saluran, lalu diikuti oleh lapisan konvolusi untuk menghasilkan peta perhatian spasial.

Hasil yang telah disempurnakan mempertahankan dimensi tensor input (C×H×W), memungkinkan integrasi yang lancar ke dalam arsitektur backbone apa pun. Implementasi ini ditunjukkan menggunakan PyTorch, memberikan panduan praktis untuk menerapkan mekanisme perhatian ganda ini pada tugas visi komputer.

Entitas Kunci: Perusahaan: Towards Data Science | Orang: Woo et al.