HeadlinesBriefing favicon HeadlinesBriefing.com

Jaringan Kecil Mengompres Data, Menarik Pentagon

Towards Data Science •
×

Saya tidak menyangka geometri akan muncul. Saya sedang mereproduksi sebagian kecil dari makalah interpretabilitas Anthropic 2022, "Toy Models of Superposition" [1], terutama karena klaim sentralnya terdengar cukup tidak masuk akal sehingga saya ingin memeriksanya sendiri daripada mempercayainya begitu saja. Klaimnya: jaringan saraf dapat mewakili lebih banyak fitur daripada dimensi yang dimilikinya untuk bekerja, dengan mengemasnya pada sudut satu sama lain dan mentolerir sedikit interferensi.

Minta ia mengompres lima hal menjadi dua dimensi dalam kondisi yang tepat, dan ia tidak memilih dua pemenang dan menyerah pada sisanya. Ia mengatur kelima hal tersebut menjadi segi lima sempurna. Saya tidak memiliki PyTorch atau pustaka autograd apa pun, dan tidak ada akses internet untuk menginstalnya, jadi semua di bawah ini adalah NumPy murni, dan saya menurunkan lintasan mundur dengan tangan.

Itu ternyata menjadi jenis yang tepat untuk menjengkelkan. Menurunkan gradien sendiri memaksa Anda untuk benar-benar memahami apa yang dilakukan model terhadap data, daripada mempercayai panggilan .backward() yang tidak pernah Anda pikirkan. Jika Anda memiliki latar belakang matematika dan belum pernah menurunkan backprop dengan tangan bahkan melalui jaringan kecil, saya benar-benar merekomendasikannya sebagai latihan.

Ini sepuluh menit aturan rantai yang membuat semua yang berikutnya menjadi klik. Semua data dalam posting ini sintetis. Saya menghasilkannya sendiri dalam kode, tidak ada dataset eksternal yang terlibat, yang juga cara makalah asli melakukannya.

Semua gambar, kecuali disebutkan lain, adalah oleh penulis. Masalah yang coba dijelaskan ini: Inilah teka-teki motivasi, dan itu nyata dalam penelitian interpretabilitas. Jika Anda melihat ke dalam jaringan saraf terlatih dengan harapan menemukan neuron individu yang mewakili konsep individu dengan bersih, satu neuron untuk "apakah ini anjing", satu untuk "apakah ini merah", Anda sebagian besar tidak menemukan itu.

Sebaliknya, Anda menemukan neuron yang tampaknya merespons beberapa hal yang tidak terkait sekaligus, neuron yang menyala untuk wajah kucing dan bagian depan mobil, misalnya. Ini disebut polisemantisitas, dan membuat interpretabilitas jauh lebih sulit, karena Anda tidak bisa begitu saja membaca apa yang "diyakini" jaringan dengan memeriksa unit individu. Proposal makalah ini adalah bahwa polisemantisitas bukanlah kebisingan atau kegagalan.

Ini adalah strategi nyata yang digunakan jaringan dengan sengaja, karena ia memiliki lebih banyak konsep untuk diwakili daripada neuron untuk mewakilinya, dan sebagian besar konsep tersebut jarang aktif pada saat yang sama. Jika dua fitur hampir tidak pernah "aktif" secara bersamaan, jaringan dapat membiarkan mereka berbagi arah dalam ruang aktivasi, karena interferensi hanya memakan biaya pada kesempatan langka ketika keduanya kebetulan menyala bersama. Strategi pengemasan inilah yang disebut makalah sebagai superposisi, dan model mainannya dirancang untuk menjadi pengaturan paling sederhana yang mungkin di mana Anda dapat melihatnya terjadi dan benar-benar mengukurnya.

Model, dan matematika yang harus saya kerjakan untuk melatihnya: Pengaturannya sengaja kecil. Anda memiliki n fitur sintetis, masing-masing angka antara 0 dan 1 yang nol sebagian besar waktu (itu sparsity) dan tidak nol sisa waktu. Anda mengompresnya melalui bottleneck dari m dimensi tersembunyi, di mana m lebih kecil dari n, dan kemudian mencoba merekonstruksi fitur asli di jalan keluar melalui ReLU.

Secara konkret, dengan satu matriks bobot W berbentuk (m, n) yang digunakan untuk kompresi dan rekonstruksi: h=W⋅x, x̂=ReLU(W⊤⋅h+b). Pelatihan meminimalkan kesalahan kuadrat berbobot antara x dan x̂, di mana setiap fitur i mendapatkan bobot kepentingan Ii, sehingga jaringan diberitahu bahwa beberapa fitur lebih penting untuk benar daripada yang lain: L=∑i Ii⋅(xi−x̂i)²\m...