HeadlinesBriefing favicon HeadlinesBriefing.com

MSE Bohong: Bagian II

Towards Data Science •
×

Dalam artikel sebelumnya, kita melihat mengapa pelatihan dengan MSE memaksa model untuk hanya melaporkan rata-rata bersyarat, dan bagaimana NLL Gaussian memungkinkannya mempelajari juga ketidakpastian per langkah yang jujur σ. Itu adalah cerita satu langkah. Postingan ini melanjutkan dari tempat kita berhenti. Semua yang kita bangun di Bagian I — NLL Gaussian, kerugian dua istilah, bukti bahwa model mempelajari rata-rata bersyarat dan varians bersyarat — adalah tentang prediksi satu langkah ke depan: diberikan jendela konteks dari T nilai yang diamati, prediksi distribusi dari nilai berikutnya x_{T+1}.

Pada waktu inferensi, dalam aplikasi nyata apa pun, ini jarang cukup. Anda ingin tahu apa yang terjadi selama 10, 100, atau 1000 langkah berikutnya. Anda menginginkan perkiraan, bukan prediksi tunggal. Dan jika model Anda probabilistik, Anda ingin perkiraan itu membawa ketidakpastian yang jujur sampai akhir cakrawala. Postingan ini tentang bagaimana melakukan ini dengan benar.

Orang mungkin segera memikirkan pendekatan naif, yaitu menerapkan model berulang kali, memasukkan prediksinya kembali sebagai input secara diam-diam adalah operasi deterministik yang membuang ketidakpastian yang telah dipelajari model dengan susah payah. Memperbaiki ini memerlukan pemikiran yang cermat tentang apa sebenarnya distribusi bersama atas nilai-nilai masa depan, dan bagaimana memperkirakannya dengan pengambilan sampel Monte Carlo. Perbaikannya hampir tidak lebih banyak kode daripada versi naif, tetapi memberikan perkiraan yang secara fundamental berbeda dan secara fundamental lebih baik.

Semuanya di sini dibangun dan diperiksa di buku catatan pendamping: dua pendekatan rollout, diterapkan pada model terlatih yang sama, pada sinyal yang sama, dengan diagnostik cakupan dan PIT (semua dijelaskan dalam postingan ini).