HeadlinesBriefing HeadlinesBriefing.com

Pembelajaran Penguatan: Multi-Armed Bandit

Towards Data Science •
×

Mesin belajar sendiri adalah mimpi fiksi ilmiah tertinggi. Saat ini kesenjangan itu menutup, dengan program seperti Alpha Go dan berbagai LLM yang ada, tetapi percayakah Anda jika saya memberi tahu Anda bahwa peneliti mulai merumuskan jenis masalah ini dan mengembangkan algoritma untuk mengatasinya pada akhir 1950-an? Meskipun jangka waktu itu tampak terlalu awal dalam sejarah teknologi dan, pada saat yang sama, tidak terlalu lama, sebenarnya saat itulah para peneliti mulai merumuskan apa yang kemudian menjadi pembelajaran penguatan seperti yang kita kenal sekarang.

Pembelajaran Penguatan (RL) adalah jenis Pembelajaran Mesin di mana agen mempelajari perilaku optimal melalui interaksi dengan lingkungannya. Alih-alih mengandalkan pemrograman eksplisit atau kumpulan data berlabel, agen ini belajar melalui trial and error, menerima umpan balik dalam bentuk penghargaan atau hukuman atas tindakannya. Proses ini mencerminkan bagaimana orang biasanya belajar secara alami, menjadikan RL pendekatan yang kuat untuk menciptakan sistem cerdas yang mampu memecahkan masalah kompleks.

Bagaimana kita sampai pada Pembelajaran Penguatan? Jika kita melihat ke belakang, apa yang kita kenal sekarang sebagai pembelajaran penguatan, sebenarnya berasal dari bidang kontrol optimal yang dimulai pada 1950-an. Namun, ada beberapa bidang penelitian lain yang akhirnya mengarah pada pengembangan pembelajaran penguatan. Berbagai bidang penelitian tertarik untuk merumuskan metodologi dan mengembangkan algoritma yang akan belajar seiring waktu. Meskipun bidang kontrol optimal mungkin terdengar asing bagi banyak orang (termasuk saya), Anda mungkin lebih akrab dengan satu keluarga algoritma yang dikembangkan untuk memecahkan masalah jenis ini, pemrograman dinamis.

Perpotongan kontrol optimal, pemrograman dinamis, dan pembelajaran baru muncul kemudian, pada akhir 1970-an. Paul Werbos mengembangkan Pemrograman Dinamis Heuristik dan kemudian, satu dekade kemudian, Chris Watkins mengintegrasikan metode pemrograman dinamis dan pembelajaran online. Bidang ini terus berkembang dengan kontribusi kunci dari Dimitri Bertsekas dan John Tsitsiklis, yang menciptakan istilah pemrograman neuro-dinamis pada pertengahan 1990-an. Ini terus menjadi area investigasi yang sangat aktif, dengan aplikasi mulai dari robotika, program seperti Alpha Go, dan masalah Bahasa Alami, untuk menyebutkan beberapa saja.

Sumber: Towards Data Science · Diringkas oleh HeadlinesBriefing