Самообучение машин — это ultimate мечта научной фантастики. Сегодня этот разрыв сокращается, с помощью таких программ, как Alpha Go и различных LLM, которые существуют, но поверите ли вы, если я скажу вам, что исследователи начали формулировать эти виды проблем и разрабатывать алгоритмы для их решения в конце 1950-х годов? Хотя этот период времени кажется слишком ранним в истории технологий и, в то же время, не таким уж далеким, именно тогда исследователи начали формулировать то, что стало обучением с подкреплением, каким мы его знаем.
Обучение с подкреплением (RL) — это тип машинного обучения, при котором агент изучает оптимальное поведение через взаимодействие со своей средой. Вместо того чтобы полагаться на явное программирование или размеченные наборы данных, этот агент учится методом проб и ошибок, получая обратную связь в виде вознаграждений или штрафов за свои действия. Этот процесс отражает то, как люди обычно учатся естественным образом, что делает RL мощным подходом для создания интеллектуальных систем, способных решать сложные проблемы.
Как мы пришли к обучению с подкреплением? Если мы оглянемся назад, то, что мы сегодня знаем как обучение с подкреплением, на самом деле берет свое начало в области оптимального управления, восходящей к 1950-м годам. Однако были и другие области исследований, которые в конечном итоге привели к развитию обучения с подкреплением. Различные области исследований, заинтересованные в формулировании методологий и разработке алгоритмов, которые учились бы с течением времени. Хотя область оптимального управления может показаться незнакомой многим (включая меня), вы, возможно, более знакомы с одним семейством алгоритмов, которое было разработано для решения таких проблем, — динамическим программированием.
Пересечение оптимального управления, динамического программирования и обучения возникло только позже, в конце 1970-х годов. Paul Werbos разработал эвристическое динамическое программирование, а затем, десятилетие спустя, Chris Watkins интегрировал методы динамического программирования и онлайн-обучения. Эта область продолжала развиваться благодаря ключевым вкладам Dimitri Bertsekas и John Tsitsiklis, которые ввели термин нейродинамическое программирование в середине 1990-х годов. Это остается чрезвычайно активной областью исследований с приложениями, начиная от робототехники, программ, таких как Alpha Go, и задач обработки естественного языка, и это лишь некоторые из них.
Источник: Towards Data Science · Сводку подготовил HeadlinesBriefing