HeadlinesBriefing HeadlinesBriefing.com

Aprendizado por Reforço: Bandido Multiarms

Towards Data Science •
×

Máquinas aprendendo por si mesmas é o sonho final da ficção científica. Hoje essa lacuna está diminuindo, com programas como Alpha Go e os diferentes LLMs que existem, mas você acreditaria se eu lhe dissesse que pesquisadores começaram a formular esses tipos de problemas e a desenvolver algoritmos para enfrentá-los no final dos anos 1950? Embora esse período pareça muito cedo na história da tecnologia e, ao mesmo tempo, não tão distante, foi nessa época que os pesquisadores começaram a formular o que se tornaria o aprendizado por reforço como o conhecemos.

O Aprendizado por Reforço (RL) é um tipo de Aprendizado de Máquina onde um agente aprende comportamento ideal através da interação com seu ambiente. Em vez de depender de programação explícita ou conjuntos de dados rotulados, este agente aprende por tentativa e erro, recebendo feedback na forma de recompensas ou penalidades por suas ações. Este processo reflete como as pessoas normalmente aprendem naturalmente, tornando o RL uma abordagem poderosa para criar sistemas inteligentes capazes de resolver problemas complexos.

Como chegamos ao Aprendizado por Reforço? Se olharmos para trás, o que conhecemos hoje como aprendizado por reforço, na verdade tem suas origens na área de controle ótimo que remonta aos anos 1950. No entanto, houve algumas outras áreas de pesquisa que eventualmente levaram ao desenvolvimento do aprendizado por reforço. Diferentes áreas de pesquisa interessadas em formular metodologias e desenvolver algoritmos que aprendessem ao longo do tempo. Embora a área de controle ótimo possa parecer desconhecida para muitos (eu incluído), você pode estar mais familiarizado com uma família de algoritmos que foi desenvolvida para resolver esses tipos de problemas, a programação dinâmica.

A interseção do controle ótimo, programação dinâmica e aprendizado só surgiu mais tarde, no final dos anos 1970. Paul Werbos desenvolveu a Programação Dinâmica Heurística e então, uma década depois, Chris Watkins integrou métodos de programação dinâmica e aprendizado online. O campo continuou a evoluir com contribuições-chave de Dimitri Bertsekas e John Tsitsiklis, que cunharam o termo programação neuro-dinâmica em meados dos anos 1990. Esta continua sendo uma área de investigação extremamente ativa, com aplicações que vão desde robótica, programas como Alpha Go e problemas de Linguagem Natural, para citar apenas alguns.

Fonte: Towards Data Science · Resumido por HeadlinesBriefing