HeadlinesBriefing HeadlinesBriefing.com

Aprendizaje por Refuerzo: Bandido Multibrazo

Towards Data Science •
×

Que las máquinas aprendan por sí mismas es el sueño definitivo de la ciencia ficción. Hoy esa brecha se está cerrando, con programas como Alpha Go y los diferentes LLM que existen, pero ¿creerías si te dijera que los investigadores comenzaron a formular este tipo de problemas y a desarrollar algoritmos para abordarlos a finales de los 1950s? Si bien ese período parece demasiado temprano en la historia de la tecnología y, al mismo tiempo, no hace tanto tiempo, fue entonces cuando los investigadores comenzaron a formular lo que se convertiría en el aprendizaje por refuerzo tal como lo conocemos.

El Aprendizaje por Refuerzo (RL) es un tipo de Aprendizaje Automático donde un agente aprende un comportamiento óptimo a través de la interacción con su entorno. En lugar de depender de la programación explícita o conjuntos de datos etiquetados, este agente aprende por prueba y error, recibiendo retroalimentación en forma de recompensas o penalizaciones por sus acciones. Este proceso refleja cómo las personas aprenden naturalmente, lo que hace del RL un enfoque poderoso para crear sistemas inteligentes capaces de resolver problemas complejos.

¿Cómo llegamos al Aprendizaje por Refuerzo? Si miramos hacia atrás, lo que hoy conocemos como aprendizaje por refuerzo, en realidad tiene sus orígenes en el área de control óptimo que se remonta a los 1950s. Sin embargo, hubo otras áreas de investigación que eventualmente llevaron al desarrollo del aprendizaje por refuerzo. Diferentes áreas de investigación interesadas en formular metodologías y desarrollar algoritmos que aprendieran con el tiempo. Si bien el área de control óptimo puede sonar desconocida para muchos (incluyéndome a mí), es posible que estés más familiarizado con una familia de algoritmos que se desarrolló para resolver este tipo de problemas, la programación dinámica.

La intersección del control óptimo, la programación dinámica y el aprendizaje solo surgió más tarde, a finales de los 1970s. Paul Werbos desarrolló la Programación Dinámica Heurística y luego, una década después, Chris Watkins integró los métodos de programación dinámica y el aprendizaje en línea. El campo continuó evolucionando con contribuciones clave de Dimitri Bertsekas y John Tsitsiklis, quienes acuñaron el término programación neuro-dinámica a mediados de los 1990s. Esta sigue siendo un área de investigación extremadamente activa, con aplicaciones que van desde la robótica, programas como Alpha Go y problemas de Lenguaje Natural, por nombrar solo algunos.

Fuente: Towards Data Science · Resumido por HeadlinesBriefing