Que les machines apprennent par elles-mêmes est le rêve ultime de la science-fiction. Aujourd'hui, cet écart se réduit, avec des programmes comme Alpha Go et les différents LLM qui existent, mais croiriez-vous si je vous disais que les chercheurs ont commencé à formuler ces types de problèmes et à développer des algorithmes pour les résoudre à la fin des années 1950 ? Bien que cette période semble trop tôt dans l'histoire de la technologie et, en même temps, pas si lointaine, c'est en fait à ce moment-là que les chercheurs ont commencé à formuler ce qui deviendrait l'apprentissage par renforcement tel que nous le connaissons.
L'apprentissage par renforcement (RL) est un type d'apprentissage automatique où un agent apprend un comportement optimal par l'interaction avec son environnement. Plutôt que de s'appuyer sur une programmation explicite ou des ensembles de données étiquetés, cet agent apprend par essais et erreurs, recevant des retours sous forme de récompenses ou de pénalités pour ses actions. Ce processus reflète la façon dont les gens apprennent naturellement, faisant du RL une approche puissante pour créer des systèmes intelligents capables de résoudre des problèmes complexes.
Comment en sommes-nous arrivés à l'apprentissage par renforcement ? Si nous regardons en arrière, ce que nous connaissons aujourd'hui comme l'apprentissage par renforcement a en fait ses origines dans le domaine du contrôle optimal remontant aux années 1950. Cependant, il y avait quelques autres domaines de recherche qui ont finalement conduit au développement de l'apprentissage par renforcement. Différents domaines de recherche intéressés par la formulation de méthodologies et le développement d'algorithmes qui apprendraient au fil du temps. Bien que le domaine du contrôle optimal puisse sembler inconnu pour beaucoup (moi y compris), vous pourriez être plus familier avec une famille d'algorithmes qui a été développée pour résoudre ces types de problèmes, la programmation dynamique.
L'intersection du contrôle optimal, de la programmation dynamique et de l'apprentissage n'a émergé que plus tard, à la fin des années 1970. Paul Werbos a développé la programmation dynamique heuristique, puis une décennie plus tard, Chris Watkins a intégré les méthodes de programmation dynamique et l'apprentissage en ligne. Le domaine a continué d'évoluer avec des contributions clés de Dimitri Bertsekas et John Tsitsiklis, qui ont inventé le terme de programmation neuro-dynamique au milieu des années 1990. Cela reste un domaine d'investigation extrêmement actif, avec des applications allant de la robotique, des programmes comme Alpha Go et des problèmes de langage naturel, pour n'en nommer que quelques-uns.
Source: Towards Data Science · Résumé par HeadlinesBriefing