HeadlinesBriefing HeadlinesBriefing.com

强化学习:多臂老虎机模拟

Towards Data Science •
×

机器自我学习是终极科幻梦想。如今,随着Alpha Go和各类LLM的出现,这一差距正在缩小。但你是否相信,研究人员在1950年代末就开始构想这些问题并开发算法?虽然这个时间点对于技术史来说似乎太早,同时又感觉并不遥远,但实际上,正是在那时,研究人员开始构想后来成为我们今天所知的强化学习。

强化学习(RL)是一种机器学习类型,其中智能体通过与环境的交互来学习最优行为。智能体不依赖显式编程或标记数据集,而是通过试错学习,并以奖励或惩罚的形式接收其行为的反馈。这个过程模仿了人类自然学习的方式,使RL成为创建能够解决复杂问题的智能系统的强大方法。

我们是如何走到强化学习的?回顾过去,我们今天所知的强化学习实际上起源于1950年代的最优控制领域。然而,还有其他几个研究领域最终导致了强化学习的发展。这些领域都致力于制定方法论和开发随时间学习的算法。虽然最优控制领域对许多人(包括我)来说可能听起来陌生,但你可能更熟悉为解决这类问题而开发的一类算法:动态规划。

最优控制、动态规划与学习的交叉点直到1970年代末才出现。Paul Werbos开发了启发式动态规划,十年后,Chris Watkins将动态规划方法与在线学习相结合。该领域继续发展,Dimitri Bertsekas和John Tsitsiklis做出了关键贡献,他们在1990年代中期创造了神经动态规划这一术语。这仍然是一个极其活跃的研究领域,应用范围从机器人技术、像Alpha Go这样的程序到自然语言问题,仅举几例。

来源: Towards Data Science · 由HeadlinesBriefing整理摘要