HeadlinesBriefing HeadlinesBriefing.com

強化学習:マルチアームドバンディット

Towards Data Science •
×

機械が自ら学習することは、究極のSFの夢です。今日、Alpha GoやさまざまなLLMのようなプログラムによって、そのギャップは縮まりつつあります。しかし、研究者が1950年代後半にこの種の問題を定式化し、それに取り組むアルゴリズムの開発を始めていたと言ったら、信じられますか?その時期はテクノロジーの歴史においてあまりにも早すぎるように思えると同時に、それほど昔のことでもありませんが、実際にその時に、研究者たちは今日私たちが知る強化学習となるものを定式化し始めたのです。

強化学習(RL)は、エージェントが環境との相互作用を通じて最適な行動を学習する機械学習の一種です。明示的なプログラミングやラベル付けされたデータセットに依存するのではなく、このエージェントは試行錯誤によって学習し、その行動に対する報酬やペナルティの形でフィードバックを受け取ります。このプロセスは、人間が通常自然に学習する方法を反映しており、RLは複雑な問題を解決できるインテリジェントシステムを構築するための強力なアプローチとなっています。

どのようにして強化学習にたどり着いたのでしょうか?振り返ってみると、今日私たちが強化学習として知っているものは、実際には1950年代にさかのぼる最適制御の分野に起源を持っています。しかし、最終的に強化学習の開発につながった研究分野が他にもいくつかありました。時間の経過とともに学習する方法論を定式化し、アルゴリズムを開発することに関心を持つさまざまな研究分野です。最適制御の分野は多くの人(私を含めて)には馴染みがないように聞こえるかもしれませんが、この種の問題を解決するために開発されたアルゴリズムのファミリー、動的計画法についてはより馴染みがあるかもしれません。

最適制御、動的計画法、学習の交差点は、後になって、1970年代後半にようやく現れました。Paul Werbosがヒューリスティック動的計画法を開発し、その後10年後にChris Watkinsが動的計画法とオンライン学習を統合しました。この分野は、1990年代半ばに神経動的計画法という用語を作り出したDimitri BertsekasとJohn Tsitsiklisの重要な貢献によって進化し続けました。これは今でも非常に活発な研究分野であり、ロボット工学、Alpha Goのようなプログラム、自然言語問題など、ほんの一部を挙げるだけでも応用範囲は多岐にわたります。

出典: Towards Data Science · 要約:HeadlinesBriefing