HeadlinesBriefing HeadlinesBriefing.com

Verstärkendes Lernen: Mehrarmiger Bandit

Towards Data Science •
×

Dass Maschinen von selbst lernen, ist der ultimative Science-Fiction-Traum. Heute schließt sich diese Lücke, mit Programmen wie Alpha Go und den verschiedenen LLMs, die es gibt, aber würden Sie es glauben, wenn ich Ihnen sagte, dass Forscher in den späten 1950er Jahren begannen, diese Art von Problemen zu formulieren und Algorithmen zu entwickeln, um sie zu bewältigen? Obwohl dieser Zeitrahmen in der Geschichte der Technologie viel zu früh erscheint und gleichzeitig noch nicht so lange her ist, begannen die Forscher tatsächlich zu dieser Zeit, das zu formulieren, was später zum verstärkenden Lernen werden sollte, wie wir es kennen.

Verstärkendes Lernen (RL) ist eine Art des maschinellen Lernens, bei der ein Agent durch Interaktion mit seiner Umgebung optimales Verhalten lernt. Anstatt sich auf explizite Programmierung oder gekennzeichnete Datensätze zu verlassen, lernt dieser Agent durch Versuch und Irrtum und erhält Rückmeldungen in Form von Belohnungen oder Strafen für seine Aktionen. Dieser Prozess spiegelt wider, wie Menschen normalerweise auf natürliche Weise lernen, was RL zu einem leistungsstarken Ansatz zur Erstellung intelligenter Systeme macht, die komplexe Probleme lösen können.

Wie sind wir zum verstärkenden Lernen gekommen? Wenn wir zurückblicken, hat das, was wir heute als verstärkendes Lernen kennen, tatsächlich seinen Ursprung im Bereich der optimalen Steuerung, die bis in die 1950er Jahre zurückreicht. Es gab jedoch einige andere Forschungsbereiche, die schließlich zur Entwicklung des verstärkenden Lernens führten. Verschiedene Forschungsbereiche, die daran interessiert waren, Methodiken zu formulieren und Algorithmen zu entwickeln, die im Laufe der Zeit lernen würden. Obwohl der Bereich der optimalen Steuerung vielen (mich eingeschlossen) unbekannt vorkommen mag, sind Sie vielleicht mit einer Familie von Algorithmen vertrauter, die zur Lösung dieser Art von Problemen entwickelt wurde, der dynamischen Programmierung.

Die Schnittstelle von optimaler Steuerung, dynamischer Programmierung und Lernen entstand erst später, in den späten 1970er Jahren. Paul Werbos entwickelte die heuristische dynamische Programmierung und dann, ein Jahrzehnt später, integrierte Chris Watkins Methoden der dynamischen Programmierung und Online-Lernen. Das Feld entwickelte sich weiter mit wichtigen Beiträgen von Dimitri Bertsekas und John Tsitsiklis, die Mitte der 1990er Jahre den Begriff der neuro-dynamischen Programmierung prägten. Dies ist nach wie vor ein äußerst aktives Forschungsgebiet mit Anwendungen, die von Robotik, Programmen wie Alpha Go und Problemen der natürlichen Sprache reichen, um nur einige zu nennen.

Quelle: Towards Data Science · Zusammengefasst von HeadlinesBriefing