HeadlinesBriefing HeadlinesBriefing.com

التعلم المعزز: محاكاة متعددة الأذرع

Towards Data Science •
×

تعلم الآلات بنفسها هو الحلم الأسمى للخيال العلمي. اليوم، هذه الفجوة تضيق، مع برامج مثل Alpha Go ونماذج LLM المختلفة الموجودة، لكن هل تصدق لو أخبرتك أن الباحثين بدأوا في صياغة هذه الأنواع من المشكلات وتطوير الخوارزميات لمعالجتها في أواخر 1950s؟ بينما يبدو هذا الإطار الزمني مبكرًا جدًا في تاريخ التكنولوجيا، وفي نفس الوقت، ليس ببعيد، في الواقع، في ذلك الوقت بدأ الباحثون في صياغة ما سيصبح التعلم المعزز كما نعرفه.

التعلم المعزز (RL) هو نوع من التعلم الآلي حيث يتعلم الوكيل السلوك الأمثل من خلال التفاعل مع بيئته. بدلاً من الاعتماد على البرمجة الصريحة أو مجموعات البيانات المصنفة، يتعلم هذا الوكيل عن طريق التجربة والخطأ، ويتلقى ملاحظات في شكل مكافآت أو عقوبات على أفعاله. تعكس هذه العملية كيف يتعلم الناس بشكل طبيعي، مما يجعل RL نهجًا قويًا لإنشاء أنظمة ذكية قادرة على حل المشكلات المعقدة.

كيف وصلنا إلى التعلم المعزز؟ إذا نظرنا إلى الوراء، فإن ما نعرفه اليوم كتعلم معزز، له في الواقع جذوره في مجال التحكم الأمثل الذي يعود إلى 1950s. ومع ذلك، كانت هناك مجالات أخرى من البحث أدت في النهاية إلى تطوير التعلم المعزز. مجالات بحثية مختلفة مهتمة بصياغة المنهجيات وتطوير الخوارزميات التي تتعلم بمرور الوقت. بينما قد يبدو مجال التحكم الأمثل غير مألوف للكثيرين (بما في ذلك أنا)، قد تكون أكثر دراية بعائلة واحدة من الخوارزميات التي تم تطويرها لحل هذه الأنواع من المشكلات، البرمجة الديناميكية.

التقاطع بين التحكم الأمثل والبرمجة الديناميكية والتعلم لم يظهر إلا لاحقًا، في أواخر 1970s. طور Paul Werbos البرمجة الديناميكية الإرشادية، ثم بعد عقد من الزمان، قام Chris Watkins بدمج طرق البرمجة الديناميكية والتعلم عبر الإنترنت. استمر المجال في التطور مع مساهمات رئيسية من Dimitri Bertsekas و John Tsitsiklis، اللذين صاغا مصطلح البرمجة العصبية الديناميكية في منتصف 1990s. لا يزال هذا مجالًا نشطًا للغاية من التحقيق، مع تطبيقات تتراوح من الروبوتات، وبرامج مثل Alpha Go، ومشكلات اللغة الطبيعية، على سبيل المثال لا الحصر.

المصدر: Towards Data Science · لخّصه HeadlinesBriefing