Deep Blue 1997 সালে দাবায় Garry Kasparov কে হারিয়েছে, Alpha Go 2016 সালে Go-তে Lee Sedol কে হারিয়েছে, এবং পোকার বটগুলি বছরের পর বছর ধরে পেশাদারদের হারিয়ে আসছে। কিন্তু Stratego নামক একটি ক্লাসিক গেম টিকে ছিল। এমনকি Deep Mind, তার অসাধারণ বাজেট নিয়েও, এমন একটি মেশিন তৈরি করতে পারেনি যা নির্ভরযোগ্যভাবে সেরা মানব খেলোয়াড়দের হারাতে পারে। এখন, Carnegie Mellon, MIT, New York University এবং Stanford University-এর গবেষকদের একটি দল এটি করেছে।
তাদের AI, যার নাম Ataraxos, Pim Niemeijer কে হারিয়েছে, যিনি সম্ভবত সর্বকালের সেরা Stratego খেলোয়াড়, 15 গেমে 1-এ, চারটি ড্র সহ। এবং এটি প্রশিক্ষণ দিতে মাত্র 16 GPU এবং কয়েক হাজার ডলার লেগেছে। Stratego-তে, প্রতিটি খেলোয়াড় 40টি টুকরা পায় যা সামরিক পদমর্যাদার প্রতিনিধিত্ব করে, একজন মার্শাল থেকে একজন গুপ্তচর পর্যন্ত, plus বোমা এবং একটি পতাকা। আপনি প্রতিপক্ষের পতাকা দখল করে জিতবেন। আপনার প্রতিপক্ষ জানে আপনার টুকরাগুলো কোথায়, কিন্তু সেগুলো কী তা জানে না।
পরিচয় শুধুমাত্র তখনই প্রকাশিত হয় যখন দুটি টুকরা যুদ্ধে সংঘর্ষ হয়—দুর্বল টুকরাটি সরানো হয়, এবং বিজয়ীর পরিচয় প্রকাশিত হয়। এটি Stratego-কে একটি অসম্পূর্ণ-তথ্য গেমে পরিণত করে, ঠিক পোকারের মতো, যা কম্পিউটারগুলি বছর আগে ক্র্যাক করেছিল। "Stratego সম্পর্কে একটি অত্যন্ত স্বতন্ত্র জিনিস আছে, যা হল এটি বিপুল পরিমাণ গোপন তথ্য যা একটি খুব দীর্ঘ সময়ের স্কেলে উন্মোচিত হয়," বলেছেন Eugene Vinitsky, NYU-এর একজন গবেষক এবং গবেষণার সহ-লেখক।
পোকারের কিছু ফর্মে, গোপন তথ্য খুবই সামান্য। Texas Hold'em-এ, "আপনার কাছে শুধুমাত্র দুটি গোপন কার্ড থাকে," বলেছেন Gabriele Farina, MIT-এর একজন কম্পিউটার বিজ্ঞানী এবং আরেক সহ-লেখক। এটি মাত্র 1,326টি সম্ভাব্য হাত রেখে যায়, একটি মেশিনের জন্য সেগুলি সব ওজন করার মতো যথেষ্ট কম। "Stratego-তে, বোর্ডে 40টি টুকরা থাকে যা যেকোনো ক্রমে থাকতে পারে," Farina বলেছেন। এটি একটি ডেসিলিয়নেরও বেশি সম্ভাব্য সেটআপ। তারপর গেমের দৈর্ঘ্য আছে। "দাবায়, সাধারণত গেমটি 40টি চাল স্থায়ী হয়, কিন্তু Stratego-তে, একটি গেম সহজেই 2,000টি চাল স্থায়ী হতে পারে," Farina বলেছেন। তার উপরে, Stratego ব্লাফিংয়ের একটি খেলা। কখনও কখনও আপনি একটি দুর্বল টুকরাকে এমনভাবে সরান যেন এটি একটি মার্শাল, শুধু প্রতিপক্ষকে ভয় দেখানোর জন্য। যখন খেলোয়াড়রা খুব বেশি ব্লাফ করে, তাদের হুমকির কোনো মানে হয় না; যখন তারা কখনো ব্লাফ করে না, তারা অনুমানযোগ্য হয়ে ওঠে। দলটি ব্যাখ্যা করে, এই ভারসাম্যমূলক কাজটিই Deep Mind-এর Deep Nash-এর মতো পূর্ববর্তী AI-কে হতবাক করেছিল, যা 2022 সালে চালু হয়েছিল।
উৎস: Ars Technica · সারাংশ: HeadlinesBriefing