HeadlinesBriefing favicon HeadlinesBriefing.com

Les récompenses aléatoires enrichissent la théorie des jeux

Ars Technica •
×

Les jeux simples gagnent des stratégies riches face au bruit. Les jeux traditionnels se jouent généralement sur un fond statique : les récompenses par résultat sont constantes. Cela limite leur pertinence pour le comportement car, dans la vie réelle, les récompenses et les conséquences des choix stratégiques changent constamment. Aujourd'hui, des chercheurs ont utilisé un modèle mathématique pour étudier une série de jeux qui incluent des stratégies évolutives et des rendements variant aléatoirement.

Le concours de théorie des jeux le plus célèbre est peut-être le dilemme du prisonnier. Dans le dilemme du prisonnier, une paire de voleurs a été capturée et est interrogée séparément par la police. Si les deux se taisent, ils seront punis pour un crime moindre. Si un prisonnier passe un accord (fait défection), alors ce prisonnier est libéré et l'autre reçoit une peine plus lourde. Si les deux passent un accord, ils reçoivent tous les deux une punition intermédiaire. La personne qui dirige le jeu peut le commencer avec différentes récompenses pour la coopération et la défection afin d'explorer comment la stratégie optimale varie avec la récompense et le risque, ce que les joueurs peuvent découvrir en variant les stratégies sur plusieurs tours. Selon l'équilibre entre la récompense pour rester silencieux (coopérer) et la trahison, le jeu se stabilise avec tout le monde trahissant tout le monde. Dans cette situation simple, tout le monde perd. Des dynamiques similaires se retrouvent dans les jeux de poule mouillée, pierre-papier-ciseaux, et plus encore.

L'évolution des stratégies peut conduire à des populations stables, des populations bistables (où la population bascule entre deux stratégies stables), ou des cycles limites, où la population change continuellement entre plusieurs stratégies. Il existe également une riche histoire de modification d'un jeu au fur et à mesure qu'il est joué. Habituellement, ce sont des variations intra-jeu. Par exemple, vous pouvez fixer une limite à la quantité de récompense disponible, de sorte que les stratégies évoluent pour tenir compte de ressources de plus en plus limitées à mesure que le nombre de tours augmente. En d'autres termes, la plupart de ces travaux plus anciens ont étudié des situations où le comportement du joueur au tour actuel modifiait les ressources ou les récompenses disponibles pour le tour suivant.

Dans la vie réelle, cependant, nous sommes guidés par des facteurs externes qui ne sont pas sous notre contrôle. Le lapin ne contrôle pas la pluie qui inonde son terrier ou la sécheresse qui tue sa nourriture. Le jeu change à chaque tour parce que les risques et les récompenses de chaque stratégie changent avec le temps. Les chercheurs ont reconnu que l'incorporation de ces dynamiques dans un modèle mathématique pourrait révéler de nouveaux comportements. Et ils n'avaient pas tort. Le dilemme du prisonnier décrit ci-dessus n'a qu'un seul point stable (tout le monde perd). Le modèle converge rapidement vers ce point, où tous les joueurs adoptent la même stratégie en quelques tours. Mais les nouveaux travaux ont constaté que si les récompenses changent avec le temps (même d'une petite quantité), alors un deuxième point stable émerge du modèle, permettant aux coopérateurs et aux défecteurs de coexister. Sous une variation encore plus grande, le point du défecteur devient instable, ce qui signifie que seuls les coopérateurs existent. Dans la poule mouillée, les résultats du modèle sont un peu plus effrayants : sans changement dans les récompenses, le point stable est que tout le monde esquive et nous survivons tous. Ajoutez juste un peu de variation, et une population qui n'esquive pas émerge. Ajoutez plus de bruit, et un basculement bistable entre survie et collision émerge. (Étant donné que la poule mouillée était essentiellement la stratégie de la Guerre froide, je suis encore plus étonné que nous ayons tous survécu pour affronter notre prochain défi existentiel.) Pour pierre-papier-ciseaux, une dynamique encore plus complexe émerge. En termes de points stables et instables, le pierre-papier-ciseaux régulier n'a aucun point stable - la stratégie ne se stabilise jamais sur le choix de tout le monde pour pierre, par exemple. Au lieu de cela, tout le monde continue de basculer continuellement entre les trois options. Si les récompenses changent aléatoirement par tour, cependant, de nouveaux points stables et instables émergent. Selon le cas, cela peut amener le jeu à plus...