HeadlinesBriefing favicon HeadlinesBriefing.com

ランダムな報酬が古典的ゲーム理論を豊かにする

Ars Technica •
×

単純なゲームはノイズに直面すると豊かな戦略を得る。伝統的なゲームは通常、静的な背景に対して行われる。つまり、各結果に対する報酬は一定である。これは、現実世界では戦略的選択の報酬と結果が絶えず変化するため、行動との関連性を制限する。現在、研究者たちは数学的モデルを用いて、進化する戦略とランダムに変化するリターンを含む一連のゲームを研究している。

おそらく最も有名なゲーム理論のコンテストは囚人のジレンマである。囚人のジレンマでは、二人の泥棒が捕まり、警察によって別々に尋問されている。もし二人とも黙っていれば、彼らは軽い罪で罰せられる。もし一人の囚人が取引に応じる(裏切る)なら、その囚人は自由になり、もう一人はより重い刑罰を受ける。もし二人とも取引に応じるなら、二人とも中間の罰を受ける。ゲームを運営する人は、協力と裏切りに対して異なる報酬でゲームを開始し、最適な戦略が報酬とリスクによってどのように変化するかを探ることができる。プレイヤーは複数のラウンドにわたって戦略を変えることでそれを理解できる。黙っている(協力する)報酬と裏切りのバランスに応じて、ゲームは全員が全員を裏切る状態で安定する。この単純な状況では、全員が負ける。同様のダイナミクスは、チキンゲーム、じゃんけんなどにも見られる。

戦略の進化は、安定した集団、双安定集団(集団が二つの安定した戦略の間で切り替わる)、またはリミットサイクル(集団が複数の戦略の間で継続的に移行する)につながる可能性がある。また、ゲームが行われている間にゲームを変更する豊かな歴史もある。通常、これらはゲーム内の変動である。例えば、利用可能な報酬の量に制限を設けることができ、ラウンド数が増えるにつれてますます限られたリソースを考慮に入れるように戦略が進化する。言い換えれば、これらの古い研究のほとんどは、現在のラウンドでのプレイヤーの行動が次のラウンドで利用可能なリソースや報酬を変える状況を研究していた。

しかし現実の生活では、私たちは自分では制御できない外部要因に動かされている。ウサギは自分の巣穴を浸水させる雨や、食料を殺す干ばつを制御できない。各ラウンドでゲームが変わるのは、各戦略のリスクと報酬が時間とともに変化するからである。研究者たちは、これらのダイナミクスを数学的モデルに組み込むことで新しい行動が明らかになるかもしれないと認識した。そして彼らは間違っていなかった。上記の囚人のジレンマには、安定点が一つしかない(全員が負ける)。モデルはすぐにその点に収束し、数ラウンド以内にすべてのプレイヤーが同じ戦略を採用する。しかし新しい研究では、報酬が時間とともに変化する場合(たとえわずかな量でも)、モデルから第二の安定点が現れ、協力者と裏切り者の両方が共存できることがわかった。さらに大きな変動の下では、裏切り者の点が不安定になり、協力者だけが存在することを意味する。チキンゲームでは、モデルの結果は少し恐ろしい。報酬に変化がない場合、安定点は全員が逸れ、私たち全員が生き残る。ほんの少しの変動を加えると、逸れない集団が現れる。さらにノイズを加えると、生存と衝突の間で双安定的に切り替わる状態が現れる。(チキンゲームが基本的に冷戦の戦略だったことを考えると、私たち全員が次の実存的挑戦に直面するために生き残ったことはさらに驚きである。)じゃんけんでは、さらに複雑なダイナミクスが現れる。安定点と不安定点の観点から、通常のじゃんけんには安定点がない。例えば、全員がグーを選ぶことに戦略が落ち着くことは決してない。代わりに、全員が三つの選択肢の間で継続的に切り替え続ける。しかし、報酬がラウンドごとにランダムに変化する場合、新しい安定点と不安定点が現れる。ケースに応じて、これはゲームをより...