HeadlinesBriefing favicon HeadlinesBriefing.com

随机奖励丰富了经典博弈论

Ars Technica •
×

简单博弈在噪声面前会获得丰富的策略。传统博弈通常是在静态背景下进行的:每种结果的奖励是恒定的。这限制了它们对行为的适用性,因为在现实生活中,策略选择的奖励和后果是不断变化的。如今,研究人员使用一个数学模型来研究一系列包含演化策略和随机变化回报的博弈。

也许最著名的博弈论竞赛是囚徒困境。在囚徒困境中,一对小偷被抓获,并被警察分别审讯。如果两人都保持沉默,他们将因较轻的罪行受到惩罚。如果一名囚犯达成交易(背叛),那么该囚犯可以获释,而另一名囚犯则受到更重的刑罚。如果两人都达成交易,他们都会受到介于两者之间的惩罚。运行博弈的人可以用不同的合作与背叛奖励来开始游戏,以探索最优策略如何随奖励和风险而变化,而玩家可以通过在多轮中改变策略来弄清楚这一点。取决于保持沉默(合作)的奖励与背叛之间的平衡,博弈会稳定在所有人背叛所有人的状态。在这种简单情况下,所有人都是输家。类似的动态也存在于胆小鬼博弈、石头剪刀布等博弈中。

策略的演化可能导致稳定种群、双稳态种群(种群在两种稳定策略之间翻转),或极限环,即种群在多种策略之间持续转移。改变正在进行中的博弈也有丰富的历史。通常,这些是博弈内的变化。例如,你可以对可用奖励总量设置上限,因此随着轮数增加,策略会演化以考虑日益有限的资源。换句话说,这些较早的研究大多研究的是玩家在当前轮次中的行为改变了下一轮可用资源或奖励的情况。

然而在现实生活中,我们受到不受我们控制的外部因素的驱动。兔子无法控制淹没其洞穴的雨水或杀死其食物的干旱。每一轮博弈都会改变,因为每种策略的风险和奖励会随时间变化。研究人员认识到,将这些动态纳入数学模型可能会揭示新的行为。他们并没有错。如上所述的囚徒困境只有一个稳定点(所有人都输)。模型会迅速收敛到该点,所有玩家在几轮内都采用相同策略。但这项新研究发现,如果奖励随时间变化(即使变化很小),那么模型中会出现第二个稳定点,使合作者和背叛者能够共存。在更大的变化下,背叛者点变得不稳定,这意味着只存在合作者。在胆小鬼博弈中,模型的结果有点更可怕:如果奖励没有变化,稳定点是所有人都转向,我们都活下来。只要加入一点点变化,就会出现一个不转向的种群。加入更多噪声,就会出现生存与撞车之间的双稳态翻转。(鉴于胆小鬼博弈基本上就是冷战策略,我更惊讶我们竟然都活了下来,去面对我们的下一个生存挑战。)对于石头剪刀布,会出现更复杂的动态。就稳定点和不稳定点而言,普通石头剪刀布没有稳定点——策略永远不会稳定到所有人都选择石头,例如。相反,每个人都会在三个选项之间持续翻转。然而,如果奖励每轮随机变化,新的稳定点和不稳定点就会出现。取决于具体情况,这可能导致博弈更……