HeadlinesBriefing favicon HeadlinesBriefing.com

Recompensas aleatórias enriquecem a teoria dos jogos

Ars Technica •
×

Jogos simples ganham estratégias ricas diante do ruído. Jogos tradicionais geralmente são jogados contra um fundo estático: as recompensas por resultado são constantes. Isso limita sua relevância para o comportamento porque, na vida real, as recompensas e consequências das escolhas estratégicas estão sempre mudando. Agora, pesquisadores usaram um modelo matemático para estudar uma série de jogos que incluem estratégias evolutivas e retornos que variam aleatoriamente.

Talvez o concurso de teoria dos jogos mais famoso seja o dilema do prisioneiro. No dilema do prisioneiro, um par de ladrões foi capturado e está sendo interrogado separadamente pela polícia. Se ambos ficarem calados, serão punidos por um crime menor. Se um prisioneiro fizer um acordo (desertar), então esse prisioneiro sai livre e o outro recebe uma pena mais pesada. Se ambos fizerem um acordo, ambos recebem uma punição intermediária. A pessoa que conduz o jogo pode iniciá-lo com diferentes recompensas por cooperar e desertar para explorar como a estratégia ótima varia com recompensa e risco, o que os jogadores podem descobrir variando as estratégias ao longo de múltiplas rodadas. Dependendo do equilíbrio entre a recompensa por permanecer em silêncio (cooperar) e a traição, o jogo se estabiliza com todos traindo todos. Nesta situação simples, todos perdem. Dinâmicas semelhantes podem ser encontradas em jogos de galinha, pedra-papel-tesoura e mais.

A evolução das estratégias pode levar a populações estáveis, populações biestáveis (onde a população oscila entre duas estratégias estáveis) ou ciclos limite, onde a população muda continuamente entre múltiplas estratégias. Há também uma rica história de mudar um jogo enquanto ele é jogado. Geralmente, essas são variações dentro do jogo. Por exemplo, você pode definir um limite para a quantidade de recompensa disponível, então as estratégias evoluem para levar em conta recursos cada vez mais limitados à medida que o número de rodadas aumenta. Em outras palavras, a maior parte deste trabalho mais antigo estudou situações em que o comportamento do jogador na rodada atual mudava os recursos ou recompensas disponíveis para a próxima rodada.

Na vida real, porém, somos movidos por fatores externos que não estão sob nosso controle. O coelho não controla a chuva que inunda sua toca ou a seca que mata seu alimento. O jogo muda a cada rodada porque os riscos e recompensas de cada estratégia mudam ao longo do tempo. Os pesquisadores reconheceram que incorporar essas dinâmicas em um modelo matemático poderia revelar novos comportamentos. E eles não estavam errados. O dilema do prisioneiro descrito acima tem apenas um único ponto estável (todos perdem). O modelo converge rapidamente para esse ponto, onde todos os jogadores adotam a mesma estratégia em poucas rodadas. Mas o novo trabalho descobriu que se as recompensas mudam com o tempo (mesmo que por uma pequena quantidade), então um segundo ponto estável emerge do modelo, permitindo que tanto cooperadores quanto desertores coexistam. Sob variação ainda maior, o ponto do desertor se torna instável, significando que apenas cooperadores existem. No jogo de galinha, os resultados do modelo são um pouco mais assustadores: sem mudança nas recompensas, o ponto estável é que todos desviam e todos sobrevivemos. Adicione apenas um pouco de variação, e uma população que não desvia emerge. Adicione mais ruído, e uma oscilação biestável entre sobrevivência e colisão emerge. (Dado que o jogo de galinha era basicamente a estratégia da Guerra Fria, fico ainda mais surpreso que todos nós sobrevivemos para enfrentar nosso próximo desafio existencial.) Para pedra-papel-tesoura, uma dinâmica ainda mais complexa emerge. Em termos de pontos estáveis e instáveis, o pedra-papel-tesoura regular não tem pontos estáveis — a estratégia nunca se estabiliza em todos escolherem pedra, por exemplo. Em vez disso, todos continuam alternando continuamente entre as três opções. Se as recompensas mudam aleatoriamente por rodada, no entanto, novos pontos estáveis e instáveis emergem. Dependendo do caso, isso pode fazer o jogo mais...