HeadlinesBriefing favicon HeadlinesBriefing.com

Случайные вознаграждения обогащают классическую теорию игр

Ars Technica •
×

Простые игры приобретают богатые стратегии перед лицом шума. Традиционные игры обычно проводятся на статическом фоне: вознаграждения за каждый исход постоянны. Это ограничивает их relevance для поведения, потому что в реальной жизни вознаграждения и последствия стратегических выборов постоянно меняются. Теперь исследователи использовали математическую модель для изучения серии игр, которые включают эволюционирующие стратегии и случайно изменяющиеся выигрыши.

Пожалуй, самый известный конкурс по теории игр — это дилемма заключённого. В дилемме заключённого пара воров была поймана и допрашивается полицией по отдельности. Если оба молчат, они будут наказаны за менее тяжкое преступление. Если один заключённый идёт на сделку (предаёт), то этот заключённый выходит на свободу, а другой получает более тяжёлый приговор. Если оба идут на сделку, оба получают промежуточное наказание. Человек, ведущий игру, может начать её с разными вознаграждениями за сотрудничество и предательство, чтобы исследовать, как оптимальная стратегия меняется в зависимости от вознаграждения и риска, что игроки могут выяснить, варьируя стратегии на протяжении нескольких раундов. В зависимости от баланса между вознаграждением за молчание (сотрудничество) и предательством, игра стабилизируется на том, что все предают всех. В этой простой ситуации все проигрывают. Похожую динамику можно найти в игре в цыплёнка, камень-ножницы-бумага и других.

Эволюция стратегий может приводить к стабильным популяциям, бистабильным популяциям (где популяция переключается между двумя стабильными стратегиями) или предельным циклам, где популяция непрерывно переходит между несколькими стратегиями. Также существует богатая история изменения игры по мере её проведения. Обычно это внутриигровые вариации. Например, можно установить лимит на доступное вознаграждение, так что стратегии эволюционируют с учётом всё более ограниченных ресурсов по мере увеличения числа раундов. Иными словами, большая часть этой более ранней работы изучала ситуации, когда поведение игрока в текущем раунде изменяло ресурсы или вознаграждения, доступные для следующего раунда.

Однако в реальной жизни нами движут внешние факторы, которые не находятся под нашим контролем. Кролик не контролирует дождь, который затопляет его нору, или засуху, которая убивает его пищу. Игра меняется каждый раунд, потому что риски и вознаграждения каждой стратегии меняются со временем. Исследователи признали, что включение этой динамики в математическую модель может выявить новое поведение. И они не ошиблись. Дилемма заключённого, описанная выше, имеет только одну стабильную точку (все проигрывают). Модель быстро сходится к этой точке, где все игроки принимают одну и ту же стратегию в течение нескольких раундов. Но новая работа обнаружила, что если вознаграждения меняются со временем (даже на небольшую величину), то из модели возникает вторая стабильная точка, позволяющая сосуществовать как кооператорам, так и предателям. При ещё большей вариации точка предателя становится нестабильной, что означает, что существуют только кооператоры. В игре в цыплёнка результаты модели немного страшнее: без изменения вознаграждений стабильная точка — это то, что все сворачивают, и мы все выживаем. Добавьте совсем немного вариации, и возникает популяция, которая не сворачивает. Добавьте больше шума, и возникает бистабильное переключение между выживанием и столкновением. (Учитывая, что игра в цыплёнка была по сути стратегией холодной войны, я ещё больше удивлён, что мы все выжили, чтобы встретить наш следующий экзистенциальный вызов.) Для камня-ножниц-бумаги возникает ещё более сложная динамика. С точки зрения стабильных и нестабильных точек, обычный камень-ножницы-бумага не имеет стабильных точек — стратегия никогда не устанавливается на том, что все выбирают камень, например. Вместо этого все продолжают непрерывно переключаться между тремя вариантами. Однако если вознаграждения меняются случайным образом каждый раунд, возникают новые стабильные и нестабильные точки. В зависимости от случая это может заставить игру больше...