Create your own
Lesson illustration

Равновесие Нэша: устойчивость и невыгодные исходы

Здравствуйте. В прошлом уроке мы учились делать прозрачный прогноз чужого следующего хода: отделять факты от интерпретаций, смотреть на ситуацию глазами другого человека и фиксировать допущения. Теперь добавим важный вопрос: если все уже сделали выбор, захочет ли кто-то изменить его в одиночку?

Сегодня разберём понятие равновесия Нэша — устойчивого сочетания ходов, где никто не улучшит свой результат, если остальные не меняют поведения. Главное уточнение: устойчивый исход вовсе не обязан быть приятным, справедливым или лучшим для всех. Иногда люди оказываются в плохой, но «самоподдерживающейся» ситуации именно потому, что выход в одиночку слишком рискован.


Устойчивость: не «хорошо», а «невыгодно уходить одному»

Представьте, что два человека уже выбрали свои действия. Чтобы проверить, устойчив ли результат, не нужно угадывать их характеры или читать лекцию о морали. Достаточно провести два мысленных теста:

  1. Зафиксировать выбор второго человека и спросить: выгодно ли первому в одиночку сменить свой ход?
  2. Затем зафиксировать выбор первого и спросить то же самое о втором.

Если оба ответа «нет», перед нами равновесие Нэша.

Иными словами, равновесие Нэша — это набор выборов, при котором ход каждого участника является его лучшим ответом на уже выбранные ходы остальных.

Важно, чего это определение не утверждает:

  • оно не говорит, что участники довольны ситуацией;
  • оно не говорит, что результат справедлив;
  • оно не гарантирует, что именно этот исход обязательно возникнет;
  • оно не требует, чтобы никто никогда не менял поведение при новых обстоятельствах.

Речь только о таком условии: при неизменности остальных односторонняя смена стратегии не улучшает положение игрока.

Это похоже на неудобную офисную договорённость. Все понимают, что процесс тратит время, но один человек не может перестроить его сам: если он перестанет заполнять лишнюю таблицу, а остальные продолжат на неё опираться, именно он будет выглядеть как тот, кто «сломал процесс». Неудобство общее, а цена одиночного выхода личная.


Матрица выплат: как увидеть стимулы, а не впечатления

В теории игр выборы часто записывают в виде матрицы. Строки соответствуют ходам первого участника, столбцы — ходам второго. В каждой клетке стоят два результата: первый относится к участнику по строкам, второй — к участнику по столбцам.

Матрица выплат классической дилеммы заключённого: строки показывают выбор заключённого 1, столбцы — выбор заключённого 2; в каждой клетке сначала указан результат заключённого 1, затем заключённого 2. Красным отмечено равновесие Нэша, зелёным — исход, лучший для обоих при совместном выборе.

На изображении числа записаны как отрицательные выигрыши, связанные со сроками: большее число лучше. Поэтому предпочтительнее : это существенно меньший срок.

Посмотрим сначала на верхнюю левую клетку: оба признаются, и каждый получает .

Проверяем первого заключённого

Предположим, второй уже признался.

  • Если первый тоже признаётся, его результат .
  • Если первый один переходит к отрицанию, его результат становится .

Менять ход невыгодно: лучше, чем .

Проверяем второго заключённого

Теперь считаем, что первый продолжает признаваться.

  • Второй признаётся и получает .
  • Если второй один начинает отрицать, он получает .

Ему тоже невыгодно менять ход в одиночку.

Значит, исход «оба признаются» — равновесие Нэша. Красное выделение на матрице показывает именно это: ни у одного нет личного стимула отклониться, пока другой остаётся на своём выборе.

Но взгляните на нижнюю правую клетку: оба отрицают вину и получают по . Этот результат лучше для каждого, чем . Поэтому он отмечен как Парето-оптимальный среди показанных вариантов: нельзя улучшить положение одного, не ухудшив положение другого.

И всё же это не равновесие. Если второй отрицает, первому выгодно единолично признаться: он получает , а не . То же верно зеркально для второго.

Здесь нет противоречия:

  • «оба отрицают» — результат, который предпочли бы оба, если бы могли надёжно выбрать его вместе;
  • «оба признаются» — результат, от которого никому невыгодно уходить поодиночке.

Равновесие Нэша отвечает на вопрос о личном отклонении. Оно не отвечает на вопрос, какой исход был бы желателен при совместной договорённости.


Короткое объяснение на классическом примере

Дилемма заключённого и равновесие Нэша

Посмотрите фрагмент «Дилемма заключённого и равновесие Нэша» от KhanAcademyRussian. Он последовательно строит матрицу, сравнивает варианты для каждого заключённого и показывает, почему устойчивый исход может быть хуже совместного.

Начните с матрицы выплат: обратите внимание, как каждому сочетанию двух действий соответствует отдельный результат. Затем посмотрите стимулы игроков, мысленно повторяя сравнение «что мне лучше сделать, если другой признается?» и «что мне лучше сделать, если другой молчит?». Завершите проверкой устойчивости: это особенно хорошо отделяет понятие равновесия от понятия наилучшего общего исхода.

В численных примерах сроки могут отличаться: где-то это один, три и десять лет, где-то, как на матрице выше, используются условные отрицательные выигрыши. Для анализа существенны не сами числа, а порядок предпочтений.

В дилемме заключённого у каждого участника есть ход, который выгоднее при любом выборе второго. Такой ход называют доминирующей стратегией.

В нашем примере для каждого заключённого признание выгоднее:

Что делает второйЕсли признатьсяЕсли отрицатьЛучший личный ход
ПризнаётсяПризнаться
ОтрицаетПризнаться

Когда оба выбирают свои доминирующие стратегии, получается равновесие. Но не всякое равновесие Нэша строится на доминирующих стратегиях: иногда лучший ход зависит от того, что делает другой человек. Сейчас достаточно удержать более общий критерий: в равновесии каждый уже выбирает лучший для себя ответ на действия остальных.


Как находить равновесие в матрице

Для двух участников и двух вариантов действий можно работать почти механически. Это полезнее, чем пытаться сразу «почувствовать» правильный ответ.

Шаг 1. Проверьте лучшую реакцию первого участника

Возьмите один столбец: это означает, что выбор второго участника зафиксирован.

Сравните первые числа в двух клетках этого столбца. Там, где первое число лучше, находится лучший ответ первого участника на данный выбор второго.

Повторите для второго столбца.

Шаг 2. Проверьте лучшую реакцию второго участника

Теперь берите по очереди строки: выбор первого участника фиксирован.

В каждой строке сравните вторые числа. Где второе число лучше, там лучший ответ второго участника.

Шаг 3. Найдите клетку с двумя лучшими ответами

Если одна и та же клетка оказалась лучшим ответом и для первого, и для второго участника, это равновесие Нэша.

Можно помнить простую формулировку:

Равновесие — это клетка, где оба могут сказать: «При данном выборе другого мне нет смысла менять только свой ход».

Шаг 4. Отдельно спросите, хорош ли этот исход для всех

После нахождения равновесия не останавливайтесь. Сравните его с другими клетками:

  • есть ли вариант, где оба получают результат лучше;
  • нужен ли для перехода совместный шаг;
  • кто пострадает, если попытается перейти к лучшему варианту один.

Именно этот последний вопрос объясняет, почему «очевидно лучший» общий вариант может так и не реализоваться.


Рабочая мини-версия: личные метрики против общего релиза

Представим две продуктовые команды перед общим релизом. В последние дни каждая может выбрать один из двух ходов:

  • вложиться в общий релиз: помочь с интеграцией, тестами и документацией;
  • оптимизировать собственную метрику: завершить только видимую часть своей работы и не брать общие риски.

Пусть условные баллы отражают сочетание премии, признания, нагрузки и риска сорвать срок. Они не претендуют на точное измерение — это карта стимулов.

Команда A / Команда BB вкладывается в общий релизB оптимизирует свою метрику
A вкладывается в общий релиз
A оптимизирует свою метрику

Разберём эту матрицу без моральных ярлыков.

Если команда B вкладывается в общее дело, команде A выгоднее сосредоточиться на собственной метрике: вместо . Она может получить выгоду от общего результата, переложив часть нагрузки на партнёров.

Если команда B оптимизирует собственную метрику, команде A всё равно выгоднее делать то же самое: вместо . Вкладываться в общую интеграцию в одиночку бессмысленно: релиз всё равно будет плохо подготовлен.

Поэтому для A личный лучший ход — оптимизировать свою метрику. Симметрично рассуждает B. Исход устойчив: ни одной команде не выгодно единолично становиться «той самой ответственной командой».

Однако лучше для обеих. Команды не обязательно ленивы, недальновидны или враждебны. Проблема может быть в конструкции стимулов:

  • вклад в общее дело плохо виден и мало вознаграждается;
  • выгоду от помощи получает другая команда;
  • нельзя заранее закрепить взаимные обязательства;
  • есть страх оказаться единственным участником, который вложился.

Это и есть логика неудачного устойчивого исхода: люди разумно реагируют на локальные стимулы, а система получает результат хуже возможного.


Почему плохое равновесие держится

В примере с заключёнными или командами люди не просто «не догадались» до хорошего исхода. Они видят его. Но знают также, что односторонний переход опасен.

CORE Econ иллюстрирует ту же структуру на примере двух соседних фермеров: каждый может применять дешёвый химикат или более безопасный способ борьбы с вредителями. Если химикат используют оба, общая вода загрязняется, но отдельному фермеру всё равно невыгодно отказываться от химиката в одиночку.

Unit 4 Social interactions

Прочитайте раздел «The prisoners’ dilemma» из учебника CORE Econ. Англоязычный пример с двумя фермерами помогает увидеть, что дилемма заключённого — не только история о тюрьме, а повторяющийся тип конфликта между личной выгодой и общим результатом.

В разделе 4.3, «The prisoners’ dilemma», сначала прочитайте описание ситуации и посмотрите на матрицу выплат Figure 4.3b. Затем в том же разделе найдите объяснение лучших ответов и прочитайте сравнение стимулов. Следите не за сельскохозяйственными деталями, а за вопросом: почему безопасный для обоих вариант неустойчив, когда каждый решает независимо.

Обычно плохое равновесие поддерживают три условия:

  1. Личная выгода от одностороннего отклонения. Если другой сотрудничает, можно выиграть, не внося свой вклад.
  2. Личный риск быть единственным сотрудничающим. Если другой не сотрудничает, ваш одиночный вклад не даёт ожидаемого результата.
  3. Отсутствие механизма совместно изменить ситуацию. Нет надёжной договорённости, проверки, санкции за нарушение или уверенности в будущих отношениях.

Пока эти условия сохраняются, призыв «давайте действовать разумнее» редко меняет исход. Он предлагает людям сменить поведение, но не меняет цену одиночного шага.


Три ошибки, которые стоит не допускать

«Равновесие Нэша — это лучший результат»

Нет. В дилемме заключённого равновесие хуже для каждого, чем взаимное сотрудничество. Устойчивость и общее качество — разные свойства.

«Если исход плохой, участники действуют иррационально»

Тоже нет. В приведённых примерах каждый выбирает лучший доступный ход с учётом поведения другого. Нерациональным было бы игнорировать риск, что партнёр не сделает свою часть.

«Чтобы выйти из плохого равновесия, достаточно одному показать пример»

Иногда пример работает, но сам по себе не отменяет стимулы. Если один участник меняет ход, а другой нет, он может оказаться в худшей клетке матрицы. Для устойчивого улучшения обычно требуется изменить саму игру: сделать вклад наблюдаемым, создать взаимные обязательства, предусмотреть последствия нарушения или учесть будущие повторные встречи. Эти инструменты будут центральными в следующих уроках.


Главное

Равновесие Нэша можно найти, проверив один вопрос для каждого участника: получит ли он лучший результат, если один изменит свой ход, а остальные останутся при прежних действиях?

  • Если никто не выиграет от такого одиночного отклонения, исход устойчив.
  • Устойчивость не означает, что исход хорош для всех.
  • В дилемме заключённого «сотрудничество с обеих сторон» может быть лучше для каждого, но не быть устойчивым: у каждого есть соблазн единолично отступить от него.
  • Плохие равновесия часто возникают не из-за плохих людей, а из-за стимулов, рисков и отсутствия надёжной координации.

В следующем уроке мы разберём бытовые и рабочие версии дилеммы заключённого подробнее: научимся узнавать конкретные стимулы, из-за которых индивидуально разумные решения приводят к результату, невыгодному всем.

Can't find a good explanation? Sign up and we'll make it for you

Sign up