博弈论:静态与动态博弈

纳什均衡、混合策略、子博弈精炼均衡、重复博弈

第 5 讲:博弈论:静态与动态博弈

本章导学

从这一章开始,经济主体不再只是“面对价格做选择”,而是必须预判他人的行动。博弈论给我们一套分析策略互动的语言:什么是策略,什么是最优反应,什么样的结果没有人愿意单方面偏离。

学完本章后,你应当能够:

  • 把经济情境写成标准式或扩展式博弈。
  • 找出占优策略、纯策略纳什均衡和混合策略纳什均衡。
  • 用逆向归纳法求动态博弈的子博弈精炼均衡。
  • 解释重复博弈中合作为什么可能出现,以及折现因子如何影响合作稳定性。

常见考查会从支付矩阵、进入博弈或重复囚徒困境开始,要求你逐步排除劣策略、求最优反应或验证均衡。答题时最重要的是检查“偏离”:一个策略组合只有在每个参与者都没有单方面获利偏离时才是均衡。

本章向前区别于第 4 章的价格接受者模型,向后直接支撑第 6 章的寡头竞争、第 8 章的机制设计和第 11 章的匹配机制。

经济动机 (Economic Motivation)

在许多经济和社会情境中,一个决策者的最优选择取决于其他决策者的选择。例如,寡头市场中的公司定价、拍卖中的出价策略、甚至国家间的贸易谈判。博弈论提供了一个强大的数学框架,用于分析这种"策略互动"情境。

与之前章节的区别:

  • 第1-4章:单个决策者或价格接受者(非策略性)
  • 第5章开始:策略互动(我的最优选择取决于你的选择)

博弈论的核心问题:

  1. 理性的参与者会如何行动?
  2. 存在稳定的结果(均衡)吗?
  3. 如何预测博弈的结果?
  4. 如何设计规则以实现期望的结果?

1. 博弈的基本要素

1.1 标准式博弈 (Normal Form Game)

定义: 一个nn人标准式博弈由以下三要素组成:

  1. 参与者集合: N={1,2,,n}N = \{1, 2, \ldots, n\}
  2. 策略空间: 每个参与者ii有策略集SiS_i
  3. 支付函数: ui:S1×S2××SnRu_i: S_1 \times S_2 \times \cdots \times S_n \to \mathbb{R}

记号:

  • 策略组合: s=(s1,s2,,sn)s = (s_1, s_2, \ldots, s_n)
  • ii外其他人的策略: si=(s1,,si1,si+1,,sn)s_{-i} = (s_1, \ldots, s_{i-1}, s_{i+1}, \ldots, s_n)
  • 参与者ii的支付: ui(si,si)u_i(s_i, s_{-i})

1.2 支付矩阵表示法

两人博弈示例 - 囚徒困境:

参与者2:合作(C)参与者2:背叛(D)
参与者1:合作(C)(-1, -1)(-3, 0)
参与者1:背叛(D)(0, -3)(-2, -2)

解读:

  • 第一个数字是参与者1的支付
  • 如果都合作:各判1年
  • 如果一方背叛:背叛者释放,合作者判3年
  • 如果都背叛:各判2年

1.3 关键假设

  1. 共同知识 (Common Knowledge): 所有参与者知道博弈的规则,且知道其他人知道,且知道其他人知道其他人知道……(无限递归)
  2. 理性 (Rationality): 参与者追求自身支付最大化
  3. 互相理性 (Mutual Rationality): 每个人都是理性的,且每个人都知道其他人是理性的

2. 纳什均衡

2.1 占优策略 (Dominant Strategy)

严格占优: 策略sis_i^*严格占优,如果对所有sisis_i' \neq s_i^*和所有sis_{-i}

ui(si,si)>ui(si,si)u_i(s_i^*, s_{-i}) > u_i(s_i', s_{-i})

弱占优: 将>>替换为\ge

严格劣势: 策略sis_i严格劣于sis_i',如果对所有sis_{-i}

ui(si,si)<ui(si,si)u_i(s_i, s_{-i}) < u_i(s_i', s_{-i})

囚徒困境分析:

  • 对参与者1:无论参与者2选择什么,背叛(D)总是优于合作(C)
    • 如果2选C:D得到0 > C得到-1
    • 如果2选D:D得到-2 > C得到-3
  • 同理,对参与者2,D也是占优策略
  • 占优策略均衡: (D, D)

理性悖论: 双方都理性地选择背叛,结果(-2, -2)却劣于双方合作(-1, -1)!这展示了个体理性与集体理性的冲突。

2.2 纳什均衡的定义

定义: 策略组合s=(s1,s2,,sn)s^* = (s_1^*, s_2^*, \ldots, s_n^*)是纳什均衡,如果对每个参与者ii

ui(si,si)ui(si,si),siSiu_i(s_i^*, s_{-i}^*) \ge u_i(s_i, s_{-i}^*), \quad \forall s_i \in S_i

直觉: 纳什均衡是一种"稳定"状态——给定其他人的策略,没有人有动机单方面偏离。

重要性质:

  1. 占优策略均衡必然是纳什均衡
  2. 纳什均衡未必是占优策略均衡
  3. 纳什均衡未必帕累托有效(囚徒困境)
  4. 纳什均衡可能不唯一

2.3 寻找纯策略纳什均衡

方法1: 下划线法

在每个参与者的每个策略下,对其他参与者的每种策略组合,找到该参与者的最优反应并划线。两条线都划的格子就是纳什均衡。

方法2: 最优反应函数

定义参与者ii的最优反应函数:

BRi(si)=argmaxsiSiui(si,si)BR_i(s_{-i}) = \arg\max_{s_i \in S_i} u_i(s_i, s_{-i})

纳什均衡满足:siBRi(si)s_i^* \in BR_i(s_{-i}^*)对所有ii

例题: 协调博弈 (Coordination Game)

参与者2:歌剧(O)参与者2:足球(F)
参与者1:歌剧(O)(2, 1)(0, 0)
参与者1:足球(F)(0, 0)(1, 2)

分析:

  • 如果2选O,1的最优反应是O(2 > 0)
  • 如果2选F,1的最优反应是F(1 > 0)
  • 对称地分析参与者2

纳什均衡: (O, O)和(F, F)——两个纯策略纳什均衡!

问题: 如果存在多重均衡,参与者如何协调?这引出了均衡选择和焦点(focal point)的概念。

2.4 剔除严格劣策略 (IESDS)

迭代剔除严格劣策略 (Iterated Elimination of Strictly Dominated Strategies):

  1. 找到所有严格劣策略并剔除
  2. 在剩余策略集中,重复步骤1
  3. 直到无法剔除为止

性质:

  • IESDS的顺序不影响最终结果
  • 如果IESDS后只剩一个策略组合,它必然是唯一的纳什均衡
  • 纳什均衡一定能在IESDS中幸存
  • 但IESDS可能无法找到所有纳什均衡

例题: 智猪博弈

小猪:按(P)小猪:等(W)
大猪:按(P)(4, 1)(-1, 4)
大猪:等(W)(6, -1)(0, 0)

分析:

  • 对小猪:无论大猪如何选择,等待(W)都优于按按钮(P)
    • 如果大猪按:W得4 > P得1
    • 如果大猪等:W得0 > P得-1
  • W是小猪的占优策略,剔除P
  • 给定小猪选W,大猪选P(得6 > 0)

唯一纳什均衡: (P, W)——大猪劳动,小猪搭便车

2.5 纳什均衡的存在性

纳什定理 (Nash, 1950): 如果策略集SiS_i都是有限的,则至少存在一个纳什均衡(可能是混合策略)。

更一般的存在性定理 (Kakutani不动点定理): 如果:

  1. 策略集SiS_i是欧几里得空间的非空紧凸子集
  2. 支付函数uiu_i连续
  3. ui(si,si)u_i(s_i, s_{-i})关于sis_i拟凹

则纯策略纳什均衡存在。


3. 混合策略纳什均衡

3.1 混合策略的定义

纯策略: 确定性地选择某个行动

混合策略: 在纯策略上的概率分布

σiΔ(Si)\sigma_i \in \Delta(S_i)

其中Δ(Si)\Delta(S_i)SiS_i上所有概率分布的集合。

记号: σi(si)\sigma_i(s_i)表示参与者ii选择纯策略sis_i的概率。

3.2 期望支付

给定混合策略组合σ=(σ1,,σn)\sigma = (\sigma_1, \ldots, \sigma_n),参与者ii的期望支付:

ui(σ)=sSui(s)j=1nσj(sj)u_i(\sigma) = \sum_{s \in S} u_i(s) \prod_{j=1}^n \sigma_j(s_j)

3.3 混合策略纳什均衡

定义: 混合策略组合σ\sigma^*是纳什均衡,如果对每个ii

ui(σi,σi)ui(σi,σi),σiΔ(Si)u_i(\sigma_i^*, \sigma_{-i}^*) \ge u_i(\sigma_i, \sigma_{-i}^*), \quad \forall \sigma_i \in \Delta(S_i)

关键引理(无差异原则): 在混合策略纳什均衡中,如果参与者ii以正概率选择某个纯策略,那么该纯策略必须是其最优反应之一,即给予ii相同的期望支付。

推论: 在混合策略均衡中,参与者在其支持集(正概率纯策略集合)中的所有策略间无差异。

3.4 求解混合策略均衡

例题: 性别战争/协调博弈

女:歌剧(O)女:足球(F)
男:歌剧(O)(2, 1)(0, 0)
男:足球(F)(0, 0)(1, 2)

已找到两个纯策略均衡:(O, O)和(F, F)。是否存在混合策略均衡?

求解步骤:

设男选O的概率为pp,女选O的概率为qq

使女无差异(她才愿意混合):

u(O)=u(F)u_{\text{女}}(O) = u_{\text{女}}(F)1p+0(1p)=0p+2(1p)1 \cdot p + 0 \cdot (1-p) = 0 \cdot p + 2 \cdot (1-p)p=2(1p)p = 2(1-p)p=2/3p = 2/3

使男无差异:

u(O)=u(F)u_{\text{男}}(O) = u_{\text{男}}(F)2q+0(1q)=0q+1(1q)2 \cdot q + 0 \cdot (1-q) = 0 \cdot q + 1 \cdot (1-q)2q=1q2q = 1 - qq=1/3q = 1/3

混合策略纳什均衡: 男选O的概率2/3,女选O的概率1/3。

期望支付:

u=2×13×23=49u_{\text{男}} = 2 \times \frac{1}{3} \times \frac{2}{3} = \frac{4}{9}u=1×13×23=29u_{\text{女}} = 1 \times \frac{1}{3} \times \frac{2}{3} = \frac{2}{9}

注意这比两个纯策略均衡都要差!混合策略均衡反映了协调失败的风险。

3.5 经典案例:石头剪刀布

石头剪刀
石头(0, 0)(1, -1)(-1, 1)
剪刀(-1, 1)(0, 0)(1, -1)
(1, -1)(-1, 1)(0, 0)

观察: 不存在纯策略纳什均衡(任何策略组合都有人想偏离)

对称混合策略均衡: 每个参与者以1/31/3概率选择每个策略

验证: 给定对手均匀随机,自己的期望支付对所有策略都是0,因此无差异,无偏离动机。


4. 动态博弈与扩展式

4.1 扩展式博弈 (Extensive Form Game)

表示方法: 博弈树

要素:

  1. 节点: 决策点
  2. 分支: 可选择的行动
  3. 信息集: 参与者无法区分的节点集合
  4. 终端节点: 博弈结束,标注支付

完美信息: 所有信息集都是单点(参与者知道历史) 不完美信息: 存在非单点信息集

4.2 逆向归纳法 (Backward Induction)

适用条件: 有限、完美信息博弈

算法:

  1. 从最后一个决策节点开始
  2. 确定该节点的最优行动
  3. 用该最优行动的支付替代该子博弈
  4. 向前移动到前一个决策节点
  5. 重复直到初始节点

例题: 进入博弈 (Entry Game)

         进入者
        /      \
      进入      不进入
      /          \
   在位者        (0, 2)
   /    \
 战斗   容纳
  /      \
(-1,-1)  (1,1)

逆向归纳:

  • 最后节点:在位者选择"容纳"(1 > -1)
  • 回到初始节点:进入者预期到容纳,选择"进入"(1 > 0)

子博弈精炼纳什均衡 (SPNE): (进入, 容纳)

关键洞见: "战斗"是不可信威胁——虽然在位者威胁说"你进入我就战斗",但一旦进入真的发生,容纳才是最优反应。SPNE排除了这种基于不可信威胁的均衡。

4.3 子博弈精炼纳什均衡

子博弈: 从某个单点信息集开始的博弈树的一部分,本身构成一个完整的博弈。

定义: 策略组合是SPNE,如果它在每个子博弈中都构成纳什均衡。

意义: SPNE要求策略在博弈的任何阶段都是可信的,即使那个阶段在均衡路径之外("离轨威胁"也必须可信)。

性质:

  1. 每个SPNE都是纳什均衡
  2. 反之不成立(纳什均衡可能包含不可信威胁)
  3. 有限完美信息博弈必然存在纯策略SPNE
  4. SPNE可以通过逆向归纳找到

4.4 蜈蚣博弈 (Centipede Game)

  1     2     1     2
  ↓     ↓     ↓     ↓
下→(1,0) 下→(0,2) 下→(3,1) 下→(2,4)
继续→  继续→  继续→  继续→ (终点)(4,3)

逆向归纳解:

  • 最后节点:参与者2选"下"(4 > 3)
  • 倒数第二:参与者1预期到这点,选"下"(3 > 2)
  • 继续倒推……
  • 结论: 参与者1在第一步就选"下",得到(1, 0)

悖论: 如果双方都"继续",可以到达(4, 3),对双方都更好!

实验证据: 实验中,参与者很少在第一步就选"下",往往会合作几轮。

解释:

  1. 有限理性
  2. 对对方理性的怀疑
  3. 利他偏好
  4. 声誉考虑(即使是单次博弈)

这展示了逆向归纳法的局限性。


5. 重复博弈

5.1 有限重复博弈

设定: 阶段博弈GG重复TT次,TT有限且为共同知识。

定理: 如果阶段博弈GG有唯一纳什均衡ss^*,则有限重复博弈的唯一SPNE是每期都选择ss^*

证明(逆向归纳):

  • TT期:这是最后一期,选择阶段博弈的纳什均衡ss^*
  • T1T-1期:由于第TT期的行动已确定为ss^*,当前期的偏离不影响未来,因此选择ss^*
  • 依此类推……

应用: 有限重复的囚徒困境中,唯一SPNE是每期都背叛。

5.2 无限重复博弈

设定: 阶段博弈GG无限次重复,参与者折现因子为δ(0,1)\delta \in (0, 1)

总支付:

t=0δtui(st)\sum_{t=0}^{\infty} \delta^t u_i(s^t)

其中sts^t是第tt期的策略组合。

策略: 现在是整个历史的函数,可以是条件性的("如果你昨天背叛,我今天就惩罚你")。

5.3 触发策略 (Trigger Strategies)

冷酷触发策略 (Grim Trigger):

  • 第一期选择合作
  • 只要历史上都是合作,继续合作
  • 一旦观察到任何人背叛,永远背叛

一次性惩罚策略:

  • 第一期合作
  • 如果对方上期合作,本期合作
  • 如果对方上期背叛,本期背叛,之后回到合作

5.4 民间定理 (Folk Theorem)

可行支付: 阶段博弈中某策略组合的支付向量

个体理性支付: 参与者能通过自己的minimax策略保证的最低支付

民间定理(简化版): 对于折现因子足够接近1(δ\delta充分大),任何满足以下条件的可行支付都可以作为某个子博弈精炼纳什均衡的平均支付:

  1. 严格高于个体理性水平
  2. 可以通过某策略组合实现

直觉:

  • 未来足够重要(δ\delta接近1)时,偏离的短期收益被未来惩罚抵消
  • 可以用惩罚阶段来支撑合作

应用: 解释卡特尔、隐性合谋等现象

5.5 无限重复囚徒困境中的合作

囚徒困境:

合作(C)背叛(D)
合作(C)(3, 3)(0, 4)
背叛(D)(4, 0)(1, 1)

冷酷触发策略支撑的合作:

如果两人都采用冷酷触发策略:

  • 合作路径支付: 31δ\frac{3}{1-\delta}
  • 偏离到背叛: 当期得4,之后永远得1,总支付4+δ1δ4 + \frac{\delta}{1-\delta}

不偏离条件:

31δ4+δ1δ\frac{3}{1-\delta} \ge 4 + \frac{\delta}{1-\delta}34(1δ)+δ3 \ge 4(1-\delta) + \delta343δ3 \ge 4 - 3\deltaδ13\delta \ge \frac{1}{3}

结论: 只要δ1/3\delta \ge 1/3(未来足够重要),双方合作是SPNE!

经济学含义:

  • 长期关系促进合作
  • 频繁互动(δ\delta高)有助于维持隐性合约
  • 一次性交易(δ\delta低)更可能出现机会主义

6. 完整例题

例题1: 求解混合策略均衡

题目: 求以下博弈的所有纳什均衡(纯策略和混合策略)

LR
U(3, 1)(0, 0)
D(1, 0)(2, 2)

解答:

(1) 纯策略纳什均衡

检查每个策略组合:

  • (U, L): 给定L,U是最优(3>1);给定U,L是最优(1>0)✓
  • (U, R): 给定R,D是最优(2>0)✗
  • (D, L): 给定L,U是最优(3>1)✗
  • (D, R): 给定R,D是最优(2>0);给定D,R是最优(2>0)✓

纯策略纳什均衡:(U, L)和(D, R)

(2) 混合策略纳什均衡

设参与者1选U的概率为pp,参与者2选L的概率为qq

使参与者2无差异:

u2(L)=u2(R)u_2(L) = u_2(R)1p+0(1p)=0p+2(1p)1 \cdot p + 0 \cdot (1-p) = 0 \cdot p + 2 \cdot (1-p)p=2(1p)p = 2(1-p)p=23p = \frac{2}{3}

使参与者1无差异:

u1(U)=u1(D)u_1(U) = u_1(D)3q+0(1q)=1q+2(1q)3 \cdot q + 0 \cdot (1-q) = 1 \cdot q + 2 \cdot (1-q)3q=q+22q3q = q + 2 - 2q4q=24q = 2q=12q = \frac{1}{2}

混合策略纳什均衡: p=2/3,q=1/2p^* = 2/3, q^* = 1/2

期望支付:

u1=3×12×23+2×12×13=1+13=43u_1 = 3 \times \frac{1}{2} \times \frac{2}{3} + 2 \times \frac{1}{2} \times \frac{1}{3} = 1 + \frac{1}{3} = \frac{4}{3}u2=1×12×23+2×12×13=13+13=23u_2 = 1 \times \frac{1}{2} \times \frac{2}{3} + 2 \times \frac{1}{2} \times \frac{1}{3} = \frac{1}{3} + \frac{1}{3} = \frac{2}{3}

例题2: 逆向归纳求解动态博弈

题目: 公司1(先行者)和公司2(跟随者)依次决定进入市场与否。进入成本为2,市场利润取决于进入者数量:

  • 1家公司进入:获利6
  • 2家公司进入:各获利3

求SPNE。

解答:

画出博弈树:

         公司1
        /      \
      进入      不进入
      /          \
   公司2         (0, 0)
   /    \
 进入   不进入
  /      \
(1,1)   (4,0)

支付计算:

  • 都进入:(6-2, 6-2) = (4, 4) 等等,题目说各获利3
  • 正确的:都进入(3-2, 3-2) = (1, 1)
  • 只1进入:(6-2, 0) = (4, 0)
  • 都不进入:(0, 0)

逆向归纳:

  • 公司2的决策节点:比较进入(1)和不进入(0),选择进入
  • 回到公司1:预期公司2进入,比较进入得1和不进入得0,选择进入

SPNE: (进入, 进入)

先行者优势? 在这个例子中不存在——先动者并未获得优势。


7. 应用案例

7.1 价格竞争中的伯特兰悖论

两家公司同时定价,消费者总是选择低价者。如果价格相同,平分市场。

这是一个博弈!纳什均衡是什么?

答案: 两家公司都定价等于边际成本p=MCp = MC(零利润)。

推理: 如果p>MCp > MC,对手有动机微降价抢走全部市场。只有p=MCp = MC时,降价会亏损,没有偏离动机。

这是伯特兰悖论:仅两家公司的市场,却达到完全竞争结果!

7.2 公共物品自愿供给

nn个人决定是否贡献成本cc来提供公共物品(价值v>cv > c给每个人)。公共物品只需一人贡献即可提供。

这是一个对称博弈。分析对称纳什均衡:

设其他人贡献的概率为pp,某人选择贡献与否无差异需要:

vc=v(1(1p)n1)v - c = v(1 - (1-p)^{n-1})

解得pp。当nn很大时,p0p \to 0——搭便车问题!

7.3 拍卖中的策略

在二价密封拍卖中,诚实出价是占优策略(无论其他人出多少,说真话总是最优的)。

这是博弈论在机制设计中的应用——下一章的主题。


8. 文献与拓展

经典著作:

  • von Neumann & Morgenstern (1944). Theory of Games and Economic Behavior
  • Nash, J. (1950). "Equilibrium Points in N-Person Games"
  • Nash, J. (1951). "Non-Cooperative Games"
  • Selten, R. (1975). "Reexamination of the Perfectness Concept for Equilibrium Points"

现代教材:

  • Gibbons, R. (1992). Game Theory for Applied Economists
  • Osborne, M. & Rubinstein, A. (1994). A Course in Game Theory
  • Mas-Colell et al. (1995), Chapter 7-9
  • Fudenberg & Tirole (1991). Game Theory

9. 本章小结

核心概念关键结果应用
占优策略无论对手如何,总是最优囚徒困境
纳什均衡无人愿单方面偏离预测博弈结果
混合策略概率化选择无纯策略均衡时
SPNE排除不可信威胁动态博弈分析
民间定理重复博弈支撑合作隐性合谋

关键洞见: ✅ 策略互动中,理性选择取决于对对方行为的预期
✅ 纳什均衡提供了预测博弈结果的稳定概念
✅ 个体理性可能导致集体非理性(囚徒困境)
✅ 重复互动和声誉可以支撑合作行为
✅ 行动顺序和承诺能力影响博弈结果

自学检查

核心直觉回看:博弈论研究“我的最优选择取决于你怎么选”的情境。纳什均衡不是说所有人都满意,而是说在给定别人策略时,没有人愿意单方面改变自己的策略。

关键模型提醒:静态博弈先找最优反应,再找交点;混合策略均衡让对手在其纯策略之间无差异;动态博弈用逆向归纳排除不可信威胁。

常见误区

  • 混淆占优策略均衡和纳什均衡。有占优策略一定是纳什均衡,但纳什均衡不一定来自占优策略。
  • 认为纳什均衡就是社会最优。囚徒困境正说明个体理性可能导致集体低效。
  • 求混合策略时让自己无差异,而不是让对手无差异。
  • 在动态博弈中接受空洞威胁,没有检查子博弈精炼性。

自测题

  1. 用支付矩阵解释囚徒困境中为什么背叛是占优策略。
  2. 一个博弈可能有多个纳什均衡吗?这会给预测带来什么问题?
  3. 求混合策略均衡时,为什么要令对手的期望支付相等?
  4. 逆向归纳法如何排除“不可信威胁”?
  5. 无限重复博弈中,折现因子为什么影响合作能否维持?

下一步学习提示

下一章的寡头模型就是博弈论的直接应用。复习时请特别熟悉“最优反应函数”的写法,因为古诺、伯特兰和斯塔克尔伯格都要从这里出发。

下一章预告: 博弈论为我们提供了分析策略互动的工具。下一章我们将应用这些工具分析寡头市场——少数几家公司竞争的市场结构。我们将看到古诺、伯特兰和斯塔克尔伯格如何用博弈论建模不同的竞争方式,以及这些模型对福利和政策的含义。

Copyright © 2026