混合策略:当对手随机化时你该怎么办

让对手无差异的均衡逻辑、最优反应对应与误读澄清

博弈理论
纳什均衡
交互课件
以让对手无差异原理求解混合策略纳什均衡 (msNE),在概率空间直观观察反应对应交点与纯化定理。
作者

Shawn

Gemini 3.7 Flash

发布于

2026年8月27日

本文依据 Muñoz-Garcia《Advanced Microeconomic Theory》第 8 章及配套课程讲义撰写,属于微观经济学专栏的博弈理论模块。

注记本讲核心目标
  1. 理解为什么当纯策略纳什均衡不存在或存在多个时,随机化(混合策略)是理性的必然选择;
  2. 掌握混合策略均衡的核心求解机制:我的混合概率不是为了让自己收益最大化,而是为了让对手在我各项纯策略间产生无差异
  3. 在概率空间 \([0,1] \times [0,1]\) 中观察阶跃式的最优反应对应及其交点;
  4. 澄清对 msNE 的经典误读:现实中没有人掷骰子,为什么混合策略依然成立(Harsanyi 纯化定理与大样本频率解释)。

什么时候纯策略会失灵

考虑经典的技术采纳博弈:企业 A 和企业 B 决定是否采纳某项新技术。

  • 企业 A 希望协调:它希望自己的选择与 B 一致;
  • 企业 B 希望错开:它希望自己的选择与 A 相反(例如为了避免直接同质竞争)。

收益矩阵如下(企业 A 选行,企业 B 选列):

企业 A  企业 B 采纳(Adopt) 不采纳(Not adopt)
采纳(Adopt) \(3, -3\) \(-4, 0\)
不采纳(Not adopt) \(-3, 1\) \(2, -2\)

用划线法容易看出:若 A 采纳,B 会选不采纳;若 B 不采纳,A 会选不采纳;若 A 不采纳,B 会选采纳;若 B 采纳,A 又想采纳……没有任何一个单元格能让双方同时处于最优反应。纯策略纳什均衡不存在。

如果 A 确定无疑地选择某一个行动,B 就会立刻针对性地反制;反之亦然。为了不被对手完全预测,双方都必须随机化自己的行动。

核心逻辑:让对手无差异

设企业 A 以概率 \(p \in [0, 1]\) 采纳技术(以 \(1-p\) 不采纳),企业 B 以概率 \(q \in [0, 1]\) 采纳技术(以 \(1-q\) 不采纳)。

重要关键直觉:谁决定了我的 \(p\)

初学者最常犯的错误是:试图调整自己的 \(p\) 来最大化自己的期望收益。然而,如果 A 的某项纯策略收益严格高于另一项,A 就会 \(100\%\) 选择前者(\(p=1\)\(p=0\)),根本不会混合。

A 愿意随机化的唯一前提是:采纳与不采纳带给 A 的期望收益完全相等!而 A 的期望收益取决于谁?取决于 B 的概率 \(q\)。因此:

  • \(q\)(B 的混合)的作用是让 A 产生无差异
  • \(p\)(A 的混合)的作用是让 B 产生无差异

我的策略由对手的收益矩阵决定,对手的策略由我的收益矩阵决定。

数学求解

为了让企业 A 在采纳与不采纳之间无差异,必须有 \(EU_A(\text{Adopt}) = EU_A(\text{Not adopt})\)

\[3q + (-4)(1-q) = -3q + 2(1-q) \quad\Longrightarrow\quad 7q - 4 = -5q + 2 \quad\Longrightarrow\quad 12q = 6 \quad\Longrightarrow\quad q^* = \frac{1}{2}\]

同理,为了让企业 B 在采纳与不采纳之间无差异,必须有 \(EU_B(\text{Adopt}) = EU_B(\text{Not adopt})\)

\[-3p + 1(1-p) = 0p + (-2)(1-p) \quad\Longrightarrow\quad -4p + 1 = -2 + 2p \quad\Longrightarrow\quad 6p = 3 \quad\Longrightarrow\quad p^* = \frac{1}{2}\]

因此,唯一的纳什均衡为混合策略均衡:\(\big((\frac{1}{2}, \frac{1}{2}), (\frac{1}{2}, \frac{1}{2})\big)\)

交互演示:概率空间中的最优反应与均衡交点

\((p, q) \in [0, 1] \times [0, 1]\) 空间中,企业 A 的最优反应 \(p^*(q)\) 和企业 B 的最优反应 \(q^*(p)\) 是带有垂直/水平阶跃段的对应(correspondence)。

拖动滑块改变企业 A 成功协调时的收益 \(a_{11}\),观察最优反应阶跃线如何移动,均衡点 \((p^*, q^*)\) 如何在概率方框中平移:

▷ 展开 / 收起代码
viewof a11 = Inputs.range([1, 6], {value: 3, step: 0.2, label: html`企业 A 双采纳收益 a₁₁`})
viewof b22 = Inputs.range([-4, -1], {value: -2, step: 0.2, label: html`企业 B 都不采纳收益 b₂₂`})
▷ 展开 / 收起代码
q_star = 6 / (a11 + 7)

// B 无差异求 p*: -3*p + 0*(1-p) ... wait:
// EU_B(Adopt) = -3*p + 1*(1-p) = 1 - 4*p
// EU_B(Not adopt) = 0*p + b22*(1-p) = b22*(1-p)
// 1 - 4*p = b22 - b22*p => (4 - b22)*p = 1 - b22 => p* = (1 - b22) / (4 - b22)
p_star = (1 - b22) / (4 - b22)
▷ 展开 / 收起代码
// ===== 数值与状态面板 =====
html`<table class="table table-sm" style="max-width:520px">
  <tr><td>企业 A 混合概率(使 B 无差异)</td><td>p* = <b>${p_star.toFixed(3)}</b></td></tr>
  <tr><td>企业 B 混合概率(使 A 无差异)</td><td>q* = <b>${q_star.toFixed(3)}</b></td></tr>
  <tr><td>均衡类型</td><td><b>唯一混合策略纳什均衡(msNE)</b></td></tr>
  <tr><td>期望收益</td><td>EU_A = <b>${(a11 * q_star - 4 * (1 - q_star)).toFixed(2)}</b>, EU_B = <b>${(1 - 4 * p_star).toFixed(2)}</b></td></tr>
</table>`
▷ 展开 / 收起代码
// ===== 概率方框 (p, q) 最优反应图 =====
// A 的最优反应 p*(q):
// 当 q > q* 时,EU_A(Adopt) > EU_A(Not) => p = 1
// 当 q < q* 时,EU_A(Adopt) < EU_A(Not) => p = 0
// 当 q = q* 时,p 可取 [0, 1] 任意值

// B 的最优反应 q*(p):
// 当 p > p* 时,EU_B(Adopt) < EU_B(Not) => q = 0 (B 想错开)
// 当 p < p* 时,EU_B(Adopt) > EU_B(Not) => q = 1
// 当 p = p* 时,q 可取 [0, 1] 任意值

Plot.plot({
  height: 380,
  width: 380,
  x: { label: "p(企业 A 采纳概率)", domain: [0, 1] },
  y: { label: "q(企业 B 采纳概率)", domain: [0, 1] },
  marks: [
    // 边框
    Plot.frame({ stroke: "#cbd5e1" }),
    // 企业 A 的最优反应曲线 p*(q)(蓝色):q < q* 为 0,q = q* 为水平段 [0,1],q > q* 为 1
    Plot.line([[0, 0], [0, q_star], [1, q_star], [1, 1]], { stroke: "#2563eb", strokeWidth: 2.5 }),
    // 企业 B 的最优反应曲线 q*(p)(红色):p < p* 为 1,p = p* 为垂直段 [0,1],p > p* 为 0
    Plot.line([[0, 1], [p_star, 1], [p_star, 0], [1, 0]], { stroke: "#ef4444", strokeWidth: 2.5 }),
    // 均衡交点
    Plot.dot([[p_star, q_star]], { fill: "#8b5cf6", r: 7, stroke: "black" }),
    Plot.text([[p_star, q_star]], { text: [`NE (${p_star.toFixed(2)}, ${q_star.toFixed(2)})`], dx: 14, dy: -12, fontSize: 13, fontWeight: "bold" })
  ],
  title: "概率空间中的最优反应交点(蓝:A 的 BR;红:B 的 BR)"
})
提示你应该看到什么
  • 最优反应的阶跃形态:蓝色线(企业 A)在 \(q < q^*\) 时紧贴左轴(\(p=0\)),在 \(q = q^*\) 处横跨整个方框,在 \(q > q^*\) 时紧贴右轴(\(p=1\));红色线(企业 B)在 \(p = p^*\) 处纵贯方框。
  • 交点即均衡:两条折线在方框内部恰好相交于一点 \((p^*, q^*)\),没有任何落在边界上的纯策略交点。
  • 改变收益的悖论效应:拖大 \(a_{11}\)(企业 A 采纳成功赚得更多),会发现移动的是水平蓝线的上下位置(即 \(q^*\) 下降),而垂直红线(\(p^*\))纹丝不动!想让 A 更愿意采纳,结果却是迫使 B 减少采纳概率——这正是 msNE 互相制衡的精妙之处。

经典特征与常见误读

讲义提炼了关于混合策略纳什均衡的三大核心性质:

  1. 无差异原则(Indifference Principle):在 msNE 中,局中人被赋予正概率的每一项纯策略,其期望收益必然相等;
  2. 严格劣势策略赋予零概率:理性的局中人永远不会对严格劣势策略赋予正概率;
  3. 奇数均衡定理(Odd Number Theorem):在有限玩家、有限纯策略的几乎所有标准式博弈中,纳什均衡的总数(纯策略 + 混合策略)通常是奇数(例如:2 个纯策略均衡必然伴随第 3 个混合策略均衡,如性别战或协同博弈)。
注记澄清:现实中真有人掷骰子做决策吗?

这是对博弈论最常见的攻击之一。现代博弈论通过两种途径为混合策略奠定微观基础:

  • 大样本与人口统计解释\(p^* = 0.5\) 并不意味着某个具体决策者每次掷硬币,而是意味着在由大量同类主体构成的总体中,有 \(50\%\) 的人选择采纳、另 \(50\%\) 的人选择不采纳;
  • Harsanyi 纯化定理(Purification Theorem):如果每个局中人对收益存在微小的私人随机扰动(不完全信息),每个玩家都在采取确定的纯策略(依据自己的微小私人信息),但在外部观察者看来,其行为完全等价于一个混合策略纳什均衡。

小结

  • 当利益冲突导致相互猜忌、纯策略均衡不存在时,混合策略纳什均衡是唯一的理性预测;
  • 求解混合策略的关键是无差异条件:解出让对手无差异的自身混合概率;
  • 概率空间 \((p, q)\) 中的最优反应对应呈阶跃状,其内部交点构成了唯一的混合均衡。

下一篇进入动态博弈世界:逆向归纳法与子博弈精炼纳什均衡(批次二预告)与寡头价格竞争的伯特兰悖论

None🤖 AI 助教「乐高」

拖完滑块还有疑惑?直接向 AI 助教「乐高」提问——它基于本站课程讲义回答,公式用 LaTeX 排版,回答附带讲义溯源。可以试试:

  • 为什么在求解混合策略纳什均衡时,核心逻辑是“让对手无差异”而不是让自己收益最大化?
  • 海萨尼(Harsanyi)纯化定理如何从不完全信息博弈角度解释混合策略?
  • 为什么在有限策略博弈中,纳什均衡的总数(在正则条件下)几乎总是奇数个?