断点回归 (RDD):局部随机化的识别与推断

从连续性假设到 rdrobust 实操——兼论阈值被操纵时怎么办

因果推断
断点回归
rdrobust
系统讲解断点回归的识别逻辑、诊断工具与现代估计推断(CCT 局部多项式 + 稳健偏误校正),并用真实数据完整演示 rdrobust;结尾讨论驱动变量被精确操纵时 RD 失效与 bunching 方法的衔接。A complete guide to regression discontinuity with a real-data rdrobust walkthrough.
作者

Shawn

Gemini 3.7 Flash

发布于

2026年8月27日

本文是政策研究专栏”因果推断”子栏目的首篇。示例数据来自 Bronzini & Iachini (2014) 的公开复现包(意大利研发补贴的评分断点),后文的所有数字都是本站本地运行的真实输出;方法篇的姊妹篇是数据资源政策模拟

注记本讲核心目标
  1. 理解 RDD 的识别逻辑:为什么断点附近是”局部随机试验”;
  2. 区分 sharp 与 fuzzy 设计,掌握两类诊断:协变量平衡与密度检验;
  3. 掌握现代估计流程:CCT 局部线性、MSE 最优带宽、稳健偏误校正推断(rdrobust);
  4. 明白什么时候 RD 会失效——驱动变量可被精确操纵时,转向 bunching 方法

识别逻辑:断点附近的局部随机试验

许多政策由评分或连续变量越过阈值触发:考试分数过线决定录取、项目评分过 75 分获得补贴、研发强度达到 3%–6% 享受税收优惠。设驱动变量(running variable)\(X_i\),断点 \(c\),处理 \(D_i = \mathbf{1}\{X_i \ge c\}\)。若个体无法精确把自己放在 \(X_i\) 的某一侧,那么断点两侧邻近个体的其他特征应当系统性相似——仿佛在 \(c\) 附近做了一次随机分组。此时断点处结果变量 \(Y\) 的跳跃就是处理的因果效应:

\[\tau_{SRD} = \lim_{x \downarrow c} E[Y_i | X_i = x] - \lim_{x \uparrow c} E[Y_i | X_i = x]\]

图 1: 意大利研发补贴的断点散点:评分 75 分两侧投资率的双侧线性拟合(本站用复现包数据重绘)

图 1 用真实数据展示了这一图景:横轴为项目评分,纵轴为投资/销售比,75 分处双侧拟合线的高度差即补贴效应的视觉估计。

Sharp 与 Fuzzy。 若越过断点就必然、也只有越过断点才能得到处理,为 sharp RDD(上式)。若处理概率在断点处只是跳跃而非从 0 到 1(如补贴申领还需企业配合),为 fuzzy RDD——用断点作为处理概率的工具变量,估计局部 Wald 量。

诊断:识别假设只能逼近,不能直接检验

连续性假设(潜在结果在 \(c\) 处连续)本身不可检验,但有两条广泛使用的诊断性证据:

协变量平衡(placebo RD)。 断点两侧,前定协变量的密度与条件均值都不应有跳跃。以我们的示例数据为例,对数就业人数在 75 分处:

. rdrobust LEMPL score, c(75)
------------------------------------------------------------------------------
     Method |   Coef.    Std. Err.    z     P>|z|    [95% Conf. Interval]
------------------------------------------------------------------------------
 Conventional |   .32606     .55138   0.5914   0.554   -.75462    1.40674
------------------------------------------------------------------------------

系数不显著且置信区间覆盖零——通过。若某个前定变量在断点处显著跳跃,两侧可比性存疑,整个设计都要重新审视。

密度检验(manipulation test)。 个体若能精确操控 \(X_i\),会人为堆积在有利一侧,导致断点左侧(或阈值之上)出现异常密度峰。

图 2: 驱动变量的直方图:检查评分分布在 75 分两侧是否异常(本站重绘)

图 2 是示例数据的评分直方图。正式检验用 McCrary (2008) 密度检验或其现代版 rddensity。注意这里有个微妙之处:有堆积不一定杀死设计——如果个体只能操纵”是否进入样本”而无法操纵条件分布,断点附近的比较仍可能有效;但如果个体能把 \(X_i\) 精确搬到阈值之上(如企业调整申报研发费用跨过 5% 门槛),RD 就彻底失效了。这正是本专栏政策模拟篇的入口。

估计与推断:告别全局高阶多项式

早期文献(包括 2014 年前发表的许多论文)流行全样本 0–3 阶多项式回归。两条现代共识改变了实践:

  1. Gelman & Imbens (2019):全局高阶多项式本质上是给远离断点的观测赋予过高的隐含权重,边界效应污染估计——应改用局部低阶多项式
  2. Calonico–Cattaneo–Titiunik (2014, JASA):传统”在最优带宽处直接报告点估计与标准误”的推断存在偏误,应做偏误校正 + 稳健方差(CCT 稳健推断),标准实现就是 rdrobust

标准流程三步:rdbwselect 选带宽(默认 MSE 最优,mserd)→ rdrobust 估计(默认局部线性 + 三角核 + 稳健推断)→ 带宽与多项式阶数敏感性。

真实数据完整演示

仍用评分断点数据,评估补贴对企业投资率的影响:

. rdrobust INVSALES score, c(75)
     Cutoff c = 75 | Left of c  Right of c
-------------------+----------------------
     Number of obs |       103         254
Eff. Number of obs |        44         100
    Order est. (p) |         1           1
    Order bias (q) |         2           2
       BW est. (h) |     6.711       6.711
------------------------------------------------------------------------------
     Method |   Coef.    Std. Err.    z     P>|z|    [95% Conf. Interval]
------------------------------------------------------------------------------
 Conventional |  -.02488     .04876  -0.5103   0.610  -.120441    .07068
       Robust |         -            -  -1.2484   0.212  -.211679    .046944
------------------------------------------------------------------------------

三个读数值得逐一咀嚼:

  • 有效样本骤减:MSE 最优带宽 \(h = 6.7\) 分,只用到断点附近 144 个观测(44 对 100)——这是”局部”二字的代价,也是其可信度的来源;
  • 稳健推断不显著:CCT 稳健置信区间 \([-0.21, 0.047]\) 覆盖零。事实上多项式阶数敏感性同样如此:局部二次 \(0.004\)(SE \(0.089\))、局部三次 \(0.079\)(SE \(0.124\)),均不显著;
  • 与论文原估计的对照Bronzini & Iachini (2014) 用的是当时的标准做法——全样本/宽窗口多项式,其局部二次估计为 \(+11\) 个百分点(\(p=0.04\))。同一数据、现代默认设定下效应不再显著,这不必然意味着原结论错误(小样本下 CCT 带宽收紧、检验功效下降),但它生动说明了方法演进如何改变同一证据的解读——精读篇会完整呈现这组对照。
提示实操清单(照抄即可)
ssc install rdrobust, replace   // 一次安装
use data.dta, clear
rdplot   Y X, c(75)             // 1. 先画图,永远先画图
rdbwselect Y X, c(75)           // 2. 带宽敏感性:mserd/msetwo/cerrd
rdrobust  Y X, c(75)            // 3. 基准:局部线性 + 稳健推断
rdrobust  Y X, c(75) p(2)       // 4. 阶数敏感性
rdrobust  W1 X, c(75)           // 5. 每个前定协变量做 placebo
rddensity X, c(75)              // 6. 操纵检验
rdrobust  Y X, c(75) h(...)     // 7. 手动带宽网格画稳健量曲线

陷阱清单

  • 有效样本不足:报告有效观测数,而非全样本量;本例 357 个观测在最优带宽下只剩 144 个;
  • Donut RD 滥用:剔除断点紧邻观测可缓解精确操纵,但也剔除了识别信息最丰富的样本,应作为稳健性而非基准;
  • 多断点(multi-cutoff):HNTE 的研发强度阈值按销售规模分档(5%/4%/3%),多断点设计需要 rdmulti 类的处理或明确的分析框架,不能简单混作一个断点;
  • 协变量调整的双重用途:把前定协变量放进 RD 回归可以精化估计(效率),但绝不能让”协变量跳不跳”的结论依赖是否控制它们。

从 RD 到 Bunching:本专栏的路线

断点回归要求驱动变量”不可被精确控制”。但高新技术企业认定的 5%/4%/3% 研发强度阈值恰恰相反——申报研发费用掌握在企业自己手里,企业会系统性地把研发强度堆积(bunch)在阈值之上以换取 15% 税率。此时密度检验必然”失败”,而堆积的形状本身成为信息:通过拟合反事实密度,可以估计企业的研发调整弹性并做政策模拟。这正是 Chen et al. (2021, AER) 的路线,也是”因果推断”与”政策模拟”两个子栏目在本专栏中的接续点。

延伸阅读

  • Lee, David S., and Thomas Lemieux. 2010. “Regression Discontinuity Designs in Economics.” Journal of Economic Literature 48(2): 281–355.
  • Calonico, Sebastian, Matias D. Cattaneo, and Rocio Titiunik. 2014. “Robust Nonparametric Confidence Intervals for Regression-Discontinuity Designs.” Econometrica 82(6): 2295–2326.
  • Cattaneo, Matias D., Nicolás Idrobo, and Rocío Titiunik. 2019. A Practical Introduction to Regression Discontinuity Designs: Foundations. Cambridge University Press.
  • Gelman, Andrew, and Guido Imbens. 2019. “Why High-Order Polynomials Should Not Be Used in Regression Discontinuity Designs.” Journal of Business & Economic Statistics 37(3): 447–456.
  • McCrary, Justin. 2008. “Manipulation of the Running Variable in the Regression Discontinuity Design: A Density Test.” Journal of Econometrics 142(2): 698–714.