Notching R&D:Chen et al. (2021, AER) 精读与复现
用税收门槛的堆积形状估计研发弹性,再做反事实政策模拟
本文是政策研究专栏”政策模拟”子栏目的首篇,也是五篇系列的收官:制度背景见高新技术企业认定政策,数据见数据资源,方法论铺垫见断点回归与研发补贴评估精读。
- 理解 notch 与 kink 的区别,以及为什么研发强度阈值只能用 bunching 而非 RD 来研究;
- 拆解论文的三段式设计:堆积事实 → 准实验(ITT)→ 结构估计与反事实;
- 用官方公开复现包(openICPSR 131201)本地重绘论文图表(本站已全部跑通);
- 掌握政策模拟的读法:弹性、重贴标签与政策工具比较如何共同决定”值不值”。
论文与制度背景
Chen, Zhao, Zhikuo Liu, Juan Carlos Suárez Serrato, and Daniel Yi Xu. 2021. “Notching R&D Investment with Corporate Income Tax Cuts in China.” American Economic Review 111(7): 2065–2100.
制度正是本专栏第一篇梳理的高新技术企业认定:研发费用占销售收入比例达到分档阈值(研究期内为小企业 6%、中型 4%、大型 3%),且满足其余条件,企业即可享受 15% 优惠税率(法定 25%)。数据为全国税收调查(研发费用明细 + 企业财务)与规模以上工业企业数据库的匹配(口径与可得性详见数据资源篇,属受限数据)。
为什么是 Bunching 而不是 RD
断点回归的前提是个体无法精确操控驱动变量。研发强度阈值恰好相反:申报研发费用是企业自己填的。于是我们看到的不是断点两侧结果的跳跃,而是密度分布本身的畸变——
AnalysisData 重绘,对应论文 Figure 2B)
图 1 是论文的标志性事实:小企业研发强度在 6% 阈值处出现尖锐的堆积峰。这不是”造假”那么简单——它同时包含三种行为:真实增加研发投入、把其他费用重贴标签(relabeling)为研发、以及调整成本约束下的边际迁移。
术语上,这类政策叫 notch(门槛两侧税负水平本身不同)而非 kink(斜率变化,如累进税率节点)。Saez (2010) 用所得税 kink 的堆积推弹性;本文把这套工具搬到企业 notch 上:堆积的质量 + 拒绝区的形状,识别出企业的研发调整成本分布。
三段式设计
第一步:堆积事实(Figures 2–3)
分规模的研发强度直方图(图 1 为小企业组):阈值处堆积、阈值左侧紧邻区间的”空洞”(企业从下方迁走)。作者还做了安慰剂检验(不存在阈值的位置无堆积)、2009 与 2011 两年的对比等——对应复现包 MatlabBunchingCode 下十余个脚本与 ModelOutput/R1_*.csv 的 bin 数据。
第二步:准实验(ITT)
堆积只证明”企业响应门槛”,不证明”研发真的变多了、生产率真的提高了”。作者利用 2009 年(政策执行首年)研发强度在阈值附近的企业构造 intent-to-treat 比较:阈值之上 vs 之下的企业在 2011 年的税收、研发、TFP 等结果(复现包 MatlabITTCode,图表 A1/A8)。结论:申报研发显著增加,其中一部分来自重贴标签。
第三步:结构估计与反事实
核心是估计一个企业异质性模型:企业选择申报研发强度,跨过门槛换取 10 个百分点税率优惠,代价是调整成本与重贴标签成本;研发又通过生产函数影响 TFP。用模拟矩估计(SMM)匹配一堆矩——阈值下方的密度份额、\([3\%,5\%]\) 区间平均研发强度、断点两侧平均 TFP、管理成本比率的断点变化、堆积点位置等。
估计出的关键参数(复现包 Replication_Report.pdf 汇总,本站核对):
| 参数 | 含义 | 估计值(基准) |
|---|---|---|
| \(\varepsilon\) | R&D 的 TFP 弹性 | 0.091(SE 0.002) |
| \(\mu_b, \sigma_b\) | 调整成本分布 | 8.011 / 2.014 |
| \(\mu_c\) | 认定固定成本 | 0.532 |
| \(\eta\) | 重贴标签成本 | 结构估计(详见论文 Table 3) |
| \(d^{-*}\) | 堆积起点(阈值下方) | ≈ 1 个百分点 |
| 不堆积的企业份额 | — | ≈ 66.5% |
对应的政策读数:重贴标签约占申报研发增量的 24.2%;研发翻倍约带来生产率 9% 的提升(\(\varepsilon\) 的对数含义)。
反事实模拟(Figures 8–9)
结构模型的价值在反事实:把门槛激励替换成等额的 R&D 税收抵免(tax credit)会怎样?答案取决于重贴标签的普遍程度——抵免按申报研发额比例返还,会放大重贴标签的套利空间;而 notch 只要求”过线”,反而限制了在申报额上做文章的边际收益。当重贴标签普遍时,门槛式政策比抵免式更有成本效益。福利侧的结论:只需适度的研发溢出,该项目即可通过成本收益检验。
复现包走读(openICPSR 131201)
这个包是”受限数据时代复现规范”的范本(数据资源篇的论点即源于此):
AER Replication Public/
├── Master_0_Run_All.do # 一键串联(需改 3 处路径)
├── Master_1_Clean.do # 清洗:需机密税调/ASIF 数据(不可公开运行)
├── Master_2_Matlab.m # bunching + ITT + 结构估计:公开数据可全跑
├── Master_3_Graphs.do # 全部图表:公开数据可全跑
├── AnalysisData/ # 作者清洗出的图表级数据(dataFigure*.dta 等)
├── MatlabStructuralCode/ # 结构估计 + 反事实(DataMoments/ 已含矩)
├── ModelOutput/ # Matlab 结果(bunching bin、拟合输出)
├── FiguresTables/ # 论文全部图表成品
└── README/ # 说明 + AEA 数据编辑部复现报告
本站本地运行结果:以 AnalysisData/ModelOutput 为输入重跑 Master_3 等价脚本(本地 Stata、包内自带 ado 备份、免 ssc install),47 个图表文件全部重新生成,图 1 即为其中 Figure 2B 的重绘。Master_2(Matlab 部分)需要 Matlab R2019b/R2020b,全流程约 1 小时 40 分钟(README 实测口径)。
- Errata 主动披露:README 记录了论文 Table 2 三个印刷错误值,并给出代码复现的正确值;
- 已知差异声明:自助法与数值求导导致的随机性会小幅影响若干标准误,README 逐表列明;
- 复现报告:
Replication_Report.tex编译后把全部输出汇集成册——AEA 数据编辑部审的就是它。
方法论对照:全专栏的收束
| 设计 | 驱动变量可控性 | 识别对象 | 本专栏实例 |
|---|---|---|---|
| Sharp RD | 不可控(委员会评分) | 断点处的局部效应 | Bronzini & Iachini 2014 |
| Bunching/Notch | 完全可控(申报值) | 调整成本/弹性(结构化) | 本文 |
| 结构反事实 | — | 政策工具比较、福利 | 本文第三段 |
延伸阅读
- Chen, Zhao, Zhikuo Liu, Juan Carlos Suárez Serrato, and Daniel Yi Xu. 2021. “Notching R&D Investment with Corporate Income Tax Cuts in China.” American Economic Review 111(7): 2065–2100.
- Saez, Emmanuel. 2010. “Do Taxpayers Bunch at Kink Points?” American Economic Journal: Economic Policy 2(3): 180–212.
- Kleven, Henrik J. 2016. “Bunching.” Annual Review of Economics 8: 535–564.
- Best, Michael Carlos, and Henrik J. Kleven. 2018. “Housing Market Responses to Transaction Taxes: Evidence from Notches and Stimulus in the UK.” Review of Economic Studies 85(1): 157–193.(notch 方法在另一政策场景的经典应用)