研发创新政策实证研究的数据资源
从高企名单到税收调查:把政策变量与企业数据拼起来
数据资源
高新技术企业
税收调查
专利数据
梳理研发与创新政策实证研究的主要数据源:高新技术企业名单、全国税收调查、工业企业数据库、专利与工商注册数据,并给出清洗与匹配的实操经验。A practical guide to data sources for R&D policy empirics in China.
本文是政策研究专栏”数据资源”子栏目的第一篇,承接高新技术企业认定政策梳理给出的制度背景,为后续三篇——断点回归方法、政策评估精读与政策模拟精读——准备数据层面的地基。
注记本讲核心目标
- 建立研发政策数据地图:每类数据源回答什么研究问题、覆盖谁、从哪里拿;
- 掌握三大核心数据源的口径与坑:高企名单、全国税收调查、专利数据;
- 学会企业级数据匹配的标准流程:名称清洗、代码对齐、模糊匹配与验证;
- 理解”受限数据 + 公开复现包”的现代复现范式。
数据地图:先想清楚研究问题
数据不是越多越好,而是要与研究设计对齐。以 HNTE 政策研究为例,不同问题对应不同的数据组合:
| 研究问题 | 核心数据 | 辅助数据 |
|---|---|---|
| 认定资格的因果效应(谁被认定、认定后表现) | 高企名单 + 企业财务/税调 | 专利、商标 |
| 研发投入对税收激励的弹性(bunching) | 全国税收调查(研发费用明细) | 工业企业数据库 |
| 认定与创新的同步性(专利产出) | 专利数据库 + 高企名单 | 年报、工商注册 |
| 上市公司层面的政策响应 | 年报披露 + CSMAR/Wind | 高企名单匹配 |
一个务实提醒:先拿到处理变量的完整名单(谁、何时、何地被认定),再谈结果变量。处理变量薄了,结果变量再厚也无济于事。
核心数据源逐个拆解
高新技术企业名单:处理变量的地基
- 权威来源:科技部火炬中心”高新技术企业认定管理工作网”(innocom.gov.cn)提供全国有效高企名录查询;各省科技厅/认定办在每批次认定后发布公示名单(含企业名称、统一社会信用代码、所在市县、领域);
- 覆盖:2008 年全国统一认定以来批次完整,含新认定与复审通过两类;
- 字段口径:早期公示仅有名称与代码,2016 年后各省公示字段趋于规范(含证书编号、有效期);
- 实操经验:按省、按批次爬取公示页(通常为 HTML 表格或附件 PDF/Excel),统一入库为”企业 × 认定年份”面板;注意复审与更名——企业更名后名单里会出现新旧两个名称,需要用代码字段合并;
- 快速替代:上市公司年报会披露”本公司为高新技术企业(证书编号 GRxxxxx,有效期三年)“,用文本检索即可构建上市公司子样本——这是验证匹配质量的免费锚点。
全国税收调查:研发费用明细的唯一公开级来源
这是 Chen et al. (2021) 的核心数据,也是国内研发政策研究绕不开的数据源。
- 组织方式:财政部与国家税务总局每年部署,覆盖全部重点税源企业并分层抽样一般企业,样本量数十万级;
- 关键字段:分行业产值/销售、研发费用(含明细科目)、高企资格标识、所得税适用税率、费用与利润明细——正是识别”研发费用占比阈值行为”所需的全部原料;
- 可得性:属受限数据,学术机构需通过所在单位数据渠道申请。Chen et al. 的复现包 README 明确说明其税调数据由复旦大学购得,复现研究者可联系复旦数据通道(econdata@fudan.edu.cn)或联系作者协助;
- 口径坑:税调的研发费用与会计报表附注、加计扣除归集口径存在系统性差异(如委托外部研发的 80% 计算规则),跨库匹配时建议保留”口径来源”字段。
工业企业数据库(ASIF):1998–2013 的规上宇宙
- 覆盖:全部规模以上工业企业,1998–2013 年区间可用性最好;2005 年起含研发相关变量(研发支出、新产品产值);
- 角色:Chen et al. 用它与税调拼接(企业层面的生产、就业信息 + 税收明细);
- 可得性:近年获取渠道收紧,一般通过高校/研究机构向统计或数据服务方申请;
- 经典坑:样本规则变动(2011 年起规上线由 500 万提至 2000 万)、同名企业跨年匹配(用法人代码+名称双校验)、异常值(按通行做法对资产负债表恒等式做筛)。
专利数据:创新产出的标准代理
- 来源分层:CNIPA 官方检索系统(免费、权威、导出受限)→ 商业库 incoPat/智慧芽(字段规范、可批量)→ 学术共享副本(如国家知识产权局公开的专利申请公布数据);
- 关键区分:申请日 vs 授权日(识别政策激励用申请日);发明、实用新型、外观设计的含金量差异(跨国比较研究通常只用发明专利);
- 企业侧匹配:专利申请人字段是申请人名称字符串,没有统一社会信用代码——这是”名称匹配”问题最集中的战场(见下节);
- 一个常见设计:以政策冲击为节点,数企业在窗口期的专利申请量(排除授权时滞带来的衰减)。
工商注册与年报数据
- 工商注册(国家企业信用信息公示系统、企查查/天眼查 API):成立年份、注册资本、经营范围、股东与对外投资——用于构造企业年龄、识别新设企业、追溯集团结构;
- 上市公司年报:研发费用(2018 年起利润表单列”研发费用”科目,之前在附注管理费用中拆分)、高企资格披露、政府补助明细(研发补贴直接可读)——小而精的验证样本。
企业级匹配:最耗工时也最决定成败的环节
四步标准流程:
第一步,键变量优先。统一社会信用代码(2015 年起全面推行,之前是组织机构代码)是唯一可靠的键;名称匹配只做兜底。
第二步,名称清洗。全角/半角统一、去括号注记(“(分公司)”“(上海)”)、繁简转换、去除空格与标点、常见后缀归一(“股份有限公司/有限责任公司/有限公司”):
import re
SUFFIXES = r"(股份)*有限(责任)?公司$"
def clean_name(name: str) -> str:
s = name.strip().replace("(", "(").replace(")", ")")
s = re.sub(r"\([^)]*\)", "", s) # 去括号注记
s = re.sub(r"\s+", "", s) # 去空白
s = re.sub(SUFFIXES, "", s) # 后缀归一
return s第三步,分层匹配。精确匹配(清洗后名称 + 省市)→ 前缀/包含匹配 → 模糊匹配(Jaro–Winkler 或编辑距离,阈值 0.9 起步)。Stata 用户可用 reclink2,Python 用户可用 thefuzz/rapidfuzz。
第四步,人工抽检。对模糊匹配结果按相似度分层抽样 50–100 条人工核对,估算误配率并写进数据文档——审稿人问起时这就是答案。
受限数据时代的复现范式
国内政策研究长期面临”数据拿不到、结果没法查”的困境,但 AEA 系期刊的实践已经给出可行解,值得国内研究借鉴:
- 数据分级:原始受限数据(税调、ASIF)→ 清洗代码(公开)→ 中间分析文件(聚合后可公开)→ 图表(完全公开);
- 代码即证据:即使数据不在手,完整、可读的清洗与分析代码本身就大幅提升可信度——Chen et al. 的公开包让任何人都能审计”从 bin 数据到 Figure 2”的每一步;
- 聚合数据救场:bunching 直方图、分组均值表等聚合产物通常不涉密,足以支撑方法教学与稳健性讨论。
延伸阅读
- Chen, Zhao, Zhikuo Liu, Juan Carlos Suárez Serrato, and Daniel Yi Xu. 2021. “Notching R&D Investment with Corporate Income Tax Cuts in China.” American Economic Review 111(7). 附录与 openICPSR 131201 复现包(数据来源与匹配细节的最一手材料)
- 科技部火炬中心:高新技术企业认定管理工作网(innocom.gov.cn)
- Brandt, Van Biesebroeck, and Zhang. 2012. “Creative Accounting or Creative Destruction? Firm-Level Productivity Growth in Chinese Manufacturing.” Journal of Development Economics(ASIF 数据处理的经典参考文献)