研发创新政策实证研究的数据资源

从高企名单到税收调查:把政策变量与企业数据拼起来

数据资源
高新技术企业
税收调查
专利数据
梳理研发与创新政策实证研究的主要数据源:高新技术企业名单、全国税收调查、工业企业数据库、专利与工商注册数据,并给出清洗与匹配的实操经验。A practical guide to data sources for R&D policy empirics in China.
作者

Shawn

Gemini 3.7 Flash

发布于

2026年8月27日

本文是政策研究专栏”数据资源”子栏目的第一篇,承接高新技术企业认定政策梳理给出的制度背景,为后续三篇——断点回归方法政策评估精读政策模拟精读——准备数据层面的地基。

注记本讲核心目标
  1. 建立研发政策数据地图:每类数据源回答什么研究问题、覆盖谁、从哪里拿;
  2. 掌握三大核心数据源的口径与坑:高企名单、全国税收调查、专利数据;
  3. 学会企业级数据匹配的标准流程:名称清洗、代码对齐、模糊匹配与验证;
  4. 理解”受限数据 + 公开复现包”的现代复现范式。

数据地图:先想清楚研究问题

数据不是越多越好,而是要与研究设计对齐。以 HNTE 政策研究为例,不同问题对应不同的数据组合:

研究问题 核心数据 辅助数据
认定资格的因果效应(谁被认定、认定后表现) 高企名单 + 企业财务/税调 专利、商标
研发投入对税收激励的弹性(bunching) 全国税收调查(研发费用明细) 工业企业数据库
认定与创新的同步性(专利产出) 专利数据库 + 高企名单 年报、工商注册
上市公司层面的政策响应 年报披露 + CSMAR/Wind 高企名单匹配

一个务实提醒:先拿到处理变量的完整名单(谁、何时、何地被认定),再谈结果变量。处理变量薄了,结果变量再厚也无济于事。

核心数据源逐个拆解

高新技术企业名单:处理变量的地基

  • 权威来源:科技部火炬中心”高新技术企业认定管理工作网”(innocom.gov.cn)提供全国有效高企名录查询;各省科技厅/认定办在每批次认定后发布公示名单(含企业名称、统一社会信用代码、所在市县、领域);
  • 覆盖:2008 年全国统一认定以来批次完整,含新认定与复审通过两类;
  • 字段口径:早期公示仅有名称与代码,2016 年后各省公示字段趋于规范(含证书编号、有效期);
  • 实操经验:按省、按批次爬取公示页(通常为 HTML 表格或附件 PDF/Excel),统一入库为”企业 × 认定年份”面板;注意复审与更名——企业更名后名单里会出现新旧两个名称,需要用代码字段合并;
  • 快速替代:上市公司年报会披露”本公司为高新技术企业(证书编号 GRxxxxx,有效期三年)“,用文本检索即可构建上市公司子样本——这是验证匹配质量的免费锚点。

全国税收调查:研发费用明细的唯一公开级来源

这是 Chen et al. (2021) 的核心数据,也是国内研发政策研究绕不开的数据源。

  • 组织方式:财政部与国家税务总局每年部署,覆盖全部重点税源企业并分层抽样一般企业,样本量数十万级;
  • 关键字段:分行业产值/销售、研发费用(含明细科目)、高企资格标识、所得税适用税率、费用与利润明细——正是识别”研发费用占比阈值行为”所需的全部原料;
  • 可得性:属受限数据,学术机构需通过所在单位数据渠道申请。Chen et al. 的复现包 README 明确说明其税调数据由复旦大学购得,复现研究者可联系复旦数据通道(econdata@fudan.edu.cn)或联系作者协助;
  • 口径坑:税调的研发费用与会计报表附注、加计扣除归集口径存在系统性差异(如委托外部研发的 80% 计算规则),跨库匹配时建议保留”口径来源”字段。

工业企业数据库(ASIF):1998–2013 的规上宇宙

  • 覆盖:全部规模以上工业企业,1998–2013 年区间可用性最好;2005 年起含研发相关变量(研发支出、新产品产值);
  • 角色:Chen et al. 用它与税调拼接(企业层面的生产、就业信息 + 税收明细);
  • 可得性:近年获取渠道收紧,一般通过高校/研究机构向统计或数据服务方申请;
  • 经典坑:样本规则变动(2011 年起规上线由 500 万提至 2000 万)、同名企业跨年匹配(用法人代码+名称双校验)、异常值(按通行做法对资产负债表恒等式做筛)。

专利数据:创新产出的标准代理

  • 来源分层:CNIPA 官方检索系统(免费、权威、导出受限)→ 商业库 incoPat/智慧芽(字段规范、可批量)→ 学术共享副本(如国家知识产权局公开的专利申请公布数据);
  • 关键区分:申请日 vs 授权日(识别政策激励用申请日);发明、实用新型、外观设计的含金量差异(跨国比较研究通常只用发明专利);
  • 企业侧匹配:专利申请人字段是申请人名称字符串,没有统一社会信用代码——这是”名称匹配”问题最集中的战场(见下节);
  • 一个常见设计:以政策冲击为节点,数企业在窗口期的专利申请量(排除授权时滞带来的衰减)。

工商注册与年报数据

  • 工商注册(国家企业信用信息公示系统、企查查/天眼查 API):成立年份、注册资本、经营范围、股东与对外投资——用于构造企业年龄、识别新设企业、追溯集团结构;
  • 上市公司年报:研发费用(2018 年起利润表单列”研发费用”科目,之前在附注管理费用中拆分)、高企资格披露、政府补助明细(研发补贴直接可读)——小而精的验证样本。

企业级匹配:最耗工时也最决定成败的环节

四步标准流程:

第一步,键变量优先。统一社会信用代码(2015 年起全面推行,之前是组织机构代码)是唯一可靠的键;名称匹配只做兜底。

第二步,名称清洗。全角/半角统一、去括号注记(“(分公司)”“(上海)”)、繁简转换、去除空格与标点、常见后缀归一(“股份有限公司/有限责任公司/有限公司”):

import re

SUFFIXES = r"(股份)*有限(责任)?公司$"

def clean_name(name: str) -> str:
    s = name.strip().replace("(", "(").replace(")", ")")
    s = re.sub(r"\([^)]*\)", "", s)          # 去括号注记
    s = re.sub(r"\s+", "", s)                 # 去空白
    s = re.sub(SUFFIXES, "", s)               # 后缀归一
    return s

第三步,分层匹配。精确匹配(清洗后名称 + 省市)→ 前缀/包含匹配 → 模糊匹配(Jaro–Winkler 或编辑距离,阈值 0.9 起步)。Stata 用户可用 reclink2,Python 用户可用 thefuzz/rapidfuzz

第四步,人工抽检。对模糊匹配结果按相似度分层抽样 50–100 条人工核对,估算误配率并写进数据文档——审稿人问起时这就是答案。

警告匹配的透明度原则

任何企业级匹配都应产出一份”匹配日志”:每一步匹配了多少、丢弃多少、模糊匹配阈值多少、抽检误配率多少。这份日志既是复现包的一部分,也是论文附录表格的素材。Chen et al. 复现包的做法值得效仿:机密数据留在作者侧,公开包提供清洗后的聚合分析文件(直方图 bin、分组均值),使后人无需原始数据也能复核全部图表——这正是本专栏政策评估政策模拟两篇复现走读得以完成的原因。

受限数据时代的复现范式

国内政策研究长期面临”数据拿不到、结果没法查”的困境,但 AEA 系期刊的实践已经给出可行解,值得国内研究借鉴:

  1. 数据分级:原始受限数据(税调、ASIF)→ 清洗代码(公开)→ 中间分析文件(聚合后可公开)→ 图表(完全公开);
  2. 代码即证据:即使数据不在手,完整、可读的清洗与分析代码本身就大幅提升可信度——Chen et al. 的公开包让任何人都能审计”从 bin 数据到 Figure 2”的每一步;
  3. 聚合数据救场:bunching 直方图、分组均值表等聚合产物通常不涉密,足以支撑方法教学与稳健性讨论。

延伸阅读

  • Chen, Zhao, Zhikuo Liu, Juan Carlos Suárez Serrato, and Daniel Yi Xu. 2021. “Notching R&D Investment with Corporate Income Tax Cuts in China.” American Economic Review 111(7). 附录与 openICPSR 131201 复现包(数据来源与匹配细节的最一手材料)
  • 科技部火炬中心:高新技术企业认定管理工作网(innocom.gov.cn)
  • Brandt, Van Biesebroeck, and Zhang. 2012. “Creative Accounting or Creative Destruction? Firm-Level Productivity Growth in Chinese Manufacturing.” Journal of Development Economics(ASIF 数据处理的经典参考文献)