1. 数据背景与研究价值
上市公司间的技术流动数据是研究企业创新生态系统的关键基础设施。这类数据通过追踪专利引用关系,能够客观反映技术知识在企业间的传播路径和强度。在创新经济学领域,专利引用被视为技术溢出的重要代理变量——当A公司引用了B公司的专利,通常意味着B公司的技术成果对A公司的研发活动产生了实质性影响。
这套2006-2025年的数据集具有三个独特价值:
- 时间跨度优势:覆盖中国资本市场股权分置改革后的完整周期,包含多个经济周期波动,适合研究制度变迁对技术扩散的影响
- 样本完整性:包含4668家引用公司和4704家被引公司,基本涵盖A股市场主要创新主体
- 清洗逻辑严谨:通过剔除自引、处理多重引用等技术手段,确保数据质量
提示:在实证研究中,这类数据常被用于构建企业间的技术邻近性矩阵,是研究创新网络演化的基础材料。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据构建方法论详解
2.1 原始数据来源与预处理
数据核心来源于CNPD008中国上市公司专利数据库,这是目前国内覆盖最全的上市公司专利数据源。原始数据清洗包含以下关键步骤:
-
去重处理:
- 依据专利申请公布号字段去除重复记录
- 剔除关键字段缺失的观测值
- 对应论文中剔除了专利申请量为零的上市公司
-
引用关系解析:
python复制# 示例:使用pandas处理被引证申请人字段 import re df['被引证申请人'] = df['被引证申请人'].str.split(r'[;;]') df_exploded = df.explode('被引证申请人')
2.2 上市公司匹配技术
通过名称匹配实现引用关系的公司级归集是本数据集的核心创新点。具体实施时需要注意:
-
名称标准化:
- 去除"股份有限公司"、"有限公司"等后缀
- 统一处理英文大小写和特殊字符
- 建立常见简称映射表(如"中国移动"vs"中移动")
-
匹配策略:
python复制# 使用模糊匹配处理名称差异 from fuzzywuzzy import fuzz def match_company(name1, name2): return fuzz.token_set_ratio(name1, name2) > 85
2.3 关键指标构建逻辑
Citations指标的计算包含多重校验:
- 时间窗口控制:仅保留2006-2025年的有效观测
- 自引剔除:排除股票代码相同的引用对
- 加权处理:
- 同一专利的多重引用计为1次
- 跨年引用进行衰减处理
注意:数据集创新性地不包含零值引用对,这虽然减少了数据体积,但在某些网络分析场景可能需要补充零值矩阵。
3. 数据结构与应用场景
3.1 核心字段说明
| 字段名称 | 类型 | 描述 | 注意事项 |
|---|---|---|---|
| 股票代码 | str | 引用方公司代码 | 需注意历史代码变更 |
| 年份 | int | 引用发生年度 | 以专利申请年为准 |
| Citations | int | 引用次数 | 已进行去重处理 |
3.2 典型分析场景
场景一:技术溢出效应研究
stata复制// 基础回归模型示例
xtreg innovation citations size rd_ratio, fe
场景二:创新网络分析
python复制# 构建有向加权网络
import networkx as nx
G = nx.from_pandas_edgelist(df, '股票代码', '股票代码_被引证',
edge_attr='Citations',
create_using=nx.DiGraph())
场景三:技术轨道预测
- 使用LSTM模型分析引用序列
- 构建技术扩散SIR模型
4. 使用注意事项与技巧
4.1 常见问题解决方案
-
公司匹配率提升:
- 建议结合工商注册号进行二次校验
- 对匹配失败样本进行人工复核
-
面板数据平衡:
r复制# 使用plm包处理非平衡面板 library(plm) pdata <- pdata.frame(df, index = c("股票代码", "年份")) -
异常值处理:
- 对极端引用值进行Winsorize处理
- 检查是否存在关联交易导致的异常引用
4.2 高级分析技巧
-
技术距离计算:
python复制# 基于余弦相似度计算技术邻近性 from sklearn.metrics.pairwise import cosine_similarity tech_matrix = pd.pivot_table(df, values='Citations', index='股票代码', columns='股票代码_被引证', fill_value=0) sim_matrix = cosine_similarity(tech_matrix) -
动态网络可视化:
python复制# 使用pyvis创建交互式网络 from pyvis.network import Network net = Network(notebook=True) net.from_nx(G) net.show('tech_network.html') -
跨库关联建议:
- 结合CSMAR财务数据研究技术流动与企业绩效
- 匹配Wind行业分类研究跨行业技术扩散
5. 数据局限性与改进方向
尽管数据集设计严谨,但仍存在以下需要注意的局限:
- 时滞效应:专利引用往往滞后实际技术吸收2-3年
- 行业差异:不同领域的专利引用惯例存在显著差异
- 未观测关系:非专利形式的技术转移无法捕捉
建议进阶研究者可以:
- 加入专利分类号(IPC)进行技术领域细分
- 构建技术流动强度指数替代原始计数
- 结合并购数据识别技术获取的其他渠道
在实际研究过程中,我建议采用"三步验证法":
- 先用小样本手工校验数据可靠性
- 进行描述性统计检查分布特征
- 用不同模型设定检验结果稳健性
这套数据最大的使用心得是:要特别注意上市公司名称变更对匹配结果的影响。我在实际操作中发现,建立公司历史名称映射表能使匹配准确率提升约15%。另外,当分析特定行业时,建议先检查该行业的专利引用基准水平,避免误读绝对引用量的经济意义。
