搞区域创新研究的同行,肯定对“技术互补指数”这个指标不陌生。但真要把1985到2024年、全国所有省份和城市之间的这个指数都算出来、整理成面板数据,工作量绝对劝退大多数人。所以看到这份“1985-2024年各省份、各城市间技术互补指数(dta)”数据时,我第一反应是:终于有人把这活儿干完了。而且直接给的是Stata的dta格式,省去了从专利原始数据清洗、匹配、计算的漫长过程。
这份数据解决的核心痛点很明确:过去想做跨地区技术关联研究的,要么自己从专利数据库抓IPC分类号,要么只能拿到几个特殊年份的截面数据,更别提城市层面的配对数据。现在数据把时间跨度拉满、尺度覆盖到城市,对于做创新地理、区域经济、产业政策的学者和从业者来说,属于“开箱即用”的宝藏。
1. 先搞清楚技术互补指数到底是什么
1.1 从专利结构到“技术画像”
要理解技术互补指数,得先明白一个地区是有“技术画像”的。就像每个人都有自己的知识结构,有人擅长计算机,有人精通材料学,一个地区的技术结构就是它在各个技术领域上的优势分布。这种分布最直观的刻画方式就是专利数据,尤其是国际专利分类号(IPC)。某个城市如果大量专利集中在化学、冶金领域,另一个城市集中在电气工程、通信领域,那这两个城市的技术画像就存在明显差异。
差异本身并不等于互补。互补指的是“你需要我、我需要你”的关系,放在技术语境里,就是两个地区在技术结构上各有所长,重叠度低,合在一起能覆盖更完整的技术链条。比如一个城市强于零部件制造,另一个强于系统集成,它们之间的合作关系就比两个都擅长零部件制造的城市更有价值。技术互补指数就是把这个“各有所长、彼此需要”的程度量化成一个数值。
1.2 互补不等于相似,技术重合度低才是关键
很多第一次接触这个概念的人容易把互补和相似搞混。相似度衡量的是两个地区技术结构有多像,重叠度越高越相似;互补度恰恰相反,它看重的是重叠度之外的部分,两个地区在技术类别上的优势领域错开得越明显,互补性就越高。
举个例子,A城市的优势技术集中在生物制药,B城市的优势集中在高端装备制造,那么从技术结构看,A和B的专利IPC分布重叠度很低,互补指数就会很高。反过来,如果A和B都集中在电子信息领域,虽然看起来都是“高科技”,但技术竞争大于协作,互补指数反而低。所以这份数据里的互补指数,本质上是在回答一个问题:两个地区是否具备“拼图式”合作的基础。
1.3 这套数据到底解决什么问题
我前几年做城市群协同创新研究时,想用技术关联度作为变量,结果光是把各个城市历年的IPC专利数据整理成可比格式就耗了两个多月。中间还要处理城市更名、行政区划变动、专利分类版本调整,一个头两个大。这份dta数据直接省掉了最痛苦的环节,拿到手就能做回归、做网络分析、做可视化。
从适用人群来说,三类人最需要它:一是学术研究者,做创新地理、区域经济、知识溢出的论文,它可以作为核心解释变量或被解释变量;二是政策研究人员,做城市群协同规划、产业链布局时能快速判断哪些城市组合应该重点合作;三是产业咨询从业者,帮企业选址或区域产业规划时,用互补指数来识别潜在合作对象。
2. dta数据结构拆解与变量逻辑
2.1 变量表长什么样
拿到dta文件,先别急着跑回归,一定要先摸清数据结构。这份数据是典型的“配对面板”结构,每一行对应一对地区在某一年份的互补指数。变量设计上,通常包含年份、地区A的行政代码、地区B的行政代码、地区A名称、地区B名称、互补指数值等核心字段。
我用Stata打开后第一件事就是describe和list in 1/20,确认变量名和观测值格式。值得提醒的是,配对结构有“省-省”“市-市”两种层级。省级层面大概是31个省份两两配对,每年有几百个观测;城市层面则是几百个城市两两配对,每个年份有几万到十几万条记录。这种结构在做面板回归时需要有意识地构造地区对ID,不能直接用原始数据跑普通回归。
2.2 覆盖范围与统计口径
数据覆盖从1985年到2024年,这个起点选择很有讲究。中国的《专利法》是1985年正式实施的,从这一年开始才有系统的、连续的国内专利申请和授权记录。所以技术互补指数的计算起点放在1985年,本质上是因为专利数据就始于这一年。早期年份专利总量少,很多城市在多数技术类别上可能是零记录,导致互补指数波动较大,这也是后续使用时要特别注意的点。
统计口径上,需要区分是用了“专利申请量”还是“专利授权量”,是只统计“发明专利”还是包含实用新型和外观设计。通常技术互补指数偏重体现“创新质量”,会倾向使用发明专利申请或授权量,因为发明专利申请的审查标准更严格、技术含量更高。如果数据说明里没有写清楚,我建议先看一眼原始描述或代码文件,搞清楚口径基础,否则不同研究之间横向比较会出现系统性偏差。
2.3 拿到dta后先做的三件事
第一件事,检查配对是否只保留了“A-B”形式,避免出现A-B和B-A同时存在的情况。很多配对数据在生成时用“i<j”的条件删除了重复项,但也有没删干净的版本,回归时会造成标准误偏差。
第二件事,确认地区代码体系。城市代码在不同年份可能有变化,尤其是2010年代以后部分县级市升为地级市、部分地市合并,需要与行政区划代码表交叉核对。
第三件事,看缺失值分布。如果某些年份的观测数明显少于相邻年份,很可能是数据源缺失或清洗时误删。我会用tab year快速看每个年份的观测数分布,心里先有个底。
3. 技术互补指数是怎么算出来的
3.1 IPC大类与显性比较优势
技术互补指数不是从天上掉下来的,它背后有一套标准的产业经济学方法。步骤大致是:先基于专利申请或授权数据,统计每个地区在各个IPC大类下的专利数量,形成“地区×技术类别”的矩阵。然后计算每个地区在每个技术类别上的占比,再通过显性比较优势(RCA)方法,判断该地区在哪些类别上有比较优势。
RCA的计算逻辑类似国际贸易中衡量出口优势的方式:某地区某类专利占该地区总专利的比例,除以全国该类专利占全国总专利的比例。如果比值大于1,就认为该地区在这个技术类别上有相对优势。经过这一步,每个地区都得到一个“优势技术组合”,这个组合就是它参与区域协作的技术底牌。
3.2 从相似度到互补度的数学转换
有了每个地区的“优势技术组合”,接下来要算两两之间的互补程度。常见做法是先构造向量,向量每个维度对应一个技术类别,取值是该类别的专利占比或RCA值,然后计算两个地区向量的余弦相似度。余弦相似度越接近1,说明两个地区技术结构越像;越接近0,说明越不同。
互补指数的构造,通常是基于“相似度的反面”做变换,比如用1减去余弦相似度,或对相似度做倒数变换等。具体使用哪种变换会影响数值分布,但排序逻辑是一致的:指数越大,两国/两地技术重合度越低、互补性越强。有些更精细的做法会把RCA二值化后再处理,比如只保留有比较优势的技术类别,避免专利数量多的地区在相似度计算中“以大压小”。
3.3 数据年份与指标的可比性问题
1985到2024年跨度快四十年,这期间IPC分类体系在变,专利审查制度在变,各地区的专利数量从几十件增长到几万件,这些都给跨年份比较带来挑战。如果数据只是按逐年份额计算,年份之间的指数不完全可比。
好在配对面板结构可以让研究者用“当年截面排序”的思路来处理,比如在同一年份内比较不同城市对的互补性高低,或者用“中心城市对-外围城市对”分组做固定效应回归,弱化年份间绝对水平差异的影响。我自己使用时,还会把互补指数按年份做百分位排序,以消除专利总量整体增长带来的水平变化。
4. 这个数据能用来做哪些研究和应用
4.1 学术研究:协同创新与知识流动
最直接的应用是作为创新合作研究的核心变量。比如想验证“技术互补性是否促进了跨区域联合专利申请”,可以把这份数据里的互补指数作为自变量,把两个地区每年合作申请的专利数量作为因变量,再加入地理距离、经济规模、制度距离等控制变量做面板回归。
进一步分解的话,还可以区分互补性对“联合研发”和“技术转移”的异质性影响。比如互补度高的地区之间可能更适合签订技术许可合同,互补度中等的地区之间可能更适合共建研发平台。这个数据给到研究者手里,等于打开了从“技术结构匹配”视角看区域合作的一扇门。
4.2 产业规划与城市群协同
在产业规划场景下,技术互补指数可以作为城市群内部“配对合作优先序”的量化依据。比如某个城市群要做产业协同发展规划,以前靠专家拍脑袋决定哪个城市和哪个城市重点合作,现在可以先跑一遍互补指数排名,找出top 20的高互补城市对,再结合产业链上下游关系做进一步筛选。
我拿长三角城市群试过,上海与苏州、南京与合肥这类组合的互补指数通常不低,但真正有意思的是那些看似不太热门、但互补度很高的配对,比如某个制造业城市与某个基础研究强市的组合。这类发现对于制定“飞地经济”“研发+制造分离布局”的政策思路很有参考价值。
4.3 从区域禀赋到企业选址
企业选址和投资决策领域也能用上这个数据。科技型企业在考虑设立分支研发机构时,不仅关心目的地自身的技术水平,还关心它和总部所在地的技术互补度。互补度高意味着能接触到的技术知识结构不同,更容易产生新火花;互补度太低则说明两地技术同质化,异地协作的增量价值有限。
当然企业决策不能只靠单一指标,但互补指数可以作为“技术生态位匹配”环节的重要输入。配合人力成本、营商环境、配套供应链等数据,能形成更立体的选址评估框架。对于产业地产商和招商机构来说,拿互补指数来筛选潜在落户企业和已有企业之间的技术关联,也是一个不错的玩法。
5. 实操环节:dta文件的读取、清洗与可视化
5.1 用Stata快速上手
拿到dta文件,Stata是最顺手的工具。打开后先用describe看变量,再用tab year看时间覆盖。
stata复制use "tech_complementary_index.dta", clear
describe
tab year
想看某个省份与其他所有省份的互补指数排名,直接用preserve和drop组合操作:
stata复制keep if provinceA == "广东" | provinceB == "广东"
* 把配对方向统一
gen partner = cond(provinceA == "广东", provinceB, provinceA)
sort year complement_index
list year partner complement_index if year == 2020 & complement_index != .
5.2 用Python pandas处理dta
不熟悉Stata的话,用Python读dta文件也方便,pandas直接支持:
python复制import pandas as pd
df = pd.read_stata("tech_complementary_index.dta")
print(df.head())
print(df["year"].value_counts().sort_index())
配对ID在后续面板回归中很关键,可以自己构造一个城市对ID:
python复制df["citypair_id"] = df[["cityA_code", "cityB_code"]].apply(
lambda x: "_".join(sorted([str(x[0]), str(x[1])])), axis=1
)
如果想把长面板转成宽面板,做某一年的矩阵热力图,用pivot即可:
python复制import matplotlib.pyplot as plt
import seaborn as sns
df_2020 = df[df["year"] == 2020]
pivot_df = df_2020.pivot(index="cityA", columns="cityB", values="complementary_index")
sns.heatmap(pivot_df, cmap="YlOrRd")
plt.show()
5.3 一图看懂城市间技术互补热力图
可视化是快速理解数据价值的方式。我通常建议先做三张图:第一张是某一年份全国重点城市两两配对的互补指数热力图,颜色越深代表互补性越强,城市间关系一目了然;第二张是某个重点城市与其他城市的互补指数时间序列图,能看出该城市技术生态位在区域中是趋于差异化还是同质化;第三张是互补指数网络图,把高于某个阈值的配对关系画出来,能直观识别区域合作的核心节点和潜在断点。
比如选2020年的省会城市数据做热力图,能明显看到有些城市对的颜色长期偏深,说明其技术结构错位明显、互补性强;而有些城市对颜色很浅,技术结构高度重叠。这种“抱团同质”的现象对研究创新极化问题很有价值。
6. 使用这套数据的踩坑指南
6.1 城市代码变化与行政区划调整
1985到2024年,行政区划变动频繁。1990年代大量“撤地设市”,2000年以后又有地区合并、县级市升格,城市代码体系在不同年份并不完全一致。使用数据前先仔细对照年份对应的行政区划代码,尤其是做多年连续追踪时,不处理好代码对应关系会直接导致变量匹配失败。
我自己踩过最典型的坑是研究期内某个城市从“地区”改为“地级市”,名称和代码都变了,数据里可能割裂成两个实体。处理办法是构建一个“地区-年份对应表”,把所有年份的代码换算成同一种口径,再合并分析。
6.2 互补指数不是万金油
互补指数衡量的是专利结构层面的互补,它不能完全等同于产业层面的合作潜力。专利只是创新活动的一部分,很多行业的技术优势并不体现在专利上,比如软件服务业大量依赖版权和商业秘密,而不是专利。所以用它来分析制造业、生物医药等技术密集型行业效果更好,用来分析服务业要谨慎。
同时,互补指数是描述性的统计指标,不包含因果含义。两个地区互补指数高,不代表它们合作一定成功,还得看制度距离、交通便利度、产业承接能力等因素。建议把它当成“潜力筛选器”,而不是“成功预测器”。
6.3 数据稀疏性与极端值
越早的年份,专利总量越少。很多城市在某个技术类别上的专利数为零,导致向量稀疏,互补指数可能会虚高或出现跳变。比如1980年代末期,东部一些中小城市可能只在轻工业方面有几件专利,和中部某资源型城市的互补指数算出来极高,但这种高值在统计上并不稳健。
对付这种情况,我的经验是分阶段处理:1985-2000年这段更多用于趋势观察,2005年以后的数据比较适合做严谨计量分析。另外可以对互补指数做前后多年的滑动平均,平滑专利数据波动带来的异常值,效果比直接用单年值好不少。
6.4 使用前建立一套自己的稳健性检查流程
分享一个我常用的检查流程:第一,随机抽10个城市对,人工去专利数据库抽样核对计算值是否符合逻辑;第二,把互补指数排名和当地产学研合作的公开案例做对照,看高互补城市对是否确实存在比较活跃的合作关系;第三,换一种相似度算法计算指标做相关性检验,如果不同算法结果排序高度一致,说明数据稳健性较好。
整个流程做下来大概半天时间,但对后续研究的可靠性有实质性保障。毕竟数据的核心价值是辅助决策,如果基础指标不可靠,后面的结论全是空中楼阁。
数据拿到手,一定要先理解、再使用、最后才是下结论。这份1985-2024年的技术互补指数dta数据,本身质量相当高,覆盖面和时间跨度都很能打,已经替研究者省下了大量基础工作。如果你正计划做区域创新、产业协同或者企业选址方向的研究或分析,完全可以拿它作为起点,把精力集中在真正需要深度加工的研究设计和政策解读上。
