做城市尺度的环境经济研究,最难受的一件事就是数据粒度始终差口气。我早年做课题时,想算清楚一个资源型城市和一个加工制造型城市在产业链上到底怎么互相影响,手头却只有一张全国投入产出表。全国42部门、153部门都全,可那是一只“平均城市”,完全看不到苏州和鄂尔多斯在技术结构上的差异,也看不到中间产品在城市之间怎么流动。后来CEADs团队整理发布了一批覆盖300多个地级及以上城市的城市多区域投入产出表,我才算真正把“城市间产业关联”这件事落到数据上。这篇文章不打算做数据手册的复读,只讲我实际下载、清洗、使用这批数据时的完整路径:数据从哪来、文件长什么样、能回答什么问题、处理时有哪些容易翻车的细节。适合正在做城市环境经济、碳排放核算、产业链研究的在校研究生和青年学者,尤其是已经有一定投入产出基础、想往地级市尺度再进一步的人。
1. 这张城市级MRIO表到底是个什么来头
1.1 CEADs是谁,它为什么值得信任
CEADs全称是China Emission Accounts and Datasets,中文语境里通常叫中国碳排放核算数据库,由国内多所高校和国际研究团队联合维护,网站主页可以直接访问。很多人对它的第一印象是“碳排放清单数据库”,其实它做得更早、影响更大的一类产品是多尺度投入产出表和与之配套的能源、排放卫星账户。
这个数据库有一个好处:它给出的不是孤零零一张表,而是一整套“经济—能源—排放”可以互相咬合的数据。比如你下载城市级MRIO后,可以在同一个平台上找到对应年份、对应城市的CO2排放清单,部门口径虽然不是百分百一致,但比你自己从不同统计口径里拼出来的要省力得多。学术圈做城市消费侧碳排放的研究里,用到CEADs数据集的频率相当高,原因就是它把“谁生产、谁消费、排放在哪里产生”这条链路用经济表的形式串起来了。
1.2 从单区域表到城市MRIO,到底多拆了一层什么
先简单区分几类表,因为很多人第一次看“城市MRIO”会懵。
传统单区域投入产出表描述的是一个经济体内部各部门之间的买卖关系,最后拉平看就是“总产出=中间需求+最终需求”。省级多区域投入产出表则把全国拆成30多个省份,能反映省际贸易,但省内部的市和市之间被视为一个整体。城市MRIO更进一步,把每个地级及以上城市都当成一个独立“区域”,每个城市又有自己的部门细分,城市之间还有中间投入和最终产品的双向流动。
你可以这样理解:省级表告诉你广东向江苏买了多少钢材,城市表却能看到这笔钢材是从广东的哪个城市出去的、流到江苏的哪个城市又被哪个部门消化掉。200多个城市动辄就是上万个“城市—部门”组合,互相交易,数据规模比省表大好几个数量级。所以这类数据不是简单的统计年鉴汇总,背后需要做大量平衡和估算。
1.3 覆盖范围、时间版本和文件构成
我目前从CEADs下载并反复使用的版本,覆盖城市数在300个以上,具体接近313个,基本囊括了全国绝大多数地级及以上城市。部门划分统一到42个部门,和国内投入产出表常见的部门分类基本对齐。时间上,官网公开版本并不是每年都出,以我掌握的信息,常见基准年包括2012年和2017年这样的大年份,具体以你在官网实际看到的版本为准。用之前一定要看清年份,不能拿来说明最新现状。
文件也不是一张“大Excel”就完事,通常解压后会看到好多个文件,包括城市间中间使用矩阵、城市最终使用向量、总产出向量、城市名称与部门名称索引等。有些压缩包还会附带整理脚本或README。第一次打开时如果直接按Excel透视表的习惯去操作,大概率会卡在行列错位。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 在什么研究里值得用它,而不是用省级或全国表
2.1 城市碳排放转移:从“谁生产”到“谁买单”
城市MRIO最经典的研究场景是消费侧碳排放核算。很多时候一个城市减排成绩单好看,可能只是把高耗能生产转移到了外地,然后通过贸易把产品买回来。用全国表或省级表做这个判断,只能给到省一级的答案。但有了城市MRIO,你可以把每个城市的最终需求(居民消费、政府消费、资本形成、出口)对应的供应链排放逐级追溯到生产地,算出“这座城市消费行为拉动了哪些城市的排放”。
实操中,先要构建一个“城市—部门”级别的直接排放系数行向量,再配合列昂惕夫逆矩阵,求得每个城市单位最终需求触发的全链条排放。这类结果最常产出的是城市间隐含碳转移矩阵,尤其能看出中心城市向周边能源型城市的碳外包。
2.2 城市群和流域减排协同:跨市产业链怎么拆
如果你关注城市群一体化,或者流域上下游的协同减排,城市MRIO也很有用。都市圈内部城市之间通勤和产业配套密集,产业结构差异大,单看省级“都市圈合计值”会把内部异质性抹掉。用城市MRIO可以把城市群内部贸易流提出来,算清楚哪两个城市之间产业关联最强,A城市某部门扩张对B城市就业或排放的乘数有多大。这对做“飞地经济”“共建园区”这类空间政策评估的研究来说,是很扎实的底层数据。
2.3 适合直接借用的研究选题方向
根据我这几年看到和参与过的研究,下面几类问题用这份表落地比较顺:
| 研究方向 | 核心逻辑 | 需要配合的数据 |
|---|---|---|
| 城市间产业关联与能耗强度 | 用总产出和直接能耗算城市层面的完全能耗系数 | CEADs城市排放/能耗数据 |
| 区域间碳转移网络分析 | 用MRIO求隐含碳城市间矩阵,再用网络指标看城市角色 | 城市CO2清单、城市属性数据 |
| 环境约束下的产业转移 | 看约束更强城市的排放是否通过贸易转入周边城市 | 环境规制指标、夜间灯光等 |
| 供应链关键节点识别 | 用列昂惕夫逆矩阵或PageRank识别中心和“卡脖子”环节 | 城市产业政策文本等 |
| 城市消费足迹与公平性 | 把碳足迹按城市人均收入分组,看消费排放不平等 | 人口、居民收入数据 |
这里要提醒一句:城市MRIO的数据单元是“城市—部门”的交易流,看不到具体企业。如果研究问题需要落到微观企业上,比如企业退出、企业创新,这个表只能用做宏观背景,必须再找企业数据库补充。
3. 下载、解压、第一次读入:我从拿到文件到跑通的路径
3.1 官网下载前的准备
CEADs的官网首页有清晰的Data菜单,不是所有数据集都摆在一个下载页上。早期版本需要在页面里点进Category再逐条找,内容非常多。我的建议是直接看官网上关于MRIO数据的介绍页,通常会写明数据集包含哪几个年份、覆盖多少城市、属于第几版本。
下载前一般要完成账号注册,填学校或单位邮箱、研究方向、预期用途。学术用途通常免费,但你需要接受数据使用协议,承诺不二次分发。这里有个小细节:如果你用一个机构公共邮箱批量下载多个数据集,建议在邮件验证后把官网发来的下载链接单独存到一个备忘录里,因为有些数据集体积很大,下载是分卷链接,退出来再找入口会绕不少弯路。我自己就吃过这个亏,后来所有CEADs下载都被我归档编号。
3.2 解压后先观察,别急着写代码
我拿到的一个典型压缩包解压后,大致会有这些文件:
| 文件类型 | 作用 | 常见格式 |
|---|---|---|
| 中间使用矩阵 | 城市-部门之间的交易流量 | CSV、TXT或Excel区块 |
| 最终使用矩阵 | 各城市的最终需求构成 | CSV、TXT或Excel区块 |
| 总产出向量 | 各城市-部门的总产出 | CSV、TXT |
| 区域名称索引 | 城市名称及行政区划代码 | CSV、XLSX |
| 部门名称索引 | 部门编号与名称 | CSV、XLSX |
| README说明 | 编制说明、计量单位、版本信息 | PDF、TXT |
我强烈建议拿到压缩包后先看README,再打开任一数据文件的“前20行”观察,而不是直接用pd.read_csv一把梭。因为不少版本的表头会带有几行额外描述信息,比如“单位:万元”“数据来源:CEADs”等,不跳过这些行,后面的数据全会被读歪。用命令行或者Excel打开前几行,花五分钟确认一下行列布局,后面能省一小时。
3.3 第一段读入代码的基本姿势
假设你解压后有一个文件叫city_mrio.csv,前几行是说明,真实表头在第4行,用pandas可以这样起步:
python复制import pandas as pd
# 先用 text 快速看结构
with open("city_mrio.csv", "r", encoding="utf-8-sig") as f:
for i in range(20):
print(i, f.readline().strip())
# 假设前3行是说明,第3行是城市维度表头
raw = pd.read_csv("city_mrio.csv", header=0, skiprows=3, index_col=0)
print(raw.shape)
print(raw.head())
这里有个常见判断方法:如果数据文件包含城市-部门,那么行索引和列索引都会很长,比如行索引是“城市代码_部门代码”的形式。先打印所有行索引的唯一前缀,再数一下唯一城市数量,如果接近313,大概率没读错。如果你看到行索引是序号而不是名称,就要再去查索引文件,把城市和部门映射回来。
3.4 最小可行性验证:把城市表加总回全国表
确认文件能读进来后,第一件事不是立刻做模型,而是做一次“数量级对账”。原理很简单:城市MRIO把所有城市之间的交易相加,再加总各城市自身最终需求,结果应当接近一张全国投入产出表的数据。具体做法是先把所有城市中间使用相加,再和统计年鉴里全国总产出的量级做一个粗略比较。如果发现总产值差出两倍以上,多半是你把单位看错了,或数据里还包含进口项,需要往下继续排查。
4. 用表之前绕不开的三个一致性问题
4.1 年份、价格和部门分类必须和自己的数据对齐
城市MRIO的城市-部门矩阵是基于多个来源估算的,编制周期长,所以它反映的是特定基准年的技术结构。你拿2017年的表去做2022年的现状分析,默认了四年间部门间消耗结构完全不变,这在快速变化的经济体里容易让审稿人质疑。合理的做法是只在基准年附近年份使用。
价格口径同样要查清楚。有的表是当年生产者价格,有的版本做了价格调整,两种表的数之间不能直接做无差别的时间序列比较。如果你打算做两期对比,先确认两个版本是否同为生产者价格,如果不是,还要找价格指数调整到不变价。
最头痛的是部门分类。同一个42部门框架在不同年份的版本里,部门名称可能有细微差别,比如“金属制品业”和“金属制品、机械和设备修理业”在不同的表里归属不同。直接按字符串匹配会漏掉好多行。稳妥做法是先把两期的部门代码映射表并起来,人工核对一次,再进入计算。不要相信“都是42部门就一定一致”这种话。
4.2 城市名单的行政口径,永远是隐藏的地雷
“地级及以上城市”听起来很清楚,真用起来并不简单。同一份文件里的城市维度,可能包含直辖市、副省级城市、普通地级市,甚至部分省直辖县级市。不同版本的数据里,省直辖县级市是否被并入附近地级市、四个直辖市是否再拆成“城市内部多个区县块”,处理规则可能不同。
这就带来一个很要命的问题:你要把城市MRIO结果和《中国城市统计年鉴》合并算人均指标,但年鉴的“直辖市级”里面常把全市作为一个单位,而MRIO版本如果对直辖市做了辖区拆分,你就需要先聚合回一个城市。反之,如果年鉴把省直辖县级市单列,而MRIO没独立列出,你也得合并。
我的检查方法很简单,下载解压后先统计城市名单里有没有这些特殊单位:四个直辖市、省直辖县级市、自治州。再看行政区划代码是四位还是更细。发现代码混乱的时候,千万不能靠“市”字去重,因为“延边朝鲜族自治州”这类单位不一定带“市”字。
4.3 总量校验:先算好自家账,再上模型
拿到表后建议做这样几道校验:
- 每一行(城市-部门)的中间使用合计加上最终使用合计,应等于该行总产出;
- 每一列(城市-部门)的中间投入合计加上增加值,应等于该列总产出;
- 各部门增加值加总后,和当年该城市GDP在一个“生产法口径”下比较,量级差异应该以较小幅度波动,不会差几倍;
- 表中自带的总产出向量对应着行的合计,如果出现大比例不相等,就需要使用附加说明里提供的调整项。
用代码检查可以这样写:
python复制z = raw.iloc[:, :n_sector_cols] # 中间使用区块
f = raw.iloc[:, n_sector_cols:] # 最终使用区块
gross_output = pd.Series(你的总产出列, index=z.index)
total_use = z.sum(axis=1) + f.sum(axis=1)
ratio = total_use / gross_output
print(ratio.describe())
如果ratio的均值偏离1太多,就要回看数据布局是不是切错了。这个步骤虽然啰嗦,却是所有后续结果的保险丝。
5. 从“能打开”到“能出结果”:建模主流程里的关键操作
5.1 先把宽矩阵清洗成标准长表
城市MRIO原始文件是宽格式,行列都很长,直接做矩阵运算容易在区块对应关系上出错。我更推荐先把它整理成一张长表,核心字段至少包括:
- 输出城市
- 输出部门
- 输入城市(或最终使用类别)
- 输入部门(如果最终使用则填“最终使用”)
- 流量值
python复制import pandas as pd
# row_names 为行索引,col_names 为列索引
# 简化示例:把宽表转长表
z_long = (
z.reset_index(names=["source"])
.melt(id_vars=["source"], var_name="target", value_name="value")
)
整理成长期后,很多下游分析可以用groupby快速完成。特别是要提取“城市A到城市B的贸易流”时,直接把城市代码拆分到字段里,一个groupby就拿到结果,不必再担心原始矩阵切片时行列错位。
长表文件不建议用Excel保存,量大容易卡死。用Parquet或CSV压缩格式更好,速度提升非常明显。
5.2 稀疏矩阵和列昂惕夫逆矩阵的正确算姿
模型层面,把所有城市-部门放在同一个大矩阵里,节点数是城市数乘以部门数。按313个城市、42个部门估算,大约是13000多维度。完整存储一个这么宽的稠密矩阵,需要的内存接近:
- 维度约1.3万×1.3万,总共接近1.8亿个元素;
- 如果每个元素是8字节的float64,整体约14.4亿字节,也就是1.3GB以上;
- 如果要算逆矩阵,中间临时内存还会成倍上涨。
好在投入产出表的实际连接非常稀疏,一个部门真正大量采购的部门只有十几个,绝大多数格子是0。所以先用SciPy的稀疏格式存矩阵是必需品。
求列昂惕夫逆矩阵也有讲究。公式是L=(I-A)^{-1},但一般不需要把整个逆矩阵算出来,更常见的是求一个“给定最终需求向量y时的总产出x”,也就是解线性方程组:
python复制import numpy as np
from scipy.sparse import csr_matrix
from scipy.sparse.linalg import spsolve
# A为稀疏直接消耗系数矩阵,n为城市-部门总数
I = csr_matrix(np.eye(n))
B = (I - A).tocsr()
x = spsolve(B, y) # y 是最终需求向量
这样既快又省内存。如果一定要完整的列昂惕夫逆矩阵,也应当用稀疏LU分解去求解,而不是直接跑稠密矩阵的np.linalg.inv,否则小内存电脑很容易崩。
5.3 城市消费侧碳排放的核算路径
要算“某城市最终需求拉动的碳排放”,需要三步:
第一步,构建直接排放系数向量f_sec,每个部门每万元产出对应多少吨CO2。这时要用CEADs城市排放清单或能源数据,把排放量除以对应城市-部门的总产出,得到直接排放系数。
第二步,设定你要研究的最终需求向量y。如果研究城市c的消费足迹,那么只在城市c的各部门最终需求列填数值,其他城市填0。
第三步,计算总产出拉动量x=(I-A)^{-1}y,再乘上直接排放系数,得到全链条排放。
如果要回答“城市A的最终需求究竟让城市B产生了多少排放”,需要把结果分解回每个生产地——也就是把f限定在城市B的部门上,再与前两步结果逐元素相乘。最后按城市汇总,就是一个“谁消费、谁生产、排放在哪”的清晰分解表。
这个过程听起来不复杂,但很多人做错在把y设成了全国总需求,或者把所有城市的最终消费一口气放进去,那得到的只是全国总排放,得不到城市归属。做消费侧核算时,y的构造一定是一个城市一个城市单独来做,最后拼接成矩阵。
5.4 结果回写到城市层的表达方式
模型算完以后,完整结果仍然是“城市-部门”维度的。如果后续要和城市夜间灯光、人口栅格这类数据合并,建议先按城市聚合,保留总量和人均,再用城市代码与属性数据匹配。匹配时建议保留两侧原始行政区划代码,不要共享“城市名称”这个中文键,否则一个“市辖区”命名差异就能让合并失败。地图绘制阶段用GeoPandas时,重点检查连接键是否出现多对多,尤其是直辖市的行政区划边界和你使用的街镇级边界容易有包含关系。
6. 实际踩坑记录:这些异常值和口径问题会安静地毁掉结果
6.1 行城市和列城市的顺序不一致
我第一次处理某个表格时,以为所有城市都是“行=销售方,列=购买方”,于是很自然地把矩阵转置了一下再用。后来对账时发现总数没什么变化,但拆到城市层面完全对不上。原因在于,有些版本的表格行、列虽然都是城市,但行索引是按“生产地分组”排列,列索引是按“消费地分组”排列,两者顺序并不保持同一个城市代码序列。直接转置会把“A卖给B”变成“B卖给A”。
排查方法很简单:抽一个你熟悉的城市部门,比如“唐山-黑色金属冶炼和压延加工业”,去查它行向的中间投入都卖给了谁,再和该部门的主要下游作个直觉比对。如果你看到唐山的钢铁大量流向了自己或邻近城市,这是合理的;如果流向了大量和钢铁无关的地方,就要怀疑行列定义和方向。
6.2 最终需求里混着“出口”,不能一律当本地消费
城市MRIO的最终需求列,通常不只包含本地居民消费和政府消费。你会在表头附近看到“固定资产投资”“存货增加”以及“出口”等列。出口这一列需要单拎出来。因为研究“消费足迹”时通常只关心本地终端消费和投资,不应该把出口也算进本地居民消费责任。如果直接全部当成y,一个外贸依赖度高的城市碳足迹会被严重高估,而且这个高估会通过逆矩阵传导到所有关联城市。
我的处理方式是:先确定研究口径,再决定最终需求向量里包含哪些列。如果问题关注“本地最终需求拉动的排放”,就只取居民消费+政府消费+固定资本形成;如果关注“城市生产侧或总需求”,再把出口包含进去。同时注意,如果表里有明确的“进口列”,这个进口列通常放在负项或独立区块,千万不能直接加进最终消费,否则会造成“进口越多、消费排放大”的悖论。
6.3 年份版本之间城市集合不连续
两期比较是实证研究里最常见的操作,但2012版和2017版的城市集合很可能有差异。有些城市在上一版里独立出现,下一版却因为数据质量问题被合并或剔除。如果你直接用两期城市名单取并集,会留下很多NaN空位。比较稳妥的做法是取两期公共城市集合,然后检查删掉的城市是否集中在某个特定区域或特定规模。
删掉的城市如果恰好是资源型城市或重工业城市,结果会小幅高估或低估全国整体指标。文章中要明确交代样本选择,最好做一组“包含全部城市但只做单期分析”的稳健性检验。
6.4 对总产出为零的城市部门,不能直接补零了事
理论上投入产出表里每个城市-部门都应该有正的总产出,但实际上,数据平衡后会留下不少零值,尤其是小城市的某些门类。如果你直接算直接消耗系数,分子分母都为零就会产生NaN。
处理时不能把所有NaN都填成0后接着跑逆矩阵,因为这会漏掉一类重要事实:某城市确实不生产该部门产品,但下游仍在使用该部门中间品,那这些中间品只能来自进口或其他城市。对于建模而言,一个“不生产某部门”的城市部门,相当于在该城市内部生产技术矩阵中不存在,不应该强行保留一个全零行。我常用做法是:
- 把总产出为零的“城市-部门”从生产部门集合中移除;
- 但在最终使用里保留它们的消费和进口项;
- 如果有进一步地城市间MRIO建模需求,再把进口或省外调入统一放到一个“外部账户”里处理。
这样做能避免矩阵奇异,同时更符合经济直觉。
6.5 保存中间结果时,Excel往往会二次坑人
别用Excel保存大矩阵和长表。几百MB的数据在Excel里打开要等半天,保存后还会自动把超长数字变成科学计数法,行政区划代码这类列会被无端篡改。我踩过一次很浪费时间的坑:保存城市代码后再读回,110100000000直接被显示成1.101E+11,前面几位精度丢失,导致后续匹配全军覆没。建议所有中间结果一律用Parquet或npz格式存储,代码读写的稳定性和速度都要好得多。
7. 让它和其他公开数据配合使用:拓展方向与引用规范
7.1 配合CEADs城市CO2排放清单,构成“环境扩展”
投入产出表本质是货币流量表,不直接告诉你排放。为了让一张经济表具备环境分析能力,必须叠加“排放卫星账户”。CEADs平台里本来就有中国城市尺度的CO2排放清单,常见的做法是把城市排放量按部门核算出来,再除以该城市对应部门的总产出,得到直接排放系数。
这时要注意一个口径问题:排放清单里的部门分类和MRIO的部门分类不一定完全对齐。有些排放数据是按能源品种计算的,你需要先把煤炭、油品、天然气这些消费量归到工业过程、交通运输、建筑等终端部门,再映射到MRIO部门。如果直接拿城市总排放除以所有部门总产出,会得到一个粗糙的平均值,推理结果也会被质疑。
7.2 结合空间显式数据做降尺度延展
城市MRIO的结果能到“地级市-部门”,但很多决策问题和空间规划需要更细的网格。想进一步到县区或栅格,就需要借助空间代理变量,比如夜间灯光、人口密度网格、工业企业POI等。一个比较稳的降尺度思路是:先在MRIO结果里算出城市某部门的总产出或排放量,然后用该城市内部乡镇街道的工业用地面积占比去分配。这个思路假设“同一城市内部该部门的生产技术是同质的”,虽不完美,但比直接均摊要靠谱。
如果只是为了做可视化,我建议在城市层面先画一张“各城市被最终需求拉动的总排放”地图,用色阶展示空间分布,再叠加城市间主要贸易流箭头。这样既直观,又不容易让读者误以为你有县区级精确数据。
7.3 版本记录和引用建议
用CEADs的数据发论文或写报告,不能只写一句“数据来自CEADs”。负责的做法是:
- 记录所用数据集的完整名称、基准年份、版本编号、城市数和部门数;
- 在代码仓库或附录中保留下载日期和文件校验信息;
- 查阅你下载版本页面里的建议引用格式,把数据编制背后的基础论文一并引用。
几个小习惯非常值得培养:每次下载完,我在压缩包外层新建一个README_version.txt,写上“下载日期、官网Dataset编号、基年、行数、列数、是否含进口列、使用协议”;处理脚本里所有文件路径都用相对路径;每步输出前都会顺手打印维度信息。这样哪怕一周后再回去看,也能快速想起这堆文件是怎么来的。
处理城市级MRIO数据从来不是一次性的事。我自己每次拿到新版本,都会先跑一遍对账脚本,再确认城市代码和部门口径,最后才开始做正经模型。建议你也照这个顺序来,数据本身不会骗人,但读错方向、混入口径的操作会安静地毁掉一整篇研究。第一次上手不用急,先把一张表的行行列列摸清楚,后面再扩展成面板和长期追踪,就顺了。
