说实话,过去几年里被问得最多的一份数据类资源,就是上市公司的并购数据库。身边做公司金融、产业经济方向的硕博来问,做量化策略的朋友也会来问;有人需要2005到2024年完整时间跨度的长面板数据,有人只想挑“重大资产重组”做事件研究,还有人手里已经有一份并购公告原始数据,但打开一看明显不对:同一事件拆成了好几条、首次公告日期格式混乱、股票代码有的带后缀有的不带,根本没法直接跑Stata。
这份2005-2024年上市公司并购数据配合Stata清洗代码,解决的正是这个环节的问题:把并购事件原始资料整理成结构化的面板数据,并给出一套可复跑的代码逻辑,让你拿到手之后不是去一条条手工核对,而是能快速判断变量口径、清洗边界和回归前的准备步骤。这篇文章会把这些年整理数据时踩过的坑、验证过的做法、以及使用者问得最多的Stata细节一并交代清楚,适合正在做并购绩效、并购溢价、公司治理与并购决策相关研究的实证党参考,也适合刚接触Stata数据分析的硕博生照着操作。
1. 这套数据解决的是“能跑回归”之前的最后一个痛点
先说一个很现实的背景:并购的底层公告信息其实不难找到,难的是把它变成一份真正可用于实证分析的面板数据。原因在于,一起并购从董事会预案到最终过户完成,往往要经历好几轮的进展公告,每一步都会生成独立的披露记录。如果你只是简单地按公告逐条下载,就会发现同一家公司和同一个标的之间的交易被拆成了好几条样本,直接拿去做回归,年份、金额、处理组都会重复计数;反之,如果只保留名称带“完成”字样的公告,又会丢掉大量仍在推进或者已经终止的交易,这在研究“首次公告的市场反应”时就不够用了。
时间跨度放在2005到2024年,是因为这二十年恰好经历了完整的信息披露电子化过程和数轮并购浪潮。从实证需要的角度看,跨度足够长才能支撑两种典型研究设计:一是事件研究法,你有机会在干净的事件窗口里吸收充分的市场收益率数据;二是长面板模型,你可以在公司层面逐年观察“是否发生过并购”“并购了几次”“是否构成重大资产重组”这些解释变量的变化路径。如果年限太少,大部分公司在样本期内根本没发生过有效并购事件,组内变异太小,固定效应模型的估计效力会非常弱。
1.1 事件口径的岔路口:首次公告日还是过户完成日
整理数据时第一个要明确的定义是“什么时间点算作一起并购事件”。这个看起来很小的问题,实际会直接影响你的样本量、CAR窗口基准日以及最终结论。
主流实证文献使用的时点有三个:董事会预案公告日(第一次向市场释放并购信号)、股东大会决议通过日、以及资产过户或股权变更完成日。三者分别在“市场预期形成”和“交易真实落地”这两个层面起作用。做短期市场反应研究几乎都用首次公告日,因为事件窗口内的异常收益在前置就已经起步;但做并购绩效或会计指标变化研究时,不少文献使用过户完成日来切割前后各年,再观察合并后的财务表现。所以数据里的日期变量不能只保留一个总日期,必须同时具备首次公告日和过户完成日,并在字段命名上写清楚到底代表什么时点,否则等到分析阶段再区分就晚了。
1.2 这份数据适合什么研究场景,不适合什么场景
这套数据比较顺手的研究方向包括:并购首次公告的累计超额收益率(CAR)、并购支付方式与公司绩效、并购是否构成关联交易时的定价差异、多次并购行为的累积效应等。它也能支持一些高频事件主题,比如上市公司围绕主业的扩张式并购与跨界并购之间的市场认知差异。
不适合的场景同样要说清楚。如果你要做的是资产剥离、债务重组、股份回购这类广义“重组”口径,或者需要分析并购后的整合绩效,数据就不完全匹配,因为这些场景需要更细的标的公司财务数据、整合过程信息和报表日后调整数据,单靠一个公开层面的并购事件主表很难支撑。这不算缺陷,它只是提醒你在借用任何数据集之前,都要先确认业务口径是不是跟你的研究问题一致。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据文件里有哪几张表,关键变量的口径是什么
拿到数据后,我强烈建议不要急着跑代码,先花十来分钟把表结构和变量口径看清楚。这一部分做得越细,后面清洗代码调整起来就越省事。整套数据主要由四张表构成:并购事件主表、交易信息明细、上市公司财务面板和日度市场收益率表。实际使用时,常驻内存的是主表和财务面板,其余两表通常通过股票代码和事件日期进行关联。
2.1 并购事件主表:每条记录对应一次“独立并购事件”
主表的一行尽量对应一次完整并购事件,而不是一条公告。这是这套数据和其他下载后直接能打开的“公告流水账”最大的差别。字段设计上大致包含以下内容:
| 变量名 | 含义 | 备注 |
|---|---|---|
| event_id | 事件唯一编号 | 去重后的核心标识 |
| stkcd | 上市公司股票代码 | 统一为6位字符串 |
| date_proposal | 首次董事会预案/公告日 | 事件研究基准日首选 |
| date_complete | 过户完成公告日 | 缺失代表尚未完成或已终止 |
| deal_status | 交易状态 | 1完成;2进行中;3终止 |
| event_type | 并购类型 | 1股权收购;2资产收购;3吸收合并;4其他 |
| target_name | 交易标的/标的公司名称 | 用于去重和内容审核 |
| payment_method | 支付方式 | 1现金;2股份;3现金+股份;4其他 |
| deal_amount | 交易总价 | 单位为万元 |
| is_related | 是否关联交易 | 1是;0否 |
| is_major | 是否构成重大资产重组 | 1是;0否 |
这里最需要留意的是 deal_amount 的单位。很多并购数据库的原始下载格式会混用万元与元,整理时如果只按变量名判断,很容易把金额做大一万倍,后续做“并购规模/公司市值”这类的相对规模变量时会得到极其异常的离群值。稳妥的做法是在读入后立即做一次单位一致性检查,比如看金额变量的分布,如果同一份数据里出现了数值相差1万倍的两批明显聚簇,优先怀疑单位混用而不是极端值。
2.2 财务面板与市场交易数据:关联时以“年份”和“日期”为界限
上市公司财务面板表的结构相对常规:stkcd + year 构成面板标识,变量包括总资产、总负债、营业收入、净利润、所有者权益等原始项,以及根据这些原始项生成的公司规模、资产负债率、ROA等常用研究变量。之所以还要在代码里完整保留原始项,是因为不同研究对变量的算法并不一致:有的文献ROA用净利润除以期末总资产,有的用营业利润除以平均总资产;如果你只保留生成完毕的ROA,后面想换口径就得回头重新下载数据。
市场收益率表则是按“日期 + 市场类型”组织的每日指数收益率和个股日收益率数据。做事件研究时通常需要把主表的 date_proposal 和日收益率表里的交易日期做区间匹配合并,进而计算估计窗口内的市场模型参数。如果用财务年度匹配那种方式直接 merge m:1 stkcd date,你会很快发现事件日和实际交易日之间经常隔着一长段停牌期,这个问题在第四章会展开讲,但这里先埋个伏笔:做事件研究时,永远要额外保留股票的停牌与复牌记录。
2.3 两个容易忽略但影响深远的筛选逻辑
主表里 event_type 和 deal_status 是研究者最容易自由发挥、也最容易搞错的字段。如果你的题目写的是“并购绩效”,理论上应该把上市公司作为买方发起的并购作为样本,也就是剥离那些上市公司作为卖方或标的方的交易。否则同一个 stkcd 在不同年份里既可能是买方也可能是卖方,回归系数含义就会变得模糊。清洗时不做这一步的话,哪怕固定效应再严谨,本质问题也得不到解决。
deal_status 的使用则取决于被解释变量。做CAR事件研究时,通常不要求交易最终完成,只要公司已经发布首次公告就说明市场已经开始反应,因此终止交易往往也应该保留;但你要做的是“并购后会计绩效”或者“是否影响下一期投资”这类反应真实交易效果的模型,这时候把未完成样本混进“处理组”就会引入严重偏误。所以代码里我将状态筛选写成了参数式逻辑,而不是一上来就统一删除某类状态,这样你可以根据自己的假设自由取舍。
3. 清洗代码的逻辑拆解:从原始公告表到可直接回归的面板
清洗阶段是这套代码的核心,也是最容易和别人的数据“打架”的地方。因为很多人下载到的原始表列名、日期格式、编码方式都不一样,直接把代码套上去往往报错。所以,这里不要追求一行命令都不改,而是理解这段处理流程的四个层次。每个层次解决一类问题,后面换数据时只要按层次替换对应字段名就行。
3.1 第一步:读入时的编码与日期格式统一
如果你手里的原始表是Excel的xlsx格式,读入通常不会出现中文乱码问题;但如果你拿到的是从数据库终端导出的csv文件,那么十有八九会遇到编码问题——Windows下导出的csv经常是GBK/GB18030编码,而Stata 14之后的默认运行环境是UTF-8。直接把文件拖进Stata后,中文列名和中文内容会呈现成一堆乱码。
解决方式是在读入时强制指定编码,而不是打开之后才去处理。命令行版本可以参考下面的结构:
stata复制import delimited "原始并购公告.csv", varnames(1) encoding("gb18030") clear
如果是在已经打开的文本文件或do文件里遇到乱码,也可以通过把Stata的Unicode编码集先切到中文编码再导入来解决:
stata复制unicode encoding set gb18030
unicode translate "原始并购公告.csv"
对于日期变量,我这里的处理原则是:读入后立即把字符串型日期转换成真正的Stata日期,而不是直接在字符串上切片拼接。Stata的日期以1960年1月1日为原点存储为整数,只有转换日期的格式,后续才能参与加减和区间判断。
stata复制* 假设原始日期字符为 yyyy-mm-dd 或 yyyy/mm/dd
gen date_proposal_new = date(date_proposal, "YMD")
format date_proposal_new %td
drop date_proposal
rename date_proposal_new date_proposal
3.2 第二步:通过样本筛选逻辑构建“有效事件”
不同研究对“有效并购事件”的定义有差别,但有几条筛选可以视为底线型的操作:
stata复制* 只保留上市公司作为买方的事件
keep if buyer_type == 1
* 剔除金融行业样本
drop if inlist(industry_code, "J66", "J67", "J68")
* 剔除关键变量缺失的样本
drop if missing(date_proposal) | missing(stkcd)
* 剔除退市整理期、长期停牌等异常状态
drop if inlist(list_status, "退市", "暂停上市")
如果你的原始表没有 buyer_type 字段,也可以根据文本信息识别:通常公告标题含有“收购”“购买股权”“受让股权”时的上市公司是买方;“出售”“转让所持股权”时的上市公司是卖方。“买方还是卖方”的判定必须在早期完成,因为后面的所有金额、关联交易、重大资产重组判断都依赖于这个基础身份。
3.3 第三步:识别并合并多头公告
原始并购公告表里最常见的问题是同一事件的多条进展公告。处理思路是使用事件键进行去重。一个相对可靠的事件键可以由“首次公告日后60天内stkcd + 标的名称 + 支付方式”共同生成。代码可选示例如下:
stata复制sort stkcd date_proposal
by stkcd: gen event_seq = _n
但更贴近投研数据处理的逻辑是先用公告标题字段做一轮文本匹配,把同一 stkcd 在相邻时间内、公告标题中标的名称相似的记录归为一组,再取事件状态变量更新的一期作为该事件的状态。简单抽象下来,就是两层循环的思路:外层按公司分组,内层按“标的名称是否相同”拆分。真实代码会比这段复杂些,但它要达到的目的很清晰——同一个标的、同一个买方之间只保留一条主事件,状态变量由最后一次更新的结果覆盖。
手工审核时还可以利用标的名称为中文的特性做模糊匹配。比如“上海瑞章信息技术有限公司”和“瑞章信息”出现在同一年份下,就应该判定为一件事。完全靠精确去重会漏掉很多人为缩写差异。
3.4 第四步:匹配财务面板并生成常见控制变量
主事件表敲定后,需要把公司-年份财务数据匹配到事件表。匹配方式有两种,取决于你的时间口径。如果你用的是首次公告日,适合的处理是取“首次公告日所在年度的上一年末财务数据”作为公司特征,这样可以避免公告发布时当期年报尚未披露导致的前视偏差。
stata复制merge m:1 stkcd year using "财务面板.dta", keep(master match) keepusing(SIZE LEV ROA BM)
生成常用的控制变量时,建议直接生成可用变量并保留原始项,例如:
stata复制gen SIZE = ln(总资产)
gen LEV = 总负债 / 总资产
gen ROA = 净利润 / 总资产
gen BM = 总资产 / (总市值 + 总负债)
这些变量生成完毕后再做缩尾处理会更合适。注意不要对 stkcd、year、虚拟变量做缩尾,那只会制造出完全不存在的非整数取值。
4. 做CAR事件研究必须提前想明白的三个细节
在所有并购实证话题里,“并购公告的市场反应”绝对是最热门的方向,但很多CAR代码跑不出稳健结果,往往不是模型问题,而是事件日、停牌和估计窗口在数据层面没有处理好。这三个细节比回归技术重要得多,务必提前设计。
4.1 首次公告日不等于可交易日
并购重组停牌是A股非常普遍的现象,在重大事项公开之前,上市公司通常会申请停牌。如果你把 date_proposal 当成事件日(t=0),然后直接取个股收益率数据里的事件前后交易日收益率,经常会出现 t=0 当天收益率为缺失的情况,因为市场当天根本没有交易。
处理办法是:不要直接使用自然日日期做窗口匹配,而是将事件日与交易日历逐一对应,找到事件日当天或者之后第一个实际有交易记录的交易日作为修正日。也就是说,如果你拿到了“公告日期”,需要先通过叠加停牌记录判断复牌日期,再以复牌日作为事件研究的锚点。否则计算出来的累计超额收益会把停牌期间的信息吸收和缺口处理得极其别扭。
4.2 估计窗口与事件窗口不能重叠,还要避开定期报告披露期
CAR计算的常规思路是先估计每个股票的正常收益模型,再计算事件窗口内的异常收益。比较保守的做法是选事件日前250个交易日至事件日前30个交易日作为估计窗口,事件窗口则取事件日前后各3天或5天。把估计窗口与事件窗口之间的缓冲区留出来,是为了防止事件信息外溢污染正常收益模型的参数估计。
这里还有一个很多人会忽略的点:如果事件窗口恰好落在年报或业绩预告密集披露期,公司股价本身就会因为基本面信息产生异动,这与并购公告无关,但会被计进CAR。数据层面没有完美的删除规则,但你可以做两个操作:第一,构造窗口内是否包含定期报告披露日的虚拟变量,作为稳健性检验;第二,在事件样本里剔除与年报披露日相距过近的事件,看结果是否有变化。这份数据的代码里保留了相应的日期接口,方便你自行扩展。
4.3 同一家公司短期内连续并购时的窗口污染
分不清“一起事件”的另一个后果,是会引发窗口期污染。例如同一家公司在第0日发布了一起收购公告,但在第+2日又发布了另一项重大合同的公告,这就会让第一个事件窗口内的异常收益混入第二个事件的影响。数据处理阶段能做的处理是给事件打上“窗口内是否重叠其他事件”的标志,如果重叠,建议在稳健性检验中剔除或加控制变量。完全不处理而直接跑市场模型,等到结果显著后才发现窗口污染,返工成本就高得多了。
5. 拿到数据后,那些你早晚会撞上的Stata细节问题
从后台数据交流来看,并购数据处理中反复出现的Stata操作问题集中在几个方向上:中文编码读取乱码、亚组分析到底怎么分组、面板单位根检验要不要做、最大最小值与缩尾边界如何选择。这篇数据的Stata代码里也覆盖了这些操作的常见形式。
5.1 中文乱码:不是数据坏了,是编码认领错了
使用第三方下载的并购公告数据,经常碰到一种情况:用Excel打开csv一切正常,但放进Stata后所有中文都变成了乱码。原因是Excel在中文Windows下保存csv时默认使用ANSI编码体系,而Stata通常按UTF-8来解析外部文件。如果你没有在import delimited阶段显式说明编码,Stata自动探测的过程中就会出错。
遇到中文乱码的解决路径有两个:
stata复制* 方法一:读入时直接指定
import delimited "并购明细.csv", varnames(1) encoding("gb18030") clear
stata复制* 方法二:你先用text editor把文件另存为UTF-8编码,再正常读入
unicode encoding set gb18030
unicode translate "并购明细.csv"
我个人的建议是优先使用方法一。因为“另存为UTF-8”需要额外人工步骤,一旦涉及多个子表,很容易漏掉其中一个,最后回归时才发现变量里的中文变成了一堆问号。
5.2 亚组分析的本质:分组跑回归背后的检验逻辑
在并购绩效研究中,“做亚组分析”通常有两种动机:一种是单纯想看子样本的系数方向有何差异,另一种则是想证明两组系数差异在统计上是显著的。不少人把门槛降低到了“只分组跑回归,比较两个显著性星号”,这其实远远不够。
正确做法是在分组回归之外,再做一个交互项回归,或者说组间系数差异检验。用一个简化的例子,如果你想把样本分成高融资约束组和低融资约束组,看并购规模对绩效的影响是否有差异,可以参考这样的框架:
stata复制xtreg F_ROA c.deal_amount##i.high_fc SIZE LEV ROA i.year, fe
交互项里的核心变量如果显著,说明两组之间的并购规模效应确实存在统计意义上的差异,这比分头跑两个回归再看系数“谁大谁小”可靠得多。尤其是当两组样本量差异很大时,显著性水平本身就不适合直接对比,很容易得到两组都不显著的结论,但其实交互项却显著,或者反过来。
5.3 Breitung检验:什么时候值得做
把并购数据处理成公司-年度面板之后,不少人会习惯性地给自己的连续被解释变量做一遍面板单位根检验。Breitung检验这类方法通常用于“宽而短”或“中等长度”的面板数据,比较适合判断ROA这类有一定持续性的财务变量是否平稳。
使用前先用 xtset 声明面板结构:
stata复制xtset stkcd year
xtunitroot breitung ROA
需要提醒的是,如果年份维度不超过15年,并购数据形成的面板年限往往偏短,这种情况下单位根检验本身功效不高,不要因为检验结果不理想就直接对变量做差分,那会改变经济含义。更稳妥的方式是用理论判断加自相关检验共同决定。
5.4 最大值最小值命令与Winsor缩尾的边界
Stata里查看最大值最小值的方法有很多,最常用的是:
stata复制summarize deal_amount, detail
另一个容易混淆的命令是生成组内极值:
stata复制bysort stkcd: egen max_amount = max(deal_amount)
bysort stkcd: egen min_amount = min(deal_amount)
但关于缩尾,我建议在生成分组极值之前先把全样本异常值处理好。先用 winsor2 对变量在1%和99%分位缩尾,是一个比较常规的起点。不过需要谨慎的是,1%与99%的截尾位置依赖样本分布,如果样本量只有几千条且分组比较多,缩尾后组的极端值仍然可能存在,这时可以分大组后再缩尾,或者用5%和95%的分位做稳健性检验。
stata复制ssc install winsor2
winsor2 SIZE LEV ROA BM deal_amount, replace cuts(1 99)
还要提醒一个经常被忽略的点:日期变量经过排序取最大最小值没有任何问题,但不要对月份或年份变量做缩尾。曾经见过有人为了“处理极端值”把并购年份也做了1%缩尾,合并公司样本全部被改成了相同年份,这属于典型的无差别清洗。
数据整理这行当里,干净的并购面板是在一次又一次回到公告原文核对的过程中建立起来的,不是靠某一趟代码就能一次性解决问题。拿到这份2005-2024年数据之后,我建议你先用主表跑一次年度事件数量分布,按年份抽查几条并购记录,与公司实际的公告历史对比看看是否对得上;等确认事件定义与你的研究问题一致后,再去跑CAR或面板模型。那样的话,后面每一步实证结果你都能讲清楚背后的业务逻辑,而不是只有一个漂亮的回归系数。
