一个做A股量化和基本面研究的朋友,可能都绕不开一个数据需求:限售解禁。CnOpenData的A股上市公司限售解禁数据,很多人只在做事件研究时才想起来翻一翻,实际上它远不止跑一个解禁日记异常收益这么简单。我这两年用这套数据做过解禁日历排雷、解禁压力因子回测、还配合大宗交易和减持公告做联动分析,踩了不少坑,也沉淀了一些筛选和清洗的经验。这篇就把我对这套数据的使用心得拆开讲,从字段口径到实操清洗,再到研究场景的落地,尽量让拿到数据的人能少走弯路。
不管你是做股票投研、写学术论文,还是搭自己的量化数据库,这篇内容都适用。我会从数据口径讲起,逐步把解禁数据拆透,再结合真实业务场景说明这类数据到底能怎么用、用的时候容易在哪里翻车。
1. 限售解禁数据到底在研究什么:一张表背后的供给冲击逻辑
1.1 限售股从哪来:五类主要来源决定了数据的使用边界
A股市场的限售股并不是单一来源,不同来源的股份在持股成本、股东性质、解禁后减持概率上差异巨大。从我在实际分析中的经验来看,至少可以分五类:
第一类是IPO首发限售股。公司在上市前引入的财务投资人、创始团队、战略投资者,持有的股份在上市后通常有一年、三年不等的锁定期。这一类的特点是解禁数量往往巨大,如果股价处于高位,股东套现的动机非常强。
第二类是定向增发限售股。上市公司向特定对象发行股份募集资金,参与机构通常锁定六个月到三十六个月不等。定增股东的持仓成本要高于原始股东,但若定增完成后股价大幅上涨,账面浮盈丰厚,解禁卖出动力也会变化。这类数据如果和定增发行价、发行日期做关联,可以判断每笔解禁对应的盈利幅度。
第三类是股权激励限售股。公司向核心员工授予限制性股票或股票期权,分年度解锁。这类解禁和员工的考核条件有关,通常设有每年可解锁比例上限,而且持有人是公司内部员工,减持行为受高管减持规则约束,实际冲击相对温和。
第四类是并购重组限售股。上市公司发行股份购买资产,交易对方会锁定十二个月到三十六个月不等。这类股份的持有人往往是标的公司原股东,解禁后的减持意愿和标的业绩承诺完成情况高度相关,如果重组标的业绩承诺未达标,股东可能面临股份补偿义务,即使解禁也不一定敢直接卖出。
第五类是股改限售股。这是历史遗留产物,随着时间推移已经基本消解,但在十年前的样本里仍然是重要变量。现在做数据清洗时通常可以直接过滤,但做长周期研究时仍然要保留。
明白了这些股份来源,数据的使用边界就很明确了。不同来源的解禁股带来的是不同性质的供给冲击,不能混为一谈。我见过不少研究直接把所有解禁事件混在一起统计平均效应,结果被稀释到看不出规律,本质上是忽略了来源维度的区分。
1.2 解禁不等于减持:为什么说事件冲击是预期博弈
在深入数据之前,有个十分关键的认知必须先建立:解禁日是股份从"限制流通"转为"可流通"的日子,并不是股东实际卖出股票的日子。很多刚接触这个主题的研究者会把解禁当作实际抛压到来,这是对事件性质的重大误解。
从市场逻辑来看,解禁消息对股价的影响在事件发生之前就已经开始。当解禁公告发布、市场获知未来某一时间点将有大批股份解禁时,理性投资者会提前调整预期——担心供给冲击的卖方提前卖出,看好基本面的买方则等着捡筹码。真正的股价反应往往发生在解禁日之前的数日至数周,解禁当天的波动反而未必剧烈。
我在用数据做事件窗口分析时,会区分两个概念:公告效应和实施效应。公告效应关注公司发布限售股上市流通提示公告前后股价变化,实施效应关注实际解禁日前后股价变化。A股交易所规则要求解禁前上市公司发布提示性公告,这个公告日是市场第一次系统性地获知确切解禁安排的时间点,信息含量往往高于解禁日本身。
这一层认知直接决定了后续用数据的建模方式。如果研究目的是抓解禁事件产生的短期交易机会,那么公告窗口是重点;如果研究目的是测度解禁供给对长期股价的压力,那么需要构建的就不是单日事件,而是一条按时间累积的解禁压力曲线。数据在不同假设下扮演完全不同的角色。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. CnOpenData这套数据长什么样:核心字段与口径拆解
2.1 从证券代码到解禁明细:核心字段逐项过一遍
拿到CnOpenData的A股限售解禁数据后,第一步不是跑代码,而是逐项了解字段含义。以我使用的版本为例,数据表大致由几个字段族构成。
第一是证券标识字段:证券代码、证券简称、交易所归属。这里有一个容易忽略的点——有些股票存在历史简称变更,证券代码也可能由于借壳上市而发生变化。如果只用简称做关联,极容易在同名公司上翻车,所以整个分析流程我坚持只用证券代码做主键。
第二是事件日期字段:解禁日期即股份正式上市流通日,另外部分版本还会包含公告日期。公告日期和解禁日期之间的间隔通常是前导研究和事件窗口设定的关键依据。
第三是解禁股份详情字段:本次解禁数量、解禁股份类型、解禁股东名称。股东名称这个字段价值很高,它可以帮你拆解一只股票具体是哪些股东在解禁。如果数据里没有单独列解禁股东,那么至少需要通过股份类型字段区分首发原股东解禁和机构定增解禁。
第四是占比测算字段:占总股本比例、占流通股本比例。占比是一个相对量,比单纯绝对解禁数量更有分析意义。一只市值百亿的股票解禁一亿股和一只市值十亿的股票解禁一亿股,冲击程度完全不同。
第五是市值测算字段:解禁市值。CnOpenData通常会把解禁时点的参考市值一并放入,方便直接按市值权重聚合。不过这个市值是按解禁日前收盘价还是公告日收盘价算的,不同数据版本之间可能不一致,使用时需要确认。
以表格形式整理,核心字段及用途如下:
| 字段 | 类型 | 典型用途 | 使用注意点 |
|---|---|---|---|
| 证券代码 | 标识 | 关联交易行情数据 | 使用六位代码,需与交易所前缀匹配 |
| 证券简称 | 标识 | 辅助核对公司身份 | 会变化,不能作为主键 |
| 解禁日期 | 事件日期 | 构建事件窗口 | 区分公告日与解禁日 |
| 解禁股份类型 | 分类 | 区分首发/定增/激励 | 不同类型冲击不同 |
| 本次解禁数量 | 数值 | 计算解禁规模 | 注意单位为股还是万股 |
| 占总股本比例 | 比例 | 衡量稀释程度 | 与是否为首发前股份关联 |
| 解禁股东名称 | 文本 | 识别股东性质 | 可能为空或为多家股东 |
| 解禁市值 | 数值 | 聚合市场冲击 | 确认基准价格来源 |
2.2 数据口径里最容易含糊的三个边界问题
熟悉字段之后,要面对的是口径问题。个人经验里最常出现争议的有三个:
第一个是"本次解禁数量"是否等于股东实际可卖的数量。 有些解禁股份有额外锁定承诺,例如高管每年转让不超过持有股份的25%、业绩承诺期不减持等。这些约束未必会体现在最基础的解禁明细表里。如果拿"本次解禁数量"直接当作流通盘增量,会使股票供给判断严重偏高。多数情况下呢,CnOpenData提供的基础解禁数据对应的是股份法定解禁的部分;当研究精度要求高时,应该配合公告中的补充承诺信息交叉核对。
第二个是限售股类型与板块制度的匹配问题。 注册制改革前后,不同板块的锁定期规则并不一致。创业板和科创板有部分特殊规定,例如未盈利企业上市后核心技术人员股份锁定期延长、科创板允许对首次公开发行前股份设置更灵活的转让安排。同一份数据表跨不同制度时期使用时,需要打上制度标签分层处理,避免在制度切换点上产生虚假断点。
第三个是除权除息对解禁股数的影响。 公司可能在锁定期内实施送转股、资本公积转增股本,导致解禁时的股份数量与初始锁定时不一致。正规的数据库会按照最新股本调整持股数量,但如果你曾经手写抓取过公告数据就应该清楚,很多免费的公告文本数据源并不调整,原始公告中"本次解禁X股"可能对应的是权益分派实施前的股本口径。拿到CnOpenData数据后,我建议用最近一期的股本数据反推校验总数,确认是否经过除权调整。
口径边界实际上是整个研究中最影响结论真实性的部分。用错口径不是代码报错,而是一切结果合理但结论错误的"静默杀手"。
3. 拿到数据后的第一步:清洗与样本筛选的实操细节
3.1 日期统一与重复事件去重
数据解析完毕并摸清字段口径之后,开始进入清洗阶段。第一件事就是把日期字段统一成标准格式并在全流程中使用同一时区。A股数据通常不涉及时区问题,但是日期格式可能混有"YYYY-MM-DD"、"YYYYMMDD"与中文日期。在Python里统一处理可以这样做:
python复制import pandas as pd
df = pd.read_csv("cnopenadata_unlock.csv", dtype={"证券代码": str})
df["解禁日期"] = pd.to_datetime(df["解禁日期"], format="%Y-%m-%d", errors="coerce")
df["公告日期"] = pd.to_datetime(df["公告日期"], format="%Y-%m-%d", errors="coerce")
# 检查日期范围是否合理
print(df["解禁日期"].min(), df["解禁日期"].max())
print(df[df["解禁日期"].isna()].shape[0])
日期清洗里最容易忽略的是规则外样本。数据里偶尔会有解禁日期为空或明显当作非交易日的情况。我的处理办法是加入交易日历匹配:用交易所公布的节假日表,把解禁日落在非交易日的记录标记出来,专门做一个子集手动核对。这类记录虽然占比很低,但在回测中如果正好落在你的因子调仓日,容易造成显著的未来函数——因为你使用了交易日历之外的日期信息。
去重方面呢,同一只股票同一批解除限售可能由多次公告组成。比如某公司同时有三家首发原股东解除限售,在上游数据采集中可能被拆成三条记录,也可能合并成一条记录。这时需要先观察数据粒度,再决定用什么键去重。以CnOpenData多数版本来看,其粒度通常已经细化到"公司-解禁日期-股东名称-股份类型"这一层,在股东为多家且股东名称字段都为空时,做聚合要格外小心,不能简单按公司代码加解禁日期合并,否则会把不同来源的多批解禁混成一批。
3.2 与行情数据关联时的隐藏坑
清洗完之后,最常见的操作就是关联行情数据,计算解禁日期附近的收益。这里有两个隐藏的坑值得分享。
第一个坑是代码格式不统一。不同数据平台的证券代码写法不一致,行情库通常是"600000.SH"格式,而解禁表可能只有纯六位"600000"。我在每个脚本的开头都强制把代码转换成统一的九位格式并校验后四位不存在脏数据。就算你只用纯六位,也至少要能分出沪市和深市,否则上交所和深交所同时存在的重叠代码会错配数据。
第二个坑是非交易日事件的处理。解禁日期理论上安排在交易日,但如果遇到临时停市或者个股停牌,例如股票因重大资产重组长期停牌,解禁日当天并没有可交易行情,此时如果直接取当日开盘价会长出空值。更合理的方式是把事件日映射到解禁日后的第一个实际可交易日期,同时记录原始解禁日与首个可交易日之间的间隔天数。这个变量本身也可以用作停牌信息的一个代理。
行情关联的代码实现如果不当容易引入偏误。一个稳妥的写法是构造一个交易日历索引,把每只股票的解禁日匹配到它之后第一个交易日:
python复制trade_days = pd.read_csv("trade_calendar.csv", parse_dates=["cal_date"])
trade_days_set = set(trade_days["cal_date"])
def next_trade_day(d):
while d not in trade_days_set:
d += pd.Timedelta(days=1)
return d
df["首个可交易日"] = df["解禁日期"].apply(next_trade_day)
df["停牌间隔"] = (df["首个可交易日"] - df["解禁日期"]).dt.days
这一步是为后续事件研究准备干净时间轴,看似基础,实际上很多"解禁后股价异动"的实证结果里的异常,追根溯源都在这里——把停牌个股的复牌日收益错误当成了解禁日收益。
3.3 样本筛选的常规规则与反直觉现象
进入样本筛选时,大多数研究会设置以下过滤条件:剔除ST股票、剔除上市首日新股、剔除解禁数量为零的记录、剔除数据缺失严重的观察。这些常规条件没有问题,我只补充几个容易漏掉的细节。
第一是次新股解禁。上市满一年对创业板和科创板而言是一个重要时间点,因为控股股东和主要股东的一年锁定期届满。如果样本里包含大量上市后一年整解禁的次新股,它们往往本身处于股价高位回调周期中,与解禁效应纠缠,导致在事件研究里容易把次新股自身的高波动特征误归因于解禁。通常可以在样本中加入"上市至解禁天数"变量,并分别跑全样本和剔除上市不足两年的子样本,观察结论稳定性。
第二是存托凭证、B股等非普通A股样本。有些数据库会默认把这些品种也囊括进来。限售解禁数据的分析目标是普通A股,凡是证券代码第一位不是6、0、3开头的,建议全部过滤,减少噪声。
第三是重复公告但未实际解禁的情况。比如某公司公告延期解禁或者股东作出补充锁定承诺,导致原定解禁日并没有真实发生流通盘增加。只看数据库一张表很难发现这些问题,有效方式是在筛选后做交叉抽样,取20条记录去巨潮资讯网核对公告原文。我每次做新一期研究前都会做这个抽样核验,一旦发现错配超过两次,宁可放弃该批数据也不带病运行。这个操作虽然耗时,远胜于回头为整个研究流程返工。
4. 解禁事件实证研究怎么做:从事件研究法到因子构建
4.1 事件研究法的最简落地流程
限售解禁数据最经典的应用场景是事件研究法,检验解禁事件发生前后股价是否产生显著异常收益。标准事件研究法并不复杂,核心思想是把个股在事件窗口内的实际收益减去"如果没有事件发生时的预期收益",得到异常收益,再按横截面平均后检验显著性。
预期收益可以用市场模型来估计:先选定事件前的一段估计窗口,例如解禁日前第60个交易日至第6个交易日,用该区间个股收益对市场收益做线性回归,得到个股的Beta和Alpha,然后外推事件窗口内每天的预期收益。
我把完整流程拆为六步,每一步都有操作要点:
-
确定事件日与事件窗口。前文提过,需区分公告日和解禁日。可以同时跑两组,一组以公告日为第0天、窗口为(-10, 10),另一组以解禁日为第0天、窗口为(-10, 10)。两组的结果差异本身就说明了市场是在提前消化信息还是在事件落地后反应。
-
确定估计窗口。估计窗口不能与事件窗口重叠,通常放在事件窗口之前。窗口长度太短则Beta估计噪声大,太长则可能包含其他公司事件干扰。60到120个交易日是比较常见的折中。
-
计算每日异常收益率。个股日收益率减去按市场Beta折算的预期收益率。
-
计算累计异常收益率CAR。将窗口内每日异常收益累加。比如(-5, 5)的CAR,就是从事件前5天开始累加到事件后5天。
-
构造t统计量。使用横截面标准差构造,同时检验CAR的均值是否显著异于零。
-
做分组对比。这是事件研究法的价值所在——全样本不显著时,按解禁比例、股东类型、估值高低分组后,往往能发现显著差异。
以下为一个分组对比示例代码框架:
python复制def compute_car(stock_data, unlock_date, window=(-5, 5)):
event_idx = stock_data.index.get_loc(unlock_date)
start = event_idx + window[0]
end = event_idx + window[1]
window_returns = stock_data["abnormal_return"].iloc[start:end + 1]
return window_returns.sum()
需要特别留意的是双重计算偏差。如果个股本身Beta很高,在估计窗口内市场恰逢大幅上涨,而事件窗口内市场转而下跌,这时市场模型预测出的预期收益会偏高,导致异常收益被系统性低估。稳健性检验办法是换用市场调整模型——直接用个股收益减去同期市场指数收益,不估计Beta。两种方法结论一致才说明结果可信。我自己的习惯是两类结果都生成,差异过大时回到估计窗口去检查是否有其他重大事件混淆。
4.2 解禁压力相关因子的构建思路
事件研究法回答"解禁这个事件带来什么影响"的因果性问题,而投资实务中更常用到的是把解禁数据滚动转化成一个截面因子——未来一段时间的解禁压力指标,用于股票排序或风险控制。
最基础也最常用的指标是未来解禁压力,定义为从某个调仓时点起未来N个自然日或交易日内,该股票累计解禁市值占当前流通市值的比例。这个比例越高,股票面临的潜在供给压力越大。
计算时需要把解禁数据按"解禁日期"与调仓日对齐。例如每月末调仓,那就在每个月末把该股票未来30天内所有解禁批次的市值加总,除以月末流通市值。A股流通市值可以从每日行情快照里取得,注意流通股本的口径应剔除仍处于限售状态的股本,否则分子分母口径不一致。
另一个更有深度的指标是大股东解禁占比。这需要用到解禁股东的股东性质分类。通常可以按股东名称字段做规则判断:名称中带"投资"、"基金"的,大概率是财务投资者;名称与公司实际控制人或高管一致,则是内部人解禁。财务投资者解禁后减持概率相对更高,因为其持股目的是获得投资收益,而非长期经营控制权。这一指标的构建没有统一标准,却往往是提升因子区分度的关键。
再一个高阶玩法是解禁前涨跌幅与解禁压力合成一个条件因子。背后的直觉很简单:解禁量大不一定股价就跌,关键要看持有人是否有足够利润空间。如果一家公司解禁比例很大,但股价自定增发行价以来一直处于亏损状态,机构解禁后卖出的意愿就会较弱,股价压力反而小于解禁比例中等、但账面浮盈丰厚的公司。把这个逻辑量化,就是在基础解禁压力因子上叠加一个"解禁股份相对成本浮盈比例"的调节项。
4.3 数据回测中的未来函数与前瞻偏差规避
做因子研究时最怕的是未来函数。限售解禁数据有一个特殊风险点:使用"全量数据"时不可避免地混进了尚未发生的信息。
比如你构建了"未来30天解禁压力"因子,在回测中,2020年1月末这个时点用的是整个数据表里所有1月末至2月末的解禁记录,这部分信息在当时完全可以通过解禁公告提前获得,不构成未来函数。但要注意,如果使用的数据表包含的是最终实际解禁日期,而实际解禁日由于上市公司调整而不同于最初公告的预计解禁日,那么回测时用实际解禁日就会带来微妙的幸存者偏差。
现实中确实存在公司变更解禁日期、延期或取消解禁的情况。如果你手上只有一版"事后确认"的数据,最好的处理方式是利用数据表附带的公告日期字段:把公告日在调仓日之前、且解禁日位于未来N天内的记录纳入因子。这只是一种近似处理,但远比直接使用全量真实日期更贴近实盘可获取信息。
另一个前瞻偏差来自退市股和长期停牌股。数据表记录了所有曾经有解禁计划的股票,但一些股票在解禁日之前就已经退市。如果回测组合里使用了当日并未正常交易、却在解禁日后退市的股票,相当于默默使用了"该股在观察日之后仍存活"的信息。严格的处理方式是在每天调仓时剔除次日不再存在行情数据的股票。
5. 进阶玩法:把静态数据变成动态决策信息
5.1 用解禁明细做股票的"事件日历"
解禁数据如果只做单次事件研究,信息利用率并不高。更实用的做法是把每只股票的历次解禁记录展开成一张事件日历,与财报发布日、分红除权日、股东大会日等公司事件叠加在一起,用来判断一段时间内公司是否面临多重事件的叠加影响。
组合管理中最常见的场景是排雷。持仓池子里如果有股票即将解禁,配合财报窗口或重大资产重组停牌窗口,一旦解禁压力遇上业绩不达预期,双杀概率会显著上升。这种场景不需要复杂的回归模型,只需要用解禁日历把"未来30天内解禁市值占流通市值超过5%"的股票拉出来,按比例降序排列,就能快速形成一个风险观察清单。
在实际使用中我的做法是每天盘后更新一个风险清单表:
- 使用解禁明细数据,取出未来60天的所有解禁事件。
- 为每条事件计算解禁市值、占总股本比例、解禁股份类型。
- 标记股东类别:实际控制人、高管、机构财务投资者、其他。
- 在上述基础上叠加最近一期减持公告数据,把正在减持或者刚披露减持计划的股东名关联起来。
- 输出综合风险评分,供组合调仓时参考。
这套流程听起来并不复杂,难在坚持每天更新并保证数据链条不断。数据源质量会直接决定这个风险清单的可信度。CnOpenData的限售解禁数据字段覆盖相对完整,尤其是解禁股东名称和股份类型字段,在做上述标记时省去了大量人工查公告的时间,但该核验的字段还是要核验。
5.2 解禁数据与大宗交易、减持公告的联动
解禁后的股东减持路径主要有两条:集中竞价减持和大宗交易减持。集中竞价减持对二级市场直接构成卖出压力,而大宗交易通常在盘后以折价方式成交,接盘方可能是希望获得折价筹码的机构或职业接盘方。接盘方后续往往会在二级市场逐步卖出,形成延迟性的供给压力。
从解禁数据出发做联动分析可以这样来展开。先按解禁股东名称匹配大宗交易卖方席位数据源,观察解禁日后多久该股东通过大宗交易减持;再统计大宗交易接盘方后续的持仓周期。两段数据串起来,就能构建一个从"解禁-股东减持决策-减持实现方式-接盘方抛售"的完整资金链路。
与之相关的另一类数据是股东减持预披露公告。按监管规则,大股东减持前需要预先披露减持计划,这份计划公告里一般会写清拟减持数量上限和减持方式。当解禁日期临近且股东发布了减持计划,市场对该股票的解禁担忧就会从"潜在"转为"现实",股价下行压力更大。
做这个联动分析最直接的产品化成果是:在每只股票解禁日前的T-3日到T日之间,如果匹配到大股东减持计划公告,将该股标记为"高压减持意愿"状态。回测以后不难发现,这个状态下的股票在解禁日前后的弱势表现会明显强于仅有解禁、没有减持公告的对照组。本质上是因为减持公告提供了股东真实意图的增量信息,把解禁这个静态事实变成了动态决策信号。
5.3 解禁压力在行业与风格层面的漂移监测
把个股层面的解禁数据聚合到行业与风格层面,还能观察到另一种现象——解禁压力的集中释放。限售解禁的分布并不是均匀的,特定年份常有大批公司同时上市或集中定增,这会导致行业层面出现解禁洪峰。
中观层面的操作逻辑很直观:某个行业未来一个季度解禁量占行业流通市值比例大幅超出历史均值时,意味着该行业在存量资金博弈中面临更明显的筹码供给冲击,风格层面可对其保持相对谨慎。反之,行业解禁处于低谷时,筹码供给压力减弱,更容易出现业绩驱动行情。
行业聚合的关键是实现方法。需要先把每只股票映射到行业分类,再用当前流通市值做权重,计算行业未来30天、60天、90天滚动解禁市值与行业流通市值之比。行业分类既可以用申万也可以用中信,框架没有差异,但必须控制行业分类标准在回测期间不发生频繁变动。滚动聚合口径下,解禁因子往往呈现明显的周期波动,在月度调仓策略中可以作为一个低频择时辅助信号,也可以作为行业配置权重偏移的参考变量。
需要注意的是,行业层面的解禁压力指标与行情本身可能存在内生关系。解禁量大往往是因为过去某个时点(比如牛市顶部)集中融资,而这类公司本身可能处于行业景气下行周期。因此,解禁压力指标在中观层面更适合做辅助约束条件而不是独立的行业择时信号。
6. 关于这套数据的几个大实话与操作建议
从字段覆盖度来说,CnOpenData这套A股限售解禁数据对于大多数研究场景够用。一个数据产品真正拉开差距的地方往往不在字段数量,而在于历史覆盖的连续性和口径的稳定性。我建议你在正式使用前,做三件事:
第一,检查数据的最早时间点。如果你研究的上证50成分股样本要从2010年算起,而数据只覆盖了2015年之后的解禁事件,那么你构建的历史因子会左端截断。尤其是定增解禁周期大约为一年,即使采用较长锁定期三年,你的样本也需要至少比研究起始时间提前三年覆盖,才能保证期初建仓时的解禁事件不丢。处理任何数据源都是这个逻辑,上游覆盖率达不到要求时宁可不做,也不要自信地做无截面覆盖假设。
第二,不同批量导出口径偶尔会有差异。有时导出的字段顺序、空值占位符、数值单位可能与上一次不一致。建议固定一套字段映射文件,在每次导入时做一次自动化校验,包括行数波动比例、关键日期范围、空值比例是否与前次导出有明显偏差等。用数据的人最怕的不是数据有错,而是这次的数据和上次的数据悄悄不一样。
第三,解禁股东名称字段一定要保留原始文本切勿随意清洗。机构名称中"XX资产管理计划"与"XX资产管理有限公司"是完全不同的主体,按关键字模糊归类时先做子类拆分,保留原始值以便随时回溯。
从多年用此类数据的经验来看,我认为限售解禁数据的核心研究价值不在于精确预测某一只股票解禁后一定下跌,而在于它为市场供给端提供了一个可量化、可提前获知的观测窗口。市场参与者的预期会不断变化,数据不会告诉你答案,但数据能帮你系统性地观察一群人——不同类型的股东,在不同价位、不同市场环境下,对解禁卖出这件事做出的选择。把这些选择背后的逻辑一点一点拆出来,才是这类数据在投研和学术研究中真正的长期价值所在。
