1. 项目背景与数据价值
上市公司劳动力结构数据一直是经济学和管理学研究的重要基础资料。2010-2024年这个时间跨度尤其珍贵,它完整覆盖了后金融危机时代、移动互联网爆发期和人工智能技术普及的关键阶段。这个数据集最独特的价值在于区分了"常规低技能"和"非常规高技能"两类劳动力,这种分类方式源自Autor-Levy-Murnane(2003)的开创性研究,比传统的学历划分或岗位职级更能反映技术变革对劳动力市场的真实影响。
我在处理这类数据时发现,上市公司披露的原始用工信息往往混杂在年报"员工情况"章节或社会责任报告中,需要经过专业清洗才能转化为可分析的结构化数据。常规低技能劳动力通常指那些工作内容高度程序化、容易被自动化替代的岗位,如基础生产线操作、标准化文书处理等;而非常规高技能劳动力则包含研发设计、复杂问题解决等创造性工作。这两类劳动力的比例变化,实际上是企业技术转型的晴雨表。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据采集与处理方法
2.1 原始数据来源
这个数据集主要整合了三个维度的信息:
- 上市公司年报中"员工构成"部分的学历、岗位、专业等结构化数据
- 招聘网站发布的岗位JD文本分析结果
- 行业研究报告中的技能需求趋势数据
其中最难处理的是年报中的非结构化描述。比如某制造业上市公司可能写着"生产人员占比65%,技术人员占比20%",这就需要结合行业特征判断"生产人员"中有多少属于自动化程度高的新型产线操作工(应归入高技能),多少是传统流水线工人(归入低技能)。
2.2 技能分类标准
我们采用改进版的ALM分类框架:
python复制# 伪代码示例:岗位分类算法
def classify_job(title, description):
routine_tasks = ["重复性","标准化","按流程","操作工"]
nonroutine_tasks = ["创新","设计","分析","优化"]
if any(keyword in description for keyword in routine_tasks):
return "常规低技能"
elif any(keyword in description for keyword in nonroutine_tasks):
return "非常规高技能"
else:
return "需人工复核"
特别注意:金融业和IT业的岗位描述存在显著差异。比如银行的"柜员"岗位,在2015年前属于常规低技能,但智能柜台普及后,留存柜员实际承担的是客户关系维护等高技能工作。
3. 核心发现与行业差异
3.1 整体趋势演变
数据显示出明显的"微笑曲线"特征:
- 常规中等技能岗位(如会计、行政)占比从2010年的42%降至2024年的18%
- 非常规高技能岗位同期从23%增长到47%
- 常规低技能岗位呈现U型变化:先降后升,但2020年后的回升主要来自新型服务业(如外卖骑手、直播运营等)
3.2 典型行业对比
通过分行业统计发现三个有趣现象:
| 行业 | 2010年高技能占比 | 2024年高技能占比 | 关键转折点 |
|---|---|---|---|
| 传统制造业 | 15% | 38% | 2018年工业机器人普及 |
| 互联网 | 45% | 62% | 2021年AIGC技术爆发 |
| 零售业 | 8% | 29% | 2020年新零售转型 |
其中互联网行业的数据波动最大。2022年后,基础编程岗位被重新归类为"常规化"工作,而prompt工程等新兴岗位则计入高技能类别。
4. 数据分析实操指南
4.1 数据清洗要点
处理原始数据时会遇到几个典型问题:
- 口径不一致:有的公司按职能分类,有的按学历分类。建议统一转换为FTE(全职当量)计算
- 并购活动干扰:需要剔除因并购导致的员工数突变(可通过商誉科目辅助识别)
- 外包混淆:部分企业将低技能工作外包,但报表中可能仍计入正式员工
清洗代码示例:
stata复制* Stata清洗示例
gen skill_type = .
replace skill_type = 1 if regexm(job_desc,"设计|开发|分析") & !regexm(job_desc,"助理")
replace skill_type = 0 if regexm(job_desc,"操作|流水线|文员")
bysort industry year: egen high_skill_ratio = mean(skill_type)
4.2 分析模型建议
对于这类面板数据,推荐采用双向固定效应模型:
code复制Y_it = α + βTech_it + γX_it + μ_i + λ_t + ε_it
其中:
- Y_it:高技能劳动力占比
- Tech_it:企业研发投入强度
- X_it:控制变量(企业规模、利润率等)
- μ_i:企业固定效应
- λ_t:时间固定效应
5. 常见问题与解决方案
5.1 数据缺失处理
2015年前部分公司未披露详细员工结构,我们开发了基于专利数据的imputation方法:
- 每百万研发投入创造的专利数 → 推测研发人员规模
- 固定资产净值与行业人均产能比 → 估算生产人员数量
- 用同行业同规模上市公司均值填补剩余缺口
5.2 异常值识别
这些情况需要特别注意:
- 高技能占比年变化超过±15%(除非有明确技术突破)
- 劳动密集型企业突然出现高技能占比跃升(可能是分类错误)
- 上市公司与母公司之间的员工借调(查看关联交易披露)
5.3 跨期可比性
由于技能定义本身在演变,建议:
- 将2010-2015年定义为"PC互联网时代"标准
- 2016-2020年采用"移动互联网时代"标准
- 2021年后使用"AI时代"分类标准
- 分析时保持同口径比较
6. 创新应用场景
这个数据集在三个方向有独特价值:
投资研究方面
- 构建"技术转型指数":高技能占比增速快的企业,未来3年ROE平均高出行业15%
- 识别"伪科技股":部分所谓高科技企业的高技能占比实际低于传统制造业
政策评估方面
- 量化产业政策效果:某省智能制造补贴每增加1亿元,当地上市公司高技能占比提升0.8%
- 预警区域人才风险:当地区高技能劳动力需求增速连续2年低于供给增速时,可能引发产业外迁
企业管理方面
- 优化研发团队配置:数据显示高技能人员占比在35-45%区间时,人均专利产出最高
- 生产线自动化决策:当常规低技能岗位人力成本超过营收的8%时,自动化改造具有经济性
在实际使用中发现,将这类数据与企业专利数据、数字化投入等指标交叉验证,能更准确判断企业的真实技术实力。比如某新能源汽车企业2023年高技能占比下降5个百分点,看似技术退步,实则是将算法团队剥离成立独立研究院所致。
