1. 项目背景与数据价值
劳动纠纷作为劳资关系的"晴雨表",其数据价值长期被学术界和实务界低估。传统研究多依赖个案分析或小样本调查,难以捕捉劳动纠纷的宏观规律和微观机制。CLDRD数据库的诞生,首次实现了对中国劳动纠纷现象的规模化、结构化观测。
从数据源来看,该数据库的创新性体现在三个维度:
- 全量覆盖:整合了行政处罚信息和司法裁判文书两大权威数据源,确保案例覆盖的全面性
- 时空连续:时间跨度达十年以上(具体年份需根据实际数据说明),支持纵向趋势分析
- 多维标注:每个案件包含50+个结构化字段(如案由、涉案金额、裁判结果等),支持复杂分析
提示:在实际使用中发现,2015年后的数据完整度显著提升,这与我国司法公开政策的推进节奏高度吻合。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据结构解析
2.1 核心数据表构成
数据库采用星型 schema 设计,包含以下核心表:
| 表名 | 记录数 | 主要字段 | 关联键 |
|---|---|---|---|
| 案件主表 | 400万+ | 案件ID、立案时间、结案时间、审理法院 | case_id |
| 当事人表 | 800万+ | 当事人ID、类型(企业/个人)、行业、注册资本 | party_id |
| 裁判结果表 | 400万+ | 裁判类型、赔偿金额、履行情况 | case_id |
| 法律依据表 | 1200万+ | 援引法条、适用情形 | case_id |
2.2 关键字段说明
以最常用的"裁判结果表"为例,其核心字段包括:
- 裁判类型:细分12种判决结果(如经济补偿、继续履行合同等)
- 赔偿金额:区分工资、补偿金、赔偿金等子项
- 履行状态:标记是否自动履行、强制执行等
- 审理周期:从立案到结案的天数计算
python复制# 典型字段取值示例
{
"case_id": "2023劳执字第12345号",
"judgment_type": ["经济补偿","确认劳动关系"],
"compensation": {
"back_wage": 28450.00,
"severance_pay": 15600.00
