1. 《明清进士题名碑录》的历史价值与数据构成
《明清进士题名碑录》作为中国科举制度的重要实物遗存,系统记录了明清两代进士的完整信息。这些石碑最初立于北京孔庙和国子监,现存于中国国家图书馆等地。每块石碑高约3米、宽1.5米,采用优质青石雕刻,碑文包含进士姓名、籍贯、甲第名次、殿试年份及皇帝年号等信息。
明代进士碑始刻于洪武四年(1371年),清代延续至光绪三十年(1904年),共记载了51624名进士的完整信息。其中明代进士22980人,清代进士28644人。这些数据具有三大核心价值:
- 历史人物的地理分布研究
- 科举制度的运作机制分析
- 古代人才流动的社会学考察
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据结构解析与字段说明
原始碑文信息经过数字化处理后,形成结构化数据表,主要包含以下字段:
| 字段名称 | 数据类型 | 示例值 | 说明 |
|---|---|---|---|
| 姓名 | 字符串 | 张居正 | 进士本名,含少数字号情况 |
| 籍贯 | 字符串 | 湖广江陵 | 按"省-府-县"三级行政划分 |
| 帝王年号 | 字符串 | 万历 | 对应殿试举行的皇帝年号 |
| 殿试年份 | 整数 | 1571 | 农历年份,需转换公历 |
| 甲第 | 字符串 | 二甲第九名 | 分三甲:一甲3人,二甲约100人,三甲200-300人 |
| 总排名 | 整数 | 12 | 按殿试成绩的总排序 |
特别注意:籍贯字段存在历史行政区划变迁问题。如"南直隶"在清初改为"江南省",康熙六年(1667年)又分拆为江苏、安徽两省,数据处理时需建立映射关系表。
3. 数据清洗的关键技术流程
3.1 碑文转录的OCR处理
采用基于深度学习的OCR模型处理拓片图像,关键步骤包括:
- 图像预处理:使用OpenCV进行灰度化、二值化、降噪处理
- 文字识别:训练CRNN神经网络模型,准确率达到98.7%
- 校验机制:通过《明清历科进士题名碑录》纸质版进行交叉验证
3.2 籍贯信息标准化
建立历史地理数据库解决行政变迁问题:
python复制def normalize_region(original):
mapping = {
'南直隶': '江南省',
'江南右布政使司': '江苏省',
'江南左布政使司': '安徽省'
}
return mapping.get(original, original)
3.3 年号转换公元纪年
处理明清两代复杂的年号更替:
sql复制CREATE TABLE reign_periods (
emperor VARCHAR(20),
era_name VARCHAR(10),
start_year INT,
end_year INT
);
-- 示例数据
INSERT INTO reign_periods VALUES
('朱翊钧','万历',1573,1620),
('爱新觉罗·玄烨','康熙',1662,1722);
4. 数据分析的典型应用场景
4.1 人才地理分布研究
通过籍贯字段可绘制进士分布热力图:
- 明代进士密集区:浙江(3280人)、江西(3114人)、江苏(2977人)
- 清代变化趋势:河北籍进士占比从4.7%升至11.3%
4.2 科举与社会流动
分析寒门子弟的上升通道:
python复制# 计算三代无官员背景的进士比例
commoner_ratio = len([x for x in records if x['family_background']=='平民']) / total_count
明代前期该比例约75%,晚明降至60%以下。
4.3 政治派系研究
结合《明实录》等史料,可重建座师-门生关系网络:
code复制王锡爵(嘉靖41年进士)
├── 沈一贯(万历11年进士)
└── 叶向高(万历11年进士)
└── 高攀龙(万历17年进士)
5. 数据使用中的注意事项
- 同名处理:建立唯一ID标识,如"张英_康熙6年_桐城"
- 缺字问题:采用"□"标注并附校勘记
- 特殊案例处理:
- 满族进士的满汉双语姓名
- 雍正元年(1723年)台湾籍进士首次出现
- 同治七年(1868年)最后一位武进士记录
建议结合《中国历史地图集》GIS数据进行空间分析,同时注意明代"南北榜"事件等制度性偏差因素。数据更新时应关注最新考古发现,如2019年南京发现的万历二十三年进士题名碑补充了7条缺失记录。
