1. 项目概述:基于大数据技术的中药智能推荐系统
作为一名长期从事大数据与中医药交叉领域研究的从业者,我深刻体会到传统中药推荐面临的三大痛点:信息碎片化严重(中药数据分散在药典、文献和临床记录中)、经验依赖性强(过度依赖医师个人经验)、缺乏量化标准(配伍禁忌主要靠记忆)。这个毕业设计项目正是为了解决这些问题而生。
我们构建的是一个融合Hadoop+Spark大数据处理框架与知识图谱技术的中药智能推荐系统。系统核心能力包括:
- 处理千万级中药数据条目(包括《中国药典》收录的6000余种药材和9万多个方剂)
- 实现秒级响应的高并发推荐服务
- 支持多维度的推荐逻辑(症状匹配、体质适配、配伍禁忌规避)
从技术架构上看,系统采用典型的大数据分层设计:
- 数据层:HDFS+Hive构建分布式数据仓库
- 计算层:Spark MLlib实现机器学习算法
- 知识层:Neo4j存储中药知识图谱
- 应用层:SpringBoot+Vue提供前后端服务
关键创新点:首次将中药"四气五味"理论(寒热温凉四气,酸苦甘辛咸五味)量化为特征向量,使传统中医药理论能够被机器学习算法处理。例如将"性温"量化为[0,1,0,0],"味苦"量化为[0,1,0,0,0]。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心技术实现细节
2.1 数据采集与治理方案
中药数据具有多源异构的特点,我们设计了专门的数据采集管道:
数据来源矩阵:
| 数据类型 | 来源示例 | 采集方式 | 数据量级 |
|---|---|---|---|
| 基础药性 | 中国药典 | Python爬虫+PDF解析 | 6000+条目 |
| 临床案例 | 医院HIS系统 | 数据脱敏后API对接 | 10万+病例 |
| 用户行为 | 电商平台 | 埋点日志收集 | 日均100万条 |
| 科研文献 | CNKI/PubMed | Scrapy爬虫 | 5万+篇 |
针对非结构化数据(如古籍文献),采用BERT-BiLSTM-CRF模型进行实体识别,F1值达到0.87。具体处理流程:
- 数据去重:基于SimHash算法去除重复药方(相似度>90%)
- 术语标准化:建立中医药术语词表(包含8,742个标准术语)
- 缺失值处理:对重要字段采用多
