1. 项目概述与核心价值
这个项目本质上是一个融合了大数据处理、机器学习和可视化技术的综合性中药知识服务系统。作为一名长期从事医疗健康领域数据挖掘的从业者,我见过太多"为了技术而技术"的毕业设计,但这个选题的巧妙之处在于:它把Hadoop/Spark这些时髦技术真正用在了中医药这个急需数字化赋能的传统领域。
系统的工作流程可以概括为:通过网络爬虫获取中药相关数据,用Hadoop/Spark构建知识图谱,基于机器学习算法实现推荐和预测功能,最后通过可视化大屏直观展示分析结果。这实际上构建了一个完整的数据价值链——从数据采集、存储计算到智能应用的全链路闭环。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术架构设计解析
2.1 大数据处理层选型
选择Hadoop+Spark的组合是经过深思熟虑的:
- Hadoop的HDFS提供了可靠的中药数据存储方案,特别是面对爬虫采集的非结构化数据(如中药文献、用户评论等)
- MapReduce适合处理中药属性等结构化数据的批量计算(如药性归经统计分析)
- Spark则用于需要迭代计算的场景(如知识图谱的关系挖掘、推荐算法的实时计算)
在实际部署时,我建议采用Hadoop 3.x + Spark 3.x的组合,并特别注意配置YARN的资源分配策略。对于学生项目,可以使用伪分布式模式,但要注意:
伪分布式环境下Spark executor的内存分配不要超过机器物理内存的70%
2.2 知识图谱构建技术路线
中药知识图谱的构建是本项目的核心难点,需要处理以下几个关键问题:
-
实体识别:
- 使用BiLSTM-CRF模型识别中药名、病症、功效等实体
- 建议先用《中国药典》构建基础词典,再结合爬虫数据扩展
-
关系抽取:
python复制# 示例:基于规则的关系抽取 def extract_relation(text): patterns = [ (r"(.*?)具有(.*?)功效", "has_effect"), (r"(.*?)适用于(.*?)患者", "treats") ] for pattern, rel in patterns: if re.matc
