1. 项目背景与核心价值
这个毕业设计项目融合了大数据处理、机器学习和可视化技术,构建了一个面向中药领域的智能推荐系统。我在实际开发中发现,传统中药推荐往往依赖医师经验,而现代技术可以挖掘药材间的潜在关联。系统通过爬虫获取中药数据,用Hadoop+Spark构建知识图谱,最终实现三大核心功能:个性化推荐、药效预测和情感分析。
对于计算机专业学生而言,这个项目能完整覆盖大数据开发生命周期。从数据采集(爬虫)、存储计算(Hadoop)、图计算(Spark GraphX)、机器学习(Spark MLlib)到前端可视化(ECharts),每个环节都值得深入钻研。实测运行环境需要8GB以上内存,建议使用Linux系统搭配Docker容器化部署。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术架构设计
2.1 整体架构分层
系统采用经典Lambda架构,分为三层:
- 批处理层:HDFS存储原始中药数据,Spark批量构建知识图谱
- 速度层:Kafka实时接收用户行为数据
- 服务层:Flask提供REST API,Vue.js实现可视化大屏
数据流向示意图:
code复制[爬虫] -> [HBase] -> [Spark ETL] -> [Neo4j]
↓
[用户行为] -> [Kafka] -> [Spark Streaming]
↓
[推荐引擎] -> [Web UI]
2.2 关键技术选型
-
爬虫框架:选用Scrapy-Redis分布式爬虫,突破反爬限制
- 配置示例:
python复制class HerbSpider(RedisSpider): name = 'tcm' redis_key = 'herb:start_urls' custom_settings = {'ITEM_PIPELINES': { 'pipelines.MongoPipeline': 300 }}
- 配置示例:
-
知识图谱存储:Neo4j图数据库存储实体关系
- 节点类型:中药、功
