1. 项目概述
这个毕业设计项目让我想起了自己第一次接触大数据分析时的兴奋感。作为一个长期混迹B站的老用户,我一直在好奇:为什么生活区的视频越来越火?鬼畜区的魅力到底在哪里?这次终于有机会用数据来验证这些疑问了。
本项目采用Python大数据分析技术,对B站视频数据进行深度挖掘。不同于简单的数据统计,我们实现了从数据采集、清洗到可视化分析的全流程,特别是创新性地结合了弹幕情感分析,让数据不仅能"说话",还能"表达情绪"。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术架构设计
2.1 整体技术栈
项目采用经典的ETL+分析架构:
- 数据采集层:使用Requests+BeautifulSoup构建爬虫
- 数据处理层:Pandas进行数据清洗,Numpy处理数值计算
- 分析层:
- PyEcharts实现可视化
- SnowNLP处理情感分析
- Jieba+Gensim做主题挖掘
- 存储层:CSV文件存储原始数据和中间结果
技术选型心得:初期考虑过Scrapy框架,但针对B站的反爬机制,手动构建的轻量级爬虫反而更灵活。PyEcharts的交互性比Matplotlib更适合展示多维数据。
2.2 数据采集方案
2.2.1 视频元数据采集
通过B站API获取视频基础信息,核心字段包括:
- 视频ID、标题、分区
- 播放量、弹幕数、评论数
- 硬币数、收藏数、点赞数
- 上传时间、时长、标签
python复制def get_video_info(bvid):
url = f"https://api.bilibili.com/x/web-interface/view?bvid={bvid}"
headers = {
"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64)",
"Referer": "https://www.bilibili.com/"
}
response = requests.get(url, headers=headers)
return response.json()['data']
