1. 项目背景与核心价值
最近在整理B站相关数据时,发现青少年模式的使用情况一直是个"黑箱"。作为国内最大的年轻人文化社区,B站每天有数百万未成年用户活跃,但他们的使用行为模式、内容偏好与成人用户究竟有何差异?平台现有的青少年模式是否真正起到了保护作用?这些问题不仅关系到产品设计优化,更是社会各界关注的焦点。
这个数据分析系统正是为了解决这一痛点而生。通过爬取B站公开数据(严格遵守robots协议),结合用户画像分析、内容分类算法和交互行为追踪,我们能够量化评估青少年模式的实际效果。比如发现"虽然80%的未成年用户开启了青少年模式,但仍有35%会通过搜索功能绕过限制"这样的关键结论,对产品改进具有直接指导意义。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 系统架构设计解析
2.1 数据采集层实现
采用分布式爬虫架构,主要抓取三类数据:
- 用户基础数据:通过API获取用户公开信息(年龄、地区等)
- 行为日志:记录视频观看时长、互动频率等(模拟真实用户行为)
- 内容元数据:视频分类、标签、弹幕关键词等
特别注意:所有数据采集均避开个人隐私字段,且将爬取频率控制在B站允许范围内(实测单IP请求间隔≥3秒可稳定运行)
2.2 数据处理流水线
使用PySpark构建ETL流程:
python复制# 典型的数据清洗示例
df_clean = (spark.read.json("raw_data/")
.filter(col("user_age") <= 18) # 筛选青少年用户
.withColumn("watch_duration",
expr("case when is_teen_mode then watch_time else 0 end"))
.groupBy("user_id")
.agg({"watch_duration": "avg", "search_count": "sum"})
)
2.3 分析模型构建
核心分析维度包括:
- 模式使用率分析:计算开启青少年模式的用户占比
- 行为对比分析:比较模式开启/关闭状态下的内容消费差异
- 规避行为检测:识别通过搜索、外链等方式绕过限制的行为
