1. 电商用户行为数据分析实战:从数据清洗到特征工程
电商平台每天都会产生海量用户行为数据,如何从这些数据中挖掘有价值的信息,是每个数据分析师必须掌握的技能。本文将以一份真实的电商用户行为数据集为例,带你完整走一遍数据分析流程。
1.1 数据集概览
我们使用的数据集包含5630条用户记录,19个原始字段,涵盖了用户基本信息和行为数据:
python复制import pandas as pd
import numpy as np
data = pd.read_csv('电商行为数据.csv')
print(data.info())
输出显示数据包含以下关键字段:
- 用户属性:客户编号、城市等级、婚姻状况、年龄分组、性别
- 行为数据:APP使用时长、下单次数、订单金额涨幅、距上次下单天数
- 业务指标:客户流失标识、满意度评分、投诉标识
1.2 数据质量检查
首先我们需要检查数据的完整性:
python复制# 检查缺失值
missing_values = data.isnull().sum()
print(missing_values[missing_values > 0])
输出显示多个字段存在缺失值:
- 客户在网时长(月):264条缺失
- 仓库到住宅距离(公里):251条缺失
- APP使用时长(小时/天):255条缺失
提示:对于数值型字段,我们通常用中位数填充缺失值;对于类别型字段,则用众数填充。
1.3 数据清洗与填充
python复制# 数值型字段用中位数填充
num_cols = data.select_dtypes(include=np.number).columns
for col in num_cols:
data[col] = data[col].fillna(data[col].median())
# 类别型字段用众数填充
cat_cols = data.select_dtypes(exclude=np.number).columns
for col in cat_cols:
data[col] = data[col].fillna(data[col].mode()[0])
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
