1. 内容整体设计与思路拆解
1.1 这个项目到底在做什么
先把这个项目说透。标题叫"用Python分析某电商销售数据",我接下来说的内容,就是把我自己做过的一整套电商销售数据取数、清洗、分析与可视化的流程完整复现一遍。
很多人一听到"数据分析"就以为要上什么高大上的工具,其实真正干活的人都知道,Excel能搞定的事没必要上Python,但一旦数据量到了几十万行、上百万行,或者分析维度很多、要做自动化报表的时候,Excel就开始卡了,VLOOKUP也开始变得吃力,这时候Python的优势就体现出来了。
我这次分析的场景是这样的:某电商店铺后台导出了一份销售订单明细表,包含大约30万行订单记录,跨度是最近一年的数据。字段包括订单编号、下单时间、商品名称、商品类目、销售数量、销售金额、成本、买家ID、支付方式、收货省份城市等。目标是回答几个问题:店铺整体销售趋势是什么样的;哪些类目是主力;哪些商品贡献了大部分利润;不同省份的销售分布如何;有没有明显的季节性波动。
这套分析做完之后要输出什么?一张核心指标总览、趋势折线图、类目占比图、Top商品排行、省份分布图、复购率指标,以及一份可以拿去和老板汇报的结论摘要。整体走一遍下来,Python的pandas做数据清洗和聚合、matplotlib和pyecharts做可视化,完全够用。
1.2 为什么选这几个库而不是别的
先说pandas,这基本是Python数据分析的第一选择,没有之一。它的DataFrame结构对表格数据的处理能力极其强大,groupby、merge、pivot_table这些方法用熟练之后,你会发现Excel里要折腾半天的操作,在pandas里两行代码就解决了。
数据量大时候,pandas底层用numpy的数组实现,性能比纯粹的Python循环快了好几个数量级。我这里有一个很直观的对比:同样是对30万行订单按月份汇总,用Python原生循环写的话可能要跑几十秒,用pandas的groupby基本上是毫秒级出结果。一开始接触pandas的人可能不太理解为什么groupby效率这么高,实际上它内部做了很多向量化运算和索引优化,你不需要自己写for循环。
可视化部分我用了pyecharts而不是纯matplotlib。因为pyecharts生成的图表是交互式的HTML文件,鼠标悬停能看到具体数值,还有缩放、图例筛选这些功能,拿给业务同事看的时候体验好很多。matplotlib当然也有它的优势,适合快速画静态图、做论文级别的精细控制,但如果是给业务方汇报,交互式图表更讨喜。后文我会把两种方式都演示一遍,让读者自己感受差异。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心细节解析与实操要点
2.1 数据文件的准备和处理
我这个项目的原始数据是模拟真实电商后台导出的CSV格式。真实场景里,各个平台的导出格式五花八门,有UTF-8编码的,有GBK编码的,有的字段名带空格,有的日期格式不统一。这里我先做一步"模拟真实丑数据"的处理:故意在CSV里混入了一些空行、重复表头、金额字段带人民币符号、日期格式不统一的问题,方便演示清洗过程。
在动手之前先建一个干净的项目目录,我习惯这么组织:
code复制sales_analysis/
├── data/
│ └── sales_data.csv
├── output/
├── main.py
└── requirements.txt
requirements.txt里写入依赖:
code复制pandas>=1.5.0
numpy>=1.23.0
matplotlib>=3.6.0
pyecharts>=2.0.0
安装方式很简单,在命令行里执行 pip install -r requirements.txt 就行。如果你用的是Anaconda环境,pandas和matplotlib一般已经预装了,只需要再补装pyecharts。
2.2 从CSV读取数据时的编码坑
读取数据这一步就有很多细节要注意。使用 pd.read_csv() 读文件的时候,如果文件是GBK编码而你没有指定encoding参数,会直接报UnicodeDecodeError。实际业务中很多老旧系统导出的CSV文件就是GBK编码,处理办法是读文件的时候牺牲一点性能,用 encoding='gbk' 或者更通用的 encoding='gb18030'。
还有一类情况是文件里前面几行有无关信息,比如"销售数据导出时间:2024-01-15"这种,真正的表头在第5行。这时候需要加 skiprows=4 或者 header=4 来跳过干扰行。
我在这次分析中故意不处理这些干扰,先把文件用默认参数读进来,让报错自然发生,然后一个一个解决,这样大家能更直观地理解为什么后面要这么写代码。
python复制import pandas as pd
df = pd.read_csv("data/sales_data.csv")
print(df.head())
print(df.shape)
第一次读取大概率会碰到两个问题:要么编码报错,要么读进来之后发现列名不对、金额是字符串、有大量NaN。这些都是很真实的情况。如果你实际运行中没有任何报错,那恭喜你,但请别跳过清洗步骤,因为脏数据不一定会让程序报错,但一定会让分析结论失真。
2.3 数据清洗的关键步骤
接下来是体现实力的时候,数据清洗占整个分析过程的比重至少在60%以上。很多初学者拿到数据就直接开画图,结果画出来的图漏洞百出,根本原因是数据没洗干净。
清洗的第一步是处理缺失值。先看看各列缺失情况:
python复制print(df.isnull().sum())
订单编号如果为空,这一行没有保留价值,直接删掉。买家ID为空但订单编号正常,有可能是线下补录或者匿名订单,是否能保留取决于业务逻辑,但如果是销售金额为空,那一行必须处理,否则最后统计的总额会偏小。
第二步是处理重复值。因为平台的导出机制,偶尔会出现完全重复的行,用 df.drop_duplicates() 就能去掉。但我要提醒一下,drop_duplicates 默认是整行完全重复才删除,如果只是订单编号重复但其他字段不同,说明这是多商品订单,不能简单去重。
第三步是数据类型转换,这里最容易踩坑。金额字段经常会被读成字符串,尤其是有千分位逗号或人民币符号的情况下。处理方法是:
python复制df["销售金额"] = df["销售金额"].astype(str).str.replace(",", "")
df["销售金额"] = df["销售金额"].str.replace("¥", "")
df["销售金额"] = pd.to_numeric(df["销售金额"], errors="coerce")
第四步是日期字段的统一。原始的"下单时间"有xlsx格式常见的形式,也有"2024/1/3"或者"2024-01-03 10:23:45"这种,处理成统一的datetime类型才能做时间维度的聚合:
python复制df["下单时间"] = pd.to_datetime(df["下单时间"], format="mixed", errors="coerce")
第五步是异常值的识别。销售数量如果是负数,大概率是退款订单,是否需要剔除要结合业务口径。销售金额如果是0或者特别离谱的大额数据,也要单独拉出来检查。
清洗完之后,每次回头去匹配原始数据做核验都是很必要的。我见过太多人清洗完数据就再也对不上总数了,这就是没有做数据一致性校验。
3. 实操过程与核心环节实现
3.1 编写数据加载与清洗模块
建议把代码拆成函数,而不是一大段脚本从上写到下。这不仅仅是代码规范的问题,更重要的是你自己后面迭代和调试会轻松很多。
python复制# main.py
import pandas as pd
import numpy as np
def load_data(filepath):
"""加载CSV数据并做基础清洗"""
df = pd.read_csv(filepath, encoding="utf-8", engine="python")
print(f"原始数据量: {df.shape}")
return df
def clean_data(df):
"""数据清洗主流程"""
# 去除全空行
df = df.dropna(how="all")
# 删除订单号和销售金额都为空的记录
df = df.dropna(subset=["订单编号", "销售金额"])
# 去除重复行
df = df.drop_duplicates()
# 金额处理:去掉符号和逗号,转为数值
df["销售金额"] = df["销售金额"].astype(str).str.replace(",", "")
df["销售金额"] = df["销售金额"].str.replace("¥", "")
df["销售金额"] = pd.to_numeric(df["销售金额"], errors="coerce")
# 日期处理
df["下单时间"] = pd.to_datetime(df["下单时间"], errors="coerce")
# 新增辅助列:年月、月份、星期
df["年月"] = df["下单时间"].dt.to_period("M").astype(str)
df["小时"] = df["下单时间"].dt.hour
# 过滤掉金额缺失的行
df = df[df["销售金额"].notna() & (df["销售金额"] > 0)]
# 计算毛利字段(如果有成本列)
if "成本" in df.columns:
df["毛利"] = df["销售金额"] - df["成本"] * df["销售数量"]
return df
清洗代码里我特意加了两列辅助字段:年月和小时。这是为后面做趋势分析和时段分析预留的。
3.2 核心指标计算
清洗完数据后,先算几个核心业务指标,这几个指标也是后续所有可视化围绕的主题。
python复制def cal_core_metrics(df):
"""计算核心指标"""
total_sales = df["销售金额"].sum()
total_orders = df["订单编号"].nunique()
total_qty = df["销售数量"].sum()
avg_order_value = total_sales / total_orders
# 月度销售额
monthly_sales = df.groupby("年月")["销售金额"].sum().reset_index()
# 类目销售额和占比
cat_sales = df.groupby("商品类目")["销售金额"].sum().sort_values(ascending=False)
# 按省份汇总
province_sales = df.groupby("收货省份")["销售金额"].sum().sort_values(ascending=False)
# 计算复购率
buyer_order_count = df.groupby("买家ID")["订单编号"].nunique()
repeat_rate = (buyer_order_count > 1).mean()
print(f"总销售额: {total_sales:,.2f}")
print(f"总订单数: {total_orders}")
print(f"客单价: {avg_order_value:,.2f}")
print(f"复购率: {repeat_rate:.2%}")
return {
"total_sales": total_sales,
"total_orders": total_orders,
"avg_order_value": avg_order_value,
"monthly_sales": monthly_sales,
"cat_sales": cat_sales,
"province_sales": province_sales,
"repeat_rate": repeat_rate,
}
这里有一个细节必须强调:订单总数不能用df的行数,要用 df["订单编号"].nunique()。因为一条订单可能包含多个商品,在明细表里就对应多行,如果直接数行数会把订单数算多。客单价是销售额除以订单数,不是除以行数。
复购率的计算逻辑也不是唯一的口径。我这里用的口径是"有过至少两次购买行为的买家占所有买家的比例"。还有一个更严谨的"复购订单占比"或"复购金额占比",侧重点不同,最终如何选择得看业务上想回答什么问题。
3.3 用matplotlib画趋势和分布图
核心指标算完,下面进入可视化的环节。先看月度销售趋势。这个图是整份分析报告的主干图,能直观看到一整年的涨跌节奏。
python复制import matplotlib.pyplot as plt
plt.rcParams["font.sans-serif"] = ["SimHei"] # 让中文字符正常显示
plt.rcParams["axes.unicode_minus"] = False # 让负号正常显示
def plot_monthly_trend(monthly_sales):
fig, ax = plt.subplots(figsize=(12, 5))
ax.plot(monthly_sales["年月"], monthly_sales["销售金额"], marker="o", linewidth=2)
ax.set_title("月度销售趋势")
ax.set_xlabel("月份")
ax.set_ylabel("销售额")
plt.xticks(rotation=45)
plt.tight_layout()
plt.savefig("output/monthly_trend.png", dpi=200)
plt.show()
中文字体问题在Windows上通常用SimHei,也就是黑体就能解决。如果你用的是macOS或Linux,可能需要换成PingFang SC或文泉驿字体,甚至要手动去注册字体文件。这一步看着小事,但确实卡住过很多人。
看类目占比,用饼图不合适的时候可以用条形图:
python复制def plot_category_sales(cat_sales):
fig, ax = plt.subplots(figsize=(10, 6))
bars = ax.barh(cat_sales.index, cat_sales.values)
ax.set_title("各商品类目销售额 Top10")
ax.set_xlabel("销售额")
for bar in bars:
width = bar.get_width()
ax.text(width, bar.get_y() + bar.get_height()/2, f"{width:,.0f}", va="center")
plt.tight_layout()
plt.savefig("output/category_sales.png", dpi=200)
plt.show()
水平条形图的好处在于类目名称不会被挤成斜体,特别是在类目名称较长且有十几个类目的时候,比垂直条形图清晰很多。
3.4 用pyecharts做交互式图表
图片类的静态图适合放到PPT或报告里,如果想把分析结果发给业务同事,让他们自己点着看,pyecharts会更方便。
python复制from pyecharts.charts import Bar, Pie
from pyecharts import options as opts
def interactive_monthly_sales(monthly_sales):
months = monthly_sales["年月"].tolist()
values = monthly_sales["销售金额"].round(0).tolist()
bar = (
Bar()
.add_xaxis(months)
.add_yaxis("销售额", values)
.set_global_opts(
title_opts=opts.TitleOpts(title="月度销售趋势(交互版)"),
tooltip_opts=opts.TooltipOpts(trigger="axis"),
datazoom_opts=[opts.DataZoomOpts()],
)
)
bar.render("output/monthly_trend.html")
生成HTML之后,双击打开就是一张可以缩放、悬停看数值的交互图表。对比matplotlib的png,pyecharts传达的信息密度和可操作性都更强。
类目占比用Pie的话,我建议只放Top10类目,其他归到"其他"类,否则图上一堆小扇形根本看不清。这只是个小经验,实际做图的时候尽量带脑子去设计信息层级,而不是把数据全丢上去。
3.5 分析结论提取
做完上面这些分析后,需要针对结果做一些有业务含义的解读。比如这次分析的数据里有明显的季节性波动:6月和11月是大促节点,销售额冲到最高点,年货节的1月也有一波小高峰。这些都是直接从趋势图里能看出来的。
从类目维度看,主力类目集中在某两三个类目上,合计占比超过六成。从这点能延伸出来的结论是:应该把更多推广预算倾斜到这些主力类目,同时对其他类目做进一步评估,看有没有"增长率高但基数小"的潜力类目值得提前布局。
有心的朋友还可以继续往下挖一层,比如看每个类目下的SKU集中度、打折力度与销量的关系、不同支付方式与客单价的关系。这些都是销售数据分析里常见的进阶玩法,初学的时候先掌握主流程就够了,后面可以慢慢往上加。
4. 常见问题与排查技巧实录
4.1 中文乱码问题排查
不论你画什么图,中文乱码问题基本上每个人都会遇到一次。原因分两类:数据源乱码和图表字体乱码。
数据源乱码的典型表现是DataFrame里显示一堆"锟斤拷"或者类似火星文。这种情况十有八九是文件编码搞错了。CSV文件用错了编码读取,就会产生这种不可逆的乱码。在读取之前先确认文件编码,一个比较实用的办法是用记事本打开文件看看保存时用的编码是什么,再不行就逐个试。
图表字体乱码是另一回事,代码里加这两行:
python复制plt.rcParams["font.sans-serif"] = ["SimHei"]
plt.rcParams["axes.unicode_minus"] = False
SimHei在Windows下有效。macOS用户换 ["Arial Unicode MS"],Linux用户可能要 ["Noto Sans CJK SC"]。有一个备选思路是直接指定字体文件的绝对路径,基本上能搞定所有环境问题:
python复制import matplotlib.font_manager as fm
font_path = "/path/to/your/font.ttf"
font_prop = fm.FontProperties(fname=font_path)
plt.title("标题", fontproperties=font_prop)
这个方法虽然代码多一些,但确实是最不挑系统的。
4.2 pandas分组的坑
用groupby聚合之后很多人习惯直接对结果做reset_index(),把分组键从索引变成普通列。这步要是不做,后面的数据处理会频繁出问题。另外如果要做多个指标的聚合,我建议用agg配合字典:
python复制result = df.groupby("年月").agg({
"销售金额": "sum",
"销售数量": "sum",
"订单编号": "nunique"
}).reset_index()
还有一种暗坑是:当groupby的列本身含NaN值时,pandas默认会把这些NaN单独分成一组。注意,这一组的数据在业务上往往是没有分析意义的,最好在分组前就过滤掉关键列的空值。
4.3 pyecharts版本差异
pyecharts从1.x版本开始API已经和旧版0.x完全不同。网上很多教程写的是旧版的写法,直接复制会报错。如果你遇到的报错信息和add、add_yaxis有关,基本就是版本问题。
确认版本的命令:
bash复制pip show pyecharts
2025年当前主流的写法都是v2的链式调用风格。如果第一次接触跳过旧的写法,直接从新版文档看起即可。
4.4 大文件读不进去怎么办
如果你的数据量级不只是几十万行,而是几百万上千万行,pandas的read_csv可能会内存告急。这时候第一个手段是分块读取:
python复制chunks = pd.read_csv("large_sales.csv", chunksize=100000)
for chunk in chunks:
# 逐块处理后合并结果
第二个手段是读文件时指定只需要的列和数据类型。不用的列就别读了,能省很多内存:
python复制df = pd.read_csv(
"large_sales.csv",
usecols=["订单编号", "销售金额", "商品类目", "下单时间"],
dtype={"订单编号": "str", "销售金额": "float32"}
)
第三步是如果数据量实在太夸张,可以考虑用polars替换pandas。polars在内存效率上比pandas强不少,语法上也有60%的相似度,真遇到瓶颈可以转向它。
4.5 可视化输出的细节优化
用pyecharts给图上加数据标签,要注意小数位数。如果数值很大,建议保留整数即可,甚至用万元/千元作为单位来展示,否则图表上密密麻麻全是数字,读者很难一眼看明白。
matplotlib保存图片时,dpi至少150以上,否则拿到大屏上或者PPT里会显得很糊。另外要留意保存的目录是否存在,如果output目录不存在,plt.savefig会直接报错的。建议代码里先加一句:
python复制import os
os.makedirs("output", exist_ok=True)
5. 一些额外的延伸想法
这个分析做下来,无论你是Python新手还是只会用Excel的运营人员,只要照着跑一遍,都能感受到数据分析的完整流程。
项目本身可以作为起点,继续往几个方向延伸。
第一个方向是接入自动化报表。每天或者每周自动跑一遍脚本,把图表刷新输出成HTML,再通过邮件或者企业微信机器人发给相关人员。这个用定时任务就能实现,Windows下在"任务计划程序"里配置一个每日执行,macOS和Linux下则用cron。
第二个方向是把分析结论搬到看板工具上。把清洗好的数据导出成新的CSV,直接接到诸如Power BI或者可使用的开源报表工具上,业务人员自己拉拽筛选维度,不依赖会写代码的人。
第三个方向是预测性分析。时间序列预测虽然看起来比较深入,但比如在月度销售额数据上尝试用基础模型做下一期预测,或者用一个很简单的线性回归去看增长趋势,都是比较现实的起步方案。别一上来就搭复杂的深度学习模型,先从能解释清楚的传统方法入手会更踏实。
第四个方向是对文本数据的挖掘。如果你有商品评价或其他非结构化数据,可以考虑用jieba分词提取高频词汇,比如看买家对"质量""穿感""物流"等词的提及频率,这对产品优化有很大帮助。
我个人在实际操作中的一个体会是:无论用什么工具,先把业务问题定义清楚比敲代码重要得多。你问"上个月的销售额为什么涨了",跟问"上个月的销售额是多少",背后是两种完全不同深度的分析。很多人一上来就追求炫酷的图表,反而忽略了数字背后的业务含义。
最后再分享一个小技巧:在分析过程中,每画一张图都养成把图同时导出PNG和HTML两个版本的习惯。各自的适用场景不一样,但是当你需要临时改PPT的时候,你大概率会庆幸自己当时多存了一个格式。
