第一次把Python作业写成“项目”,而不是“答题”,大概率是从第五次作业开始的。前四次作业你还在练变量、分支、循环、列表和函数,每个文件二十行代码收工;到了第五次,老师突然抛出一个要读文件、做分析、画图表、给结论的题目,很多人的反应是一致的:单看每一步都学过,合起来就是不知道怎么写。
我带过不少学Python的同学,也批改过不少这种作业。这个阶段最难的从来不是Python语法本身,而是“项目启动方式”变了:代码不再只是从上到下跑一遍把print结果交上去,而是需要你先理解数据、拆解任务、再组合之前学过的所有东西。今天这篇就拿一个典型的第五次作业来拆,题型是“读取数据 -> 清洗分析 -> 可视化报告”,这也是目前Python入门课里最常见的综合练习方向。
1. 第五次作业的分水岭:从答题到做小项目
1.1 不是语法变难了,而是启动方式变了
前面四次作业,老师大概率只让你写一段功能代码。比如“输入一个数,判断是奇数还是偶数”“用字典统计单词次数”,所有数据都在代码里写死,程序跑完就算完。
第五次作业不一样,它通常要求你面对一个真实数据源。最常见的是给你一份 CSV 或 Excel 文件,让你读进来做统计;进阶一点的题目会让你从一个网页采集数据再做分析。很多人的第一反应是:我之前学过的列表、字典、函数,到底怎么用在一个几百行的数据文件上?所以如果你现在感觉“上课都听懂了,作业就是不知道从哪下手”,不是你水平不行,是这门课第一次要求你从“语法片段”走向“小项目”。
我自己看到过太多作业最后得分不高的原因都不是程序跑不起来,而是代码逻辑只能跑通老师演示的那一个固定场景,换个数据文件就崩。这就是典型的“还在用答题思维写项目”。
1.2 一个可以贯穿全文的作业框架
为了让这篇内容不只是空谈,我以一个很常见的第五次作业题作为主线展开。假设老师给你一份文件 weather.csv,里面是某城市2024年全年的每日天气记录,列包括日期、天气现象、最高气温、最低气温、风向、风力,其中温度字段带“℃”字符,比如“5℃”,要求你完成三件事:
- 统计每月平均最高气温,并画折线图;
- 统计晴天、雨天、雪天等天气类型的天数占比,并画饼图;
- 找出全年最高气温和最低气温分别出现在哪一天、分别是多少度;
- 最后将核心统计结果保存成一个结构化文件。
如果你的第五次作业不是天气数据,而是课程成绩、豆瓣图书、电商销量等类似描述,不要紧。这套框架全部通用:读数据,清理数据,按某种维度做统计,用图表表达,把结论交付出去。这也是为什么我建议你把这篇里的思路吃透,而不是只抄代码。
1.3 评分老师眼里,作业好坏是怎么分档的
我自己批类似作业时,习惯把作业分成三档。第一档是程序能跑,结果正确,但代码是堆在一个几十行的块里,全程print,一旦运行目录不对就报错。第二档是代码有一定函数划分,能处理基础异常,输出路径清晰,图表能保存下来。第三档是明显有工程习惯:目录结构规整、数据读取路径用相对路径处理、关键统计结果写进CSV、图注清晰、结论能解释图中信息。
第五次作业想拿高分,核心不是炫技。老师这个阶段想看你会不会“把一个模糊的需求转成可运行的代码”,也就是基础工程意识。下面的内容全部围绕这个目标展开。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 环境配置和项目目录结构,是第一个被扣分的地方
2.1 venv 与依赖管理对这次作业意味着什么
第五次作业开始,你需要用到第三方库了,最常见的是 pandas、matplotlib;如果作业方向偏爬虫,还要用到 requests、beautifulsoup4。这时候就出现了一个以前不太容易碰到的问题:为什么我在 PyCharm 里点运行没问题,但自己在终端执行 python main.py 就报 ModuleNotFoundError: No module named 'pandas'?
原因很典型:你在 PyCharm 里选了解释器,但那个解释器和你命令行里使用的 Python 不是同一个版本,或者 PyCharm 内部自动帮你创建过虚拟环境,而你的命令行走的系统 Python。很多人一开始会被这个问题磨掉耐心。
建议从一开始就在项目目录里创建虚拟环境:
bash复制mkdir python_homework5
cd python_homework5
python -m venv venv
激活虚拟环境:
bash复制# Windows
venv\Scripts\activate
# macOS / Linux
source venv/bin/activate
激活后命令行前面会出现 (venv) 提示符,这时再去装依赖,所有包都会安装到这个项目独立的虚拟环境里,不会污染全局,也不会被其他项目影响:
bash复制pip install pandas matplotlib
如果作业是爬虫方向,额外装:
bash复制pip install requests beautifulsoup4
把依赖导出到文件,方便老师那边复现:
bash复制pip freeze > requirements.txt
这一步看起来繁琐,但能解决后面一大半“到我电脑上跑不了”的问题。老师复查你的作业时,看到项目里带了 requirements.txt,印象分会明显不一样。
2.2 推荐的项目目录与代码组织方式
第五次作业理论上只需要一个 main.py 就够了,但我不建议你把所有代码堆在桌面一个无名字的 .py 文件里。一个简单清晰的结构是这样:
text复制python_homework5/
├── data/
│ └── weather.csv
├── output/
├── venv/
├── main.py
└── requirements.txt
output 目录用来放图表和统计结果,提交前再整个清理掉生成的中间图片也行。不推荐把 venv 一起打包发给老师,那样文件体积巨大还容易把一堆无用缓存带过去。
代码里的路径处理是最容易被忽略的坑。很多人读文件会直接写死成:
python复制df = pd.read_csv("data/weather.csv")
这行代码在 PyCharm 当前工作目录恰好是项目根目录时没问题。但如果你换到别的地方运行,或者从其他目录执行 python main.py,程序会直接报 FileNotFoundError。我批作业时经常看到有人为了解决这个问题,把CSV文件复制来复制去,最后交上来的代码一换电脑就跑不了。
更稳妥的写法是用 pathlib 基于代码文件所在位置去定位目录:
python复制from pathlib import Path
BASE_DIR = Path(__file__).resolve().parent
DATA_PATH = BASE_DIR / "data" / "weather.csv"
OUTPUT_DIR = BASE_DIR / "output"
OUTPUT_DIR.mkdir(exist_ok=True)
这样无论你从哪个路径启动,代码都会根据自己的位置找到 data 文件夹,这是所有后续步骤能成立的前提。很多第五次作业扣分根本就不是逻辑问题,而是路径问题。
3. 数据获取:文件读取与爬虫式采集的通用写法
3.1 从本地CSV读数据,最大的拦路虎是编码
拿到数据文件后,第一步永远是“先看数据长什么样”,而不是急着写统计逻辑。在代码里加一行:
python复制import pandas as pd
df = pd.read_csv(DATA_PATH)
print(df.head())
print(df.columns)
print(df.dtypes)
很多同学在这里会遇到第一个报错:UnicodeDecodeError: 'utf-8' codec can't decode byte ...。别慌。这通常是老师给的文件不是UTF-8编码,而是Windows环境常见的GBK或GB2312。我习惯写一个能自动兼容的函数,而不是每次手动改参数:
python复制def load_weather_data():
if not DATA_PATH.exists():
raise FileNotFoundError(f"找不到数据文件:{DATA_PATH}")
try:
df = pd.read_csv(DATA_PATH, encoding="utf-8")
except UnicodeDecodeError:
df = pd.read_csv(DATA_PATH, encoding="gbk")
return df
如果你遇到的是 Excel 文件 .xlsx,先确保环境里装了 openpyxl:
bash复制pip install openpyxl
对应读取方式:
python复制df = pd.read_excel("data/weather.xlsx", engine="openpyxl")
读进来之后检查列名。这是Python练习里一个非常容易被忽略的细节:CSV文件第一行如果带BOM,pandas读进来第一列列名可能会变成 \ufeffdate。你后面写 df["date"] 的时候就会莫名其妙报 KeyError。排查方法很简单,看清楚 df.columns 的输出。真遇到的话,可以对列名做一次清理:
python复制df.columns = df.columns.str.replace("\ufeff", "", regex=False)
这种“先打印看数据”的习惯非常值得养成。第五次作业之后,你面对的数据只会越来越脏,先检查再操作是绕不开的步骤。
3.2 如果作业是爬虫方向,requests 的基本流程
有些老师的第五次作业会直接要求爬数据,最典型的是“抓取某个网页的表格或列表,保存到本地再分析”。这里我用一个静态网页作为示例结构,实际网址由你作业里指定。核心流程固定五步:
- 构造请求头,尤其是 User-Agent;
- 发起请求并确认响应状态;
- 手动修正网页编码;
- 用解析库提取目标字段;
- 把结果保存为CSV。
一个可以直接改的脚手架是这样的:
python复制import requests
from bs4 import BeautifulSoup
import pandas as pd
HEADERS = {
"User-Agent": (
"Mozilla/5.0 (Windows NT 10.0; Win64; x64) "
"AppleWebKit/537.36 (KHTML, like Gecko) "
"Chrome/120.0 Safari/537.36"
)
}
def fetch_page(url):
resp = requests.get(url, headers=HEADERS, timeout=10)
resp.raise_for_status()
# 有的页面 requests 自动判断编码会判错,导致中文乱码
resp.encoding = resp.apparent_encoding
return resp.text
def parse_rows(html):
soup = BeautifulSoup(html, "html.parser")
rows = []
for tr in soup.select("table tr")[1:]: # 跳过表头
cells = tr.find_all("td")
if len(cells) >= 3:
rows.append([cell.text.strip() for cell in cells])
return rows
这里有一个值得注意的实操点。很多人爬下来网页后明明用浏览器看是有中文的,代码里却全是乱码,原因是 requests 根据响应头猜编码,遇到某些站点会猜错。手动设置 resp.encoding = resp.apparent_encoding,让程序先去读HTML里的 <meta> 声明,就能解决绝大多数乱码问题。
我不建议在做作业阶段去挑战那些加密、动态渲染、有严格访问控制的网站。第五次作业考察的是基础能力,选一个能通过静态HTML拿到数据的页面足够了。抓取过程中也要注意频率,别写一个死循环每秒请求十几次,本身就是不礼貌的行为,还会被服务端封IP。
3.3 先落盘,再做分析,才是“项目”的习惯
网页数据解析完,或者从某个接口拿到数据后,第一件事不是立刻分析,而是先保存成CSV。
python复制df = pd.DataFrame(rows, columns=["日期", "天气", "最高气温", "最低气温"])
df.to_csv(DATA_PATH, index=False, encoding="utf-8-sig")
这样做的价值在于:数据采集和数据分析是两个阶段。采集过程可能因为网络抖动导致页面内容不完整,如果你直接在后边接分析,不容易定位错误到底出在“采集”还是“清洗”。先把原始数据落盘,一旦后面分析出问题,你能快速判断是源数据的问题还是处理逻辑的问题。这个习惯放到以后做真实项目时也适用。
如果老师给你的题目本身就是本地文件,跳过爬虫这段,数据读取后直接进入下一步。
4. 数据处理与分析:隐藏扣分点最密集的部分
4.1 先解决数据类型:把字符串变成真正的数字和时间
现在的天气数据如果是从CSV直接读进来的,high_temp 这一列很可能是带“℃”的字符串。统计之前必须先把它转成浮点数,否则 mean()、max() 这些操作全都会出问题。一个比较稳的转换函数是:
python复制def clean_temperature_series(series):
return (
series.astype(str)
.str.replace("℃", "", regex=False)
.str.replace("°C", "", regex=False)
.astype(float)
)
整体清洗流程可以这样组织:
python复制df["date"] = pd.to_datetime(df["date"], errors="coerce")
df["high_temp"] = clean_temperature_series(df["high_temp"])
df["low_temp"] = clean_temperature_series(df["low_temp"])
df = df.dropna(subset=["date", "high_temp", "low_temp"])
日期列也必须转成真正的日期类型,否则你后面没法按月份分组。这一步处理完,建议立刻打印一次 df.dtypes,看到 high_temp 是 float64,date 是 datetime64[ns],才算真正进入分析阶段。
这里我专门提一下 errors="coerce" 的含义:如果某一行日期格式不对,pandas不会当场抛出异常让整个程序崩掉,而是把非法值转成 NaT,后续通过 dropna 清理掉。这是处理真实数据时保护程序稳定性的常用思路。
4.2 缺失值、异常值和“一种天气多种叫法”的清理
很多数据文件里会出现空行,或者某个字段写的是空字符串。读取后先用:
python复制print(df.info())
print(df.isna().sum())
看每一列缺多少数据。对天气数据里的气温列,最粗暴但有效的做法就是直接删除缺失行。前面代码里的 dropna 已经处理了。
除了空值,真实数据里还有一类隐藏陷阱:极端异常值。比如某天最高温记录成“50℃”,它可能不是真实值,但会影响全年平均。通常我会加一层基本范围过滤:
python复制df = df[(df["high_temp"] >= -60) & (df["high_temp"] <= 60)]
df = df[(df["low_temp"] >= -70) & (df["low_temp"] <= 40)]
范围可以根据自己数据实际情况调,目的是把明显的录入错误排除掉。判断条件放太严会误删真实天气记录,放太松又起不到作用,这个度需要你结合数据分布来定。
天气现象的清理稍微带一点业务逻辑。同一个数据文件里,可能出现“晴”“晴间多云”“多云转晴”“小雨”“中雨”各种写法。如果直接按原始字符串计数,饼图会碎得没法看。处理办法是先归纳,把天气归并成几个大类。
python复制def normalize_weather(s):
s = str(s)
if "雨" in s:
return "雨"
if "雪" in s:
return "雪"
if "云" in s:
return "多云"
if "晴" in s:
return "晴"
if "阴" in s:
return "阴"
return "其他"
df["weather_type"] = df["weather"].map(normalize_weather)
注意判断顺序。我把“雨”“雪”放在最前面,是因为“雨夹雪”这种同时包含两个字的现象,优先归入“雨”或“雪”都比单开一个“其他”更合理。“晴间多云”包含“晴”也包含“云”,按上面的顺序会归到“多云”,这样能更好反映实际日照情况。具体怎么归并没有标准答案,关键是你要在注释里说清楚归类原则,让老师知道你做了思考,而不是无脑计数。
4.3 分组统计与关键结论输出
数据干净了,后面的统计就顺理成章。先把月份字段提取出来:
python复制df["month"] = df["date"].dt.month
计算每月平均最高气温:
python复制monthly_high = (
df.groupby("month")["high_temp"]
.agg(["mean", "max", "min"])
.round(1)
)
print(monthly_high)
查找全年最高和最低气温出现的日期:
python复制hottest_idx = df["high_temp"].idxmax()
coldest_idx = df["low_temp"].idxmin()
hottest_day = df.loc[hottest_idx]
coldest_day = df.loc[coldest_idx]
print("全年最高气温:", hottest_day["high_temp"], ",日期:", hottest_day["date"].date())
print("全年最低气温:", coldest_day["low_temp"], ",日期:", coldest_day["date"].date())
很多同学到这里就开始写一堆 print,把结果打到控制台就觉得自己做完了。但第五次作业的评分标准往往会要求“把结果保存下来”,这是你在前四次作业不太会遇到的需求。我更推荐把所有核心统计汇总成一个表并输出成文件:
python复制summary_data = {
"指标": [
"年平均最高气温",
"年平均最低气温",
"全年最高气温",
"全年最高气温日期",
"全年最低气温",
"全年最低气温日期",
"最高温月份",
],
"数值": [
round(df["high_temp"].mean(), 1),
round(df["low_temp"].mean(), 1),
hottest_day["high_temp"],
hottest_day["date"].strftime("%Y-%m-%d"),
coldest_day["low_temp"],
coldest_day["date"].strftime("%Y-%m-%d"),
int(monthly_high["mean"].idxmax()),
],
}
summary_df = pd.DataFrame(summary_data)
summary_df.to_csv(
OUTPUT_DIR / "summary_stats.csv",
index=False,
encoding="utf-8-sig",
)
注意最后那个 encoding="utf-8-sig"。如果你用普通 utf-8 保存CSV,Windows下的Excel打开会中文乱码,用 utf-8-sig 带BOM保存就不会。这个细节在作业报告展示阶段很加分。
另外一个容易踩的坑是用 idxmax() 时,如果 DataFrame 索引不是从0开始的连续整数,最终取出来的行可能和你预期不一致。常规读CSV生成的索引连续,问题不大;一旦你做过 dropna() 或者排序,索引仍然保持原样,不一定连续。稳妥起见,可以在清洗后加:
python复制df = df.reset_index(drop=True)
这样能避免很多让人摸不着头脑的索引问题。
5. 可视化输出:能不能拿到印象分,全看这一步
5.1 中文字体问题:乱码和方块字是零容忍错误
matplotlib 默认字体对中文支持不好,画图时标题、坐标轴如果出现中文,通常会显示成一个个小方块。第一次用 matplotlib 画中文图的同学,十有八九都要在这里卡一下。解决办法是在绘图前设置中文字体:
python复制import matplotlib.pyplot as plt
plt.rcParams["font.sans-serif"] = ["Microsoft YaHei", "SimHei", "Arial Unicode MS"]
plt.rcParams["axes.unicode_minus"] = False
三选一通常能覆盖主流系统:Windows 用 Microsoft YaHei 或 SimHei,macOS 可以用 Arial Unicode MS。别忘了设置 axes.unicode_minus = False,否则坐标轴上的负号会显示成方块。如果你是在 Linux 服务器上画图,系统没有中文字体,需要先装 fonts-noto-cjk,或者在代码里指定一张已有的中文字体文件路径,作业阶段一般用不到这么复杂,但你要知道方向。
5.2 给每张图想清楚“想表达什么问题”
第五次作业里最让我觉得可惜的情况,是图能画出来,但图表达的信息和文字结论对不上。图表不是装饰品,它是用来回答某个问题的。月平均最高气温变化,适合用折线图展示趋势;天气类型的天数占比,适合用饼图或横向条形图展示结构;两个变量的关系才适合用散点图。不要为了把图表数量凑够而硬画一些无关图形。
画每月平均最高气温折线图,正确思路是先取数再画图:
python复制mean_temp_by_month = df.groupby("month")["high_temp"].mean()
fig, ax = plt.subplots(figsize=(10, 5))
ax.plot(mean_temp_by_month.index, mean_temp_by_month.values, marker="o", linestyle="-")
ax.set_title("2024年月平均最高气温变化趋势")
ax.set_xlabel("月份")
ax.set_ylabel("平均最高气温(℃)")
ax.set_xticks(range(1, 13))
ax.grid(True, linestyle="--", alpha=0.5)
plt.savefig(OUTPUT_DIR / "monthly_avg_temp.png", dpi=150, bbox_inches="tight")
plt.close()
绘制天气类型占比饼图时的完整代码也可以照这个思路写:
python复制weather_count = df["weather_type"].value_counts()
# 防止某些类别占比过低导致标签挤成一团,合并为“其他”
threshold = 0.02
other_count = weather_count[weather_count / weather_count.sum() < threshold].sum()
weather_count = weather_count[weather_count / weather_count.sum() >= threshold]
if other_count > 0:
weather_count["其他"] = other_count
fig2, ax2 = plt.subplots(figsize=(8, 8))
ax2.pie(
weather_count.values,
labels=weather_count.index,
autopct="%.1f%%",
startangle=90,
)
ax2.set_title("2024年天气类型占比")
plt.savefig(OUTPUT_DIR / "weather_type_pie.png", dpi=150, bbox_inches="tight")
plt.close()
这里有个细节值得说:饼图里如果出现好几种只占一天的天气类型,标签会挤成一团,图非常难看。所以先用占比阈值把占比小于2%的类别合并成“其他”。这个步骤在评分老师眼里是“会用真实场景思维处理数据”的标志。
5.3 保存图片而不是弹窗,作品集需要文件
很多同学写 matplotlib 时习惯用 plt.show() 弹窗看结果,但在第五次作业里,我们最终交付的是一份包含图片文件的作业包,不是靠运行时弹窗展示的。所以我个人建议所有图都执行 plt.savefig(),保存时用 bbox_inches="tight" 避免坐标轴标签被截掉。
保存图片后,再顺手用 plt.close() 关闭当前图形,否则循环里画多张图时可能造成内存堆积,虽然作业数据量小看不出来,但代码习惯一旦养成,后面做大数据分析时会少踩很多坑。
保存文件名也很重要。用 monthly_avg_temp.png、weather_type_pie.png 这种能看懂的文件名,不要叫 Figure_1.png。最终提交时,如果老师在 output/ 目录直接看到几张含义明确的图,他会默认你是一个有条理的人。
6. 高发报错排查与提交前的自查清单
6.1 第五次作业最高频的四类报错
这个阶段大家遇到的报错其实高度集中。我挑了四类最常见的,做成一个排查表,照着定位会快很多。
| 报错现象 | 原因 | 定位方法 |
|---|---|---|
ModuleNotFoundError: No module named 'pandas' |
运行脚本的解释器没装依赖 | 先 which python 看解释器路径,再确认是否激活虚拟环境 |
UnicodeDecodeError |
文件编码不是UTF-8 | 改用 encoding="gbk" 重试,或写自动尝试函数 |
KeyError: 'xxx' |
列名和你认为的不一致,或带BOM | 打印 df.columns 逐项核对 |
| 中文显示成方块 | matplotlib字体设置缺失 | 添加 plt.rcParams["font.sans-serif"] 配置 |
ModuleNotFoundError 那个情况,批作业时几乎每届都会碰到。最典型的场景是:在 PyCharm 里给项目配置了解释器,运行没问题,然后老师要求提交一段能在命令行运行的程序,同学直接在 cmd / Terminal 里执行 python main.py,结果系统找到的是另一个没装 pandas 的 Python,立刻报错。
所以如果你依赖 PyCharm,我建议同时打开项目中的终端,确认激活虚拟环境后再跑一次。只有一个入口能跑通不算真正跑通,多个入口都能稳定运行才是完成状态。
6.2 常见逻辑问题的定位顺序
程序一旦报错,不要瞎猜。我的排查顺序是:
- 先看完整报错信息里的最后一行,它通常会告诉你出错文件和行号;
- 去那一行检查变量名、列名、括号是否匹配;
- 如果错误不明确,在关键步骤前插入
print(),打印中间结果; - 每次只改一个地方,再重新运行;
- 程序跑通后,删除调试用
print,再做一次最终运行。
很多同学为了省事,一报错就怀疑是环境问题,无脑重新安装包,结果浪费时间。实际上,第五次作业里大量报错都发生在数据处理步骤,根源往往是“你以为是数字,其实是字符串”或者“你以为列存在,其实列名带了空格”。用 df.dtypes 和 df.columns 检查数据结构,比反复重装库高效得多。
6.3 提交作业前,一张清单帮你避免低分
每次提交之前,我都会建议学生过一遍下面这个清单。别觉得它琐碎,许多第五次作业的低分不是能力问题,而是交付物不完整。
| 检查项 | 说明 |
|---|---|
| 项目目录是否完整 | 代码、数据文件、输出目录、requirements.txt 在一个根目录下 |
| 能否全新环境运行 | 用 pip install -r requirements.txt 后能直接 python main.py 跑通 |
| 路径是否是硬编码绝对路径 | 不要用 C:\Users\xxx\Desktop\... 这种路径交作业 |
| 输出文件是否正常打开 | CSV用Excel打开不报错、不乱码;PNG能正常预览 |
| 图里中文是否正常 | 检查标题、坐标轴、图例 |
| 是否有一些有效分析和结论 | 不能只有代码和图,还要有“最高温出现在几月”等可读结论 |
| 是否清理了无用文件 | 不要提交 venv、__pycache__、临时调试脚本 |
| 注释是否够用 | 函数上方写清作用,关键步骤留一行注释即可,别整个文件刷注释 |
这个清单看起来简单,真正做到能避免大量返工。我见过好几个同学的作业跑起来没有任何问题,图也好看,结果交作业时把整个 venv 文件夹一起压缩上传,文件一百多MB,老师心情立刻变差。提交前花两分钟删掉这类不必要的东西,属于性价比极高的操作。
代码写到这个程度,实际上你已经完成了从“会语法”到“会用Python处理一个小项目”的跨越。第五次作业往后,很多内容都是围绕这个框架加新工具:数据库、接口调用、大数据分析、机器学习模型,底层的读数据、清数据、分析规律、可视化的思维完全一致。如果这份代码是你自己一行一行敲出来,并且理解了每一步为什么这样做,那后续学下去会顺畅很多。我个人的体会是,第五次作业交上去的那一刻,才是真正开始觉得“Python可以用来解决问题”的瞬间。
