写爬虫这个话题,我一直觉得网上大多数教程都走歪了——上来就甩一段 requests + BeautifulSoup 的代码,然后告诉你"复制就能跑"。结果你复制完,要么跑不出数据,要么被对方网站拒绝访问,要么连为什么这样写都说不清楚。我做了几年 Web 自动化相关的工作,日常跟各种网页、接口、反爬机制打交道,踩过不少坑。这篇就当作一次系统性的基础复盘,不讲虚的,只讲真正会用到的东西。
先说清楚"爬虫基础"到底要解决什么问题。一句话概括:用程序代替人工,批量、自动地从网页里提取结构化数据。你要么在给数据分析攒料,要么在做舆情监控,要么在搭自己的信息聚合工具,要么就是想验证某个页面下的某种变化。不管需求是什么,核心链路都一样:请求页面 → 拿到内容 → 解析数据 → 存储落地 → 应对异常。这篇文章会沿着这条链路,把每一环的底层逻辑和实操细节掰开讲,并且专门补上"静态页面和动态页面"这条分水岭——因为很多初学者正是在这里卡住的。
无论你是想入门 Python 爬虫,还是已经在用 Selenium 做 Web 自动化却对"为什么这样写"没有底,这篇都适用。我会尽量用"为什么这么做"的视角来讲,而不是只给结果。毕竟,爬虫这东西,知其然不知其所以然,遇到问题根本无从下手。
1. 爬虫的本质:从“模拟浏览器”到“理解网页数据”
1.1 爬虫到底在爬什么:先弄懂 HTTP 请求与响应
很多人第一次写爬虫,脑子里想的都是"怎么写代码",但真正要解决的第一步是:你的程序怎么跟目标网站对话。这个对话就是 HTTP 协议。
你可以把浏览器访问网页想象成你去餐厅点菜。你(客户端)拿着菜单说"我要一份宫保鸡丁",厨房(服务器)做完之后把菜端到你面前。HTTP 请求就是你的"点菜动作",HTTP 响应就是"端上来的菜"。爬虫要做的,就是跳过人坐在餐厅里这个环节,让程序自己拿着菜单去点菜,然后把端上来的菜直接放到自己的盘子里。
在实际代码里,一次最简单的 HTTP 请求是什么样?用 Python 的 requests 库,几行就能跑通:
python复制import requests
resp = requests.get("https://example.com")
print(resp.status_code) # 200 表示请求成功
print(resp.text[:500]) # 打印 HTML 前 500 个字符
这段代码里,resp.status_code 就是服务器返回的状态码,resp.text 就是网页源码。但注意,requests 拿到的东西,和你在浏览器里"看到"的东西不是一回事。你在浏览器里看到的排版、图片、按钮,都是浏览器基于 HTML、CSS、JavaScript 渲染之后的结果;而 requests 拿到的,只是原始的 HTML 文本。这就是后面静态页面和动态页面岔路口的起点。
1.2 状态码、请求头与常用方法
爬虫基础里,有几个 HTTP 概念必须烂熟于心。
状态码最常见的就是这几类:
| 状态码 | 含义 | 爬虫常见场景 |
|---|---|---|
| 200 | 请求成功 | 正常拿到页面 |
| 301/302 | 重定向 | 服务器把请求转到了另一个地址 |
| 403 | 禁止访问 | 大概率被反爬拦截了 |
| 404 | 不存在 | 路径写错了 |
| 429 | 请求过多 | 触发频率限制 |
| 500/502/503 | 服务器错误 | 服务器本身出问题了 |
请求头是爬虫最容易忽视、却也最容易被反爬卡住的地方。其中最重要的是 User-Agent(用户代理)和 Cookie。
- User-Agent:告诉服务器"你是什么浏览器"。很多网站会判断 UA,如果发现你不是一个常见浏览器而是一段 Python 脚本,直接拒绝响应。
- Cookie:相当于你的"通行证",服务器用它识别会话状态。登录后的网站,很多时候只有带上 Cookie 才能访问到真实数据。
一个更接近真实场景的请求,通常长这样:
python复制headers = {
"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36",
"Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",
"Accept-Language": "zh-CN,zh;q=0.9",
}
resp = requests.get("https://example.com", headers=headers, timeout=10)
timeout=10 是很多人一开始会漏掉的参数。没有超时设置,一旦目标服务器迟迟不响应,你的爬虫会一直挂在那里,看起来像"死机"了一样。所以我会习惯性地给每个请求都加上超时时间。
1.3 页面渲染方式:决定你用什么方案的关键因素
网页内容的产生方式,大致可以分成两类。
静态页面:服务器直接把 HTML 传给你,你要的内容就在 HTML 里面。这种页面用 requests 就能搞定,解析起来也简单,用正则、XPath、CSS 选择器都行。
动态页面:服务器传给你的 HTML 只是一个空壳,真正的内容是 JavaScript 在浏览器里运行时,再向后端接口请求数据,然后动态渲染出来的。这种页面的典型特征就是:你用 requests 拿到 HTML,搜索结果里根本找不到你要的数据,或者只有一堆 <script> 标签和空的 div 节点。
怎么判断一个页面是静态还是动态?很简单,在浏览器里右键"查看网页源代码",然后 Ctrl+F 搜索目标内容。如果在源码里搜得到,说明是静态;搜不到,说明是动态。这个方法对初学者来说是最直观的验证手段。
动态页面的爬取方式有两种思路:
- 找到它背后的真实接口,直接请求接口拿 JSON 数据——这是最高效、最稳定的方式。
- 用 Selenium 之类的 Web 自动化工具,启动一个真实浏览器,让页面自己渲染完,然后再去读取渲染后的内容——这是最通用的兜底方案。
这就是我为什么说"爬虫基础"和"Web 自动化"是天然相关的话题。爬虫不一定要用 Selenium,但当你遇到动态页面时,Selenium 往往才是能让你顺利收工的那把刀。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 工具选型与基础环境:requests、BeautifulSoup、lxml、Selenium 怎么选
2.1 Python 环境与库的定位
学爬虫,绕不开几个库。但很多人一开始就被"到底该学哪个"搞晕了。我的建议是:没有人只用一个库,不同环节用不同工具,组合起来才是常态。
| 库 | 定位 | 适用场景 |
|---|---|---|
| requests | 发 HTTP 请求 | 绝大部分请求环节 |
| httpx | requests 的现代替代品 | 需要异步、HTTP/2 时 |
| BeautifulSoup4 | HTML 解析 | 结构简单、小规模抓取 |
| lxml | 高性能 HTML/XML 解析 | 配合 XPath 使用 |
| parsel | Scrapy 的解析器 | 熟悉 CSS 选择器的话很顺手 |
| Selenium | 浏览器自动化 | 动态页面、需要模拟用户操作 |
| Playwright / Puppeteer | 新一代自动化 | 现代浏览器控制、效率更高 |
Python 环境这块,建议直接用 Anaconda 或者 Python 3.10+ 的虚拟环境,避免把包装得乱七八糟。安装命令也很简单:
bash复制pip install requests beautifulsoup4 lxml selenium
做 Web 自动化的话,Selenium 还需要一个浏览器驱动。现在 Selenium 4 之后支持 Selenium Manager 自动管理驱动,比之前手动下载 chromedriver 省心不少,但如果你遇到版本不匹配的问题,还是要知道驱动和浏览器版本需要对应这个常识。
2.2 requests 库的食用基本法:GET、POST、会话保持
requests 库里,最常用的其实是这几个方法:
python复制import requests
# GET 请求
resp = requests.get(url, params={"keyword": "python"}, headers=headers)
# POST 请求,常用于提交表单或接口调用
resp = requests.post(url, data={"username": "test", "password": "123"}, headers=headers)
# 使用 Session 保持会话,可以自动维护 Cookie
session = requests.Session()
session.headers.update(headers)
resp = session.get(url)
这里面的 Session 对象,是很多人进阶之后才发现的宝藏。它能跨请求保持 Cookie、复用底层连接,在处理"先登录后访问"的流程时特别方便。如果你的爬虫需要模拟用户登录,那就别每次都用 requests.get 裸调,改用 Session,否则登录状态根本传不下去。
2.3 为什么我不建议一上来就学 Scrapy
网上很多课程一上来就讲 Scrapy,但我个人觉得,对新手来说,先把 requests + BeautifulSoup 这套直球组合玩熟,再去看 Scrapy,才是合理路径。因为 Scrapy 是一个完整的框架,自带爬虫引擎、调度器、下载中间件、管道(Pipeline)等等。它很强,但它的概念和抽象层级会分散你对"请求→解析→存储"这条主线的注意力。等你用原生 requests 写过几个小爬虫,理解了抓取过程的每个阶段之后,再迁移到 Scrapy,你会觉得 Scrapy 是在帮你省事,而不是在给你增加负担。
不过,如果项目规模上来了,比如需要爬几万、几十万个页面,Scrapy 的异步并发优势就会非常明显。你要是已经有点基础了,可以直接把它列入计划。
3. 解析网页的三种主流姿势:正则、XPath、CSS 选择器
3.1 正则表达式:最快但最脆
正则表达式是很多人的第一反应:拿 HTML 全文,直接 pattern 匹配。它确实快、轻量,不依赖任何解析库。但 HTML 本身不是一种严格规律的语言,标签嵌套、属性引号、换行空格都可能导致正则匹配失败。举个例子,你想匹配所有链接:
python复制import re
html = '<a href="https://example.com/page/1">链接</a>'
pattern = r'href="(.*?)"'
print(re.findall(pattern, html))
这个简单场景没问题,但一旦 HTML 里有 href 的引号变成单引号,或者属性顺序变了,你的正则就必须跟着改。正则适合用来提取明确的字符串片段,不适合用来解析嵌套的 HTML 结构。所以在爬虫里,正则更多是辅助手段,而不是主解析器。
3.2 XPath + lxml:结构定位的利器
XPath 是一种在 HTML/XML 文档中查找信息的语言,而且 lxml 对 XPath 的支持非常成熟。它的核心思路是:沿着文档结构树,用路径表达式定位节点。
python复制from lxml import html
doc = html.fromstring(resp.text)
# 选取所有 a 标签的 href 属性
links = doc.xpath("//a/@href")
# 选取 class 为 title 的 h2 标签文本
titles = doc.xpath("//h2[@class='title']/text()")
XPath 比正则的优势在于,它理解 HTML 的层级结构。哪怕标签换了个位置,只要层级关系清楚,照样找得到。它还支持非常复杂的条件,比如"找到第三组含某 class 的 div 下的所有图片地址",这种需求用正则会写出天书,XPath 却只有短短一行。
有个小建议:先在 Chrome 开发者工具里右键要抓取的元素,选择"Copy → Copy XPath",然后再根据实际需要微调。这是最快上手的路径。但也要知道,浏览器生成的是绝对路径,页面上一个大改动就全断了,所以有经验的爬虫工程师通常会把绝对路径改写为相对路径,把条件写得宽容一些。
3.3 BeautifulSoup 与 CSS 选择器:对新手最友好
BeautifulSoup 在"理解 HTML 结构"这件事上做得特别符合直觉。它可以像 Python 对象一样访问标签的层级:
python复制from bs4 import BeautifulSoup
soup = BeautifulSoup(resp.text, "html.parser")
# 查找所有标题
for h2 in soup.find_all("h2"):
print(h2.get_text(strip=True))
# 用 CSS 选择器
data = soup.select("div.card > h2.title")
BeautifulSoup 的 select 方法支持 CSS 选择器,如果你写过前端,上手成本几乎为零。比如 div.card > h2.title 的意思是"class 为 card 的 div 下的直接子元素 h2,且该 h2 的 class 为 title"。这种写法简洁清晰,非常推荐。
三种方案放一起总结的话:正则适合定长、明确文本;XPath 适合复杂结构、层级查询;BeautifulSoup 适合快速开发、逻辑直观的小项目。实际工作中,我往往是混合使用,大多数情况下用 XPath 或 CSS 选择器做主解析,正则做二次清洗,这才是一个工程效率最高的组合。
4. 动态页面与 Web 自动化的切入点:数据从哪来、怎么取
4.1 为什么 requests 拿不到动态数据
动态页面的麻烦在于,你从服务器收到的 HTML 可能只是一个空的 <div id="app"></div>,里面的内容全部靠 JavaScript 动态塞进去。这种情况下,你用 requests 拿到 HTML,自然找不到任何目标数据。
那怎么办?最简单的办法是打开浏览器的开发者工具(F12),切到 Network(网络)面板,刷新页面,仔细看里面的 XHR 或 Fetch 请求。大概率你会找到一个返回 JSON 数据的接口。这个接口就是"数据源头"。
找到了这个接口之后,你就可以直接向这个接口发请求,省去浏览器渲染的耗时和开销。这也是爬虫工程师最喜欢的方案——快、稳、占用资源少。例如你在 Network 里看到这样一个接口:
text复制https://api.example.com/list?page=1&page_size=20
返回的内容是:
json复制{
"data": {
"items": [
{"id": 1, "title": "文章标题", "author": "作者"}
]
}
}
那你的爬虫核心代码就从"解析 HTML"变成了"请求接口 + 解析 JSON":
python复制resp = requests.get("https://api.example.com/list", params={"page": 1, "page_size": 20}, headers=headers)
data = resp.json()
for item in data["data"]["items"]:
print(item["title"], item["author"])
这种方式在 B 站、微博、各类电商 App 的移动端页面上尤其常见。识别并请求真实接口,是进阶爬虫的重要能力,它比任何解析库都重要。
4.2 当接口不好找时,Selenium 就来兜底
有些网站对接口做了双重验证,比如参数加密、签名校验、Headers 里带 token,或者干脆要浏览器环境才能请求。这时候直接调接口会非常痛苦,因为你需要逆向它的加密逻辑。对基础阶段的爬虫来说,用 Selenium 直接驱动浏览器把页面渲染完,再拿渲染后的内容,反而最省事。
一个最简单的 Selenium 示例:
python复制from selenium import webdriver
from selenium.webdriver.common.by import By
import time
driver = webdriver.Chrome()
driver.get("https://example.com")
# 等待关键元素出现,显式等待比写死 sleep 更稳
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
WebDriverWait(driver, 10).until(
EC.presence_of_element_located((By.CLASS_NAME, "product-item"))
)
items = driver.find_elements(By.CLASS_NAME, "product-item")
for item in items:
print(item.text)
driver.quit()
重点说一下 WebDriverWait。初学 Selenium 的人最常犯的错误是直接写 time.sleep(5),不管页面加载完成没有,先睡够再说。这在网络波动时会导致时间不够或浪费大量时间。而显式等待是"等某个条件成立",页面 1 秒加载完就 1 秒执行,10 秒才加载完就等到 10 秒,既稳又快。
Selenium 能做的还不止"拿到渲染后的 HTML"。它可以点击按钮、填写表单、滚动页面、切换窗口,这意味着你能模拟真实用户的操作流。比如"点击加载更多"才能翻出后续内容的列表页,用 Selenium 处理起来就非常自然。
4.3 自动化浏览器之外的细节
用 Selenium 的时候,有几点实操心得:
- 无头模式。服务器上跑爬虫,不需要弹出浏览器窗口,用
chrome_options.add_argument("--headless")即可。但要注意,无头模式偶尔会触发网站的反爬,这时候还要额外隐藏"webdriver 特征"。 - 推荐 Playwright 或 Pyppeteer 作为替代。如果 Selenium 在某个网站上频繁被识别,可以试试 Playwright,它的指纹伪装能力更强。不过那是后续进阶内容,基础阶段先把 Selenium 跑熟就够了。
- 控制浏览器窗口大小和下载路径,避免默认行为干扰流程。
动态页面的爬取思路,总结下来就是两条路:能找到接口就请求接口;找不到接口或接口加密太复杂,就用浏览器自动化渲染。两条路都是爬虫基础的核心技能,缺一不可。
5. 数据解析与清洗:从“能看到”到“能存下来”
写到这里,你已经能把网页内容拉下来了,也能提取出里面的关键信息了。但爬虫的最终目的是"可用数据",这中间还有一个经常被忽略的环节——数据清洗。
5.1 去空白、去噪声、字段格式统一
HTML 解析出来的文本经常带着大量空格、换行、制表符。比如你用 get_text() 拿到的可能长这样:
text复制"\n\n 2024-05-10 14:23:01\n \n 作者:张三\n "
这类文本必须清洗一下,常规操作包括:
python复制text = " ".join(text.split())
这行代码可以把连续空白全部压缩成单个空格,是最常用的清洗方式。另外,提取日期、价格、数字时,还可能要去掉多余的单位、逗号、货币符号。比如:
python复制price_text = "¥1,299.00"
price = float(price_text.replace("¥", "").replace(",", ""))
这些清洗规则看起来琐碎,但直接影响你后续分析的准确性。爬虫的工程成本,很大一部分其实花在清洗上,而不是抓取本身。很多初学者把数据存下来之后发现统计结果对不上,回头查才发现是没清洗干净。
5.2 数据存储:CSV、JSON、SQLite 怎么选
按数据规模,我一般这样推荐:
| 存储方案 | 适合场景 | 优点 | 局限 |
|---|---|---|---|
| CSV | 小规模、Excel 可直接打开 | 简单、通用 | 无结构约束、并发写入差 |
| JSON | 嵌套结构、接口数据 | 保持层级 | 不适合复杂查询 |
| SQLite | 单机中等规模 | 轻量、支持 SQL | 高并发弱 |
| MySQL/PostgreSQL | 大规模、多人访问 | 强大、成熟 | 需要维护服务 |
写 CSV 的代码很简单:
python复制import csv
with open("data.csv", "w", newline="", encoding="utf-8-sig") as f:
writer = csv.writer(f)
writer.writerow(["标题", "作者", "时间"])
writer.writerow(["爬虫基础", "张三", "2024-05-10"])
注意这里用 encoding="utf-8-sig",这样生成的 CSV 用 Excel 打开时,中文才不会乱码。这个小细节,我见过太多人踩坑了。
如果数据量到了几万条以上、且需要频繁查询和去重,我更推荐直接用 SQLite。Python 内置 sqlite3 模块,不需要额外安装:
python复制import sqlite3
conn = sqlite3.connect("spider.db")
cur = conn.cursor()
cur.execute("""
CREATE TABLE IF NOT EXISTS articles (
id INTEGER PRIMARY KEY AUTOINCREMENT,
title TEXT,
author TEXT,
publish_date TEXT
)
""")
cur.execute("INSERT INTO articles (title, author, publish_date) VALUES (?, ?, ?)",
("爬虫基础", "张三", "2024-05-10"))
conn.commit()
conn.close()
数据库的另一个天然好处是,你可以用 UNIQUE 约束来做去重,或者在插入时用 SELECT ... WHERE 判断是否已存在。这比在 CSV 里手动去重舒适太多。
6. 实战案例:从零抓取一个标题列表
理论知识说了不少,我们来跑一个完整的实际案例。假设我们要从某个博客网站上抓取文章标题、作者和发布时间,并把结果保存为 CSV。
6.1 页面分析与目标定位
首先,在浏览器里打开目标页面,按下 F12 打开开发者工具,用左上角的 inspect 图标点击页面上的标题元素。这时你会看到对应的 HTML 结构,例如:
html复制<div class="post-item">
<h2 class="post-title"><a href="/p/12345">这是一个文章标题</a></h2>
<span class="post-author">张三</span>
<span class="post-date">2024-05-10</span>
</div>
这个结构非常典型。我们要提取每个 div.post-item 下的:
- 标题文本:
h2.post-title的文本 - 链接:
h2.post-title a的 href - 作者:
span.post-author的文本 - 日期:
span.post-date的文本
6.2 完整代码实现
python复制import requests
from bs4 import BeautifulSoup
import csv
headers = {
"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36"
}
# 抓取第一页到第三页
all_data = []
for page in range(1, 4):
url = f"https://example.com/blog?page={page}"
resp = requests.get(url, headers=headers, timeout=10)
resp.raise_for_status() # 状态码不是 200 时直接抛异常
soup = BeautifulSoup(resp.text, "html.parser")
items = soup.select("div.post-item")
for item in items:
title_tag = item.select_one("h2.post-title a")
if title_tag is None:
continue
title = title_tag.get_text(strip=True)
link = title_tag["href"]
author_tag = item.select_one("span.post-author")
date_tag = item.select_one("span.post-date")
author = author_tag.get_text(strip=True) if author_tag else ""
date = date_tag.get_text(strip=True) if date_tag else ""
all_data.append([title, author, date, link])
print(f"抓取成功:{title},作者:{author},日期:{date}")
# 存储为 CSV
with open("blog_posts.csv", "w", newline="", encoding="utf-8-sig") as f:
writer = csv.writer(f)
writer.writerow(["标题", "作者", "日期", "链接"])
writer.writerows(all_data)
print(f"完成,共抓取 {len(all_data)} 条数据")
这段代码里有两个值得说明的细节:
resp.raise_for_status()的作用是:如果服务器返回 4xx 或 5xx,直接抛出异常,避免你拿着一个错误页面继续解析,最后得到一堆空数据。这让程序在出错时能快速停下来。select_one返回的是第一个匹配元素,如果没有匹配到元素,返回None。所以需要用if author_tag else ""做一下兜底,避免因某个字段缺失导致整个程序崩溃。
6.3 运行结果与常见问题
正常运行的话,终端会逐行打印"抓取成功:xxx",最后生成一个 blog_posts.csv 文件。如果你遇到"proceed finished with exit code 0"但没有任何输出,最常见的原因就是选择器没有匹配到元素,导致循环体里什么都没打印。
这类问题的排查方法很简单:先单独打印 resp.text,看返回的 HTML 是否包含你预期的结构。如果包含,说明选择器写错了;如果不包含,说明请求层面就没拿到正确的页面(可能被反爬、需要登录、或 URL 不对)。永远先确认 request 拿到的内容,再去找解析逻辑的问题。
6.4 给这个案例加上限速与延时
上面那个代码直接跑,如果页面数量少还好,页面一多,很容易因为请求频率过高被目标网站封禁。所以建议在生产环境里加上请求间隔:
python复制import time
for page in range(1, 4):
# ... 请求和解析 ...
time.sleep(1) # 每页之间暂停 1 秒
time.sleep(1) 是简单粗暴的频率控制方式。更优雅的做法是使用随机延时:
python复制import random
time.sleep(random.uniform(0.5, 1.5))
随机延时的目的,是让请求间隔看起来更像真实用户的点击节奏,而不是一台每 1.000 秒准时发出请求的机器人。这也是爬虫工程上的一个基础礼仪和防御手段。
7. 绕开常见坑:反爬识别、编码问题、异常处理
7.1 常见的反爬手段与应对思路
爬虫基础阶段,你迟早会遇到反爬,因为现在大多数网站都会做一定程度的防护。常见的手段按防护强度从低到高排序是这样的:
| 反爬手段 | 表现 | 应对思路 |
|---|---|---|
| UA 检测 | 请求头 User-Agent 异常 | 伪装成真实浏览器 UA |
| Referer 检测 | 请求来源不符合预期 | 添加 Referer 请求头 |
| Cookie 校验 | 未登录或会话无效 | 先模拟登录或手动获取 Cookie |
| IP 频率限制 | 短时间大量请求被封 | 降低请求频率、使用代理池(进阶) |
| 验证码 | 出现图形/滑块验证 | 接入打码平台或浏览器自动化(进阶) |
| 数据加密 | 接口返回密文 | 逆向 JS、断点调试(进阶) |
这里最需要注意的是,反爬本质上是在挑战服务器对你的信任。尽量不强闯,尤其不要对一个小网站一次性发起巨量请求,既给对方服务器增加负担,也可能给自己带来不必要的麻烦。控制频率、合理抓取,是行业内的共识。
7.2 编码问题:中文乱码的根源
很多初学者抓取中文网站时,打印出来的内容是乱码。这通常是编码声明与实际编码不一致导致的。requests 库会根据 HTTP 响应头里的 charset 推断编码,但有些网站没有规范声明,或者声明错了。
解决方法很简单:
python复制resp.encoding = resp.apparent_encoding
apparent_encoding 是 requests 基于内容自动检测出来的编码,通常强制赋值之后中文就能显示正常。不过要注意,自动检测有时会误导,更稳妥的做法是先看网页源码里的 <meta charset="...">,然后手动指定。
python复制resp.encoding = "utf-8" # 或 gbk、gb2312,取决于页面声明
7.3 异常与重试机制:让爬虫更健壮
网络请求永远是脆弱的。目标服务器可能超时、返回 503、或者你的网络本身不稳定。一个健壮的爬虫应该有异常捕获和重试逻辑。
python复制import time
import requests
def fetch_url(url, headers=None, retries=3):
for attempt in range(retries):
try:
resp = requests.get(url, headers=headers, timeout=10)
resp.raise_for_status()
return resp
except requests.RequestException as e:
print(f"第 {attempt + 1} 次请求失败:{e}")
if attempt < retries - 1:
time.sleep(2)
return None
这段代码的意思是:请求失败后再试两次,每次间隔 2 秒。三次都失败了才放弃。这个模式在实际工程里非常重要,宁可重试,也不要程序因为一次网络抖动就崩溃退出。
7.4 关于 Pycharm 运行后 exit code 0 的说明
很多人第一次写爬虫,在 PyCharm 里运行,结果终端只显示 Process finished with exit code 0,什么都没打印。这个现象其实说明程序正常跑完了,但没有执行任何打印语句。常见原因有三:
- 选择器没匹配到元素,循环被跳过。
- 请求被反爬,返回的是验证页或空白页。
- 你的脚本里压根没有
print,或者print被注释掉了。
排查方法就是上面说的,先打印 resp.status_code 和 resp.text[:200] 看请求阶段是否正常。看清问题出在哪一层,再对症下药。
8. 从爬虫基础到进阶:明确下一步方向
如果说这篇博文能给你留下一个最重要的印象,那就是爬虫是"请求 → 解析 → 存储 → 容错"的工程组合拳。搞清楚这条主干,无论之后你走向 Scrapy 框架、分布式爬虫,还是再往深了做数据分析和 AI 数据管道,都不会跑偏。
在你掌握基础之后,可以按顺序思考这几步进阶方向:
- 框架化:把 requests + BeautifulSoup 的逻辑迁移到 Scrapy,感受异步并发带来的效率提升。
- 接口逆向:学习 JavaScript 逆向、抓包分析、签名参数还原,这是爬虫对抗技术中水最深也最烧脑的部分。
- 分布式爬虫:用 Scrapy-Redis 或 Celery 实现多节点协同抓取,解决大规模抓取场景下的调度问题。
- 数据管道:把清洗、去重、入库标准化,让爬虫产出的数据能直接落到分析层。
- 合规边界:爬虫不是"想爬就爬",务必要注意 robots.txt、目标网站服务条款、个人信息保护等相关要求,做负责任的开发者。
最后再说一点个人经验。我见过很多人学爬虫,把大量时间花在研究各种奇技淫巧上,却连最基本的状态码和选择器都讲不清。爬虫基础的意义,不在于让你会跑一个 Demo,而在于让你对"网页从请求到渲染的整个过程"有足够清晰的认知。有了这份认知,任何页面摆在你面前,你都能快速判断"该用哪种方式、走哪条路径"。
如果你现在正卡在某个页面上,不妨退一步,按照这篇文章的顺序重新捋一遍:请求是否正常?内容在哪个环节?该用静态解析还是动态渲染?数据存哪里?大多数时候,问题的答案就藏在这几个问号之中。希望这篇内容能帮你少走一点弯路。
