你有没有遇过这种场景:一份PDF发出去之前,发现某一页上还留着一行不该出现的字,可能是内部批注、合同模板里的提示语,或者一个反复修改后依然漏掉的旧信息。用编辑器打开想删掉,结果要么提示要付费,要么删完后整页排版跟着乱。我的做法是直接用Python来处理,调几行代码就能把“PDF某一页中的文字”精准移除。这篇文章就是把整个方案、原理、代码和坑一次讲清楚,既适合刚接触Python的新手,也能给需要做文档脱敏、批量清理PDF文字的人一个直接能用的参考。
1. 先搞清楚一件事:你说的“删文字”是哪种删?
很多人一搜“删除PDF文字”,第一反应是找个工具,用白色矩形把文字盖住。这严格来说不叫删除,叫遮挡。PDF里的文字对象还完整保留在内容流里,你用鼠标能选中,Ctrl+C能复制,甚至拿解压工具把页面打开,字符串原文还在里面。如果这个文件是要对外发布或者做脱敏处理,这种“删除”等于没删。
文件最终用途决定你要用哪种方案,建议按这个思路来选:
| 场景 | 推荐方案 | 原因 |
|---|---|---|
| 临时截图给人看,不追求底层干净 | 白色矩形填充覆盖 | 最快,视觉上看不到即可 |
| 正式提交、对外发布、脱敏要求高 | 内容流级删改(Redaction) | 文字对象被彻底移除,搜索和复制均不可见 |
| 带OCR文本层的扫描件,想去掉文字层保留图像 | 移除文本层/替换页面 | 保留底层扫描图像,文字层消失 |
| 删除一整页 | 直接删除页面对象 | 比操作内容流更简单高效 |
所以动手前先问自己一个问题:这份文件发出去之后,别人会不会拿到源文件去分析?如果答案是“会”或者“有可能”,就不建议用覆盖方案。后面讲的所有内容,也默认是基于“真正从内容流里删掉文字”这个目标来展开的。
1.1 视觉覆盖和真正删除的本质区别
我用一个最简单的方式解释。PDF页面上的文字,本质上是一堆“绘制指令”,类似告诉打印机“在某个坐标,用某个字体,画出一串字符”。你把白色矩形盖在文字上面,等于在这堆绘制指令后面又追加了一条“画一个白色矩形”的指令。页面显示时,矩形遮住了文字,但之前的文字指令并没有消失。这是两层的问题。
内容流级删除则完全不同。它是把那段“绘制文字”的指令从内容流里直接抹掉,或者把该字符的显示范围标记为“删除区域”,再让PDF渲染引擎跳过这一区域的文本,同时清理掉字体引用和文本块信息。文字不再存在于页面描述里,自然也就无从选中和复制。
这个区别在纯数字环境下很容易被忽略,但在文件安全要求高的场景里是生死线。比如你给客户发一份报价单,里面有一行只给内部看的折扣底价,用白色方块盖住,对方把矩形删掉就能看到;用Redaction删除,对方无论如何无法恢复。
1.2 布局固定性:为什么删完不会自动重排
还有一个必须提前建立的心理预期:PDF和Word不一样,它没有“文档流”的概念,页面是绝对定位的。你在Word里删掉一行字,后面的内容会自动上移;在PDF里删掉一行字,那块区域就空着,后面的内容位置纹丝不动。
大部分时候我们手动删文字,目的就是想让某个位置不再显示内容,所以空着反而是正常的。但如果你期望的是“删掉第5页的某句话后,整个页面的排版自动重新整理”,那需要的是文档编辑工具而不是PDF处理方案,可能要回到源文件去改。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 工具选型:为什么我最后选了PyMuPDF
Python处理PDF的库不少,PyPDF2(现在叫pypdf)、pdfrw、pikepdf、reportlab、PyMuPDF各有各的擅长领域。但具体到“删除某一页中的指定文字”这个需求,绝大多数库做不了,或者做起来非常别扭。
2.1 主流Python PDF库在“删文字”上的能力边界
我整理了一张表,把它们的边界列出来:
| 库 | 主要能力 | 能不能按文字内容删除 | 备注 |
|---|---|---|---|
| PyPDF2 / pypdf | 页面合并、拆分、旋转、提取文本 | 不能,文本提取都经常乱 | 想删指定文字需要自己解析内容流,成本极高 |
| pdfrw | 读写PDF结构、页面操作 | 理论上可以,但你需要手工解析和重写内容流 | 适合做表单和简单操作,文字级操作不友好 |
| pikepdf | 基于qpdf,PDF底层结构操控能力强 | 可以进入内容流,但删除逻辑得完全自己写 | 精通PDF结构的人会喜欢,普通用户上手难 |
| reportlab | 从零生成PDF | 不是修改工具 | 主要用来造新文档 |
| PyMuPDF(fitz) | 渲染、文本提取、注释、删改 | 能,自带Redaction API | 最省事,精确匹配文字位置 |
在试过一圈之后,我的结论是:如果想快速、稳定地实现“搜索某个关键词,然后把包含它的文字块从页面上删干净”,PyMuPDF是当前社区里最优解。它把“定位文字”和“删除文字”拆成两个非常清晰的API,省去了大量内容流解析工作。
需要说明的是,PyMuPDF并不是万能的。它的强项是处理有文本层的PDF(也就是文字可以被选中、搜索的PDF),对于纯图片型扫描件,它同样无能为力。这一点后面有一整节来展开。
2.2 Redaction机制:脱敏工具当删除工具用
PyMuPDF处理这个需求的核心机制叫Redaction,直译是“删改、涂黑”。这个功能最早是给文档脱敏用的——比如政府公开文件前,需要把身份证号、电话号这些敏感信息彻底抹掉。它做的事情是:
- 在页面上定位一个矩形区域;
- 标记这个区域为“待删改”;
- 调用应用方法后,PyMuPDF会解析页面内容流,把落入这个区域内的文字指令、图像、链接、注释一并清除;
- 同时把该区域填充为指定颜色(通常是白色或黑色)。
听起来是不是正合适?所谓“删除PDF某一页中的文字”,本质上就是“对一个区域做Redaction”。文字是目标区域,删改把它变成白底空白,但又不仅仅是画个白色方块——它是真的从内容流清理掉了。
PyMuPDF还提供了search_for方法,能根据文字内容找到它所在的位置,返回一个或多个矩形坐标。把这两个功能串起来,就是最直接的删除流程:先搜文字,拿到矩形,标记删改,应用删改。
3. 动手前的原理课:PDF页面里的文字到底怎么存的
既然是做技术方案,我建议还是花五分钟搞清楚底层存储方式。理解了这一点,遇到各种奇奇怪怪的“删不掉”情况时,你就能自己推断问题出在哪。
3.1 内容流里的文字运算符
PDF页面内容不是一个“文字图层”加一个“图片图层”,而是写在一段内容流(Content Stream)里的一串操作符。用文本形式看,类似这样:
code复制BT
/F1 12 Tf
72 720 Td
(Hello, World) Tj
ET
其中BT和ET标记一段文本对象的开始和结束,Tf设置字体和字号,Td设置起始坐标,Tj是显示一个字符串。还有更复杂的TJ运算符,用来显示带字符间距调整的字符串数组。
关键点:PDF里的文字不是像HTML里那样的“元素”,而是一串绘制指令。所以“删除文字”在底层只有两条路:要么把这些指令从内容流中去掉,要么用覆盖指令遮住它,再没有第三种魔法。
3.2 为什么“搜不到文字”时不能硬删
search_for的工作原理,是解析页面里每个文字块的Unicode编码,通过字体里的ToUnicode映射表转成真实字符,然后和你要搜索的关键词做匹配。这个过程依赖字体信息是否完整。
现实中很多PDF是从某个软件导出的,字体嵌入不规范,或者只保留了字形而没有Unicode映射关系,结果就是——肉眼能看到“张三”,但用search_for就是搜不到。这时如果你把整个文件列为“无法处理”,就太可惜了。
正确思路是准备两套方案:能搜索定位就用搜索定位,精确删除;搜索不到,就用坐标区域删除。比如你知道要删的文字在第2页右半边的中上位置,直接画一个矩形覆盖过去,同样能解决问题。后面实操部分两套代码都会给。
3.3 Redaction应用后会留下什么
apply_redactions执行完之后,目标区域内的文字绘制指令被移除,同时页面内容流会做一次清理和重写。如果这个区域内有图像,默认情况下也会被一并删除(可以调整参数保留或只删除图像)。区域本身会被填充成你指定的颜色。
这里有个容易被忽视的细节:Redaction不会把该区域“挖空”,渲染后它就是一块纯色。所以如果你删的是正文中的一句话,页面会留下一块白底,而其他文字位置不变。还有一点,Redaction处理的是页面内容流,不会影响其他页面的内容,这一点也符合“删除某一页中的文字”的需求定位。
4. 核心实操:给“删除某页文字”写一个能直接用的脚本
环境准备很简单,只需要一个库。我建议在虚拟环境里操作,避免污染系统Python环境。
4.1 安装与基本环境检查
打开终端,执行:
bash复制pip install pymupdf
安装完成后,用下面的代码确认一下版本,并顺手检查当前PDF能不能正常打开:
python复制import fitz # PyMuPDF 的导入模块名是 fitz
print(fitz.__doc__)
这里有个历史遗留问题要说明:PyMuPDF安装包的名字是pymupdf,但导入模块名一直是fitz。网上很多老教程写import fitz,新接触的人容易困惑,其实两者是同一个东西。新版PyMuPDF(1.24.0+)也支持import pymupdf的写法,但为了兼容老代码,社区普遍还是用import fitz。
4.2 按文字内容删除:先定位再删
假设你有一份PDF,需要删除第5页中出现的所有“仅内部参考”这几个字。完整脚本如下:
python复制import fitz
def delete_text_on_page(pdf_path, output_path, page_index, keywords):
"""
删除指定页面中的指定关键词文字
:param pdf_path: 输入PDF路径
:param output_path: 输出PDF路径
:param page_index: 页码,从0开始
:param keywords: 关键词列表,如 ["仅内部参考", "机密"]
"""
doc = fitz.open(pdf_path)
if page_index < 0 or page_index >= len(doc):
print(f"页码 {page_index} 超出范围,文档共有 {len(doc)} 页")
doc.close()
return
page = doc[page_index]
for keyword in keywords:
# 第一步:查找关键词位置
rects = page.search_for(keyword)
if not rects:
print(f"在第 {page_index + 1} 页没有找到: {keyword}")
continue
# 第二步:为每个匹配位置添加删改标注
for rect in rects:
# 关键:fill=(1,1,1) 表示用白色填充,避免出现黑块
page.add_redact_annot(rect, fill=(1, 1, 1))
print(f"标记删除: {keyword} @ {rect}")
# 第三步:统一应用所有删改操作
page.apply_redactions()
# 保存文件
doc.save(output_path, garbage=4, deflate=True)
doc.close()
print(f"处理完成,结果已保存至: {output_path}")
if __name__ == "__main__":
delete_text_on_page(
pdf_path="input.pdf",
output_path="output.pdf",
page_index=4, # 第5页
keywords=["仅内部参考", "机密"]
)
这个脚本里有几个地方需要特别解释:
page.search_for返回的是一个矩形对象列表。如果同一个关键词在同一页出现多次,它会返回多个矩形,每个矩形对应一处文字。代码里用循环遍历,逐个添加删改标注,最后一次性apply_redactions。
为什么不是每找到一个就立即apply_redactions?因为删改操作会重写内容流,如果你频繁交替执行“查找-应用-再查找-再应用”,有概率因为内容流变化导致位置偏移,而且性能也差。正确做法是全部标记好,最后统一应用。
4.3 按区域删除:不知道文字内容也能删
有些场景下你根本不知道那行字具体是什么,双击文字只能看到一个乱码,或者干脆就是一个文本框嵌入了特殊的编码字形,search_for搜不到。这时按坐标区域删除就是兜底方案。
python复制import fitz
def delete_region_on_page(pdf_path, output_path, page_index, area_rect, fill_color=(1, 1, 1)):
"""
删除指定页面中某个矩形区域内的所有可见内容
:param area_rect: 矩形区域,格式为 (x0, y0, x1, y1)
"""
doc = fitz.open(pdf_path)
page = doc[page_index]
rect = fitz.Rect(area_rect)
page.add_redact_annot(rect, fill=fill_color)
page.apply_redactions()
doc.save(output_path, garbage=4, deflate=True)
doc.close()
print(f"已删除区域 {area_rect} 内的内容")
if __name__ == "__main__":
delete_region_on_page(
pdf_path="input.pdf",
output_path="output_region.pdf",
page_index=2,
area_rect=(100, 200, 300, 250), # 坐标以PDF点为单位,1点=1/72英寸
)
坐标怎么看?一个实用小技巧:先用page.get_text("words")把页面文字块全部打印出来,格式是(x0, y0, x1, y1, word, block_no, line_no, word_no),这样就能拿到每段文字的具体坐标。没有文本层的话,就只能肉眼量了,一般PDF查看器里显示的实际尺寸,和PDF坐标基本是1:1的对应关系。
4.4 批处理:多页关键词一次删干净
标题是“某一页”,但实际项目中,我经常遇到的是“某几页里都有这个词,都要删”。扩展逻辑很简单,把页码参数改成页码范围:
python复制import fitz
def delete_text_on_pages(pdf_path, output_path, page_list, keywords):
doc = fitz.open(pdf_path)
for page_index in page_list:
if page_index < 0 or page_index >= len(doc):
print(f"跳过越界页码: {page_index}")
continue
page = doc[page_index]
for keyword in keywords:
for rect in page.search_for(keyword):
page.add_redact_annot(rect, fill=(1, 1, 1))
page.apply_redactions()
print(f"第 {page_index + 1} 页处理完成")
doc.save(output_path, garbage=4, deflate=True)
doc.close()
凡是涉及逐页操作,我强烈建议在循环里打日志,把每页处理结果标注出来。原因无他:PDF页面多的时候,你以为处理了第5页,其实脚本里的索引是从0开始的,第5页对应page_index=4,这个错我犯过不止一次。所以写个直观的页码打印,能在调试时省下大量时间。
5. 实际运行中踩过的坑和应对方法
代码看起来简单,但从“能跑”到“稳定跑对”,中间隔着一些我踩过的坑。逐个列出来,供后面的人参考。
5.1 搜索到的文字“删不干净”的几种情况
第一种情况是文字被跨行拆分。search_for默认是精确匹配字符串,如果一句话在PDF里因为排版原因被分成了两行,搜索完整句子就找不到。解决办法是拆成短关键词,分别搜索并标记。比如“请于2024年12月31日前提交申请表”,分成“2024年12月31日”和“提交申请表”两段分别删。
第二种情况是同一个词有全角半角、空格差异。你搜的是“内部参考”,PDF里可能是“内部 参考”或者“内部参考 ”(带个尾随空格)。稳妥做法是对关键词做归一化处理:把英文标点转中文标点、去掉首尾空格后再逐个试。不过在搜索之前并不知道PDF原文怎么存,最实际的办法就是多个关键词变体都试一遍:
python复制keywords_variants = ["内部参考", "内部 参考", "内部\t参考", "internal use only", "INTERNAL USE ONLY"]
第三种情况是文字被做过透明或叠放处理。有些PDF在文字上方叠加了一层图形或蒙版,Redaction虽然删了文字,但图形还在,视觉上依然能看到一个色块。这种时候就需要用区域删除方案,把该区域整体清空,包括图形、图像。
还有一点非常容易踩:执行完apply_redactions之后再去搜索关键词,发现还是在。原因多半是你搜到了另一个页面上的相同文字,或者这个页面里文字被拆分成了多个span,而你只删了其中一部分。我的验证方式很直接:保存后重新打开PDF,用page.get_text()提取整页文本,再看目标词是否还在。
5.2 保存文件的两个重要细节
PyMuPDF的save方法参数很多,但有两个参数我几乎是必开的:garbage=4和deflate=True。
garbage是垃圾回收级别,级别越高,清理越彻底。对于Redaction操作,内容流已经被重写过,建议用garbage=4,它可以清除未引用的对象、冗余数据,让输出文件更干净。deflate=True则是对内容流进行压缩,减小文件体积。
另一点,Redaction操作后的文件,不建议用“增量保存”覆盖原文件。PyMuPDF支持incremental=True的增量保存模式,速度快,但增量保存保留了原始版本信息,理论上存在被恢复的可能。既然目的是删除敏感文字,那增量保存就违背了初衷。我的习惯是生成新文件,原文件另存备份。
5.3 扫描件没有文本层的处理思路
这个话题得单独说。扫描件、拍照件这类PDF,本质上就是一张图片装进了PDF外壳,里面根本没有文本层。你对它做任何文字搜索都是白搭,search_for肯定找不到,get_text()提取出来也是空。
遇到这种文件,第一选择是考虑是否真的需要“删除文字”。如果只需要把图片上某个区域的文字盖掉,那可以直接用图像处理库——把PDF页面渲染成高分辨率图片,用Pillow画个白色矩形,再保存为新PDF。
python复制import fitz
from PIL import Image
# 渲染PDF页面为图片
doc = fitz.open("scan.pdf")
page = doc[0]
pix = page.get_pixmap(dpi=200)
pix.save("page.png")
# 用Pillow在指定区域画白色矩形
img = Image.open("page.png")
# 注意:图像坐标与PDF坐标需要换算,dpi=200时像素=点*200/72
这个方法说白了还是视觉覆盖,但对于纯图片文件,它已经是实际意义上最有效的“删除”了,因为图片里根本没有可提取的文字对象。另一种思路是先OCR识别文字位置,再用Redaction区域删除,但因为OCR本身就有误差,我不推荐作为通用方案。
6. 更进一步:从“删文字”到“PDF文字清理”的完整思路
掌握前面的基本操作后,可以往两个方向扩展:一是去掉整个文本层,二是把关键词脱敏做得更智能。
6.1 如何移除PDF里的整个文本层
我做一个扩展,解决“双层PDF”场景。所谓双层PDF,就是底层是一张扫描图像,上层是OCR软件叠加的透明文字层,方便搜索和复制。但有时候你希望把它还原成纯图片版本,防止别人复制文字。用PyMuPDF可以这么做:
python复制import fitz
def strip_text_layer(pdf_path, output_path, dpi=200):
doc = fitz.open(pdf_path)
new_doc = fitz.open()
for page in doc:
# 将原页面渲染成位图
pix = page.get_pixmap(dpi=dpi)
img_data = pix.tobytes("png")
# 创建新页面,尺寸保持与原页面一致
new_page = new_doc.new_page(width=page.rect.width, height=page.rect.height)
new_page.insert_image(page.rect, stream=img_data)
new_doc.save(output_path, garbage=4, deflate=True)
new_doc.close()
doc.close()
注意,这个方法相当于把每个页面变成图片,文件体积会明显增大,而且文字不再可搜索。如果只是想去掉某几页的文字层,只对目标页执行这个操作,其他页面保持不变,可以自行裁剪代码。dpi的选择要权衡:200dpi能满足常规阅读,300dpi更清晰但文件更大。
这个方法还能用来“归档”:把带批注、带链接的PDF清理成纯展示版本,防止他人顺藤摸瓜跳转到外部资源。
6.2 结合正则表达式批量脱敏敏感信息
最后一个进阶用法,也是我自己项目里最常用的:用正则找敏感信息,再用Redaction删掉。比如批量删除PDF里的手机号、身份证号。
思路是用page.get_text("dict")获取页面文字块的详细信息,包括每个span的文本和坐标,然后用正则匹配,找到匹配的span位置并标记。
python复制import fitz
import re
def redact_pattern(pdf_path, output_path, pattern):
doc = fitz.open(pdf_path)
regex = re.compile(pattern)
for page in doc:
page_rects = []
data = page.get_text("dict")
for block in data["blocks"]:
if "lines" not in block:
continue
for line in block["lines"]:
for span in line["spans"]:
text = span["text"]
if regex.search(text):
# 用span的bbox作为删除区域
bbox = fitz.Rect(span["bbox"])
page_rects.append(bbox)
for rect in page_rects:
page.add_redact_annot(rect, fill=(0, 0, 0)) # 涂黑
page.apply_redactions()
if page_rects:
print(f"第 {page.number + 1} 页处理了 {len(page_rects)} 处")
doc.save(output_path, garbage=4, deflate=True)
doc.close()
# 示例:批量涂黑手机号
redact_pattern("input.pdf", "output.pdf", r"1[3-9]\d{9}")
这里用fill=(0,0,0)黑色填充,脱敏文档用黑条是行业惯例。如果你希望是白底,改成(1,1,1)即可。get_text("dict")的优势是能拿到每个span的精确边界,和search_for返回的矩形相比,它对单行中的片段级匹配更灵活。
在我实际跑过的文件里,这个方法能一次性处理几百页PDF,把匹配到的电话、邮箱全部涂黑,不需要人工干预。当然了,正则精度要自己把控,别把正常数字也误删了。
做这类操作,我的个人建议是始终保留原始文件备份,因为Redaction是不可逆的。先复制一份再处理,哪怕处理完发现误删,也能一键还原。另外,处理完务必用阅读器打开检查一遍,重点看有没有残留的选中文本、有没有区域变成黑块的意外情况。PDF处理这件事,代码能跑通只是第一步,结果符合预期才算真正完成。
