每天跟PDF打交道是躲不掉的事:写方案要导出PDF,看论文要打开PDF,收合同要确认PDF,连网页想留个存档也得转成PDF。偏偏这个格式又很特殊,看起来是个标准文档,实际想改个字符都费劲,所以大家才会到处搜“PDF编辑器”“PDF转Word”“PDF转Excel”。我自己也在这上面踩过不少坑,曾经为了把一个扫描合同转成可编辑Word,在线转换网站上传了三次都失败,后来才意识到问题不在工具,而在于我没搞清楚PDF到底分几种类型。
今天这篇不打算推荐某一款“神器”就收工,而是把我在实践中沉淀下来的完整处理思路写出来:怎么判断自己需要哪些PDF功能、主工具怎么选、高频操作有哪些细节坑、碰到“正在准备用于阅读”“网页PDF下载不了”这类问题怎么解,以及最后再用Python脚本解决一批重复劳动。不管你是办公室文员、学生、工程师还是自由职业者,这篇文章的很多方法都能直接套用。
1. 别急着装软件,先盘点你的PDF需求长什么样
很多朋友上来就问“哪个PDF工具最好用”,这个问题本身就有问题。PDF需求差异太大了,一个天天审合同的人和一个天天做标书的人,需要的功能完全不在一个维度。先花五分钟搞清楚自己要什么,再去选工具,效率翻倍。
1.1 高频PDF需求到底有哪些
我习惯把日常需求分成五类,每一类对应的功能和工具侧重点都不一样。
| 需求类型 | 典型场景 | 对应核心功能 |
|---|---|---|
| 阅读批注 | 看论文、审合同、写读书笔记 | 高亮、注释、签名、书签 |
| 格式转换 | 报告复用、数据提取、素材收集 | 转Word、转Excel、转PPT、转图片 |
| 页面操作 | 标书整理、讲义合并、资料归档 | 合并、拆分、旋转、删除页、加页码 |
| 内容修复 | 扫描件归档、老书重排、邮件压缩 | OCR识别、压缩体积、修复损坏 |
| 输出打印 | 网页保存、工程图纸打印、特定纸张输出 | 打印为PDF、自定义纸张尺寸 |
这么一分就清楚了:你需要的可能只是“阅读批注”,那轻量级阅读器就够了;但如果你经常要把PDF里的表格抠出来做Excel,那转换保真度就是第一指标;如果你整天处理扫描合同,OCR能力才是核心。
还有个容易被忽略的点是“频率”。偶尔一次的需求,可以交给在线网站;高频重复的需求,必须落到本地软件或脚本上。我见过有人为了省事,每个月把几十份敏感合同传到在线转换网站,且不说隐私风险,光是上传下载的时间就够喝一壶了。
1.2 主工具怎么选:本地优先、按场景打分
经常有人问我“搜狗PDF编辑器到底好不好用”“某某编辑器是不是智商税”,我一贯的回复是:别问,试。装上之后拿同一个文件跑三个任务——转Word、OCR识别、加页码,十分钟就知道适不适合你。真正值得关注的评判维度其实很固定。
- 转换保真度:转出来的Word有没有乱码、表格是否错位、图片是否丢失。这是最硬核的指标。
- 中文OCR识别率:如果你处理的是中文扫描件,识别率直接决定你要不要返工。
- 编辑是否顺手:能不能直接改文字、插图片、加链接,还是只能像盖章一样盖注释。
- 批量处理能力:一次性处理几十个文件时,有没有批量操作入口。
- 隐私与授权模式:优先本地处理,敏感文件别走在线;再看是买断还是订阅,算一下长期成本。
我的主力方案是“一个综合型桌面PDF编辑器 + 一到两个专项工具”。综合型工具用来覆盖阅读、批注、转换、编辑、合并等日常操作,类似Adobe Acrobat、福昕PDF、PDFelement、WPS PDF这类都可以;专项工具则根据自己最痛的点选,比如某个OCR引擎识别率特别高,或者某个压缩工具对小文件优化特别好。
这里要给个忠告:不要迷信“一个软件解决所有问题”的广告词。成熟的做法是选定一个主力软件把80%需求固定在它上面,剩下20%用脚本或专用工具补位。这样既不会频繁切换工具,又不会被单一软件绑架。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 从转换到编辑:几个最常用功能拆开讲透
这一章是全文的实操核心。我把日常最高频的功能逐一拆开,每个都讲清楚“为什么要这么做”和“实际怎么做”。
2.1 PDF转Word/Excel:文字版和扫描版是完全两种玩法
处理PDF转Word,首先要做的一件事是判断这个PDF是“文字版”还是“扫描版”。文字版PDF里的每个字都是可选的,能复制、能搜索,转换时只需要重新排版;扫描版PDF本质上是一张张图片,字是在图里的,必须先经过OCR识别,否则你拿什么工具转Word都是徒劳。
判断方法很简单:用阅读器打开PDF,用鼠标拖选一段文字,如果能选中,就是文字版;如果只能框出一个矩形,连字都选不了,那就是扫描版。
文字版转Word,操作时注意选择“可编辑文本”模式,而不是“图片模式”。导出后要重点检查三件事:标题层级是否保留、表格线是否对齐、图片是否跑位。我实测下来,绝大多数工具在转简单排版文档时问题不大,但遇到多栏论文或复杂表格时,多多少少会出bug,这时候别急着删掉原PDF,对照着修版效率反而更高。
扫描版转Word,顺序必须是“先OCR再转换”。工具里一般叫“OCR识别”或“光学字符识别”,语言要选中文,输出格式选“可搜索PDF”或直接选Word。这里有个实用技巧:扫描分辨率低于200DPI时,OCR识别率会明显下降,最好保证300DPI以上;如果原图是歪的,先用工具的“倾斜纠正”功能摆正,再识别。
转Excel的场景稍微特殊。PDF里的表格结构不一定规整,合并单元格、单元格边框、跨页表头在转换时是最容易翻车的三个位置。转换后我一般会在Excel里做一次“边框修复”和“列宽适配”,别指望一键生成完美表格。如果表格是图片形式的,同样先OCR。
2.2 编辑、加目录、加水印:哪些能改哪些不能改
很多人以为PDF一旦生成就不能改,其实不是。现代PDF编辑器可以直接修改文字内容、字体颜色、图片位置,只是没有Word那么自由。而且很多扫描版PDF本质是图片,文字根本不存在,这种就不要硬改,要么OCR之后重新生成,要么通过覆盖注释来“造假性修改”。
直接改文字时要注意字体问题。如果原PDF用的字体没有嵌入,你新打的字可能跟原文字体不一致,看起来格格不入。解决办法是在编辑器中把新文字设置为同款字体,如果系统没有这个字体,就选一个观感接近的替代字体。
加目录是PDF处理里被问到非常多的一项。很多人拿到一本几百页的电子书或项目文档,想加一个带页码的目录,操作其实分两步:第一步,在阅读器左侧的书签面板里给关键章节添加书签;第二步,在PDF编辑器里插入一个新的目录页,把各章节标题和页码列出来,并给每个条目加上跳转链接。如果你用的工具支持“从书签生成目录”,一键就能搞定。
加水印和页眉页脚也属于高频操作。标书里经常要加“机密”“内部资料”之类的水印,工具里一般都有“添加水印”功能,可以设置文字内容、透明度、角度和出现范围。我建议透明度设置在20%到40%之间,太浓会遮挡正文,太淡又起不到作用。
2.3 合并、拆分、压缩:处理大文件的基本功
合并PDF最常见的坑是顺序搞错。几十个附件合并成一份标书时,只要顺序乱了,全部白做。我的习惯是:在文件夹里先把文件名改成“01_封面”“02_目录”“03_正文”这样的格式,再拖进合并工具,这样即使工具显示顺序和你预期不一致,也能通过文件名迅速发现。
拆分PDF则要看清是按“页”拆还是按“范围”拆。比如合同只需要把某一页发给对方,直接输入页码范围即可;如果要把一本教材按章节拆成多个独立文件,很多编辑器支持按书签拆分,比手动一页页挑高效得多。拆分之后记得检查每个文件的首页是否完整,有时工具会把页边距裁掉一点。
压缩PDF的核心是搞清楚体积大在哪。据我观察,90%的“庞大”PDF都是因为嵌入了高分辨率图片。压缩时优先把图片分辨率降到150DPI或200DPI,再把多余字体子集化,效果立竿见影。但注意,打印用的PDF不要压得太狠,否则印刷出来全是马赛克。如果是几百MB的超大文件,在线工具往往直接超限,建议用本地工具或命令行工具处理。
2.4 扫描件OCR:让“图片版PDF”变成可搜索文字
OCR(光学字符识别)是个很神奇的技术,简单说就是把图片里的文字“认出来”并变成可复制的字符。我最早接触OCR是为了把一堆老合同归档,几百页扫描件如果靠人工录入,得崩溃;用OCR跑一遍,瞬间就能全文搜索关键字了。
使用OCR时有几个提高识别率的关键点:
- 原始图像要清晰,300DPI是起步线,手指按住的阴影、黑边、歪斜都会影响识别。
- 先用工具做“透视纠正”或“倾斜纠正”,让文字行保持水平。
- 语言包一定要选对。中文PDF就选“简体中文”,如果夹杂英文,就勾选“中文+英文”混合模式。
- 识别后别急着转Word,先在“可搜索PDF”模式下抽查几页,确认姓名、数字、金额这类关键信息没错。
OCR的识别引擎决定了上限。现在主流PDF编辑器和专业OCR软件都自带识别引擎,中文识别率已经不差,但遇到古文、公式、手写体,还是会翻车。如果你处理的是专业领域材料,建议先拿小样测一下再铺开跑。
3. 一单实操走一遍:从扫描合同到可编辑Word
理论讲再多,不如完整走一遍流程。这一章我用一个真实场景串联:手上有一份扫描版合同PDF,客户要Word版,怎么把它处理得又快又干净。
3.1 前期准备:扫描质量和文件清理
先把合同页扫描成PDF,这一步质量直接决定后面好不好做。我一般用扫描仪或手机扫描App,分辨率设成300DPI,颜色模式选灰度或彩色。黑白模式下,如果公章是红色的,扫描出来会变成黑色,后续识别容易把印章区域的内容搞乱。
扫描完成后,打开PDF检查一遍,把歪斜页面转正,把空白页删掉,把方向颠倒的页面旋转回来。很多工具支持“自动清理页面”功能,可以一键去掉黑边、空白页和颠倒页。这一步别偷懒,前期清理越干净,OCR识别越省心。
3.2 OCR识别与导出Word
打开PDF编辑器,找到“OCR识别”功能,语言选“简体中文”,输出格式选“可搜索PDF”或者直接选“Word文档”。我习惯先输出“可搜索PDF”,因为这样能保留原始版面的视觉样式,检查识别效果也直观。
如果你的工具支持“OCR并导出为Word”,直接一次性完成当然更省事,但要注意:导出后的Word里,段落顺序可能会出现错乱,尤其是多栏版式或带表格的合同。遇到这种情况,先在可搜索PDF模式下抽查关键页,确认识别无误,再导出Word。
这里有个小细节:OCR识别耗时较长时,不要一直在软件前台盯着,把输出目录设置好,让它后台跑就行。如果文件页数超过五十页,建议拆成几段分别识别,不容易中途报错。
3.3 版面修复的常规操作
OCR识别出的Word文档,后续修复工作往往比识别本身更费时间。常见的修复项包括:标题字号不统一、表格线断裂、正文段落缩进错乱、图片位置偏移。
我的修复顺序是:先处理页面设置(纸张大小、页边距),再统一各级标题的格式,接着检查表格和图片,最后重新插入页码。如果只是给客户提供内容可编辑的版本,版式修复做到“干净、能看”即可,不需要纠结到像素级。
实在修复不回来的复杂版面,有一个投机取巧的办法:保留PDF作为原始依据,Word里只保留正文文字,用“文本型”方式交付。客户要的是可编辑内容,不一定要100%复刻原版式。
3.4 批量处理:几十个文件怎么一次解决
如果手头不是一份合同,而是几十份扫描件要同时转Word,逐个人工操作会非常痛苦。综合型PDF编辑器一般都有“批量工具”或“动作向导”,可以把“OCR识别+导出Word”固定成一个动作,然后一次导入多个PDF文件批量执行。
批量处理的效率提升非常明显,但有几个坑要提前规避:一是所有文件的语言要统一,避免自动检测时混用;二是输出文件名最好设置带规则的前缀,比如“原文件名_OCR”,否则一堆自动生成的Word文件根本分不清谁是谁;三是批量处理前先抽样测试两个文件,确认参数没问题再全量跑。
如果你的批量需求特别复杂,比如需要按目录结构拆分、按页数重命名、提取图片后自动压缩,那就别在图形界面里折腾了,直接去第5章用Python脚本解决。
4. 高频问题排查与避坑实录
这一章整理的是我真实遇到过、被问到过的问题。很多问题百度一搜有人提,但几乎没人讲透,我在这里把原因和解决方案一次说清。
4.1 打开PDF总提示“正在准备用于阅读”怎么解
不少朋友遇到过这种情况:用PDF阅读器打开某个文件,底部状态栏一直显示“正在准备用于阅读”或“正在准备以阅读”,然后半天没反应。这通常不是文件损坏,而是PDF包含了“首次查看初始化”相关结构,阅读器每次打开都要重建视图信息。
解决办法有几个,按优先级从高到低试:
- 用PDF编辑器打开这个文件,执行“另存为”,另存时选择“优化PDF”或“减小文件大小”,重新保存后,初始化信息一般会被清除。
- 在阅读器首选项里关闭“允许快速Web查看”或“恢复上次查看的视图”相关选项。
- 换个阅读器试试,如果其他阅读器正常,说明就是原阅读器兼容性问题。
我还见过一种情况:文件本身是在某个专业软件里导出的,带了特殊的注释或书签,导致阅读器初始化较慢。这种情况下,用编辑器删掉多余书签和注释,也会改善。
4.2 网页里的PDF怎么下载
网页里预览PDF时想下载,但页面上偏偏没有下载按钮,这个需求我每个月都能遇到。其实有几个通用办法。
最稳妥的是用浏览器菜单打印:按Ctrl+P,在目标打印机里选择“另存为PDF”,就能把当前预览页面存成一个新PDF。不过这种方法会把页面上的工具栏、边栏也一起打进去,通常需要先在打印预览里勾选“背景图形”,并把边距调成“无”。
技术流一点的方法是按F12打开开发者工具,切到“网络”标签,刷新页面,然后在类型里筛选“pdf”,找到那个.pdf资源,右键点击“在新标签页中打开”,浏览器就会直接展示并允许下载。
还有一种场景是网页PDF不是单独文件,而是逐页图片拼成的“伪PDF”。这种最省事的办法就是逐页截图,或者用浏览器打印功能把所有页面连续打印成PDF。虽然效率低,但胜在简单。
4.3 Microsoft Print to PDF如何添加自定义纸张尺寸
Windows自带的“Microsoft Print to PDF”非常好用,很多工程图纸、网页打印都靠它。但默认纸张只有A4、Letter等标准尺寸,想输出一个自定义宽高的PDF,比如80mm×50mm的标签,怎么加呢?
步骤其实不复杂:
- 按下快捷键
Win + R,输入printui /s,回车,打开“打印服务器属性”窗口。 - 切换到“表单”选项卡,勾选“创建新表单”。
- 在“表单名称”里输入一个容易识别的名字,比如“标签80x50”。
- 在“单位”里选择公制或英制,并填写宽度和高度,注意勾选“公制”后输入的是厘米或毫米。
- 点击“保存表单”,关闭窗口。
设置完成后,在任意软件里按Ctrl+P调出打印对话框,选择“Microsoft Print to PDF”作为打印机,再进入“打印首选项”或“高级”设置,在“纸张规格”里就能找到刚才创建的“标签80x50”,选中它再打印,生成的PDF就是自定义尺寸。
提示:创建表单时需要管理员权限,普通用户可能无法保存。另外,表单名不要和系统预设名称重复,否则会被拒绝。
4.4 中文字体缺失导致PDF乱码怎么办
打开一个PDF,发现中文全部显示成方块、问号或者乱码,这也是高频问题。原因是PDF里没有嵌入字体,而你的电脑里又没有安装对应的中文字体。
遇到这种情况,可以先看乱码是什么类型:如果是整个文档所有中文都变成方框,那是字体完全缺失;如果只是某些特殊字符显示为问号,那是字符映射缺失。
最简单的解决方法是给系统装上对应的中文字体。常见的PDF中文字体有“思源黑体”“思源宋体”“微软雅黑”“宋体”等,装齐这些基本能覆盖大多数情况。如果不想装字体,还可以用PDF编辑器把缺失字体“替换”成系统已有字体,或者对页面执行“转曲”,让文字变成轮廓,彻底避免依赖字体。
反过来说,如果你自己生成PDF时想避免别人乱码,最好在导出时勾选“嵌入所有字体”。这个选项在Word、WPS、LaTeX里都有,默认不一定打开,需要手动设置。
4.5 取消夸克默认打开PDF的方式
手机上下载了夸克浏览器或夸克网盘,之后点击PDF文件,总是默认用夸克打开,想换回其他阅读器却不知道怎么改。这个问题的核心是“默认应用”设置。
安卓手机通用做法是:打开系统“设置”,找到“应用管理”或“应用”,在应用列表里找到“夸克”,点击“打开支持的文件”或“默认打开”,找到PDF文件类型,取消勾选。部分手机在“设置→应用→默认应用→打开链接”里,也能对具体文件类型做调整。
如果手机支持“文件管理”,也可以在文件管理器里找到PDF文件,长按它,选择“打开方式”,再选择你想要的阅读器,并勾选“始终使用此应用打开”。这样下次点击PDF就不会再走夸克了。
桌面端夸克浏览器类似的逻辑:在浏览器设置里找到“下载设置”或“文件类型关联”,把PDF关联改为其他阅读器即可。如果你用的不是夸克,而是其他App抢占默认PDF,方法都一样,去系统默认应用设置里改就行。
4.6 PDF对比工具怎么选
经常写合同、改方案的朋友,免不了要比对两个版本之间的差异。PDF对比工具有两类:一类是文本层比对,只看文字差异;另一类是视觉比对,直接把两页并排或叠加显示差异区域。
Adobe Acrobat Pro自带的“比较文件”功能属于比较成熟的方案,可以细粒度选择“按字符”或“按单词”比对,生成的结果里会标出新增、删除和修改的位置。Beyond Compare也支持PDF文本比较,适合快速看内容变化。在线对比工具使用方便,但敏感文件不建议上传。
对比时有个容易误判的场景:如果两个PDF一个是Word转的,一个是扫描件,或者是不同字体渲染的,比对结果会出现大量“假差异”。所以比对前尽量保证两个文件“同源”——同一个导出软件、同一套字体,再做对比才有参考价值。
5. 进阶:用Python批量处理PDF
到了这一章,说明你已经不满足于在图形界面里一个个点按钮了。当面对几十上百个PDF要重命名、拆分、提取图片、加水印时,脚本能比手动操作快一个数量级。Python是处理这类任务最顺手的语言之一。
5.1 常用Python PDF库怎么分工
Python处理PDF的库很多,每个库的定位和强项不一样,先把分工搞清楚,再根据任务选库。
| 库名 | 主要能力 | 适合场景 |
|---|---|---|
| pypdf(原PyPDF2) | 读取、合并、拆分、加密、旋转页面 | 页面级别操作 |
| PyMuPDF(fitz) | 高性能解析、提取图片和文本、渲染页面 | 提取图片、大量文档处理 |
| pdfplumber | 精细提取文本、表格,保留坐标信息 | 表格提取、文本解析 |
| pdf2image | 将PDF页面转换为图片 | 预览、OCR前置处理 |
| reportlab | 从零创建PDF | 生成报表、发票 |
我的经验是:页面合并拆分优先用pypdf,因为它API简单稳定;需要提取图片或快速解析内容时用PyMuPDF,它的速度比逐页渲染快得多;处理表格数据时,pdfplumber是神器,能按坐标取单元格内容。
安装这些库非常方便,一行命令搞定:
bash复制pip install pypdf PyMuPDF pdfplumber pdf2image reportlab
提示:pypdf是新版的包名,旧代码里常见的PyPDF2已经逐步迁移,新项目建议直接用pypdf。
5.2 提取PDF中的全部图片
需要把PDF里所有图片批量导出时,手动右键保存一个个图片太慢了,尤其PDF里图片还被剪裁、旋转过的时候,手动操作很容易出问题。用PyMuPDF可以直接深入到PDF对象级别把原始图片导出。
下面这段代码可以提取PDF每一页上的所有图片,并按页码保存:
python复制import fitz # PyMuPDF
doc = fitz.open("input.pdf")
for page_no in range(len(doc)):
page = doc[page_no]
images = page.get_images(full=True)
if not images:
continue
for img_index, img in enumerate(images):
xref = img[0]
base_image = doc.extract_image(xref)
image_bytes = base_image["image"]
image_ext = base_image["ext"] # png/jpeg等格式
filename = f"page{page_no+1}_img{img_index+1}.{image_ext}"
with open(filename, "wb") as f:
f.write(image_bytes)
print(f"已保存:{filename},大小:{len(image_bytes)} 字节")
doc.close()
这段代码的思路很简单:遍历每一页,调用get_images(full=True)拿到该页所有图片引用,然后用extract_image把图片原始字节取出来,最后写入文件。extract_image返回的ext字段能告诉你它是PNG还是JPEG,直接当扩展名用即可。
为什么推荐用PyMuPDF而不用其他库?因为它是C库绑定,解析速度很快,而且对图片对象的提取非常直接,不需要先把页面渲染成图再裁剪。实测一个100页的PDF,提取全部图片一般在几秒内完成。
如果你发现提取出来的图片尺寸比显示出来的要小很多,这是因为PDF里有些图片被放大显示但实际分辨率很低,或者是分块存储的。这种情况只能通过渲染页面来获得完整视觉效果,这时可以把页面渲染成高分辨率PNG再裁剪。
5.3 拆分与合并PDF脚本
用pypdf处理页面级别的拆分合并,代码量非常小。比如要把一个PDF的第3页到第6页单独拆出来保存成一个文件:
python复制from pypdf import PdfReader, PdfWriter
reader = PdfReader("input.pdf")
writer = PdfWriter()
# 注意:页码从0开始,所以第3页对应索引2,第6页对应索引5
for i in range(2, 6):
writer.add_page(reader.pages[i])
with open("split_pages.pdf", "wb") as f:
writer.write(f)
print("拆分完成,共", len(writer.pages), "页")
合并多个PDF也一样简单,核心就是逐个读取文件,再不断往同一个writer里加页面:
python复制from pypdf import PdfReader, PdfWriter
writer = PdfWriter()
pdf_files = ["file1.pdf", "file2.pdf", "file3.pdf"]
for filename in pdf_files:
reader = PdfReader(filename)
for page in reader.pages:
writer.add_page(page)
with open("merged.pdf", "wb") as f:
writer.write(f)
print("合并完成,总页数:", len(writer.pages))
这两个脚本的实用价值在于可以放进循环里配合批量任务使用。比如你批量下载了一批PDF,每个文件名都带日期,想按日期范围拆分成不同批次,用脚本处理比手动操作可靠得多。
页面索引从0开始是个容易弄混的点。如果你要取第1页,索引是0;要取第10页,索引是9。写代码前先在脑里换算清楚,或者用len(reader.pages)打印总页数确认范围。
5.4 用脚本批量转Word的现实与局限
很多读者可能最希望的是“用Python一键把PDF转成Word”,这个需求听起来很美,但现实中我会劝你降低预期。纯Python的免费库对复杂版式PDF转Word的支持并不理想,生成出来的Word往往版面错乱,比图形界面的综合工具差很多。
原因在于PDF转Word本质上是“逆向排版”,需要解析PDF的文本块、图片、表格位置关系,再映射回Word的段落流和表格结构。排版稍微复杂一点,纯算法就很难还原。
如果确实要走脚本路线,我的建议是:
- 先判断PDF是文字版还是扫描版。
- 文字版PDF,可以用PyMuPDF或pdfplumber提取文本和坐标信息,再用python-docx按段落重新组织成Word。适合纯文本、结构简单的文档。
- 扫描版PDF,先渲染成图片,再调用OCR引擎(如Tesseract)识别文字,最后生成Word。识别速度慢,且版式基本不可能完美复原。
- 对复杂版式,直接调用装好的综合PDF编辑器命令行接口,或者用“LibreOffice命令行转换”,效果会稳定得多。
所以我的个人结论是:脚本批量转Word适合“内容提取”而非“版式复刻”。如果你的目标只是把PDF里的文字变成可编辑内容,脚本很高效;但如果客户要求Word和原PDF长得几乎一样,那就老老实实打开综合型PDF编辑器,用GUI操作吧。
最后再分享一个我反复强调的个人习惯:处理任何PDF之前,先花30秒分辨它到底是文字版还是扫描版。这一步想清楚,后面选什么工具、用什么参数、会遇到什么坑,基本都有数了。希望上面这些从工具选型到脚本批量的经验,能帮你在面对“PDF处理”这个千古难题时,少走点弯路。
