最近在搞手写笔记电子化这个事,说大不大,说小也不小。手写笔记拍成照片,识别成电子文字,再按段落拆好,最后放进 Word 里能直接编辑——听起来就是“拍照转文字”嘛,但真做起来你会发现,市面上能“把字认出来”的工具一大堆,能做到“按段落拆分、导入文档还不乱”的,确实不多。这篇我把自己从选型到落地的完整过程写下来,包括 OCR 引擎怎么选、段落拆分怎么做、代码怎么写、踩过哪些坑,希望能给正在做类似需求的朋友省点时间。
1. 需求拆解:从一张照片到一份可编辑文档
1.1 手写笔记识别的三个隐性难点
先说一个容易被忽视的事实:手写笔记识别的难点,从来不在“认字”这一步。
很多人第一次接触 OCR(Optical Character Recognition,光学字符识别)时,以为装个库、调个接口就能把图片里的字全提出来。但真把手写笔记扔进去,问题就接踵而至。手写识别有三个非常现实的门槛:
第一个是字形差异。每个人的字迹都不一样,连笔、简写、涂改、错字,甚至同一个字在不同人笔下完全是两种形态。这跟印刷体识别完全不是一回事。印刷体是“标准答案”,模型见得多、训练数据足;手写体是“自由发挥”,模型稍微没见过这种写法就直接翻车。
第二个是排版杂乱。手写笔记不像印刷文档那样有固定的列宽、字号、行距。写的歪了、挤了、跨行了,都是常态。有的页面还有表格、箭头、下划线、荧光笔标记,这些非纯文本元素对识别引擎的“版面理解能力”是一大考验。
第三个是输出结构。就算把所有字都认出来了,如果结果是一坨没有分段的长文本,那在文档里也基本没法用。你要的是“第一段是标题,第二段是正文,第三段是备注”,而不是一串密密麻麻的文字流。这就引出了标题里的核心词——段落拆分。
所以说,标题里这个需求其实是一条完整的流水线:拍摄 → 预处理 → 文字识别 → 版式分析 → 段落重组 → 文档导出。任何一环做得不好,结果都会大打折扣。
1.2 完整链路:四个环节缺一不可
如果把整套流程拆开,大概可以分成下面四个阶段。
- 图像预处理:把手机拍的照片做透视矫正、亮度均衡、去噪、二值化,尽量把“照片”变成“接近扫描件”的图。
- 文字识别(OCR):把图像里的文字区域检测出来,再逐个识别成字符序列。这个环节决定了识别准确率的上限。
- 段落拆分(版式分析):根据文本块的位置坐标、行间距、缩进、语义相关性,把散落的文字行合并成逻辑段落。
- 文档导入:把拆分好的段落按顺序写入 .docx/.doc 等办公文档格式,保留段落边界、换行、标题样式,做到一键导入后即可编辑。
下面我按这个顺序,把每个环节的工具选型、实现方案、参数调优和踩坑记录都展开讲。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 工具选型:OCR 引擎怎么挑
2.1 主流开源引擎横向对比
OCR 引擎这块,我在本地试过三套主流的开源方案,分别是 Tesseract、PaddleOCR 和 UMI-OCR(RapidOCR 的封装)。它们背后用的模型架构不同,实际效果差异还挺大的。
先给一张对比表,方便你快速选型:
| 引擎 | 底层模型 | 手写识别能力 | 中文支持 | 段落/版式分析 | 本地部署难度 | 适合场景 |
|---|---|---|---|---|---|---|
| Tesseract 5.x | LSTM + 传统图像处理 | 一般,需自行训练 | 中规中矩,需下载 chi_sim 语言包 | 弱,基本靠坐标硬切 | 低,安装包即用 | 印刷体、扫描件 |
| PaddleOCR(PP-OCRv4/v5) | DB 文本检测 + SVTR 识别 | 较强,自带手写模型 | 很好,中文识别率领先 | 较强,PP-Structure 可做版面分析 | 中,依赖 PaddlePaddle 框架 | 中文文档、票据、手写笔记 |
| UMI-OCR(RapidOCR) | PaddleOCR 模型转 ONNX | 较强 | 很好,复用 PaddleOCR 模型 | 有基础段落合并功能 | 低,桌面 App 开箱即用 | 日常批量识别、非程序员使用 |
我个人的建议是:如果你只是想快速处理一批图片,不想写代码,直接上 UMI-OCR 的桌面版就行,它内置了 PaddleOCR 的模型转换产物,识别效果不错,还带一个“竖排/纵向阅读顺序”开关,处理特殊排版很有用。
但如果你要像我一样做“段落拆分 + 一键导入文档”这种定制化流水线,那就建议直接上 PaddleOCR,因为它的布局分析能力(PP-Structure)能直接输出文本块的位置信息,这是后续做段落合并的关键输入。
2.2 Tesseract:老牌工具但手写是短板
Tesseract 我用了挺多年,稳定、简单,pip 装一下或者下载安装包就能跑。但它对手写体的支持确实不太行。倒不是说完全认不出来,而是它对“行”和“段”的切分很粗糙,经常把相邻行的文字混在一起,或者把一个段落硬切成两块。
另外,Tesseract 的 image_to_data 输出的单词级坐标虽然可以用来做行聚类,但要自己写不少逻辑才能还原出段落结构。而且它对中文手写体的训练数据质量一般,识别率上限明显低于 PaddleOCR。
如果你确实需要用 Tesseract,记得下载 chi_sim 语言包,并且设置 --psm 4(按行识别)或 --psm 6(按统一文本块),不要用默认的 --psm 3,那个模式对排版复杂的图片会输出乱序文本。
2.3 PaddleOCR:手写识别的主选方案
PaddleOCR 是我最终选定的方案。原因很简单:它开源、支持中文、有专门的手写识别模型,而且 PP-Structure 能输出带坐标的版面分析结果。
具体来说是这么用的:
- 检测模型:
text_detection用 DB 算法,负责把图片里的文字行“框”出来,输出每个文本行的四个角点坐标。 - 识别模型:
text_recognition用 SVTR 系列模型识别框内的字符序列。PaddleOCR 提供了中文手写专用模型,效果比通用模型好不少。 - 方向分类器:
text_image_orientation负责判断文字方向,如果笔记里混有竖排内容,这个模块能先把图转正再识别。
我在实际测试里,用手机随手拍的手写课堂笔记,PaddleOCR 的手写模型识别准确率大概在 85%~95% 之间,具体取决于字迹工整程度和拍摄角度。这个准确率可能还是不够完美,但配合人工校对,已经能大幅提升整理效率了。
2.4 云端 API vs 本地模型:安全与成本的取舍
另外提一嘴云端 API。像百度 OCR(就是你热词里提到的那个 java 对接百度 OCR 的场景)、腾讯 OCR(医疗版)这类服务,识别效果一般都不错,尤其是印刷体和高清扫描件,准确率能到 99% 以上。但你得考虑两个问题:
- 数据隐私:手写笔记可能包含个人隐私、工作机密,一旦上传到云端,你没法控制数据去向。
- 长期成本:免费额度用完以后,按次计费,批量处理几百张图时成本不低。
本地模型就没有这些问题,一次部署,永久使用,断网也能跑。唯一的代价是部署环境稍微有点门槛,需要装 Python 和 PaddlePaddle。但这一步做好了,后面全自动。
3. 段落拆分:识别出“字”之后的关键一步
3.1 为什么识别出文字后还需要“按段落拆分”
这个问题我专门拿出来讲,是因为我发现很多人的 OCR 流程走到“识别出文字”就停了,结果拿到的是一整块无结构的文本,根本没法直接入文档。
实际上,段落拆分解决的是“版式信息恢复”的问题。原始笔记里,作者通过换行、缩进、空行来传达结构信息——比如标题独占一行、正文按意群分段、列表项用编号开头。但 OCR 只是把像素“翻译”成字符,它不知道这些字符之间的逻辑关系。所以我们要用坐标和规则,把结构找回来。
举一个例子。假设原始笔记是这样的:
code复制机器学习(Machine Learning)是人工智能的一个重要分支。
它研究如何让计算机从数据中自动学习规律,
并用这些规律对新数据做出预测。
常见算法包括监督学习、无监督学习和强化学习。
印刷体识别出来后,OCR 可能输出:
code复制机器学习(Machine Learning)是人工智能的一个重要分支。它研究如何让计算机从数据中自动学习规律,并用这些规律对新数据做出预测。常见算法包括监督学习、无监督学习和强化学习。
文字一个没丢,但原先的段落边界全没了。放在文档里,读者很难快速抓住重点。段落拆分要做的,就是把第二行“它研究如何……”和第三行开头合并回同一段,直到遇到真正的空行语义边界。
3.2 基于坐标的段落合并算法
PaddleOCR 检测模型输出的文本框坐标是带顺序的,每个框有 (x1, y1, x2, y2),对应左上角和右下角。我们叫它“文本行框”。
要还原段落,最朴素的思路是:按垂直方向排序,计算相邻文本行之间的垂直间距,如果间距明显小于行高,就认为是同一段;如果间距较大(比如超过平均行高的 1.5~2 倍),就认为是段落分隔。
这个思路在印刷体文档上效果很好,但在手写笔记上会出不少问题。手写笔记的行距往往不均匀,有的段落中间也有大空隙,有的段落之间挨得很近。所以纯靠间距判断不够稳。
我最终用的方案是“三层合并策略”:
- 按列聚类:先根据文本行框的左右位置判断是否存在多栏布局。手写笔记经常有“左侧正文 + 右侧批注”的情况,如果不先分栏,后续合并会把不同栏的行交错拼在一起,一塌糊涂。
- 行间距聚类:对每一栏内部,按 y 坐标排序,计算相邻行间距。然后用 K-Means 或者简单的阈值法把间距分成“段内间距”和“段间间距”两簇,以此确定段落边界。
- 语义与缩进修正:如果识别结果里包含明显的标题行(比如“一、”“1.”“摘要”开头),或者某一行开头有较大缩进(x1 明显大于所在行平均起始位置),就把它们单独划分为新段落,即使行间距没有拉开。
这三层叠加,段落的还原准确率能到 90% 以上。剩下的一些边界情况,比如手写箭头跨行标注、划删除线覆盖文字,只能靠人工微调了。
下面给一段伪代码,展示核心逻辑:
python复制def split_paragraphs(boxes, max_ratio=1.8, min_gap_px=5):
"""
boxes: list of dict, each has 'x1','y1','x2','y2','text'
return: list of paragraphs, each is list of line indexes
"""
# 1. 排序:按 y 中心坐标
boxes = sorted(boxes, key=lambda b: (b['y1'] + b['y2']) / 2)
lines = []
for box in boxes:
cy = (box['y1'] + box['y2']) / 2
h = box['y2'] - box['y1']
lines.append({'cy': cy, 'h': h, 'box': box})
# 2. 计算相邻行间距
gaps = []
for i in range(len(lines) - 1):
gap = lines[i + 1]['cy'] - lines[i]['cy']
gaps.append(gap)
# 3. 二分类:大间隔 -> 换段
avg_h = sum(l['h'] for l in lines) / max(len(lines), 1)
paragraphs = []
current = [0]
for i in range(1, len(lines)):
gap = gaps[i - 1]
if gap > max(avg_h * max_ratio, min_gap_px):
paragraphs.append(current)
current = [i]
else:
current.append(i)
paragraphs.append(current)
# 4. 缩进修正:如果某行 x1 明显大于前一行,视为新段落开头
# 具体实现略,按实际数据调阈值
return paragraphs
这段代码你在本地改改阈值,就能适配大多数手写笔记的场景。
3.3 竖排与特殊排版的应对
网络热词里有人提到 UMI-OCR 的“竖排 / 纵向阅读顺序”开关,确实是个好东西。竖排笔记在手写场景里虽然不多,但日记、古诗抄写、部分日语笔记里很常见。
PaddleOCR 的方向分类器会把竖排文字旋转成可读方向,但要注意:旋转之后,原本的“从右往左读”就变成了“从上往下读”,字符顺序是对的,但段的切分逻辑可能会乱。我的经验是:竖排笔记单独走一条分支,先检测文本方向,再决定按 x 轴还是 y 轴排序。如果手头有竖排文本,用 UMI-OCR 自带开关处理会更省心。
3.4 从“文本行”到“段落”还需要语义判断
还有一个容易被忽略的点:OCR 存在错字和断句问题。如果识别结果本身缺字错字,段落切得再好也没用。
比如原文是“机器学习是人工智能。研究如何”识别成了“机器学习是人工智。能研究如何”,语义就被截断了。这个问题靠纯几何规则解决不了,需要引入语言模型做后处理。我在脚本里加了一个可选步骤:调用一个本地运行的语言模型(比如 PaddleNLP 的文本纠错模型)给每个段落做一次“通顺性校验”,如果检测到明显的断句异常,就尝试把段落合并,或者把疑似错字标出来供人工确认。
这一步不是必须的,但对追求高质量输出的用户非常有用。毕竟整理笔记的目的不是“能读”,而是“可以直接用”。
4. 一键导入办公文档的实现
4.1 为什么选择 python-docx 而不是纯文本
段落拆分完成后,下一个问题就是如何导出。最简单的做法是输出纯文本 .txt,看起来方便,但导入 Word 后字号、行距、标题样式全部丢失,跟“可以编辑”还有距离。
我最终用的是 python-docx 库来生成 .docx 文件。它可以直接在后台创建 Word 文档、设置标题、正文样式、段落间距,不需要依赖桌面 Office 软件安装。
生成后的文档结构大致这样:
code复制一级标题:项目标题/日期
正文段落1
正文段落2
列表项1
列表项2
每一行识别文本都会被写入一个独立的 Word 段落对象,同时设置样式。这样用户拿到手,字体、字号、缩进都已经调好,直接可以继续编辑。
4.2 保留段落结构的关键设置
用 python-docx 写段落特别简单,但有几个“坑”需要提前规避。
首先,识别文本里可能包含 \n 换行符。如果直接 add_paragraph(text),换行符会被自动忽略,导致两行文字挤在一个段落里。正确做法是用 add_run 逐段写入,遇到 \n 时用 add_break() 明确添加换行。
其次,中文文档默认字体可能是宋体,实际用起来不太好看。正常办公场景一般会用“宋体 + 小四 + 1.5 倍行距”,或者“微软雅黑 + 五号 + 单倍行距”。代码里需要显式设置字体名称和字号。
第三,如果笔记里包含编号列表(比如“1. 2. 3.”),不要简单粗暴地全部写成普通段落,否则 Word 里没法快速调整缩进和编号。我建议识别完文本后,做一个正则匹配,发现行首是“数字+点/顿号”的,就用 List Paragraph 样式写入。
下面是一段核心导出代码的示例:
python复制from docx import Document
from docx.shared import Pt
from docx.enum.text import WD_LINE_SPACING
def save_paragraphs_to_docx(paragraphs, output_path):
doc = Document()
# 默认样式:宋体,小四,1.5倍行距
doc.styles['Normal'].font.name = '宋体'
doc.styles['Normal'].font.size = Pt(12)
doc.styles['Normal'].paragraph_format.line_spacing_rule = WD_LINE_SPACING.ONE_POINT_FIVE
for p in paragraphs:
# 段落标记逻辑:第一个短行作为标题
if len(p) < 30 and p.endswith(':') is False:
para = doc.add_heading(level=1)
run = para.add_run(p)
run.font.name = '微软雅黑'
run.font.size = Pt(16)
else:
para = doc.add_paragraph()
# 处理换行符
parts = p.split('\n')
for idx, part in enumerate(parts):
run = para.add_run(part)
if idx < len(parts) - 1:
run.add_break()
doc.save(output_path)
注意这里 len(p) < 30 的“标题判断”是个启发式规则,实际应用中建议用更靠谱的方式:比如检测该行是否本身就是检测模型输出的标题类型,或者是否以“第”“章”“节”等词开头。否则很容易把正文短句误判成标题。
4.3 批量处理与文件命名管理
一键导入还有一个隐含需求:批量处理。一次拍 50 张笔记照片,总不能一张一张手动导。所以我把整条流程封装成一个类,输入一个文件夹路径,输出一个合并好的 .docx 文件,中间自动完成所有图片的识别、段落拆分和文档生成。
文件命名建议带时间戳,例:笔记_20250614_上午.docx,避免覆盖。识别过程中的中间结果(每张图片的段落 JSON)也建议保留,这样后续发现问题不用重新识别一遍全图,直接改 JSON 便宜很多。
我还加了一个“人工校对标记”功能:识别置信度低于 0.8 的文本,在 Word 里用红色字体标出。这极大减少了人工复查的难度。
5. 实操流程:从零跑通一个完整例子
5.1 环境准备与依赖安装
本地跑这套流程,需要 Python 3.9 以上版本。我用的是 3.11,没遇到兼容问题。主要依赖:
bash复制pip install paddlepaddle
pip install paddleocr
pip install python-docx
pip install pillow opencv-python
如果你的机器有 NVIDIA 显卡,可以装 paddlepaddle-gpu,识别速度会快很多。没有也没关系,CPU 模式下单张图片的处理时间大概在 1~3 秒,批量处理完全够用。
5.2 图像预处理:照片质量决定识别上限
这一步经常被低估。我见过很多人把拍歪、反光、模糊的照片直接扔给 OCR,然后抱怨识别率低。其实很多识别失败都是“垃圾进,垃圾出”导致的。
我自己在预处理里做三件事:
- 透视矫正:手机拍 A4 纸笔记,必然会有一点点透视变形。用 OpenCV 的
findContours找到纸张边缘,算透视变换矩阵,把纸拉正。 - 亮度均衡:手写笔迹颜色深浅不一,纸张可能有阴影。用自适应直方图均衡化(CLAHE)提亮文字与背景的对比度。
- 去噪 + 锐化:去除拍照产生的颗粒噪点,让笔画边缘更锐利。
预处理的核心逻辑代码如下:
python复制import cv2
import numpy as np
def preprocess_image(img):
# 1. 缩放:限制最大边为 2000px,保留细节同时提速
h, w = img.shape[:2]
if max(h, w) > 2000:
scale = 2000 / max(h, w)
img = cv2.resize(img, None, fx=scale, fy=scale,
interpolation=cv2.INTER_AREA)
# 2. 转灰度 + CLAHE
gray = cv2.cvtColor(img, cv2.COLOR_BGR2GRAY)
clahe = cv2.createCLAHE(clipLimit=2.0, tileGridSize=(8, 8))
gray = clahe.apply(gray)
# 3. 去噪
gray = cv2.fastNlMeansDenoising(gray, h=30)
# 4. 锐化
kernel = np.array([[0, -1, 0], [-1, 5, -1], [0, -1, 0]])
sharpened = cv2.filter2D(gray, -1, kernel)
return sharpened
这里 fastNlMeansDenoising 的 h=30 是常见经验值,太高会把笔迹细节抹平,太低去噪不明显。
5.3 调用 PaddleOCR 做检测与识别
PaddleOCR 3.x 的 API 很简洁,官方推荐用 PaddleOCR() 初始化。下面是能跑通的完整调用代码:
python复制from paddleocr import PaddleOCR
ocr = PaddleOCR(
use_textline_orientation=True, # 自动判断文字方向
lang='ch',
ocr_version='PP-OCRv5', # 也可以换 PP-OCRv4
)
result = ocr.predict('note.jpg')
# 结果是一个 list,每项包含识别文本和坐标
for line in result:
# line['rec_texts'] 是文本列表
# line['rec_polys'] 是每个文本行的坐标
pass
PaddleOCR 3.x 的输出结构跟 2.x 有区别,2.x 返回的是 dict,3.x 返回的是 OCRResult 对象,有 text、rec_texts、rec_scores、rec_polys 等属性。如果你的代码跑不通,优先检查一下版本兼容性。
5.4 完整脚本:拍照 → 识别 → 分段 → 导出
下面把整条流水线串起来,给你一个完整的可直接修改的脚本框架。我这里省略了透视矫正的具体实现(因为不同场景的纸张定位参数差很多),但主流程是完整的:
python复制import os
from paddleocr import PaddleOCR
from docx import Document
def build_paragraphs(ocr_result, img_w):
raw_lines = []
for res in ocr_result:
texts = res['rec_texts']
polys = res['rec_polys']
for text, poly in zip(texts, polys):
xs = [p[0] for p in poly]
ys = [p[1] for p in poly]
raw_lines.append({
'text': text,
'x1': min(xs),
'y1': min(ys),
'x2': max(xs),
'y2': max(ys),
})
# 按列聚类(简化版:假设单栏)
raw_lines.sort(key=lambda line: (line['y1']))
# 行间距聚类判断段落
paragraphs = []
current = [raw_lines[0]] if raw_lines else []
for i in range(1, len(raw_lines)):
prev = raw_lines[i - 1]
curr = raw_lines[i]
gap = curr['y1'] - prev['y2']
avg_h = (prev['y2'] - prev['y1'] + curr['y2'] - curr['y1']) / 2
if gap > 0.8 * avg_h:
paragraphs.append(current)
current = []
current.append(curr)
if current:
paragraphs.append(current)
return [' '.join([l['text'] for l in p]) for p in paragraphs]
def images_to_docx(image_dir, output_path):
ocr = PaddleOCR(lang='ch')
doc = Document()
doc.add_heading('手写笔记电子化', level=0)
for fname in sorted(os.listdir(image_dir)):
if not fname.lower().endswith(('.jpg', '.jpeg', '.png')):
continue
img_path = os.path.join(image_dir, fname)
result = ocr.predict(img_path)
# 获取图片宽度,用于判断缩进
img_w = 0
paragraphs = build_paragraphs(result, img_w)
doc.add_heading(fname, level=1)
for para_text in paragraphs:
doc.add_paragraph(para_text)
doc.save(output_path)
print(f'已导出:{output_path}')
if __name__ == '__main__':
images_to_docx('./notes', './notes_output.docx')
这段代码跑通以后,基本就完成了“拍照转电子文字 + 段落拆分 + 一键导入办公文档”的整个需求。剩下的优化方向就看你的具体场景了。
5.5 参数调优:同一张图不同参数的差异实测
我在调整参数时记录了一些有意思的结果。同样是手写笔记照片,PaddleOCR 的 text_thresh(检测阈值)从默认的 0.5 调到 0.3,检测出的文本框数量会明显增多,但也会多出一些无效框;调高到 0.7,误检减少,但漏检变多。因为手写笔迹比较浅,我最后用的 0.45,算是平衡点。
还有 unclip_ratio,这个参数控制检测框向外扩展的幅度。手写笔记里笔画有连笔,检测框经常把相邻文字挤在一起,导致识别结果缺字。把 unclip_ratio 调小(从 2.0 到 1.5),能缓解一部分。
但这些参数真要调到最佳状态,得拿你自己的笔记照片反复试。我给不了统一答案,只能给个方向。
6. 踩坑记录与常见问题排查
6.1 常见问题速查表
下面是我实际运行过程中遇到过的几个高频问题,整理成表格,方便你排查:
| 问题现象 | 可能原因 | 排查与解决办法 |
|---|---|---|
| 识别结果乱序,一段跑到另一段中间 | 多栏版面未分栏 | 先做列聚类;或者把图片放大后交给 PaddleOCR 检测,看文本框的可视化结果 |
| 部分文字完全识别不出来 | 图片过暗/过亮/模糊 | 调整 CLAHE 参数;重新拍照保证光线均匀;检查是否旋转了 90 度 |
| 段落合并错误,该断的没断 | 行间距阈值设置过大 | 打印每行 y 坐标和行距,画直方图确定真实阈值,不要拍脑袋设参数 |
| 导入 Word 后字体不是中文 | python-docx 默认字体设置缺失 | 必须在 docx.styles['Normal'].font 同时设置 name 和 qname(通过 rFonts 设置东亚字体) |
| 图片多时识别速度太慢 | CPU 推理 | 换 GPU,或把图片缩小到 1600px 以内;也可以先做批量队列线程化 |
| 置信度虚高但识别错字 | 模型对连笔字的盲目自信 | 打开 rec_batch_num=1 逐行识别;或者人工校验标注错误频率 |
6.2 记一次典型的“段落错乱”排查实录
有一次处理一位朋友拍的笔记照片,识别出的文本内容没问题,但段落输出顺序完全乱了。在脚本里加了一个可视化工具,把每个文本框按坐标画在原图上,发现根源在于页面左下角有一片明显的阴影。检测模型把阴影边缘识别成了“文字区域”,生成了几个与正文无关的假文本框,把原本按列排布的顺序打乱了。
解决办法是预处理阶段增加一道“阴影检测”:计算图像局部均值与全局均值的差异,超过阈值的区域直接置为白色背景。这个简单步骤一下子消除了假文本框,段落顺序恢复正常。
另外一个高频坑:手机拍摄时如果纸张弯曲较大,透视矫正检测纸张边缘时会失败。这种情况我都建议用户“不要用最小面积矩形拟合纸边”,而是先找最大轮廓,看轮廓的凸包面积是否接近纸面面积;如果纸边有明显的卷曲,直接放弃自动矫正,改成四点手动标定,虽然多一步操作,但稳定性好得多。
6.3 经验建议:人工复核环节不能省
最后说一个最实用的经验。哪怕 OCR 模型再强,指望它 100% 无误是不可能的。手写笔记里出现的涂改、删除线、重写符号,模型经常会一脸懵。
我现在的做法是:识别 + 导出之后,自己快速过一遍文档,重点看这几个位置:
- 每页开头的标题是否被识别成正文;
- 手绘的箭头、括号是否引发了错行;
- 数字、英文单词、公式是否被截断。
一遍快速浏览大概花不了几分钟,但能避免大部分低级错误散发到正式文档里。
收尾:写在实操之后
我个人在实际操作中最大的体会是:这个需求真正值钱的部分不是“把字认出来”,而是“把结构保留住”。很多人做完 OCR 就停在了“识别出文本”这一步,结果后续整理还是靠手工,等于白干了。要是你也想把这个流程完全打通,我强烈建议先在 20 张左右有代表性的笔记照片上做一轮参数调整和段落规则验证,然后再上批量。我一开始直接拿 100 张图跑,发现段落合并规则有问题,重新改了代码之后还得全部重跑,浪费时间。先小规模试,把规则调稳,再放大规模,这是最省力的路径。
