PDF 和图片的 OCR:如何获得准确的文字
光学字符识别会读取图片或扫描页面中字母的形状,并将其转换为真正的、可选中和可搜索的文字,方便后续编辑、检索与再利用这些内容。
OCR 实际做了什么
一张扫描页面,或一张文档照片,本质上只是一张图片,一个没有字母或单词概念的像素网格。OCR 会分析这个网格,识别字符形状,并输出它找到的文字以及页面上每个识别出的单词的位置。
可搜索 PDF 与提取的文字
OCR PDF会在原始页面图像上方添加一个不可见的、可搜索的文字层,因此页面看起来仍然与扫描件完全一样,但下面的文字在任何 PDF 阅读器中都可以选中和搜索。相反,图片转文字只单独提取识别出的文字,不涉及任何页面图像,适用于你只想要文字的情况。
语言与自动检测
识别功能支持 95 种或更多语言。语言可以按页自动检测,这对混合文档很方便,或者当你确切知道文档包含什么内容时,也可以手动选择一种或多种语言。对于文字不够多、难以可靠检测语言的短文档或非常规文档,手动选择往往比自动检测更准确。
扫描质量小贴士
页面以 300 dpi 的分辨率读取,这是标准打印文字的良好基线。一些习惯能对准确度产生实质性的影响:
- 保持页面平整;歪斜的文字会明显降低识别准确度。
- 使用均匀的光线,避免页面上出现阴影,因为低对比度会混淆字符形状。
- 以 300 dpi 或更高分辨率扫描,而不是依赖低分辨率的手机照片。
- 尽可能在扫描前将卷曲或折叠的页面展平。
多语言文档
对于在两三种语言之间切换的页面,请手动选择所有相关语言,而不要依赖按页工作的自动检测,因为它可能会漏掉只出现在该页某个小部分的语言。
表格与表单
OCR 能识别表格单元格和表单字段内的文字,但并不总能完美保留原始的网格结构,尤其是在边框较细或版式不常见的情况下。请仔细检查数字表格,因为一个被误读的数字很容易在视觉上被忽略。
手写的局限性
在手写文字上,识别准确度会急剧下降,而在字体较小、装饰性字体、低对比度和歪斜页面的情况下会进一步下降。工整的印刷体大写字母比连笔手写字表现更好,但这里没有任何 OCR 工具能可靠地替代人工转录手写笔记。
检查结果
始终将 OCR 输出与原件进行抽样对照,尤其是数字、姓名以及任何小字号文字。快速浏览一下转换后的页面,可以在大多数识别错误造成下游问题之前将其发现。
选择合适的工具
当最终文件需要继续保持与原始扫描件一样的外观但要变得可搜索时,使用OCR PDF。当你只需要识别出的文字、不需要任何页面图像时,使用图片转文字。当扫描文档具有值得保留为 Markdown 的结构、标题、列表或表格时,使用扫描转 Markdown,具体内容参见PDF 转 Markdown 指南。当最终目标是可编辑文档而不是纯文本时,使用PDF 转 Word。无论你选择哪种工具,快速地将第一页与输出结果进行人工核对,仍然是确认你选择的设置对那份特定文档是否正确的最快方法。