PDF 與圖片的 OCR:如何取得精準的文字辨識結果
光學字元辨識技術會仔細讀取圖片或掃描頁面中每一個字母的形狀,並將這些形狀準確轉換成真正可以選取、複製與搜尋的完整文字內容。
OCR 實際上做了什麼
一張掃描頁面,或是文件的照片,本質上只是一張圖片,一個由像素組成的網格,並沒有字母或單字的概念。OCR 會分析這個網格,辨識字元形狀,並輸出找到的文字,同時附上頁面上每個辨識出單字的位置。
可搜尋 PDF 與擷取文字的差異
OCR PDF 會在原始頁面圖片上疊加一層隱形、可搜尋的文字層,因此頁面外觀仍與掃描檔完全相同,但底層文字在任何 PDF 檢視器中都可以選取和搜尋。Image to Text 則只單獨擷取辨識出的文字,不涉及任何頁面圖片,適合只需要文字內容的情況。
語言與自動偵測
辨識支援 95 種以上的語言。語言可以逐頁自動偵測,這對混合語言的文件很方便,或者當你確切知道文件內容時,也可以手動選擇一種或多種語言。對於篇幅短或內容特殊、文字量不足以可靠偵測語言的文件,手動選擇通常比自動偵測更準確。
提升掃描品質的技巧
頁面以 300 dpi 讀取,這是標準印刷文字的良好基準值。幾個習慣能對辨識準確度帶來實際差異:
- 保持頁面平直;歪斜的文字會明顯降低辨識準確度。
- 使用均勻的光線,避免頁面上出現陰影,因為低對比度會混淆字元形狀。
- 以 300 dpi 或更高的解析度掃描,而非依賴低解析度的手機照片。
- 盡可能在掃描前將捲曲或折疊的頁面壓平。
混合語言文件
若一個頁面在兩到三種語言之間切換,建議手動選取所有相關語言,而不要依賴自動偵測,因為自動偵測是逐頁進行的,可能會漏掉只出現在頁面中一小部分的語言。
表格與表單
OCR 能辨識表格儲存格和表單欄位中的文字,但並不總能完美保留原始的網格結構,尤其是邊框較細或版面不尋常時更是如此。請仔細檢查數字表格,因為誤判的數字很容易被肉眼忽略。
手寫文字的限制
辨識準確度在手寫文字上會明顯下降,遇到小字體、裝飾性字型、低對比度和歪斜頁面時準確度會進一步降低。工整的印刷體字母表現優於草寫手寫字,但這裡沒有任何 OCR 工具能可靠取代人工謄寫手寫筆記。
檢查結果
務必將 OCR 輸出結果與原始檔案逐一比對,特別留意數字、姓名以及任何小字體文字。快速瀏覽轉換後的頁面,能在造成下游問題之前抓出大部分辨識錯誤。
選擇合適的工具
當最終檔案需要保持原始掃描外觀但變得可搜尋時,使用 OCR PDF。當你只需要辨識出的文字,不需要頁面圖片時,使用 Image to Text。當掃描文件具有值得保留為 Markdown 的結構,例如標題、清單或表格時,使用 Scan to Markdown,詳情可參閱 PDF to Markdown guide。當最終目標是可編輯文件而非純文字時,使用 PDF to Word。無論選擇哪種工具,快速手動檢查第一頁與輸出結果的對照,始終是確認所選設定是否適合該特定文件的最快方法。