PDF와 이미지 OCR: 정확한 텍스트를 얻는 방법
광학 문자 인식은 이미지나 스캔된 페이지에 있는 문자의 모양을 읽어 실제로 선택하고 복사할 수 있는 텍스트로 변환합니다.
OCR이 실제로 하는 일
스캔된 페이지나 문서 사진은 문자나 단어의 개념이 없는 픽셀 격자인 단순한 이미지일 뿐입니다. OCR은 그 격자를 분석하고 문자 모양을 인식하여, 찾은 텍스트를 페이지에서 인식된 각 단어의 위치와 함께 출력합니다.
검색 가능한 PDF와 추출된 텍스트 비교
OCR PDF는 원본 페이지 이미지 위에 보이지 않는 검색 가능한 텍스트 레이어를 추가하여, 페이지가 스캔과 정확히 같아 보이지만 그 아래의 텍스트는 모든 PDF 뷰어에서 선택하고 검색할 수 있게 됩니다. Image to Text는 단어만 필요할 때 페이지 이미지 없이 인식된 텍스트만 추출합니다.
언어와 자동 감지
인식은 95개 이상의 언어를 지원합니다. 혼합 문서에 편리하게 페이지별로 언어를 자동으로 감지할 수 있으며, 문서 내용을 정확히 알고 있을 때는 하나 이상의 언어를 수동으로 선택할 수 있습니다. 수동 선택은 언어를 안정적으로 감지할 만한 텍스트가 충분하지 않은 짧거나 특이한 문서에서 자동 감지보다 더 정확한 경향이 있습니다.
스캔 품질 팁
페이지는 표준 인쇄 텍스트에 좋은 기준선인 300 dpi에서 읽습니다. 몇 가지 습관이 정확도에 실질적인 차이를 만듭니다:
- 페이지를 곧게 유지하세요. 기울어진 텍스트는 인식 정확도를 눈에 띄게 줄입니다.
- 균일한 조명을 사용하고 페이지 전체의 그림자를 피하세요. 낮은 대비는 문자 모양을 혼동하게 합니다.
- 저해상도 휴대폰 사진에 의존하는 대신 300 dpi 이상으로 스캔하세요.
- 가능하면 스캔하기 전에 구부러지거나 접힌 페이지를 평평하게 펴세요.
혼합 언어 문서
두 세 개의 언어가 전환되는 페이지의 경우, 해당 페이지의 일부에만 나타나는 언어를 놓칠 수 있는 자동 감지에 의존하는 대신 관련된 모든 언어를 수동으로 선택하세요. 자동 감지는 페이지별로 작동합니다.
표와 양식
OCR은 표 셀과 양식 필드 내의 텍스트를 인식하지만, 특히 가는 테두리나 특이한 레이아웃에서는 원본 격자 구조를 항상 완벽하게 보존하지는 않습니다. 잘못 읽은 숫자는 시각적으로 놓치기 쉬우므로 숫자 표를 꼼꼼히 확인하세요.
필기의 한계
인식 정확도는 필기에서 크게 떨어지며, 작은 글씨, 장식적 글꼴, 낮은 대비, 기울어진 페이지에서는 더 떨어집니다. 깔끔하게 인쇄된 대문자가 필기체보다 성능이 좋지만, 여기에 있는 어떤 OCR 도구도 필기 메모의 인간 전사를 대신할 수 있는 신뢰할 만한 대안은 아닙니다.
결과 확인
OCR 출력을 원본과 대조하여 항상 특히 숫자, 이름, 작은 글씨의 텍스트를 spot-check하세요. 변환된 페이지를 빠르게 훑어보면 대부분의 인식 오류를 다운스트림에서 문제가 발생하기 전에 잡을 수 있습니다.
올바른 도구 선택
최종 파일이 원본 스캔처럼 보이지만 검색 가능해야 한다면 OCR PDF를 사용하세요. 페이지 이미지 없이 인식된 단어만 필요하다면 Image to Text를 사용하세요. 스캔된 문서에 Markdown으로 보존할 가치가 있는 구조, 제목, 목록 또는 표가 있다면 Scan to Markdown을 사용하세요. 이는 PDF to Markdown guide에서 다룹니다. 최종 목표가 일반 텍스트가 아닌 편집 가능한 문서라면 PDF to Word를 사용하세요. 어떤 도구를 선택하든 출력과 첫 번째 페이지를 대조하는 빠른 수동 검토가 선택한 설정이 해당 문서에 적합했는지 확인하는 가장 빠른 방법입니다.