OCR Cho PDF và Ảnh: Cách Nhận Được Văn Bản Chính Xác
Nhận dạng ký tự quang học đọc hình dạng của các chữ cái trong ảnh hoặc trang scan và chuyển đổi chúng thành văn bản thực có thể chọn được.
OCR Thực Sự Làm Gì
Một trang scan, hoặc ảnh chụp tài liệu, chỉ là một ảnh, một lưới pixel không có khái niệm về chữ cái hay từ ngữ. OCR phân tích lưới đó, nhận dạng hình dạng ký tự, và xuất văn bản tìm được cùng với vị trí của mỗi từ được nhận dạng trên trang.
PDF Có Thể Tìm Kiếm so với Văn Bản Trích Xuất
OCR PDF thêm một lớp văn bản ẩn, có thể tìm kiếm phía trên ảnh trang gốc, vì vậy trang trông giống y chang bản scan nhưng văn bản bên dưới có thể chọn và tìm kiếm trong bất kỳ trình xem PDF nào. Image to Text thay vào đó trích xuất văn bản đã nhận dạng riêng lẻ, không có ảnh trang, cho khi bạn chỉ cần các từ.
Ngôn Ngữ và Tự Động Phát Hiện
Nhận dạng hỗ trợ 95 ngôn ngữ hoặc hơn. Ngôn ngữ có thể tự động phát hiện từng trang, thuận tiện cho các tài liệu hỗn hợp, hoặc bạn có thể chọn thủ công một hoặc nhiều ngôn ngữ khi bạn biết chính xác tài liệu chứa gì. Chọn thủ công thường chính xác hơn tự động phát hiện cho các tài liệu ngắn hoặc bất thường nơi không có đủ văn bản để phát hiện ngôn ngữ đáng tin cậy.
Mẹo Chất Lượng Scan
Các trang được đọc ở 300 dpi, đây là mức cơ sở tốt cho văn bản in tiêu chuẩn. Một vài thói quen tạo ra sự khác biệt thực sự đối với độ chính xác:
- Giữ trang thẳng; văn bản nghiêng làm giảm độ chính xác nhận dạng đáng chú ý.
- Dùng ánh sáng đều và tránh bóng trên trang vì độ tương phản thấp gây nhầm lẫn hình dạng ký tự.
- Scan ở 300 dpi hoặc cao hơn thay vì dựa vào ảnh điện thoại độ phân giải thấp.
- Làm phẳng các trang bị cong hoặc gấp trước khi scan nếu có thể.
Tài Liệu Nhiều Ngôn Ngữ
Đối với trang chuyển đổi giữa hai hoặc ba ngôn ngữ, hãy chọn thủ công tất cả các ngôn ngữ liên quan thay vì dựa vào tự động phát hiện, vốn hoạt động theo từng trang và có thể bỏ sót ngôn ngữ chỉ xuất hiện trong một phần nhỏ của trang đó.
Bảng và Biểu Mẫu
OCR nhận dạng văn bản trong các ô bảng và trường biểu mẫu, nhưng không phải lúc nào cũng bảo toàn cấu trúc lưới gốc hoàn hảo, đặc biệt với đường viền mỏng hoặc bố cục bất thường. Kiểm tra cẩn thận các bảng số vì chữ số đọc sai dễ bỏ sót về mặt trực quan.
Giới Hạn Của Chữ Viết Tay
Độ chính xác nhận dạng giảm mạnh với chữ viết tay, và giảm thêm với chữ in nhỏ, phông chữ trang trí, độ tương phản thấp và trang nghiêng. Chữ in hoa ngay ngắn làm tốt hơn chữ viết nối, nhưng không có công cụ OCR nào ở đây là sự thay thế đáng tin cậy cho việc sao chép của con người đối với ghi chú viết tay.
Kiểm Tra Kết Quả
Luôn kiểm tra ngẫu nhiên đầu ra OCR so với bản gốc, đặc biệt là các số, tên và bất kỳ văn bản nào in nhỏ. Lướt qua nhanh một trang đã chuyển đổi bắt được hầu hết các lỗi nhận dạng trước khi chúng gây ra vấn đề xuôi dòng.
Chọn Công Cụ Phù Hợp
Dùng OCR PDF khi file cuối cần tiếp tục trông như bản scan gốc nhưng có thể tìm kiếm. Dùng Image to Text khi bạn chỉ cần các từ được nhận dạng, không có ảnh trang. Dùng Scan to Markdown khi tài liệu scan có cấu trúc, tiêu đề, danh sách hoặc bảng, đáng bảo tồn dưới dạng Markdown, như đề cập trong PDF to Markdown guide. Dùng PDF to Word khi mục tiêu cuối là tài liệu có thể chỉnh sửa thay vì văn bản thuần. Dù bạn chọn công cụ nào, xem xét thủ công nhanh trang đầu tiên so với đầu ra vẫn là cách nhanh nhất để xác nhận các cài đặt bạn chọn là đúng cho tài liệu cụ thể đó.