OCR untuk PDF dan Gambar: Cara Mendapatkan Teks yang Akurat
Pengenalan karakter optis membaca bentuk huruf dalam gambar atau halaman yang dipindai dan mengubahnya menjadi teks yang nyata dan dapat dipilih.
Apa yang Sebenarnya Dilakukan OCR
Halaman hasil scan, atau foto dokumen, hanyalah gambar, kisi piksel tanpa konsep huruf atau kata. OCR menganalisis kisi tersebut, mengenali bentuk karakter, dan menghasilkan teks yang ditemukan beserta posisi setiap kata yang dikenali di halaman.
PDF yang Dapat Dicari vs. Teks Terekstrak
OCR PDF menambahkan lapisan teks yang tidak terlihat namun dapat dicari di atas gambar halaman asli, sehingga halaman masih terlihat persis seperti scan tetapi teks di bawahnya dapat dipilih dan dicari di penampil PDF manapun. Image to Text sebaliknya mengekstrak teks yang dikenali saja, tanpa gambar halaman, untuk kasus ketika kamu hanya membutuhkan kata-katanya.
Bahasa dan Deteksi Otomatis
Pengenalan mendukung 95 bahasa atau lebih. Bahasa dapat dideteksi secara otomatis halaman per halaman, yang praktis untuk dokumen campuran, atau kamu dapat memilih satu atau beberapa bahasa secara manual jika tahu persis isi dokumen tersebut. Pemilihan manual cenderung lebih akurat daripada deteksi otomatis untuk dokumen pendek atau tidak biasa di mana tidak cukup teks untuk mendeteksi bahasa secara andal.
Tips Kualitas Scan
Halaman dibaca pada 300 dpi, yang merupakan dasar yang baik untuk teks cetak standar. Beberapa kebiasaan membuat perbedaan nyata pada akurasi:
- Jaga halaman tetap lurus; teks miring mengurangi akurasi pengenalan secara nyata.
- Gunakan pencahayaan merata dan hindari bayangan di seluruh halaman, karena kontras rendah mengacaukan bentuk karakter.
- Scan pada 300 dpi atau lebih tinggi daripada mengandalkan foto ponsel beresolusi rendah.
- Ratakan halaman yang melengkung atau terlipat sebelum scan bila memungkinkan.
Dokumen Multibahasa
Untuk halaman yang beralih antara dua atau tiga bahasa, pilih semua bahasa yang relevan secara manual daripada mengandalkan deteksi otomatis, yang bekerja per halaman dan mungkin melewatkan bahasa yang hanya muncul di bagian kecil halaman tersebut.
Tabel dan Formulir
OCR mengenali teks di dalam sel tabel dan bidang formulir, tetapi tidak selalu mempertahankan struktur kisi asli dengan sempurna, terutama dengan batas tipis atau tata letak yang tidak biasa. Periksa tabel numerik dengan seksama, karena digit yang salah baca mudah terlewat secara visual.
Keterbatasan Tulisan Tangan
Akurasi pengenalan turun tajam pada tulisan tangan, dan turun lebih jauh lagi dengan cetakan kecil, font dekoratif, kontras rendah, dan halaman miring. Huruf cetak yang rapi dan tegak lebih baik daripada tulisan sambung, tetapi tidak ada alat OCR di sini yang dapat diandalkan sebagai pengganti transkripsi manusia untuk catatan tulisan tangan.
Memeriksa Hasil
Selalu periksa output OCR secara acak terhadap aslinya, terutama angka, nama, dan teks apapun dalam cetakan kecil. Pemindaian cepat halaman yang dikonversi menangkap sebagian besar kesalahan pengenalan sebelum menyebabkan masalah hilir.
Memilih Alat yang Tepat
Gunakan OCR PDF ketika berkas akhir perlu tetap terlihat seperti scan asli tetapi dapat dicari. Gunakan Image to Text ketika kamu hanya membutuhkan kata-kata yang dikenali, tanpa gambar halaman. Gunakan Scan to Markdown ketika dokumen hasil scan memiliki struktur, heading, daftar, atau tabel yang layak dipertahankan sebagai Markdown, sebagaimana dibahas dalam PDF to Markdown guide. Gunakan PDF to Word ketika tujuan akhir adalah dokumen yang dapat diedit daripada teks biasa. Alat apa pun yang kamu pilih, tinjauan manual cepat halaman pertama terhadap output tetap menjadi cara tercepat untuk memastikan pengaturan yang dipilih sudah tepat untuk dokumen tersebut.