OCR untuk PDF dan Imej: Bagaimana Mendapatkan Teks yang Tepat
Pengecaman aksara optik membaca bentuk huruf dalam sesuatu imej atau halaman yang diimbas dan mengubahnya menjadi teks sebenar yang boleh dipilih.
Apa Sebenarnya yang Dilakukan OCR
Halaman yang diimbas, atau foto sesuatu dokumen, hanyalah sesuatu imej, grid piksel tanpa sebarang tanggapan tentang huruf atau perkataan. OCR menganalisis grid itu, mengecam bentuk aksara, dan menghasilkan teks yang ditemuinya bersama kedudukan setiap perkataan yang dikenal pasti pada halaman itu.
PDF Boleh Dicari berbanding Teks Diekstrak
OCR PDF menambah lapisan teks yang tidak kelihatan dan boleh dicari di atas imej halaman asal, jadi halaman itu masih kelihatan sama seperti imbasan tetapi teks di bawahnya boleh dipilih dan dicari dalam mana-mana pemapar PDF. Image to Text sebaliknya mengekstrak teks yang dikenal pasti dengan sendirinya, tanpa sebarang imej halaman terlibat, untuk keadaan apabila anda hanya inginkan perkataan itu.
Bahasa dan Pengesanan Automatik
Pengecaman menyokong 95 atau lebih bahasa. Bahasa boleh dikesan secara automatik bagi setiap halaman, yang mudah untuk dokumen bercampur, atau anda boleh memilih satu atau lebih bahasa secara manual apabila anda tahu tepat apa yang terkandung dalam dokumen itu. Pemilihan manual cenderung lebih tepat berbanding pengesanan automatik untuk dokumen pendek atau luar biasa di mana tidak cukup teks untuk mengesan bahasa dengan boleh dipercayai.
Petua Kualiti Imbasan
Halaman dibaca pada 300 dpi, garis dasar yang baik untuk teks bercetak standard. Beberapa amalan memberikan perbezaan sebenar kepada ketepatan:
- Pastikan halaman lurus; teks yang serong mengurangkan ketepatan pengecaman dengan jelas.
- Gunakan pencahayaan sekata dan elakkan bayang-bayang merentasi halaman, kerana kontras rendah mengelirukan bentuk aksara.
- Imbas pada 300 dpi atau lebih tinggi berbanding bergantung pada foto telefon beresolusi rendah.
- Ratakan halaman yang bergelung atau berlipat sebelum mengimbas apabila boleh.
Dokumen Berbilang Bahasa
Untuk halaman yang beralih antara dua atau tiga bahasa, pilih semua bahasa berkaitan secara manual berbanding bergantung pada pengesanan automatik, yang berfungsi mengikut halaman dan mungkin terlepas bahasa yang hanya muncul dalam bahagian kecil halaman itu.
Jadual dan Borang
OCR mengecam teks dalam sel jadual dan medan borang, tetapi ia tidak selalu mengekalkan struktur grid asal dengan sempurna, terutamanya dengan sempadan nipis atau susun atur luar biasa. Semak jadual berangka dengan teliti, kerana digit yang dibaca salah mudah terlepas secara visual.
Batasan Tulisan Tangan
Ketepatan pengecaman menurun dengan mendadak pada tulisan tangan, dan menurun lagi dengan cetakan kecil, fon dekoratif, kontras rendah dan halaman serong. Huruf blok bercetak yang kemas lebih baik berbanding tulisan tangan bersambung, tetapi tiada alat OCR di sini merupakan pengganti yang boleh dipercayai untuk transkripsi manusia bagi nota bertulis tangan.
Menyemak Hasil
Sentiasa semak sampel output OCR berbanding asal, terutamanya nombor, nama dan sebarang teks bercetak kecil. Semakan pantas ke atas halaman yang ditukar menangkap kebanyakan ralat pengecaman sebelum ia menyebabkan masalah pada peringkat seterusnya.
Memilih Alat yang Betul
Gunakan OCR PDF apabila fail akhir perlu terus kelihatan seperti imbasan asal tetapi menjadi boleh dicari. Gunakan Image to Text apabila anda hanya memerlukan perkataan yang dikenal pasti, tanpa imej halaman. Gunakan Scan to Markdown apabila dokumen yang diimbas mempunyai struktur, tajuk, senarai atau jadual, yang berbaloi dikekalkan sebagai Markdown, seperti yang dibincangkan dalam panduan PDF ke Markdown. Gunakan PDF to Word apabila matlamat akhirnya ialah dokumen yang boleh disunting berbanding teks biasa. Apa jua alat yang anda pilih, semakan manual pantas ke atas halaman pertama berbanding output kekal sebagai cara paling pantas untuk mengesahkan bahawa tetapan yang anda pilih adalah yang betul untuk dokumen tertentu itu.