OCR pentru PDF-uri și imagini: cum să obții text corect
Recunoașterea optică a caracterelor citește formele literelor dintr-o imagine sau o pagină scanată și le transformă în text real, selectabil.
Ce face OCR de fapt
O pagină scanată, sau o fotografie a unui document, este pur și simplu o imagine, o grilă de pixeli fără nicio noțiune de litere sau cuvinte. OCR analizează acea grilă, recunoaște formele caracterelor și generează textul găsit împreună cu poziția fiecărui cuvânt recunoscut pe pagină.
PDF căutabil versus text extras
OCR PDF adaugă un strat de text invizibil, căutabil, peste imaginea paginii originale, astfel încât pagina arată exact ca scanarea, dar textul de dedesubt este selectabil și căutabil în orice vizualizator PDF. Image to Text extrage în schimb textul recunoscut de sine stătător, fără nicio imagine de pagină implicată, pentru când vrei doar cuvintele.
Limbi și detectare automată
Recunoașterea acceptă 95 sau mai multe limbi. Limba poate fi detectată automat pagină cu pagină, ceea ce este convenabil pentru documente mixte, sau puteți alege una sau mai multe limbi manual atunci când știți exact ce conține documentul. Selecția manuală tinde să fie mai precisă decât detectarea automată pentru documente scurte sau neobișnuite unde nu există suficient text pentru a detecta limba în mod fiabil.
Sfaturi pentru calitatea scanării
Paginile sunt citite la 300 dpi, ceea ce este o referință bună pentru text tipărit standard. Câteva obiceiuri fac o diferență reală în precizie:
- Păstrați pagina dreaptă; textul înclinat reduce vizibil precizia recunoașterii.
- Folosiți o iluminare uniformă și evitați umbrele pe pagină, deoarece contrastul scăzut derutează formele caracterelor.
- Scanați la 300 dpi sau mai mult în loc să vă bazați pe o fotografie de telefon cu rezoluție mică.
- Îndreptați paginile ondulate sau îndoite înainte de scanare, atunci când este posibil.
Documente cu limbi mixte
Pentru o pagină care alternează între două sau trei limbi, selectați manual toate limbile relevante în loc să vă bazați pe detectarea automată, care funcționează pe pagină și poate rata o limbă care apare doar într-o secțiune mică din acea pagină.
Tabele și formulare
OCR recunoaște textul din interiorul celulelor de tabel și al câmpurilor de formular, dar nu păstrează întotdeauna perfect structura grilei originale, mai ales cu borduri fine sau aspecte neobișnuite. Verificați cu atenție tabelele numerice, deoarece o cifră citită greșit este ușor de ratat vizual.
Limitări la scris de mână
Precizia recunoașterii scade brusc la scrisul de mână, și scade și mai mult cu text mic, fonturi decorative, contrast scăzut și pagini înclinate. Literele de tipar clare, îngrijite se descurcă mai bine decât scrisul cursiv, dar niciun instrument OCR de aici nu este un substitut fiabil pentru o transcriere umană a notelor de mână.
Verificarea rezultatelor
Verificați întotdeauna prin sondaj rezultatul OCR față de original, în special numerele, numele și orice text cu font mic. O trecere rapidă în revistă a unei pagini convertite prinde majoritatea erorilor de recunoaștere înainte ca acestea să provoace o problemă în etapele următoare.
Alegerea instrumentului potrivit
Folosiți OCR PDF atunci când fișierul final trebuie să continue să arate ca scanarea originală, dar să devină căutabil. Folosiți Image to Text atunci când aveți nevoie doar de cuvintele recunoscute, fără nicio imagine de pagină. Folosiți Scan to Markdown atunci când documentul scanat are structură, titluri, liste sau tabele, care merită păstrate ca Markdown, așa cum este descris în PDF to Markdown guide. Folosiți PDF to Word atunci când scopul final este un document editabil, nu text simplu. Indiferent de instrumentul pe care îl alegeți, o revizuire manuală rapidă a primei pagini față de rezultat rămâne cea mai rapidă modalitate de a confirma că setările alese au fost cele corecte pentru acel document anume.