OCR PDF-ekhez és képekhez: hogyan érjünk el pontos szöveget
Az optikai karakterfelismerés leolvassa a betűk alakját egy képen vagy beolvasott lapon, és valódi, kijelölhető szöveggé alakítja azokat.
Mit csinál valójában az OCR
Egy beolvasott lap, vagy egy dokumentumról készült fénykép, egyszerűen egy kép, egy pixelrács betűk vagy szavak fogalma nélkül. Az OCR elemzi ezt a rácsot, felismeri a karakterek alakját, és kiadja a talált szöveget minden felismert szó lapon lévő pozíciójával együtt.
Kereshető PDF a kinyert szöveg ellen
Az OCR PDF egy láthatatlan, kereshető szövegréteget ad az eredeti lapkép fölé, így a lap pontosan úgy néz ki, mint a beolvasás, de az alatta lévő szöveg kijelölhető és kereshető bármely PDF-megjelenítőben. Az Image to Text ehelyett önmagában kinyeri a felismert szöveget, lapkép nélkül, ha csak a szavakra van szüksége.
Nyelvek és automatikus felismerés
A felismerés 95 vagy több nyelvet támogat. A nyelv laponként automatikusan felismerhető, ami vegyes dokumentumok esetén hasznos, vagy manuálisan is kiválaszthat egy vagy több nyelvet, ha pontosan tudja, mit tartalmaz a dokumentum. A manuális kiválasztás pontosabb szokott lenni az automatikus felismerésnél rövid vagy szokatlan dokumentumoknál, ahol nincs elég szöveg a nyelv megbízható felismeréséhez.
Szkennelési minőségi tippek
A lapokat 300 dpi-nél olvassa be a rendszer, ami jó alapérték a standard nyomtatott szöveghez. Néhány szokás valós különbséget tesz a pontosságban:
- Tartsa egyenesen a lapot; a torz szöveg észrevehetően rontja a felismerési pontosságot.
- Használjon egyenletes fényt, és kerülje az árnyékokat a lapon, mivel az alacsony kontraszt összezavarja a karakterek alakját.
- Szkenneljen 300 dpi-n vagy magasabban, ne hagyatkozzon alacsony felbontású telefonos fényképre.
- Simítsa ki a hullámos vagy hajtott lapokat a szkennelés előtt, ha lehetséges.
Vegyes nyelvű dokumentumok
Egy két vagy három nyelv között váltó lap esetén válassza ki manuálisan az összes releváns nyelvet, inkább, mint hogy az automatikus felismerésre hagyatkozna, amely laponként működik, és elszalaszthat egy nyelvet, amely csak a lap egy kis részén jelenik meg.
Táblázatok és űrlapok
Az OCR felismeri a táblázatcellák és űrlapmezők belsejében lévő szöveget, de nem mindig tartja meg tökéletesen az eredeti rácsszerkezetet, különösen vékony keretek vagy szokatlan elrendezések esetén. Alaposan ellenőrizze a numerikus táblázatokat, mivel egy hibásan olvasott számjegyet vizuálisan könnyű elszalasztani.
A kézírás korlátai
A felismerés pontossága élesen csökken kézírás esetén, és tovább csökken apró betűtípusnál, díszes betűtípusoknál, alacsony kontrasztnál és torz lapoknál. A tiszta, nyomtatott nagybetűk jobban teljesítenek, mint a folyóírás, de itt semmilyen OCR-eszköz nem megbízható helyettesítője egy kézzel írt jegyzet emberi átírásának.
Az eredmények ellenőrzése
Mindig ellenőrizze véletlenszerűen az OCR-kimenetet az eredetihez képest, különösen a számokat, neveket és bármilyen apró betűs szöveget. Az átalakított lap gyors átfutása elkapja a legtöbb felismerési hibát, mielőtt azok problémát okoznának a folyamat további részében.
A megfelelő eszköz kiválasztása
Használja az OCR PDF eszközt, ha a végleges fájlnak tovább kell úgy kinéznie, mint az eredeti beolvasás, de kereshetővé kell válnia. Használja az Image to Text eszközt, ha csak a felismert szavakra van szüksége, lapkép nélkül. Használja a Scan to Markdown eszközt, ha a beolvasott dokumentumnak van struktúrája, címsorai, listái vagy táblázatai, amelyeket érdemes Markdownként megőrizni, ahogy a PDF to Markdown guide útmutató is leírja. Használja a PDF to Word eszközt, ha a végső cél egy szerkeszthető dokumentum, nem sima szöveg. Bármelyik eszközt válassza is, az első lap gyors, kézi átnézése a kimenettel szemben marad a leggyorsabb módja annak, hogy megerősítse: a kiválasztott beállítások megfelelőek voltak az adott dokumentumhoz.