OCR pro PDF a obrázky: jak získat přesný text
Optické rozpoznávání znaků čte tvary písmen na obrázku nebo naskenované stránce a přeměňuje je na skutečný, vybíratelný text.
Co OCR skutečně dělá
Naskenovaná stránka nebo fotografie dokumentu je jen obrázek, mřížka pixelů bez jakéhokoli povědomí o písmenech nebo slovech. OCR analyzuje tuto mřížku, rozpoznává tvary znaků a vygeneruje nalezený text spolu s pozicí každého rozpoznaného slova na stránce.
Prohledávatelné PDF versus extrahovaný text
OCR PDF přidá neviditelnou, prohledávatelnou textovou vrstvu přes původní obrázek stránky, takže stránka vypadá přesně jako skenovaná, ale text pod ní je vybíratelný a prohledávatelný v jakémkoli prohlížeči PDF. Image to Text naopak extrahuje rozpoznaný text samostatně, bez zapojení obrázku stránky, pro chvíle, kdy chcete jen slova.
Jazyky a automatická detekce
Rozpoznávání podporuje 95 nebo více jazyků. Jazyk lze detekovat automaticky po stránkách, což je vhodné pro smíšené dokumenty, nebo lze vybrat jeden či více jazyků manuálně, pokud přesně víte, co dokument obsahuje. Manuální výběr bývá přesnější než automatická detekce u krátkých nebo neobvyklých dokumentů, kde není dostatek textu pro spolehlivou detekci jazyka.
Tipy pro kvalitu skenování
Stránky se čtou při 300 dpi, což je dobrý základ pro standardní tištěný text. Několik zvyků skutečně ovlivňuje přesnost:
- Udržujte stránku rovnou; zkosený text výrazně snižuje přesnost rozpoznávání.
- Používejte rovnoměrné osvětlení a vyhněte se stínům na stránce, protože nízký kontrast mate tvary znaků.
- Skenujte při 300 dpi nebo vyšším rozlišení, nespoléhejte se na fotografii z mobilu s nízkým rozlišením.
- Vyhlaďte zvlněné nebo přeložené stránky před skenováním, kde je to možné.
Dokumenty s více jazyky
Pro stránku, která přechází mezi dvěma nebo třemi jazyky, vyberte manuálně všechny relevantní jazyky, spíše než spoléhat na automatickou detekci, která funguje po stránkách a může přehlédnout jazyk, který se objeví jen v malé části dané stránky.
Tabulky a formuláře
OCR rozpoznává text uvnitř buněk tabulek a polí formulářů, ale ne vždy dokonale zachová původní strukturu mřížky, zejména u tenkých ohraničení nebo neobvyklých rozvržení. Číselné tabulky pečlivě kontrolujte, protože chybně přečtenou číslici lze snadno vizuálně přehlédnout.
Omezení u rukopisu
Přesnost rozpoznávání u rukopisu výrazně klesá a klesá dále u malého písma, dekorativních fontů, nízkého kontrastu a zkosených stránek. Čisté, tištěné velké tiskací písmo si vede lépe než spojité psané písmo, ale žádný z těchto nástrojů OCR není spolehlivou náhradou lidského přepisu ručně psaných poznámek.
Kontrola výsledků
Vždy namátkově zkontrolujte výstup OCR proti originálu, zejména čísla, jména a jakýkoli text malým písmem. Rychlé prolétnutí převedené stránky odhalí většinu chyb rozpoznávání dřív, než způsobí problém dál v procesu.
Výběr správného nástroje
Použijte OCR PDF, když má výsledný soubor dál vypadat jako původní scan, ale stát se prohledávatelným. Použijte Image to Text, když potřebujete jen rozpoznaná slova, bez obrázku stránky. Použijte Scan to Markdown, když má naskenovaný dokument strukturu, nadpisy, seznamy nebo tabulky, které stojí za zachování jako Markdown, jak popisuje PDF to Markdown guide. Použijte PDF to Word, když je konečným cílem editovatelný dokument, ne prostý text. Ať zvolíte jakýkoli nástroj, rychlá manuální kontrola první stránky proti výstupu zůstává nejrychlejším způsobem, jak potvrdit, že zvolené nastavení bylo pro daný dokument správné.