OCR voor PDF's en afbeeldingen: hoe je nauwkeurige tekst krijgt
Optische tekenherkenning leest de vormen van letters in een afbeelding of een gescande pagina en zet ze om in echte, selecteerbare tekst.
Wat OCR eigenlijk doet
Een gescande pagina, of een foto van een document, is gewoon een afbeelding, een raster van pixels zonder enig begrip van letters of woorden. OCR analyseert dat raster, herkent tekenvormen, en geeft de gevonden tekst weer samen met de positie van elk herkend woord op de pagina.
Doorzoekbare PDF versus geëxtraheerde tekst
OCR PDF voegt een onzichtbare, doorzoekbare tekstlaag toe over de originele pagina-afbeelding, dus de pagina blijft er precies uitzien als de scan, maar de tekst daaronder is selecteerbaar en doorzoekbaar in elke PDF-viewer. Image to Text extraheert in plaats daarvan alleen de herkende tekst, zonder pagina-afbeelding, voor wanneer je alleen de woorden nodig hebt.
Talen en automatische detectie
Herkenning ondersteunt 95 of meer talen. De taal kan automatisch per pagina worden gedetecteerd, wat handig is voor gemengde documenten, of je kunt handmatig een of meer talen kiezen wanneer je precies weet wat het document bevat. Handmatige selectie is doorgaans nauwkeuriger dan automatische detectie voor korte of ongewone documenten waar niet genoeg tekst is om de taal betrouwbaar te detecteren.
Tips voor scankwaliteit
Pagina's worden gelezen op 300 dpi, een goede basis voor standaard gedrukte tekst. Een paar gewoontes maken een echt verschil voor de nauwkeurigheid:
- Houd de pagina recht; scheve tekst vermindert de herkenningsnauwkeurigheid merkbaar.
- Gebruik gelijkmatige verlichting en vermijd schaduwen over de pagina, omdat laag contrast tekenvormen verwart.
- Scan op 300 dpi of hoger in plaats van te vertrouwen op een lage-resolutie telefoonfoto.
- Maak gekrulde of gevouwen pagina's vlak voor het scannen waar mogelijk.
Documenten met meerdere talen
Voor een pagina die tussen twee of drie talen wisselt, selecteer je alle relevante talen handmatig in plaats van te vertrouwen op automatische detectie, die per pagina werkt en een taal kan missen die alleen in een klein deel van die pagina voorkomt.
Tabellen en formulieren
OCR herkent de tekst binnen tabelcellen en formuliervelden, maar behoudt niet altijd perfect de oorspronkelijke rasterstructuur, vooral bij dunne randen of ongewone lay-outs. Controleer numerieke tabellen zorgvuldig, omdat een verkeerd gelezen cijfer visueel makkelijk te missen is.
Beperkingen bij handschrift
De herkenningsnauwkeurigheid daalt sterk bij handschrift, en daalt nog verder bij kleine letters, decoratieve lettertypen, laag contrast en scheve pagina's. Nette, gedrukte blokletters presteren beter dan cursief handschrift, maar geen OCR-tool hier is een betrouwbare vervanging voor menselijke transcriptie van handgeschreven notities.
Resultaten controleren
Controleer OCR-uitvoer altijd steekproefsgewijs tegen het origineel, vooral cijfers, namen en tekst in kleine letters. Een snelle blik op een geconverteerde pagina vangt de meeste herkenningsfouten op voordat ze een probleem verderop veroorzaken.
De juiste tool kiezen
Gebruik OCR PDF wanneer het uiteindelijke bestand moet blijven ogen als de originele scan maar doorzoekbaar moet worden. Gebruik Image to Text wanneer je alleen de herkende woorden nodig hebt, zonder pagina-afbeelding. Gebruik Scan to Markdown wanneer het gescande document structuur heeft, koppen, lijsten of tabellen, die het waard zijn om als Markdown te behouden, zoals beschreven in de PDF naar Markdown-gids. Gebruik PDF to Word wanneer het einddoel een bewerkbaar document is in plaats van platte tekst. Welke tool je ook kiest, een snelle handmatige controle van de eerste pagina tegen de uitvoer blijft de snelste manier om te bevestigen dat de gekozen instellingen juist waren voor dat specifieke document.