OCR för PDF-filer och bilder: hur du får korrekt text
Optisk teckenigenkänning läser formerna på bokstäverna i en bild eller en skannad sida och omvandlar dem till riktig, markeringsbar text.
Vad OCR egentligen gör
En skannad sida, eller ett foto av ett dokument, är bara en bild, ett rutnät av pixlar utan någon förståelse för bokstäver eller ord. OCR analyserar detta rutnät, känner igen teckenformer och genererar den text den hittar tillsammans med positionen för varje igenkänt ord på sidan.
Sökbar PDF jämfört med extraherad text
OCR PDF lägger till ett osynligt, sökbart textlager ovanpå den ursprungliga sidbilden, så sidan ser fortfarande exakt ut som skanningen men texten under är markeringsbar och sökbar i alla PDF-visare. Image to Text extraherar i stället den igenkända texten helt fristående, utan någon sidbild inblandad, för de gånger du bara vill ha orden.
Språk och automatisk identifiering
Igenkänningen stödjer 95 eller fler språk. Språk kan identifieras automatiskt sida för sida, vilket är praktiskt för blandade dokument, eller du kan välja ett eller flera språk manuellt när du vet exakt vad dokumentet innehåller. Manuellt val brukar vara mer träffsäkert än automatisk identifiering för korta eller ovanliga dokument där det inte finns nog med text för att tillförlitligt avgöra språket.
Tips för skanningskvalitet
Sidor läses vid 300 dpi, vilket är en bra baslinje för vanlig tryckt text. Några vanor gör verklig skillnad för träffsäkerheten:
- Håll sidan rak; sned text minskar igenkänningens noggrannhet märkbart.
- Använd jämn belysning och undvik skuggor över sidan, eftersom låg kontrast förvirrar teckenformerna.
- Skanna vid 300 dpi eller högre i stället för att förlita dig på ett lågupplöst mobilfoto.
- Platta till rullade eller vikta sidor innan skanning där det är möjligt.
Flerspråkiga dokument
För en sida som växlar mellan två eller tre språk, välj alla relevanta språk manuellt i stället för att förlita dig på automatisk identifiering, som fungerar per sida och kan missa ett språk som bara förekommer i en liten del av den sidan.
Tabeller och formulär
OCR känner igen texten inuti tabellceller och formulärfält, men bevarar inte alltid det ursprungliga rutnätet perfekt, särskilt vid tunna ramlinjer eller ovanliga layouter. Kontrollera numeriska tabeller noggrant, eftersom en felavläst siffra är lätt att missa visuellt.
Begränsningar för handskrift
Igenkänningens noggrannhet sjunker kraftigt vid handskrift, och sjunker ytterligare vid liten text, dekorativa typsnitt, låg kontrast och sneda sidor. Tydliga, tryckta versaler klarar sig bättre än sammanhängande handstil, men inget OCR-verktyg här är ett tillförlitligt substitut för en mänsklig avskrift av handskrivna anteckningar.
Kontroll av resultat
Kontrollera alltid OCR-resultatet mot originalet, särskilt siffror, namn och all text i liten stil. En snabb genomgång av en konverterad sida fångar de flesta igenkänningsfel innan de orsakar ett problem längre fram.
Att välja rätt verktyg
Använd OCR PDF när slutfilen behöver fortsätta se ut som originalskanningen men bli sökbar. Använd Image to Text när du bara behöver de igenkända orden, utan någon sidbild. Använd Scan to Markdown när det skannade dokumentet har struktur, rubriker, listor eller tabeller, värda att bevara som Markdown, enligt beskrivningen i PDF to Markdown guide. Använd PDF to Word när slutmålet är ett redigerbart dokument snarare än vanlig text. Vilket verktyg du än väljer förblir en snabb manuell granskning av första sidan mot resultatet det snabbaste sättet att bekräfta att de inställningar du valde var rätt för just det dokumentet.