OCR per PDF e immagini: come ottenere testo accurato
Il riconoscimento ottico dei caratteri legge le forme delle lettere in un'immagine o in una pagina scansionata e le trasforma in testo vero e selezionabile.
Cosa fa davvero l'OCR
Una pagina scansionata, o la foto di un documento, è semplicemente un'immagine, una griglia di pixel senza alcuna nozione di lettere o parole. L'OCR analizza quella griglia, riconosce le forme dei caratteri, e produce il testo trovato insieme alla posizione di ogni parola riconosciuta sulla pagina.
PDF ricercabile rispetto a testo estratto
OCR PDF aggiunge un livello di testo invisibile e ricercabile sopra l'immagine della pagina originale, quindi la pagina continua ad avere l'aspetto esatto della scansione ma il testo sottostante è selezionabile e ricercabile in qualsiasi lettore PDF. Image to Text invece estrae il testo riconosciuto da solo, senza alcuna immagine di pagina coinvolta, per quando servono soltanto le parole.
Lingue e rilevamento automatico
Il riconoscimento supporta 95 o più lingue. La lingua può essere rilevata automaticamente pagina per pagina, il che è comodo per documenti misti, oppure puoi scegliere manualmente una o più lingue quando sai esattamente cosa contiene il documento. La selezione manuale tende a essere più accurata del rilevamento automatico per documenti brevi o inusuali dove non c'è abbastanza testo per rilevare la lingua in modo affidabile.
Consigli per la qualità della scansione
Le pagine vengono lette a 300 dpi, una buona base per il testo stampato standard. Alcune abitudini fanno una vera differenza sulla precisione:
- Mantieni la pagina dritta; il testo storto riduce notevolmente la precisione del riconoscimento.
- Usa un'illuminazione uniforme ed evita ombre sulla pagina, dato che il basso contrasto confonde le forme dei caratteri.
- Scansiona a 300 dpi o più invece di affidarti a una foto a bassa risoluzione fatta con il telefono.
- Appiattisci le pagine curvate o piegate prima di scansionare, quando possibile.
Documenti multilingue
Per una pagina che alterna due o tre lingue, seleziona manualmente tutte le lingue rilevanti invece di affidarti al rilevamento automatico, che funziona per pagina e potrebbe non riconoscere una lingua presente solo in una piccola sezione di quella pagina.
Tabelle e moduli
L'OCR riconosce il testo dentro le celle delle tabelle e i campi dei moduli, ma non sempre preserva perfettamente la struttura originale della griglia, specialmente con bordi sottili o layout inusuali. Controlla con attenzione le tabelle numeriche, dato che una cifra letta male è facile da non notare a colpo d'occhio.
Limiti con la scrittura a mano
La precisione del riconoscimento scende in modo netto con la scrittura a mano, e scende ancora di più con caratteri piccoli, font decorativi, basso contrasto e pagine storte. Le lettere in stampatello nitide se la cavano meglio della scrittura corsiva, ma nessuno strumento OCR qui presente è un sostituto affidabile della trascrizione umana di appunti scritti a mano.
Verificare i risultati
Controlla sempre l'output OCR rispetto all'originale, in particolare numeri, nomi e qualsiasi testo in caratteri piccoli. Una rapida scorsa di una pagina convertita individua la maggior parte degli errori di riconoscimento prima che causino un problema successivo.
Scegliere lo strumento giusto
Usa OCR PDF quando il file finale deve continuare ad avere l'aspetto della scansione originale ma diventare ricercabile. Usa Image to Text quando servono solo le parole riconosciute, senza immagine di pagina. Usa Scan to Markdown quando il documento scansionato ha una struttura, titoli, elenchi o tabelle, che vale la pena preservare come Markdown, come spiegato nella guida da PDF a Markdown. Usa PDF to Word quando l'obiettivo finale è un documento modificabile invece di testo semplice. Qualunque strumento tu scelga, una rapida revisione manuale della prima pagina rispetto all'output resta il modo più veloce per confermare che le impostazioni scelte fossero quelle giuste per quel particolare documento.