OCR para PDFs e imagens: como obter texto preciso
O reconhecimento óptico de caracteres lê as formas das letras em uma imagem ou página digitalizada e as transforma em texto real e selecionável.
O que o OCR realmente faz
Uma página digitalizada, ou uma foto de um documento, é apenas uma imagem, uma grade de pixels sem noção alguma de letras ou palavras. O OCR analisa essa grade, reconhece formas de caracteres, e produz o texto que encontra junto com a posição de cada palavra reconhecida na página.
PDF pesquisável em relação a texto extraído
O OCR PDF adiciona uma camada de texto invisível e pesquisável sobre a imagem original da página, então a página ainda parece exatamente com a digitalização, mas o texto por baixo é selecionável e pesquisável em qualquer visualizador de PDF. O Imagem para texto em vez disso extrai o texto reconhecido por si só, sem imagem de página envolvida, para quando você só quer as palavras.
Idiomas e detecção automática
O reconhecimento suporta 95 idiomas ou mais. O idioma pode ser detectado automaticamente página por página, o que é conveniente para documentos mistos, ou você pode escolher um ou mais idiomas manualmente quando sabe exatamente o que o documento contém. A seleção manual tende a ser mais precisa do que a detecção automática para documentos curtos ou pouco comuns onde não há texto suficiente para detectar o idioma de forma confiável.
Dicas de qualidade de digitalização
As páginas são lidas a 300 dpi, o que é uma boa base para texto impresso padrão. Alguns hábitos fazem uma diferença real na precisão:
- Mantenha a página reta; texto inclinado reduz notavelmente a precisão de reconhecimento.
- Use iluminação uniforme e evite sombras sobre a página, já que baixo contraste confunde as formas dos caracteres.
- Digitalize a 300 dpi ou mais em vez de depender de uma foto de celular de baixa resolução.
- Alise páginas curvadas ou dobradas antes de digitalizar quando possível.
Documentos em vários idiomas
Para uma página que alterna entre dois ou três idiomas, selecione manualmente todos os idiomas relevantes em vez de depender da detecção automática, que funciona por página e pode não identificar um idioma que aparece apenas em uma pequena seção dessa página.
Tabelas e formulários
O OCR reconhece o texto dentro de células de tabela e campos de formulário, mas nem sempre preserva perfeitamente a estrutura de grade original, especialmente com bordas finas ou layouts inusuais. Verifique cuidadosamente tabelas numéricas, já que um dígito lido errado é fácil de passar despercebido visualmente.
Limites com escrita à mão
A precisão de reconhecimento cai drasticamente com escrita à mão, e cai ainda mais com letras pequenas, fontes decorativas, baixo contraste e páginas inclinadas. Letras de forma limpas e impressas se saem melhor do que a escrita cursiva, mas nenhuma ferramenta de OCR aqui substitui de forma confiável uma transcrição humana de notas manuscritas.
Verificando os resultados
Sempre confira pontualmente a saída do OCR em relação ao original, particularmente números, nomes e qualquer texto em letras pequenas. Uma rápida olhada em uma página convertida detecta a maioria dos erros de reconhecimento antes que causem um problema posterior.
Escolhendo a ferramenta certa
Use OCR PDF quando o arquivo final precisa continuar parecendo com a digitalização original, mas se tornar pesquisável. Use Imagem para texto quando você só precisa das palavras reconhecidas, sem imagem de página. Use Digitalização para Markdown quando o documento digitalizado tem estrutura, títulos, listas ou tabelas, que vale a pena preservar como Markdown, como abordado no guia de PDF para Markdown. Use PDF para Word quando o objetivo final é um documento editável em vez de texto simples. Seja qual for a ferramenta escolhida, uma revisão manual rápida da primeira página em relação à saída continua sendo a forma mais rápida de confirmar que as configurações escolhidas eram as corretas para aquele documento em particular.