OCR pour PDF et images : comment obtenir un texte précis
La reconnaissance optique de caractères lit les formes des lettres dans une image ou une page numérisée et les transforme en texte réel et sélectionnable.
Ce que fait réellement l'OCR
Une page numérisée, ou une photo d'un document, n'est qu'une image, une grille de pixels sans aucune notion de lettres ou de mots. L'OCR analyse cette grille, reconnaît les formes de caractères, et produit le texte qu'il trouve ainsi que la position de chaque mot reconnu sur la page.
PDF consultable face à texte extrait
OCR PDF ajoute une couche de texte invisible et consultable au-dessus de l'image de page d'origine, donc la page ressemble toujours exactement au scan mais le texte en dessous est sélectionnable et consultable dans toute visionneuse PDF. Image vers texte extrait au contraire le texte reconnu seul, sans aucune image de page impliquée, pour quand tu veux juste les mots.
Langues et détection automatique
La reconnaissance prend en charge 95 langues ou plus. La langue peut être détectée automatiquement page par page, ce qui est pratique pour des documents mixtes, ou tu peux choisir une ou plusieurs langues manuellement quand tu sais exactement ce que contient le document. La sélection manuelle tend à être plus précise que la détection automatique pour des documents courts ou inhabituels où il n'y a pas assez de texte pour détecter la langue de façon fiable.
Conseils pour la qualité de scan
Les pages sont lues à 300 dpi, ce qui constitue une bonne base pour du texte imprimé standard. Quelques habitudes font une réelle différence sur la précision :
- Garde la page droite ; un texte incliné réduit sensiblement la précision de reconnaissance.
- Utilise un éclairage uniforme et évite les ombres sur la page, car un faible contraste brouille les formes des caractères.
- Numérise à 300 dpi ou plus plutôt que de te fier à une photo de téléphone basse résolution.
- Aplatis les pages recourbées ou pliées avant de numériser quand c'est possible.
Documents multilingues
Pour une page qui alterne entre deux ou trois langues, sélectionne manuellement toutes les langues concernées plutôt que de te fier à la détection automatique, qui fonctionne par page et peut manquer une langue qui n'apparaît que dans une petite section de cette page.
Tableaux et formulaires
L'OCR reconnaît le texte à l'intérieur des cellules de tableau et des champs de formulaire, mais il ne préserve pas toujours parfaitement la structure de grille d'origine, surtout avec des bordures fines ou des mises en page inhabituelles. Vérifie soigneusement les tableaux numériques, car un chiffre mal lu est facile à manquer visuellement.
Limites avec l'écriture manuscrite
La précision de reconnaissance chute nettement avec l'écriture manuscrite, et chute encore plus avec les petits caractères, les polices décoratives, le faible contraste et les pages inclinées. Les lettres capitales d'imprimerie bien nettes s'en sortent mieux que l'écriture cursive, mais aucun outil OCR ici ne remplace de façon fiable une transcription humaine de notes manuscrites.
Vérifier les résultats
Vérifie toujours ponctuellement la sortie OCR par rapport à l'original, en particulier les chiffres, les noms et tout texte en petits caractères. Un survol rapide d'une page convertie détecte la plupart des erreurs de reconnaissance avant qu'elles ne causent un problème en aval.
Choisir le bon outil
Utilise OCR PDF quand le fichier final doit continuer à ressembler au scan d'origine mais devenir consultable. Utilise Image vers texte quand tu as seulement besoin des mots reconnus, sans aucune image de page. Utilise Scan vers Markdown quand le document numérisé a une structure, titres, listes ou tableaux, qui vaut la peine d'être préservée en Markdown, comme couvert dans le guide PDF vers Markdown. Utilise PDF vers Word quand l'objectif final est un document éditable plutôt que du texte brut. Quel que soit l'outil que tu choisis, une révision manuelle rapide de la première page par rapport à la sortie reste la façon la plus rapide de confirmer que les réglages choisis étaient les bons pour ce document en particulier.