OCR для PDF та зображень: як отримати точний текст
Оптичне розпізнавання символів читає форми літер на зображенні чи сканованій сторінці і перетворює їх на справжній текст, який можна виділяти.
Що насправді робить OCR
Скована сторінка, чи фотографія документа, це просто зображення, сітка пікселів без будь-якого уявлення про літери чи слова. OCR аналізує цю сітку, розпізнає форми символів і виводить знайдений текст разом із позицією кожного розпізнаного слова на сторінці.
PDF із можливістю пошуку проти видобутого тексту
OCR PDF додає невидимий, придатний для пошуку текстовий шар над зображенням оригінальної сторінки, тож сторінка все ще виглядає точно як скан, але текст під нею можна виділити й знайти у будь-якому переглядачі PDF. Image to Text натомість видобуває розпізнаний текст самостійно, без будь-якого зображення сторінки, для випадків, коли потрібні лише слова.
Мови й автоматичне визначення
Розпізнавання підтримує 95 або більше мов. Мову можна визначати автоматично для кожної сторінки, що зручно для змішаних документів, або можна обрати одну чи декілька мов вручну, коли ви точно знаєте, що містить документ. Ручний вибір зазвичай точніший, ніж автоматичне визначення для коротких чи незвичних документів, де тексту недостатньо для надійного визначення мови.
Порада щодо якості скана
Сторінки читаються за 300 dpi, що є хорошою базовою лінією для стандартного друкованого тексту. Декілька звичок дійсно впливають на точність:
- Тримайте сторінку прямо; перекошений текст помітно знижує точність розпізнавання.
- Використовуйте рівномірне освітлення й уникайте тіней на сторінці, оскільки низький контраст плутає форми символів.
- Скануйте за 300 dpi чи вище, а не покладайтеся на фото телефоном низької роздільної здатності.
- Розгладьте закручені чи зігнуті сторінки перед сканування, де це можливо.
Багатомовні документи
Для сторінки, що перемикається між двома чи трьома мовами, оберіть усі відповідні мови вручну, а не покладайтеся на автоматичне визначення, яке працює по сторінці й може пропустити мову, яка з'являється лише в невеликому розділі тієї сторінки.
Таблиці й форми
OCR розпізнає текст усередині клітинок таблиць і полів форм, але не завжди ідеально зберігає оригінальну структуру сітки, особливо з тонкими рамками чи незвичними макетами. Уважно перевіряйте числові таблиці, оскільки неправильно прочитану цифру легко пропустити візуально.
Обмеження для рукописного тексту
Точність розпізнавання різко падає на рукописному тексті, і падає ще більше з дрібним шрифтом, декоративними гарнітурами, низьким контрастом і перекошеними сторінками. Чіткі друковані великі літери виходять краще, ніж курсивний почерк, але жоден інструмент OCR тут не є надійною заміною людської транскрипції рукописних заміток.
Перевірка результатів
Завжди вибірково перевіряйте результат OCR порівняно з оригіналом, особливо числа, імена й будь-який текст дрібним шрифтом. Швидкий перегляд перетвореної сторінки виявляє більшість помилок розпізнавання, перш ніж вони спричинять проблему на подальшому етапі.
Вибір правильного інструменту
Використовуйте OCR PDF, коли кінцевий файл має все ще виглядати як оригінальний скан, але стати придатним для пошуку. Використовуйте Image to Text, коли потрібні лише розпізнані слова, без зображення сторінки. Використовуйте Scan to Markdown, коли скований документ має структуру, заголовки, списки чи таблиці, варту збереження як Markdown, як описано в посібнику PDF у Markdown. Використовуйте PDF to Word, коли кінцева мета це редагований документ, а не простий текст. Який би інструмент ви не обрали, швидкий ручний перегляд першої сторінки порівняно з результатом залишається найшвидшим способом підтвердити, що обрані налаштування були правильними саме для цього документа.