OCR для PDF и изображений: как получить точный текст
Оптическое распознавание символов считывает формы букв на изображении или отсканированной странице и превращает их в настоящий, выделяемый текст.
Что на самом деле делает OCR
Отсканированная страница или фотография документа , это просто изображение, сетка пикселей, не имеющая понятия о буквах или словах. OCR анализирует эту сетку, распознаёт формы символов и выдаёт найденный текст вместе с позицией каждого распознанного слова на странице.
PDF с возможностью поиска и извлечённый текст
OCR PDF добавляет невидимый, доступный для поиска текстовый слой над изображением исходной страницы, поэтому страница всё ещё выглядит точно как скан, но текст под ней можно выделять и искать в любой программе просмотра PDF. Изображение в текст вместо этого извлекает распознанный текст сам по себе, без какого-либо изображения страницы, для случаев, когда вам нужны только слова.
Языки и автоопределение
Распознавание поддерживает 95 или более языков. Язык может определяться автоматически постранично, что удобно для смешанных документов, или вы можете выбрать один или несколько языков вручную, когда точно знаете, что содержит документ. Ручной выбор, как правило, точнее автоопределения для коротких или нетипичных документов, где недостаточно текста для надёжного определения языка.
Советы по качеству скана
Страницы считываются при 300 dpi, что является хорошей базовой линией для стандартного печатного текста. Несколько привычек существенно влияют на точность:
- Держите страницу прямо; наклонённый текст заметно снижает точность распознавания.
- Используйте равномерное освещение и избегайте теней на странице, поскольку низкий контраст сбивает распознавание форм символов.
- Сканируйте при 300 dpi или выше, а не полагайтесь на фото с телефона низкого разрешения.
- Разгладьте свёрнутые или сложенные страницы перед сканированием, когда это возможно.
Многоязычные документы
Для страницы, которая переключается между двумя или тремя языками, выбирайте все нужные языки вручную, а не полагайтесь на автоопределение, которое работает постранично и может пропустить язык, встречающийся только в небольшом разделе этой страницы.
Таблицы и формы
OCR распознаёт текст внутри ячеек таблиц и полей форм, но не всегда идеально сохраняет исходную структуру сетки, особенно при тонких границах или нестандартных макетах. Внимательно проверяйте числовые таблицы, поскольку неправильно распознанную цифру легко пропустить визуально.
Ограничения с почерком
Точность распознавания резко падает на рукописном тексте и падает ещё сильнее при мелком шрифте, декоративных гарнитурах, низком контрасте и наклонённых страницах. Аккуратные печатные буквы блочного стиля распознаются лучше, чем курсивный почерк, но ни один инструмент OCR здесь не является надёжной заменой человеческой расшифровке рукописных записей.
Проверка результатов
Всегда выборочно проверяйте результат OCR по сравнению с оригиналом, особенно числа, имена и любой текст мелким шрифтом. Быстрый просмотр преобразованной страницы выявляет большинство ошибок распознавания до того, как они вызовут проблему на следующем этапе.
Выбор подходящего инструмента
Используйте OCR PDF, когда итоговый файл должен продолжать выглядеть как исходный скан, но стать доступным для поиска. Используйте Изображение в текст, когда вам нужны только распознанные слова, без изображения страницы. Используйте Скан в Markdown, когда у отсканированного документа есть структура, заголовки, списки или таблицы, которую стоит сохранить как Markdown, как описано в руководстве по PDF в Markdown. Используйте PDF в Word, когда конечная цель это редактируемый документ, а не простой текст. Какой инструмент вы бы ни выбрали, быстрая ручная проверка первой страницы по сравнению с результатом остаётся самым быстрым способом убедиться, что выбранные настройки были правильными для этого конкретного документа.