OCR dla PDF i obrazów: jak uzyskać dokładny tekst
Optyczne rozpoznawanie znaków odczytuje kształty liter na obrazie lub zeskanowanej stronie i zmienia je w prawdziwy, zaznaczalny tekst.
Co OCR naprawdę robi
Zeskanowana strona, albo zdjęcie dokumentu, to po prostu obraz, siatka pikseli bez żadnego pojęcia o literach czy słowach. OCR analizuje tę siatkę, rozpoznaje kształty znaków i wypisuje znaleziony tekst wraz z pozycją każdego rozpoznanego słowa na stronie.
PDF z możliwością wyszukiwania a wyodrębniony tekst
OCR PDF dodaje niewidzialną, przeszukiwalną warstwę tekstową nad oryginalnym obrazem strony, więc strona wciąż wygląda dokładnie jak skan, ale tekst pod nią można zaznaczyć i przeszukać w każdej przeglądarce PDF. Image to Text natomiast wyodrębnia rozpoznany tekst samodzielnie, bez żadnego obrazu strony, na wypadek, gdy potrzebujesz tylko słów.
Języki i automatyczne wykrywanie
Rozpoznawanie obsługuje 95 lub więcej języków. Język może być wykrywany automatycznie strona po stronie, co jest wygodne dla dokumentów mieszanych, albo możesz wybrać jeden lub więcej języków ręcznie, gdy wiesz dokładnie, co dokument zawiera. Ręczny wybór bywa dokładniejszy niż automatyczne wykrywanie dla krótkich lub nietypowych dokumentów, gdzie nie ma wystarczająco tekstu, aby wiarygodnie wykryć język.
Wskazówki dotyczące jakości skanu
Strony są odczytywane przy 300 dpi, co jest dobrym punktem wyjścia dla standardowego tekstu drukowanego. Kilka nawyków robi realną różnicę w dokładności:
- Trzymaj stronę prosto; przekrzywiony tekst wyraźnie zmniejsza dokładność rozpoznawania.
- Stosuj równomierne oświetlenie i unikaj cieni na stronie, bo niski kontrast myli kształty znaków.
- Skanuj przy 300 dpi lub wyżej, a nie licz na zdjęcie z telefonu w niskiej rozdzielczości.
- Wygładź zwinięte lub pogięte strony przed skanowaniem, jeśli to możliwe.
Dokumenty wielojęzyczne
Dla strony, która przełącza się między dwoma lub trzema językami, wybierz ręcznie wszystkie właściwe języki, a nie licz na automatyczne wykrywanie, które działa strona po stronie i może przegapić język pojawiający się tylko w małej części tej strony.
Tabele i formularze
OCR rozpoznaje tekst wewnątrz komórek tabel i pól formularzy, ale nie zawsze idealnie zachowuje pierwotną strukturę siatki, zwłaszcza przy cienkich obramowaniach lub nietypowych układach. Sprawdzaj tabele liczbowe uważnie, bo błędnie odczytaną cyfrę łatwo przeoczyć wizualnie.
Ograniczenia dla pisma ręcznego
Dokładność rozpoznawania spada wyraźnie przy piśmie ręcznym, a spada jeszcze bardziej przy małej czcionce, ozdobnych fontach, niskim kontraście i przekrzywionych stronach. Wyraźne, drukowane wielkie litery wypadają lepiej niż kursywa, ale żadne narzędzie OCR tutaj nie jest wiarygodnym zamiennikiem ludzkiej transkrypcji notatek pisanych ręcznie.
Sprawdzanie wyników
Zawsze sprawdzaj wybiórczo wynik OCR w porównaniu z oryginałem, zwłaszcza liczby, nazwy i tekst drukowany małą czcionką. Szybkie przejrzenie przekonwertowanej strony wychwytuje większość błędów rozpoznawania, zanim spowodują problem na dalszym etapie.
Wybór właściwego narzędzia
Użyj OCR PDF, gdy końcowy plik musi wciąż wyglądać jak oryginalny skan, ale ma być przeszukiwalny. Użyj Image to Text, gdy potrzebujesz tylko rozpoznanych słów, bez obrazu strony. Użyj Scan to Markdown, gdy zeskanowany dokument ma strukturę, nagłówki, listy lub tabele, wartą zachowania jako Markdown, jak opisano w przewodniku PDF do Markdown. Użyj PDF to Word, gdy końcowym celem jest edytowalny dokument, a nie czysty tekst. Niezależnie od wybranego narzędzia, szybki ręczny przegląd pierwszej strony w porównaniu z wynikiem pozostaje najszybszym sposobem na potwierdzenie, że wybrane ustawienia były właściwe dla tego konkretnego dokumentu.