PDF ve Görseller için OCR: Doğru Metin Nasıl Elde Edilir
Optik karakter tanıma, bir görüntüdeki veya taranan sayfadaki harflerin şekillerini okur ve bunları gerçek, seçilebilir metne dönüştürür.
OCR Gerçekte Ne Yapar
Taranan bir sayfa veya bir belgenin fotoğrafı, harf ya da kelime kavramı olmayan bir piksel ızgarası olan yalnızca bir görüntüdür. OCR bu ızgarayı çözümler, karakter şekillerini tanır ve bulunan metni sayfadaki her tanınan kelimenin konumuyla birlikte çıkarır.
Aranabilir PDF ile Çıkarılan Metin Karşılaştırması
OCR PDF, orijinal sayfa görüntüsünün üzerine görünmez, aranabilir bir metin katmanı ekler; böylece sayfa tam olarak tarama gibi görünmeye devam eder ancak altındaki metin herhangi bir PDF görüntüleyicisinde seçilebilir ve aranabilir olur. Image to Text ise yalnızca kelimelere ihtiyaç duyduğunuzda, sayfa görüntüsü olmaksızın yalnızca tanınan metni çıkarır.
Diller ve Otomatik Algılama
Tanıma, 95 veya daha fazla dili destekler. Dil, karma belgeler için kullanışlı olan sayfa sayfa otomatik algılanabilir ya da belgenin tam olarak ne içerdiğini bildiğinizde bir veya daha fazla dili manuel olarak seçebilirsiniz. Manuel seçim, dili güvenilir biçimde saptamak için yeterli metin bulunmayan kısa veya alışılmadık belgeler için genellikle otomatik algılamadan daha doğrudur.
Tarama Kalitesi Önerileri
Sayfalar, standart basılı metin için iyi bir taban olan 300 dpi'da okunur. Birkaç alışkanlık, doğruluk üzerinde gerçek bir fark yaratır:
- Sayfayı dik tutun; eğik metin tanıma doğruluğunu belirgin biçimde azaltır.
- Düzgün aydınlatma kullanın ve sayfada gölge bırakmaktan kaçının; düşük kontrast karakter şekillerini karıştırır.
- Düşük çözünürlüklü telefon fotoğrafına güvenmek yerine 300 dpi veya daha yüksekte tarayın.
- Mümkünse tarlamadan önce kıvrılmış ya da katlanmış sayfaları düzeltin.
Karma Dilli Belgeler
İki ya da üç dil arasında geçiş yapan bir sayfa için, sayfanın yalnızca küçük bir bölümünde görünen bir dili kaçırabilecek otomatik algılamaya güvenmek yerine ilgili tüm dilleri manuel olarak seçin.
Tablolar ve Formlar
OCR, tablo hücrelerindeki ve form alanlarındaki metni tanır; ancak özellikle ince kenarlıklar veya alışılmadık düzenlerle orijinal ızgara yapısını her zaman mükemmel biçimde koruyamaz. Sayısal tabloları dikkatli biçimde kontrol edin; yanlış okunan bir rakam görsel olarak kolayca gözden kaçabilir.
El Yazısının Sınırlılıkları
Tanıma doğruluğu el yazısında belirgin biçimde düşer; küçük baskı, dekoratif yazı tipleri, düşük kontrast ve eğik sayfayla daha da düşer. Düzenli basılı büyük harfler el yazısı karakterlerden daha iyi performans gösterir; ancak buradaki hiçbir OCR aracı el yazılı notların insan transkripsiyonunun güvenilir bir alternatifi değildir.
Sonuçların Kontrolü
OCR çıktısını her zaman örnekleme yöntemiyle orijinalle karşılaştırarak denetleyin; özellikle sayılar, adlar ve küçük punto içeren metinlere dikkat edin. Dönüştürülmüş bir sayfanın hızlı göz atılması, çoğu tanıma hatasını aşağı akışta sorun oluşturmadan önce yakalar.
Doğru Aracı Seçmek
Son dosyanın orijinal tarama gibi görünmesi ancak aranabilir olması gerekiyorsa OCR PDF kullanın. Yalnızca tanınan kelimelere, sayfa görüntüsü olmaksızın ihtiyaç duyuyorsanız Image to Text kullanın. Taranan belgede başlıklar, listeler veya tablolar gibi Markdown olarak korunmaya değer yapı varsa Scan to Markdown kullanın; bu, PDF to Markdown guide sayfasında ele alınmaktadır. Son hedef düz metin yerine düzenlenebilir bir belge ise PDF to Word kullanın. Hangi aracı seçerseniz seçin, çıktıya karşı ilk sayfanın hızlı manuel incelemesi, seçtiğiniz ayarların o belge için doğru olduğunu doğrulamanın en hızlı yolu olmaya devam eder.