PDF और इमेज के लिए OCR: सटीक टेक्स्ट कैसे पाएं
ऑप्टिकल कैरेक्टर रिकग्निशन किसी इमेज या स्कैन किए गए पेज में अक्षरों के आकार को पढ़ता है और उन्हें असली, चयन योग्य टेक्स्ट में बदल देता है।
OCR वास्तव में क्या करता है
एक स्कैन किया गया पेज, या किसी दस्तावेज़ की फ़ोटो, महज़ एक इमेज है, अक्षरों या शब्दों की किसी अवधारणा के बिना पिक्सेल का एक ग्रिड। OCR उस ग्रिड का विश्लेषण करता है, अक्षर आकृतियों को पहचानता है, और उसे मिला टेक्स्ट पेज पर हर पहचाने गए शब्द की स्थिति के साथ आउटपुट करता है।
सर्च योग्य PDF बनाम एक्सट्रैक्ट किया गया टेक्स्ट
OCR PDF मूल पेज इमेज के ऊपर एक अदृश्य, सर्च योग्य टेक्स्ट लेयर जोड़ता है, इसलिए पेज अभी भी स्कैन जैसा ही दिखता है लेकिन नीचे का टेक्स्ट किसी भी PDF व्यूअर में चयन योग्य और सर्च योग्य है। इसके बजाय Image to Text बिना किसी पेज इमेज के शामिल हुए, पहचाने गए टेक्स्ट को अकेले एक्सट्रैक्ट करता है, जब आप बस शब्द चाहते हैं।
भाषाएं और स्वचालित पहचान
रिकग्निशन 95 या अधिक भाषाओं को सपोर्ट करता है। भाषा को पेज-दर-पेज स्वचालित रूप से पहचाना जा सकता है, जो मिश्रित दस्तावेज़ों के लिए सुविधाजनक है, या जब आप ठीक से जानते हैं कि दस्तावेज़ में क्या है तो आप एक या अधिक भाषाओं को मैन्युअल रूप से चुन सकते हैं। छोटे या असामान्य दस्तावेज़ों के लिए जहां भाषा को भरोसे के साथ पहचानने के लिए पर्याप्त टेक्स्ट नहीं होता, मैन्युअल चयन स्वचालित पहचान की तुलना में अधिक सटीक होता है।
स्कैन क्वालिटी टिप्स
पेज 300 dpi पर पढ़े जाते हैं, जो मानक प्रिंटेड टेक्स्ट के लिए एक अच्छा बेसलाइन है। कुछ आदतें सटीकता में वास्तविक अंतर लाती हैं:
- पेज को सीधा रखें; तिरछा टेक्स्ट रिकग्निशन सटीकता को उल्लेखनीय रूप से कम करता है।
- समान लाइटिंग का उपयोग करें और पेज पर छाया से बचें, क्योंकि कम कंट्रास्ट अक्षर आकृतियों को उलझा देता है।
- कम-रेज़ोल्यूशन फ़ोन फ़ोटो पर निर्भर रहने के बजाय 300 dpi या उससे अधिक पर स्कैन करें।
- जहां संभव हो स्कैन करने से पहले मुड़े हुए या फोल्ड किए गए पेजों को समतल करें।
मिश्रित-भाषा दस्तावेज़
किसी ऐसे पेज के लिए जो दो या तीन भाषाओं के बीच बदलता है, स्वचालित पहचान पर निर्भर रहने के बजाय सभी संबंधित भाषाओं को मैन्युअल रूप से चुनें, जो प्रति पेज काम करती है और किसी भाषा को मिस कर सकती है जो उस पेज के केवल एक छोटे से हिस्से में दिखती है।
टेबल और फ़ॉर्म
OCR टेबल सेल और फ़ॉर्म फ़ील्ड के भीतर के टेक्स्ट को पहचानता है, लेकिन यह हमेशा मूल ग्रिड संरचना को पूरी तरह से संरक्षित नहीं करता, विशेष रूप से पतली सीमाओं या असामान्य लेआउट के साथ। संख्यात्मक टेबल की सावधानी से जांच करें, क्योंकि गलत पढ़े गए अंक को विज़ुअली मिस करना आसान है।
हस्तलेखन की सीमाएं
हस्तलेखन पर रिकग्निशन सटीकता तेज़ी से गिरती है, और छोटे प्रिंट, डेकोरेटिव फ़ॉन्ट, कम कंट्रास्ट और तिरछे पेजों के साथ यह और गिरती है। साफ़-सुथरे, प्रिंटेड ब्लॉक अक्षर कर्सिव हैंडराइटिंग की तुलना में बेहतर परिणाम देते हैं, लेकिन यहां कोई भी OCR टूल हस्तलिखित नोट्स के मानवीय ट्रांसक्रिप्शन का भरोसेमंद विकल्प नहीं है।
परिणामों की जांच करना
हमेशा मूल के साथ OCR आउटपुट की स्पॉट-जांच करें, विशेष रूप से संख्याएं, नाम और छोटे प्रिंट में कोई भी टेक्स्ट। किसी डाउनस्ट्रीम समस्या पैदा करने से पहले कन्वर्ट किए गए पेज पर एक त्वरित नज़र अधिकांश रिकग्निशन त्रुटियों को पकड़ लेती है।
सही टूल चुनना
OCR PDF का उपयोग करें जब फ़ाइनल फ़ाइल को मूल स्कैन जैसा दिखना जारी रखना है लेकिन सर्च योग्य बनना है। Image to Text का उपयोग करें जब आपको बिना किसी पेज इमेज के केवल पहचाने गए शब्दों की ज़रूरत है। Scan to Markdown का उपयोग करें जब स्कैन किए गए दस्तावेज़ में संरचना, शीर्षक, सूचियाँ या टेबल हों, जिन्हें Markdown के रूप में संरक्षित करना उचित हो, जैसा कि PDF to Markdown guide में बताया गया है। PDF to Word का उपयोग करें जब अंतिम लक्ष्य सादे टेक्स्ट के बजाय एक एडिटेबल दस्तावेज़ हो। आप जो भी टूल चुनें, आउटपुट के मुकाबले पहले पेज की एक त्वरित मैनुअल समीक्षा यह पुष्टि करने का सबसे तेज़ तरीका बनी रहती है कि आपने चुनी गई सेटिंग्स उस विशेष दस्तावेज़ के लिए सही थीं।