PDF এবং ছবির জন্য OCR: সঠিক টেক্সট পাওয়ার উপায়
অপটিক্যাল ক্যারেক্টার রিকগনিশন একটি ছবি বা স্ক্যান করা পৃষ্ঠার অক্ষরের আকৃতি পড়ে এবং সেগুলোকে প্রকৃত, নির্বাচনযোগ্য টেক্সটে রূপান্তর করে।
OCR আসলে কী করে
একটি স্ক্যান করা পৃষ্ঠা, বা একটি ডকুমেন্টের ছবি, শুধু একটি ইমেজ, অক্ষর বা শব্দের কোনো ধারণা ছাড়াই পিক্সেলের একটি গ্রিড। OCR সেই গ্রিড বিশ্লেষণ করে, অক্ষরের আকৃতি সনাক্ত করে, এবং পৃষ্ঠায় প্রতিটি সনাক্ত করা শব্দের অবস্থানের সাথে খুঁজে পাওয়া টেক্সট আউটপুট দেয়।
অনুসন্ধানযোগ্য PDF বনাম এক্সট্র্যাক্ট করা টেক্সট
OCR PDF মূল পৃষ্ঠার ছবির উপর একটি অদৃশ্য, অনুসন্ধানযোগ্য টেক্সট লেয়ার যুক্ত করে, ফলে পৃষ্ঠাটি এখনও স্ক্যানের মতোই দেখায় কিন্তু নিচের টেক্সট যেকোনো PDF ভিউয়ারে নির্বাচনযোগ্য এবং অনুসন্ধানযোগ্য। Image to Text এর পরিবর্তে সনাক্ত করা টেক্সট নিজেই এক্সট্র্যাক্ট করে, কোনো পৃষ্ঠার ছবি ছাড়াই, যখন আপনার শুধু শব্দগুলো প্রয়োজন।
ভাষা এবং স্বয়ংক্রিয় সনাক্তকরণ
রিকগনিশন ৯৫ বা তার বেশি ভাষা সমর্থন করে। ভাষা পৃষ্ঠা ধরে ধরে স্বয়ংক্রিয়ভাবে সনাক্ত করা যায়, যা মিশ্র ডকুমেন্টের জন্য সুবিধাজনক, বা আপনি যখন ঠিক জানেন ডকুমেন্টে কী আছে তখন এক বা একাধিক ভাষা ম্যানুয়ালি বেছে নিতে পারেন। ম্যানুয়াল নির্বাচন সংক্ষিপ্ত বা অস্বাভাবিক ডকুমেন্টের জন্য স্বয়ংক্রিয় সনাক্তকরণের চেয়ে বেশি সঠিক হয়, যেখানে ভাষা নির্ভরযোগ্যভাবে সনাক্ত করার জন্য পর্যাপ্ত টেক্সট থাকে না।
স্ক্যান কোয়ালিটি টিপস
পৃষ্ঠাগুলো ৩০০ dpi-তে পড়া হয়, যা স্ট্যান্ডার্ড মুদ্রিত টেক্সটের জন্য একটি ভালো বেসলাইন। কিছু অভ্যাস নির্ভুলতায় সত্যিকারের পার্থক্য তৈরি করে:
- পৃষ্ঠা সোজা রাখুন; বাঁকা টেক্সট রিকগনিশনের নির্ভুলতা উল্লেখযোগ্যভাবে কমিয়ে দেয়।
- সমান আলো ব্যবহার করুন এবং পৃষ্ঠার উপর ছায়া এড়িয়ে চলুন, কারণ কম কনট্রাস্ট অক্ষরের আকৃতিকে বিভ্রান্ত করে।
- কম রেজোলিউশনের ফোন ফটোর উপর নির্ভর করার পরিবর্তে ৩০০ dpi বা তার বেশিতে স্ক্যান করুন।
- সম্ভব হলে স্ক্যান করার আগে কুঁচকানো বা ভাঁজ করা পৃষ্ঠা সমান করুন।
মিশ্র-ভাষার ডকুমেন্ট
দুই বা তিনটি ভাষার মধ্যে পরিবর্তিত হওয়া একটি পৃষ্ঠার জন্য, স্বয়ংক্রিয় সনাক্তকরণের উপর নির্ভর না করে সব প্রাসঙ্গিক ভাষা ম্যানুয়ালি নির্বাচন করুন, কারণ এটি প্রতি পৃষ্ঠা অনুযায়ী কাজ করে এবং সেই পৃষ্ঠার একটি ছোট অংশে থাকা একটি ভাষা মিস করতে পারে।
টেবিল এবং ফর্ম
OCR টেবিল সেল এবং ফর্ম ফিল্ডের ভেতরের টেক্সট সনাক্ত করে, কিন্তু সবসময় মূল গ্রিড স্ট্রাকচার পুরোপুরি সংরক্ষণ করে না, বিশেষ করে সরু বর্ডার বা অস্বাভাবিক লেআউটের ক্ষেত্রে। সংখ্যাসূচক টেবিলগুলো সাবধানে পরীক্ষা করুন, কারণ ভুল পড়া একটি সংখ্যা দৃশ্যত মিস করা সহজ।
হাতের লেখার সীমাবদ্ধতা
হাতের লেখায় রিকগনিশনের নির্ভুলতা তীব্রভাবে কমে যায়, এবং ছোট প্রিন্ট, ডেকোরেটিভ ফন্ট, কম কনট্রাস্ট এবং বাঁকা পৃষ্ঠার সাথে আরও কমে যায়। পরিষ্কার, মুদ্রিত ব্লক লেটার কার্সিভ হাতের লেখার তুলনায় ভালো ফল দেয়, কিন্তু এখানকার কোনো OCR টুলই হাতে লেখা নোটের একটি মানুষের প্রতিলিপির নির্ভরযোগ্য বিকল্প নয়।
ফলাফল যাচাই করা
সর্বদা মূলের সাথে OCR আউটপুট স্পট-চেক করুন, বিশেষ করে সংখ্যা, নাম এবং ছোট প্রিন্টের কোনো টেক্সট। একটি রূপান্তরিত পৃষ্ঠার একটি দ্রুত স্কিম বেশিরভাগ রিকগনিশন ভুল ধরে ফেলে, সেগুলো পরে কোনো সমস্যা তৈরি করার আগেই।
সঠিক টুল বেছে নেওয়া
চূড়ান্ত ফাইলকে মূল স্ক্যানের মতো দেখাতে হবে কিন্তু অনুসন্ধানযোগ্য হতে হবে, তখন OCR PDF ব্যবহার করুন। কোনো পৃষ্ঠার ছবি ছাড়া শুধু সনাক্ত করা শব্দগুলো প্রয়োজন হলে Image to Text ব্যবহার করুন। স্ক্যান করা ডকুমেন্টে গঠন, শিরোনাম, লিস্ট বা টেবিল থাকলে যা মার্কডাউন হিসেবে সংরক্ষণ করার মতো, তখন Scan to Markdown ব্যবহার করুন, যেমনটি PDF to Markdown guide-এ বর্ণিত। চূড়ান্ত লক্ষ্য প্লেইন টেক্সট নয় বরং একটি সম্পাদনাযোগ্য ডকুমেন্ট হলে PDF to Word ব্যবহার করুন। আপনি যে টুলই বেছে নিন, প্রথম পৃষ্ঠার আউটপুটের বিরুদ্ধে একটি দ্রুত ম্যানুয়াল পর্যালোচনা নিশ্চিত করার সবচেয়ে দ্রুত উপায় থাকে যে আপনার বেছে নেওয়া সেটিংস সেই বিশেষ ডকুমেন্টের জন্য সঠিক ছিল।