OCR สำหรับ PDF และรูปภาพ: วิธีให้ได้ข้อความที่แม่นยำ
การรู้จำอักขระด้วยแสงอ่านรูปทรงของตัวอักษรในภาพหรือหน้าที่สแกน แล้วแปลงเป็นข้อความจริงที่เลือกและคัดลอกได้
OCR ทำอะไรกันแน่
หน้าที่สแกน หรือรูปถ่ายของเอกสาร ก็คือภาพเท่านั้น เป็นตารางพิกเซลที่ไม่มีแนวคิดเรื่องตัวอักษรหรือคำใด ๆ OCR วิเคราะห์ตารางพิกเซลนั้น รู้จำรูปทรงตัวอักษร และแสดงข้อความที่พบพร้อมตำแหน่งของแต่ละคำที่รู้จำได้บนหน้านั้น
PDF ที่ค้นหาได้ เทียบกับ ข้อความที่ดึงออกมา
OCR PDF เพิ่มเลเยอร์ข้อความที่ค้นหาได้แบบไม่เห็นด้วยตาไว้เหนือภาพหน้าต้นฉบับ ดังนั้นหน้ายังคงดูเหมือนภาพที่สแกนทุกประการ แต่ข้อความด้านล่างสามารถเลือกและค้นหาได้ในโปรแกรมดู PDF ใดก็ตาม Image to Text ดึงข้อความที่รู้จำออกมาโดยตรงแทน โดยไม่มีภาพหน้าเข้ามาเกี่ยวข้อง สำหรับกรณีที่คุณต้องการแค่คำเท่านั้น
ภาษาและการตรวจจับอัตโนมัติ
การรู้จำรองรับ 95 ภาษาหรือมากกว่า ภาษาสามารถตรวจจับโดยอัตโนมัติเป็นรายหน้า ซึ่งสะดวกสำหรับเอกสารที่ผสมหลายภาษา หรือคุณสามารถเลือกหนึ่งภาษาหรือมากกว่าด้วยตนเองเมื่อรู้แน่ชัดว่าเอกสารมีเนื้อหาเป็นภาษาใด การเลือกด้วยตนเองมักแม่นยำกว่าการตรวจจับอัตโนมัติสำหรับเอกสารสั้นหรือแปลกที่มีข้อความไม่มากพอให้ตรวจจับภาษาได้อย่างน่าเชื่อถือ
เคล็ดลับคุณภาพการสแกน
หน้าจะถูกอ่านที่ 300 dpi ซึ่งเป็นค่าพื้นฐานที่ดีสำหรับข้อความพิมพ์มาตรฐาน มีนิสัยไม่กี่อย่างที่ส่งผลต่อความแม่นยำอย่างมาก:
- รักษาหน้าให้ตรง ข้อความที่เอียงลดความแม่นยำในการรู้จำได้อย่างเห็นได้ชัด
- ใช้แสงที่สม่ำเสมอและหลีกเลี่ยงเงาบนหน้า เพราะความต่างสีต่ำทำให้รูปทรงตัวอักษรสับสน
- สแกนที่ 300 dpi หรือสูงกว่า แทนการพึ่งพารูปถ่ายจากโทรศัพท์ความละเอียดต่ำ
- คลี่หน้าที่ม้วนหรือพับก่อนสแกนเมื่อทำได้
เอกสารที่มีหลายภาษาผสมกัน
สำหรับหน้าที่สลับไปมาระหว่างสองหรือสามภาษา ให้เลือกทุกภาษาที่เกี่ยวข้องด้วยตนเองแทนการพึ่งพาการตรวจจับอัตโนมัติ ซึ่งทำงานเป็นรายหน้าและอาจพลาดภาษาที่ปรากฏเพียงในส่วนเล็ก ๆ ของหน้านั้น
ตารางและแบบฟอร์ม
OCR รู้จำข้อความภายในเซลล์ตารางและช่องแบบฟอร์ม แต่ไม่ได้คงโครงสร้างตารางต้นฉบับไว้อย่างสมบูรณ์แบบเสมอไป โดยเฉพาะกับขอบเส้นบางหรือเลย์เอาต์ที่ไม่ปกติ ตรวจสอบตารางตัวเลขอย่างละเอียด เพราะตัวเลขที่อ่านผิดพลาดมองเห็นได้ยาก
ข้อจำกัดของลายมือ
ความแม่นยำในการรู้จำลดลงอย่างมากกับลายมือ และลดลงยิ่งกว่ากับตัวพิมพ์เล็ก ฟอนต์ประดับ ความต่างสีต่ำ และหน้าที่เอียง ตัวพิมพ์บล็อกที่เรียบร้อยทำได้ดีกว่าลายมือแบบเขียนต่อกัน แต่ไม่มีเครื่องมือ OCR ใดในที่นี้ที่ทดแทนการถอดความด้วยมือของบันทึกลายมือได้อย่างน่าเชื่อถือ
ตรวจสอบผลลัพธ์
ตรวจสอบผลลัพธ์ OCR เทียบกับต้นฉบับเสมอ โดยเฉพาะตัวเลข ชื่อ และข้อความตัวพิมพ์เล็กใด ๆ การอ่านผ่าน ๆ หน้าที่แปลงแล้วอย่างรวดเร็วจะจับข้อผิดพลาดในการรู้จำส่วนใหญ่ได้ก่อนที่จะก่อปัญหาในขั้นตอนต่อไป
เลือกเครื่องมือที่เหมาะสม
ใช้ OCR PDF เมื่อไฟล์สุดท้ายต้องดูเหมือนภาพที่สแกนต้นฉบับแต่ค้นหาได้ ใช้ Image to Text เมื่อคุณต้องการเพียงคำที่รู้จำได้ โดยไม่มีภาพหน้า ใช้ Scan to Markdown เมื่อเอกสารที่สแกนมีโครงสร้าง หัวข้อ รายการ หรือตารางที่คุ้มค่าจะคงไว้เป็น Markdown ตามที่กล่าวไว้ใน PDF to Markdown guide ใช้ PDF to Word เมื่อเป้าหมายสุดท้ายคือเอกสารที่แก้ไขได้แทนข้อความธรรมดา ไม่ว่าจะเลือกเครื่องมือใด การตรวจสอบด้วยมืออย่างรวดเร็วของหน้าแรกเทียบกับผลลัพธ์ยังคงเป็นวิธีที่เร็วที่สุดในการยืนยันว่าค่าที่คุณเลือกเหมาะสมกับเอกสารนั้นโดยเฉพาะ