OCR עבור PDF ותמונות: איך לקבל טקסט מדויק
זיהוי תווים אופטי קורא את הצורות של האותיות בתמונה או בעמוד סרוק וממיר אותן לטקסט אמיתי וניתן לבחירה.
מה OCR עושה בפועל
עמוד סרוק, או צילום של מסמך, הוא בסך הכול תמונה, רשת פיקסלים בלי שום מושג של אותיות או מילים. OCR מנתח את הרשת הזו, מזהה צורות תווים, ומפיק את הטקסט שמצא לצד המיקום של כל מילה שזוהתה בעמוד.
PDF ניתן לחיפוש מול טקסט מחולץ
OCR PDF מוסיף שכבת טקסט שקופה וניתנת לחיפוש מעל תמונת העמוד המקורית, כך שהעמוד עדיין נראה בדיוק כמו הסריקה אך הטקסט מתחת ניתן לבחירה ולחיפוש בכל מציג PDF. Image to Text לעומת זאת מחלץ את הטקסט המזוהה בפני עצמו, בלי תמונת עמוד מעורבת, לרגעים שבהם אתם רוצים רק את המילים.
שפות וזיהוי אוטומטי
הזיהוי תומך ב-95 שפות ומעלה. ניתן לזהות שפה אוטומטית עמוד אחר עמוד, מה שנוח למסמכים מעורבים, או שאפשר לבחור שפה אחת או יותר באופן ידני כשיודעים בדיוק מה מכיל המסמך. בחירה ידנית נוטה להיות מדויקת יותר מזיהוי אוטומטי במסמכים קצרים או חריגים שבהם אין מספיק טקסט לזיהוי שפה אמין.
טיפים לאיכות סריקה
עמודים נקראים ב-300 dpi, שהוא בסיס טוב לטקסט מודפס סטנדרטי. כמה הרגלים עושים הבדל אמיתי בדיוק:
- שמרו על העמוד ישר; טקסט עקום מפחית באופן ניכר את דיוק הזיהוי.
- השתמשו בתאורה אחידה והימנעו מצללים על העמוד, כיוון שניגודיות נמוכה מבלבלת את צורות התווים.
- סרקו ב-300 dpi או יותר במקום להסתמך על צילום טלפון ברזולוציה נמוכה.
- החליקו עמודים מקומטים או מקופלים לפני הסריקה במידת האפשר.
מסמכים בשפות מעורבות
לעמוד שמתחלף בין שתי או שלוש שפות, בחרו את כל השפות הרלוונטיות באופן ידני במקום להסתמך על זיהוי אוטומטי, שפועל לפי עמוד ועלול לפספס שפה שמופיעה רק בחלק קטן מהעמוד ההוא.
טבלאות וטפסים
OCR מזהה את הטקסט בתוך תאי טבלה ושדות טפסים, אך לא תמיד משמר במדויק את מבנה הרשת המקורי, במיוחד עם מסגרות דקות או פריסות חריגות. בדקו טבלאות מספריות בקפידה, כיוון שקל לפספס חזותית ספרה שזוהתה שגוי.
מגבלות בכתב יד
דיוק הזיהוי צונח בחדות בכתב יד, וצונח עוד יותר בכתב קטן, גופנים דקורטיביים, ניגודיות נמוכה ועמודים עקומים. אותיות דפוס מודפסות ונקיות מצליחות טוב יותר מכתב יד רץ, אך שום כלי OCR כאן אינו תחליף אמין לתמלול אנושי של פתקים בכתב יד.
בדיקת התוצאות
בדקו תמיד את פלט ה-OCR מול המקור בבדיקת מדגם, במיוחד מספרים, שמות וכל טקסט בגופן קטן. מעבר מהיר על עמוד שהומר תופס את רוב שגיאות הזיהוי לפני שהן גורמות לבעיה בהמשך.
בחירת הכלי הנכון
השתמשו ב-OCR PDF כאשר הקובץ הסופי צריך להמשיך להיראות כמו הסריקה המקורית אך להפוך לניתן לחיפוש. השתמשו ב-Image to Text כשצריך רק את המילים שזוהו, בלי תמונת עמוד. השתמשו ב-Scan to Markdown כשלמסמך הסרוק יש מבנה, כותרות, רשימות או טבלאות, ששווה לשמר כ-Markdown, כמתואר ב-PDF to Markdown guide. השתמשו ב-PDF to Word כשהמטרה הסופית היא מסמך הניתן לעריכה ולא טקסט רגיל. בכל כלי שתבחרו, סקירה ידנית מהירה של העמוד הראשון מול הפלט נשארת הדרך המהירה ביותר לאשר שההגדרות שנבחרו היו הנכונות לאותו מסמך ספציפי.