ما استخراج النصوص من ملفات PDF باستخدام OCR؟

تعرض بعض ملفات PDF نصًا لا يمكن نسخه أو استخراجه بشكل صحيح. يخزّن المستند الممسوح ضوئيًا كل صفحة على هيئة صورة، لذلك لا يحتوي على أي نص يمكن نسخه. وتخزّن ملفات PDF أخرى النص بالفعل، لكن بترميز خطوط معطوب أو غير مألوف: تبدو الحروف صحيحة على الصفحة، لكن نسخها ينتج أحرفًا عشوائية أو مربعات فارغة أو لا ينتج شيئًا. يحدث هذا عندما لا يحدد الخط الحرف الذي يمثله كل شكل من أشكال حروفه، أو عندما يحدده بشكل خاطئ.

تقرأ تقنية OCR (التعرّف الضوئي على الأحرف) النص كما يقرؤه الإنسان، من أشكال الحروف على الصفحة. وهي لا تستخدم النص المخزّن في ملف PDF، لذا تستخرج النص الصحيح من كلا النوعين من الملفات.

وصف الأداة

تستخرج هذه الأداة النص من ملف PDF باستخدام OCR، مباشرةً في متصفحك. تعرض كل صفحة كصورة، ثم تتعرّف على الحروف فيها باستخدام محرّك Tesseract OCR. اختر ملف PDF ولغة المستند، ثم استخرج النص وانسخه أو نزّله كملف .txt. يبدأ نص كل صفحة بعنوان الصفحة، ويمكنك متابعة التقدم صفحةً بصفحة.

مثال

تُستخرج صفحة تقرير ذات عمودين، يُنسخ نصها على هيئة أحرف مشوّهة مثل "еКпФщЮФГиНтЮЧьФщ"، على النحو التالي:

الصفحة 1

التقرير الفصلي

يبدأ العمود الأول هنا. زادت الإيرادات
خلال الفترة المشمولة بالتقرير لأن المستودع الجديد
افتُتح في مارس، وانخفضت أوقات الشحن
بمقدار يومين.

ظلت التكاليف مستقرة. وظّف الفريق أربعة مهندسين
ونقل نظام الفوترة إلى الخوادم الجديدة من دون
أي توقف للعملاء.

يتابع العمود الثاني التقرير. ارتفعت درجات
رضا العملاء إلى 87 بالمئة، وأجاب فريق الدعم
عن معظم التذاكر خلال ساعة واحدة.

تخطط الشركة لافتتاح مكتب في لشبونة خلال
الربع القادم، وترجمة الموقع إلى البرتغالية،
وإطلاق التطبيق للأجهزة اللوحية.

الميزات

  • يستخرج النص من ملفات PDF الممسوحة ضوئيًا ومن ملفات PDF ذات ترميز خطوط معطوب أو غير مألوف
  • يتعرّف على النصوص بـ 19 لغة، منها العربية والصينية والهندية واليابانية والكورية والروسية
  • يقرأ الصفحات متعددة الأعمدة عمودًا تلو الآخر
  • يقرأ الصفحات الممسوحة ضوئيًا وهي مائلة أو مقلوبة رأسًا على عقب
  • يقرأ حتى أربع صفحات في الوقت نفسه، بحسب عدد أنوية المعالج في جهازك
  • يعرض نص كل صفحة فور قراءتها، ويحتفظ به إذا ألغيت العملية
  • يعمل في متصفحك، لذا لا يغادر ملف PDF جهازك

آلية العمل

تفتح الأداة ملف PDF باستخدام PDF.js، وتعرض كل صفحة بوضعية مستقيمة بدقة 300 dpi، بما في ذلك الصور والنصوص والرسومات. تُحوَّل الصفحة إلى صورة بتدرجات الرمادي، ثم يحدّد Tesseract الأعمدة والكتل النصية فيها، ويتعرّف على كل سطر. وبما أن النص يُقرأ من الصورة، فلا تؤثر الخطوط والنصوص المخزّنة في ملف PDF على النتيجة.

عندما تكون ثقة Tesseract بالنص الذي قرأه من إحدى الصفحات منخفضة، فقد تكون الصفحة مقلوبة رأسًا على عقب؛ عندها تعيد الأداة قراءتها بعد تدويرها، وتعتمد القراءة التي يثق بها Tesseract أكثر.

تكون لغة المستند افتراضيًا هي لغة هذا الموقع إذا كانت الأداة تستطيع قراءتها، والإنجليزية خلاف ذلك. في المرة الأولى التي تستخرج فيها نصًا بلغة ما، ينزّل المتصفح بيانات التعرّف الخاصة بها من هذا الموقع.

نصائح

  • اختر اللغة التي كُتب بها المستند. عند اختيار لغة غير صحيحة، كثيرًا ما يُساء التعرّف على أحرف مثل ä وß وé.
  • إذا أمكنك نسخ النص من ملف PDF كما هو، فإن أداة استخراج النص من PDF تقرأ النص المخزّن مباشرةً، وهذا أسرع ويحافظ على الأحرف كما هي تمامًا.
  • تكون النتيجة نصًا عاديًا: تُحفظ أسطر كل صفحة والأسطر الفارغة بين الفقرات، لكن لا تُحفظ الخطوط أو الأحرف العريضة أو التخطيط.
  • تُعرض الصفحات الكبيرة جدًا، مثل صفحات الملصقات، بدقة أقل، لذا قد لا تظهر الكتابة الصغيرة فيها.
  • يظهر تحذير يوضح عدد الصفحات التي لا تحتوي على نص، مثل الصفحات الفارغة.
  • لا يمكن قراءة ملفات PDF المحمية بكلمة مرور. أزِل كلمة المرور أولًا.