مستخرج نصوص PDF
استخرج النص المضمّن من كل صفحة في ملف PDF مباشرةً من متصفحك.
الإدخال
الإخراج
ملف القراءة
ما هو استخراج النص من PDF؟
يستخرج استخراج النص من PDF الأحرف القابلة للقراءة آليًا المخزنة داخل مستند PDF. وعلى عكس التعرف الضوئي على الأحرف (OCR)، يقرأ هذه العملية طبقة النص المضمّنة بالفعل في الملف بدلًا من التعرف على الأحرف من صور الصفحات.
يمكن البحث في النص المستخرج ونسخه وفهرسته وتحليله أو إعادة استخدامه في مستندات أخرى. ويعتمد ترتيب النتيجة على طريقة تخزين PDF للنص، لذلك قد لا تتبع التخطيطات المعقدة، مثل الأعمدة والجداول والعناوين الموضوعة في مواقع محددة، ترتيب القراءة المرئي لها.
وصف الأداة
تستخرج هذه الأداة النص المضمّن من ملف PDF مباشرةً في المتصفح. حدّد ملف PDF لمعالجة كل صفحة، وراجع تقدّم الاستخراج، ثم انسخ النتيجة أو نزّلها كملف .txt. تحافظ عناوين الصفحات على فصل المحتوى بين الصفحات المختلفة، كما يحدّد تحذير الصفحات التي لا تحتوي على نص مضمّن.
أمثلة
قد ينتج عن ملف PDF مؤلف من صفحتين، يحتوي على عنوان في الصفحة الأولى وفقرة قصيرة في الصفحة الثانية، ما يلي:
الصفحة 1
التقرير ربع السنوي
الصفحة 2
زادت الإيرادات خلال فترة التقرير.الميزات
- يستخرج النص المضمّن من كل صفحة قابلة للقراءة في ملف PDF
- يعرض التقدّم صفحةً بصفحة ويُبلغ عن الصفحات التي لا تحتوي على طبقة نص
- يعمل محليًا في المتصفح ويتيح لك تنزيل النتيجة كملف نصي
آلية العمل
تُحمّل الأداة ملف PDF في المتصفح، وتقرأ عناصر النص المخزنة في كل صفحة، ثم تجمعها في نص عادي. وتُحافَظ على فواصل الأسطر الواردة في PDF حيثما توفرت، كما تُضاف عناوين الصفحات قبل المحتوى المستخرج.
القيود
- تتطلب الصفحات الممسوحة ضوئيًا أو الصفحات التي تحتوي على صور فقط استخدام OCR، ولن تنتج هذه الأداة نصًا منها.
- قد تُستخرج المستندات متعددة الأعمدة والجداول والتخطيطات التي تتضمن عناصر موضوعة في مواقع محددة بترتيب قراءة غير متوقع.
- قد يتعذر قراءة ملفات PDF التالفة أو المحمية بكلمة مرور.