Εξαγωγή κειμένου PDF με OCR
Εξαγάγετε το κείμενο ενός PDF διαβάζοντας τις σελίδες του ως εικόνες με OCR. Λειτουργεί με σαρωμένα PDF, καθώς και με PDF των οποίων το κείμενο αντιγράφεται ως αλλοιωμένοι χαρακτήρες λόγω προβληματικής ή ασυνήθιστης κωδικοποίησης γραμματοσειράς.
Είσοδος
Έξοδος
Readme
Τι είναι η εξαγωγή κειμένου από PDF με OCR;
Ορισμένα PDF εμφανίζουν κείμενο που δεν μπορεί να αντιγραφεί ή να εξαχθεί σωστά. Ένα σαρωμένο έγγραφο αποθηκεύει κάθε σελίδα ως εικόνα, επομένως δεν περιέχει καθόλου κείμενο προς αντιγραφή. Άλλα PDF αποθηκεύουν το κείμενό τους, αλλά χρησιμοποιούν προβληματική ή ασυνήθιστη κωδικοποίηση γραμματοσειράς: τα γράμματα εμφανίζονται σωστά στη σελίδα, αλλά η αντιγραφή τους δίνει τυχαίους χαρακτήρες, κενά πλαίσια ή τίποτα. Αυτό συμβαίνει όταν μια γραμματοσειρά δεν καθορίζει ποιον χαρακτήρα αντιπροσωπεύει κάθε σχήμα γράμματος ή τον καθορίζει λανθασμένα.
Το OCR (οπτική αναγνώριση χαρακτήρων) διαβάζει το κείμενο όπως ένας άνθρωπος, αναγνωρίζοντας τα σχήματα των γραμμάτων στη σελίδα. Δεν χρησιμοποιεί το κείμενο που είναι αποθηκευμένο στο PDF, οπότε εξάγει το σωστό κείμενο και από τους δύο τύπους αρχείων.
Περιγραφή εργαλείου
Αυτό το εργαλείο εξάγει το κείμενο ενός PDF με OCR, απευθείας στο πρόγραμμα περιήγησής σας. Αποδίδει κάθε σελίδα ως εικόνα και αναγνωρίζει τα γράμματα με τη μηχανή OCR Tesseract. Επιλέξτε το PDF και τη γλώσσα του εγγράφου, εξαγάγετε το κείμενο και, στη συνέχεια, αντιγράψτε το ή κατεβάστε το ως αρχείο .txt. Το κείμενο κάθε σελίδας ξεκινά με επικεφαλίδα σελίδας και μπορείτε να παρακολουθείτε την πρόοδο σελίδα προς σελίδα.
Παράδειγμα
Μια σελίδα αναφοράς με δύο στήλες, της οποίας το κείμενο αντιγράφεται ως αλλοιωμένοι χαρακτήρες, όπως «еКпФщЮФГиНтЮЧьФщ», εμφανίζεται ως εξής:
Σελίδα 1
Τριμηνιαία έκθεση
Η πρώτη στήλη αρχίζει εδώ. Τα έσοδα αυξήθηκαν
κατά την περίοδο αναφοράς, επειδή άνοιξε η νέα
αποθήκη τον Μάρτιο και οι χρόνοι αποστολής μειώθηκαν
κατά δύο ημέρες.
Το κόστος παρέμεινε σταθερό. Η ομάδα προσέλαβε τέσσερις μηχανικούς και
μετέφερε το σύστημα τιμολόγησης στους νέους διακομιστές χωρίς
καμία διακοπή για τους πελάτες.
Η δεύτερη στήλη συνεχίζει την έκθεση. Οι βαθμολογίες
ικανοποίησης πελατών αυξήθηκαν στο 87 τοις εκατό και η ομάδα
υποστήριξης απάντησε στα περισσότερα αιτήματα μέσα σε μία ώρα.
Το επόμενο τρίμηνο η εταιρεία σχεδιάζει να ανοίξει γραφείο στη
Λισαβόνα, να μεταφράσει τον ιστότοπο στα Πορτογαλικά και να
κυκλοφορήσει την εφαρμογή για κινητά σε tablet.Δυνατότητες
- Εξάγει κείμενο από σαρωμένα PDF και από PDF με προβληματική ή ασυνήθιστη κωδικοποίηση γραμματοσειράς
- Αναγνωρίζει κείμενο σε 19 γλώσσες, μεταξύ των οποίων Αραβικά, Κινέζικα, Χίντι, Ιαπωνικά, Κορεατικά και Ρωσικά
- Διαβάζει σελίδες με πολλές στήλες, τη μία στήλη μετά την άλλη
- Διαβάζει σελίδες που έχουν σαρωθεί γυρισμένες στο πλάι ή ανάποδα
- Διαβάζει έως και τέσσερις σελίδες ταυτόχρονα, ανάλογα με τον αριθμό των πυρήνων επεξεργαστή της συσκευής σας
- Εμφανίζει το κείμενο κάθε σελίδας μόλις ολοκληρωθεί η ανάγνωσή της και το διατηρεί αν ακυρώσετε τη διαδικασία
- Εκτελείται στο πρόγραμμα περιήγησής σας, ώστε το PDF να μην εγκαταλείπει ποτέ τη συσκευή σας
Πώς λειτουργεί
Το εργαλείο ανοίγει το PDF με το PDF.js και αποδίδει κάθε σελίδα όρθια, στα 300 dpi, μαζί με τις εικόνες, το κείμενο και τα σχέδιά της. Η σελίδα μετατρέπεται σε εικόνα σε αποχρώσεις του γκρι και το Tesseract εντοπίζει τις στήλες και τα τμήματα κειμένου της, προτού αναγνωρίσει κάθε γραμμή. Επειδή το κείμενο διαβάζεται από την εικόνα, οι γραμματοσειρές και το κείμενο που είναι αποθηκευμένο στο PDF δεν έχουν σημασία.
Όταν το Tesseract έχει χαμηλή βεβαιότητα για το κείμενο που διάβασε σε μια σελίδα, η σελίδα μπορεί να είναι ανάποδα. Σε αυτή την περίπτωση, το εργαλείο τη διαβάζει ξανά περιστρέφοντάς την και κρατά την ανάγνωση για την οποία το Tesseract έχει μεγαλύτερη βεβαιότητα.
Η γλώσσα του εγγράφου ορίζεται αρχικά στη γλώσσα αυτού του ιστότοπου, αν το εργαλείο μπορεί να την αναγνωρίσει, και διαφορετικά στα Αγγλικά. Την πρώτη φορά που εξάγετε κείμενο σε μια γλώσσα, το πρόγραμμα περιήγησης κατεβάζει από αυτόν τον ιστότοπο τα δεδομένα αναγνώρισης για τη συγκεκριμένη γλώσσα.
Συμβουλές
- Επιλέξτε τη γλώσσα στην οποία είναι γραμμένο το έγγραφο. Αν επιλέξετε λάθος γλώσσα, γράμματα όπως ä, ß ή é συχνά αναγνωρίζονται λανθασμένα.
- Αν μπορείτε να αντιγράψετε κανονικά το κείμενο από το PDF, το εργαλείο εξαγωγής κειμένου από PDF διαβάζει απευθείας το αποθηκευμένο κείμενο. Έτσι, η διαδικασία είναι ταχύτερη και διατηρούνται οι ακριβείς χαρακτήρες.
- Το αποτέλεσμα είναι απλό κείμενο: διατηρούνται οι γραμμές κάθε σελίδας και οι κενές γραμμές μεταξύ των παραγράφων, αλλά όχι οι γραμματοσειρές, η έντονη γραφή και η διάταξη.
- Οι πολύ μεγάλες σελίδες, όπως οι αφίσες, αποδίδονται σε χαμηλότερη ανάλυση, οπότε τα μικρά γράμματα μπορεί να μην αναγνωριστούν.
- Εμφανίζεται προειδοποίηση για τον αριθμό των σελίδων χωρίς κείμενο, όπως οι κενές σελίδες.
- Δεν είναι δυνατή η ανάγνωση PDF που προστατεύονται με κωδικό πρόσβασης. Αφαιρέστε πρώτα τον κωδικό πρόσβασης.