Was ist die OCR-Texterkennung in PDFs?

In manchen PDFs lässt sich der Text nicht kopieren oder korrekt extrahieren. Ein gescanntes Dokument speichert jede Seite als Bild und enthält daher überhaupt keinen Text, den man kopieren könnte. Andere PDFs enthalten zwar Text, verwenden aber eine fehlerhafte oder ungewöhnliche Schriftkodierung: Die Buchstaben sehen auf der Seite richtig aus, beim Kopieren erscheinen jedoch zufällige Zeichen, leere Kästchen oder gar nichts. Das passiert, wenn eine Schriftart nicht angibt, für welches Zeichen die jeweilige Buchstabenform steht, oder eine falsche Zuordnung enthält.

Die OCR (optische Zeichenerkennung) liest den Text so, wie es ein Mensch tut: anhand der Buchstabenformen auf der Seite. Sie verwendet nicht den im PDF gespeicherten Text und kann daher den richtigen Text aus beiden Dateitypen auslesen.

Beschreibung des Tools

Dieses Tool extrahiert Text mit OCR aus einem PDF direkt in Ihrem Browser. Es zeichnet jede Seite als Bild und erkennt die Buchstaben darauf mit der OCR-Engine Tesseract. Wählen Sie das PDF und die Dokumentsprache aus, extrahieren Sie den Text und kopieren Sie ihn anschließend oder laden Sie ihn als .txt-Datei herunter. Der Text jeder Seite beginnt mit einer Seitenüberschrift. Außerdem können Sie den Fortschritt Seite für Seite verfolgen.

Beispiel

Eine Seite eines Berichts mit zwei Spalten, deren Text beim Kopieren als unleserliche Zeichen erscheint, etwa „еКпФщЮФГиНтЮЧьФщ“, wird so ausgegeben:

Seite 1

Quartalsbericht

Die erste Spalte beginnt hier. Der Umsatz stieg
im Berichtszeitraum, weil das neue Lager im März
eröffnet wurde und sich die Lieferzeiten um zwei Tage
verkürzten.

Die Kosten blieben stabil. Das Team stellte vier Ingenieure ein und
verlegte das Abrechnungssystem ohne
Ausfallzeiten für Kunden auf die neuen Server.

In der zweiten Spalte wird der Bericht fortgesetzt. Die
Kundenzufriedenheit stieg auf 87 Prozent, und das Support-Team
beantwortete die meisten Anfragen innerhalb einer Stunde.

Im nächsten Quartal plant das Unternehmen, ein Büro in
Lissabon zu eröffnen, die Website ins Portugiesische zu übersetzen und
die mobile App für Tablets auf den Markt zu bringen.

Funktionen

  • Extrahiert Text aus gescannten PDFs und PDFs mit fehlerhafter oder ungewöhnlicher Schriftkodierung
  • Erkennt Text in 19 Sprachen, darunter Arabisch, Chinesisch, Hindi, Japanisch, Koreanisch und Russisch
  • Liest mehrspaltige Seiten spaltenweise
  • Liest Seiten, die seitlich oder auf dem Kopf gescannt wurden
  • Liest abhängig von der Anzahl der Prozessorkerne Ihres Geräts bis zu vier Seiten gleichzeitig
  • Zeigt den Text jeder Seite direkt nach dem Einlesen an und behält ihn auch dann, wenn Sie den Vorgang abbrechen
  • Läuft in Ihrem Browser, sodass das PDF Ihr Gerät nie verlässt

Funktionsweise

Das Tool öffnet das PDF mit PDF.js und zeichnet jede Seite aufrecht mit 300 dpi samt Bildern, Text und Zeichnungen. Die Seite wird in ein Graustufenbild umgewandelt. Tesseract ermittelt darauf die Spalten und Textblöcke und erkennt anschließend jede Zeile. Da der Text aus dem Bild gelesen wird, spielen die Schriftarten und der im PDF gespeicherte Text keine Rolle.

Wenn Tesseract beim Lesen einer Seite nur wenig Vertrauen in das Ergebnis hat, ist die Seite möglicherweise auf dem Kopf. In diesem Fall liest das Tool sie noch einmal umgedreht ein und verwendet die Lesung, der Tesseract mehr vertraut.

Als Dokumentsprache wird zunächst die Sprache dieser Website verwendet, sofern das Tool sie lesen kann, andernfalls Englisch. Wenn Sie zum ersten Mal Text in einer Sprache extrahieren, lädt der Browser die entsprechenden Erkennungsdaten von dieser Website herunter.

Tipps

  • Wählen Sie die Sprache, in der das Dokument verfasst ist. Bei falscher Sprache werden Buchstaben wie ä, ß oder é häufig falsch erkannt.
  • Wenn Sie den Text bereits aus dem PDF kopieren können, liest der PDF-Textextraktor den gespeicherten Text direkt aus. Das geht schneller und erhält die Zeichen exakt.
  • Das Ergebnis ist reiner Text: Die Zeilen jeder Seite und Leerzeilen zwischen Absätzen bleiben erhalten, Schriftarten, Fettdruck und Layout jedoch nicht.
  • Sehr große Seiten, etwa Poster, werden mit geringerer Auflösung gezeichnet. Dadurch werden kleine Schriftzeichen möglicherweise nicht erkannt.
  • Eine Warnung zeigt an, auf wie vielen Seiten kein Text gefunden wurde, etwa auf leeren Seiten.
  • Passwortgeschützte PDFs können nicht gelesen werden. Entfernen Sie zuerst das Passwort.