Was ist die PDF-Textextraktion?

Die PDF-Textextraktion ruft maschinenlesbare Zeichen ab, die in einem PDF-Dokument gespeichert sind. Im Gegensatz zur optischen Zeichenerkennung (OCR) liest sie die bereits in der Datei eingebettete Textebene, anstatt Buchstaben aus Seitenbildern zu erkennen.

Extrahierter Text kann gesucht, kopiert, indiziert, analysiert oder in anderen Dokumenten wiederverwendet werden. Die Reihenfolge des Ergebnisses hängt davon ab, wie das PDF seinen Text speichert. Daher folgen komplexe Layouts wie Spalten, Tabellen und positionierte Beschriftungen möglicherweise nicht der visuellen Lesereihenfolge.

Toolbeschreibung

Dieses Tool extrahiert eingebetteten Text direkt in Ihrem Browser aus einem PDF. Wählen Sie ein PDF aus, um jede Seite zu verarbeiten, den Fortschritt der Extraktion zu überprüfen und das Ergebnis als .txt-Datei zu kopieren oder herunterzuladen. Seitenüberschriften halten die Inhalte verschiedener Seiten getrennt, und eine Warnung kennzeichnet Seiten, die keinen eingebetteten Text enthalten.

Beispiele

Ein zweiseitiges PDF mit einem Titel auf der ersten Seite und einem kurzen Absatz auf der zweiten Seite kann Folgendes ergeben:

Seite 1

Quartalsbericht

Seite 2

Der Umsatz ist während des Berichtszeitraums gestiegen.

Funktionen

  • Extrahiert eingebetteten Text aus jeder lesbaren Seite eines PDFs
  • Zeigt den Fortschritt für jede Seite an und meldet Seiten ohne Textebene
  • Wird lokal im Browser ausgeführt und ermöglicht das Herunterladen des Ergebnisses als Textdatei

Funktionsweise

Das Tool lädt das PDF in Ihrem Browser, liest die auf jeder Seite gespeicherten Textelemente und fügt sie zu einfachem Text zusammen. Zeilenumbrüche aus dem PDF werden, sofern verfügbar, beibehalten. Außerdem werden vor dem extrahierten Inhalt Seitenüberschriften hinzugefügt.

Einschränkungen

  • Für gescannte oder ausschließlich aus Bildern bestehende Seiten ist OCR erforderlich. Mit diesem Tool wird daraus kein Text extrahiert.
  • Mehrspaltige Dokumente, Tabellen und stark positionierte Layouts werden möglicherweise in einer unerwarteten Lesereihenfolge extrahiert.
  • Beschädigte oder passwortgeschützte PDFs sind möglicherweise nicht lesbar.