Che cos'è l'estrazione del testo dai PDF?

L'estrazione del testo dai PDF recupera i caratteri leggibili automaticamente memorizzati all'interno di un documento PDF. A differenza del riconoscimento ottico dei caratteri (OCR), legge il livello di testo già incorporato nel file invece di riconoscere le lettere dalle immagini delle pagine.

Il testo estratto può essere cercato, copiato, indicizzato, analizzato o riutilizzato in altri documenti. L'ordine del risultato dipende dal modo in cui il PDF memorizza il testo, pertanto layout complessi come colonne, tabelle ed etichette posizionate potrebbero non seguire il loro ordine di lettura visivo.

Descrizione dello strumento

Questo strumento estrae il testo incorporato da un PDF direttamente nel browser. Seleziona un PDF per elaborare ogni pagina, controlla l'avanzamento dell'estrazione e copia o scarica il risultato come file .txt. Le intestazioni delle pagine mantengono separati i contenuti delle diverse pagine e un avviso identifica le pagine che non contengono testo incorporato.

Esempi

Un PDF di due pagine contenente un titolo nella prima pagina e un breve paragrafo nella seconda potrebbe produrre:

Pagina 1

Rapporto trimestrale

Pagina 2

I ricavi sono aumentati durante il periodo di riferimento.

Funzionalità

  • Estrae il testo incorporato da ogni pagina leggibile di un PDF
  • Mostra l'avanzamento pagina per pagina e segnala le pagine prive di un livello di testo
  • Funziona localmente nel browser e consente di scaricare il risultato come file di testo

Come funziona

Lo strumento carica il PDF nel browser, legge gli elementi di testo memorizzati in ogni pagina e li combina in testo semplice. Le interruzioni di riga del PDF vengono preservate quando disponibili e le intestazioni delle pagine vengono aggiunte prima del contenuto estratto.

Limitazioni

  • Le pagine scansionate o contenenti esclusivamente immagini richiedono l'OCR e non produrranno testo con questo strumento.
  • I documenti a più colonne, le tabelle e i layout con elementi posizionati con precisione potrebbero essere estratti in un ordine di lettura imprevisto.
  • I PDF danneggiati o protetti da password potrebbero non essere leggibili.