Estrazione del testo da PDF con OCR
Estrai il testo da un PDF leggendo le sue pagine come immagini con l’OCR. Funziona con i PDF scansionati e con quelli il cui testo viene copiato come una sequenza di caratteri illeggibili a causa di una codifica dei font errata o insolita.
Input
Output
Leggimi
Che cos’è l’estrazione di testo OCR dai PDF?
Alcuni PDF mostrano testo che non può essere copiato o estratto correttamente. Un documento acquisito tramite scansione memorizza ogni pagina come immagine, quindi non contiene testo da copiare. Altri PDF contengono il testo, ma utilizzano una codifica dei font non corretta o insolita: le lettere appaiono giuste sulla pagina, ma quando le si copia si ottengono caratteri casuali, caselle vuote o nessun risultato. Questo accade quando un font non specifica a quale carattere corrisponde ciascuna delle sue forme di lettere, oppure lo specifica in modo errato.
L’OCR (riconoscimento ottico dei caratteri) legge il testo come farebbe una persona, riconoscendo la forma delle lettere sulla pagina. Non utilizza il testo memorizzato nel PDF, quindi riesce a estrarre il testo corretto da entrambi i tipi di file.
Descrizione dello strumento
Questo strumento estrae il testo da un PDF con l’OCR, direttamente nel browser. Trasforma ogni pagina in un’immagine e ne riconosce le lettere con il motore OCR Tesseract. Scegli il PDF e la lingua del documento, estrai il testo e poi copialo o scaricalo come file .txt. Il testo di ogni pagina inizia con un’intestazione che indica il numero di pagina; inoltre, puoi seguire l’avanzamento pagina per pagina.
Esempio
Il testo di una pagina di un rapporto a due colonne, che copiato appare come una sequenza di caratteri senza senso, ad esempio «еКпФщЮФГиНтЮЧьФщ», viene estratto così:
Pagina 1
Rapporto trimestrale
La prima colonna inizia qui. I ricavi sono aumentati
durante il periodo di riferimento perché il nuovo
magazzino è stato aperto a marzo e i tempi di spedizione
si sono ridotti di due giorni.
I costi sono rimasti stabili. Il team ha assunto quattro
ingegneri e ha trasferito il sistema di fatturazione sui
nuovi server senza alcuna interruzione del servizio per i
clienti.
La seconda colonna prosegue il rapporto. Il punteggio
di soddisfazione dei clienti è salito all’87 per cento e il
team di assistenza ha risposto alla maggior parte delle
richieste entro un’ora.
Il prossimo trimestre l’azienda prevede di aprire un ufficio
a Lisbona, tradurre il sito web in portoghese e lanciare
l’app mobile per tablet.Funzionalità
- Estrae il testo da PDF acquisiti tramite scansione e da PDF con codifica dei font non corretta o insolita
- Riconosce il testo in 19 lingue, tra cui arabo, cinese, hindi, giapponese, coreano e russo
- Legge le pagine con più colonne, una colonna dopo l’altra
- Legge le pagine acquisite di lato o capovolte
- Legge fino a quattro pagine contemporaneamente, in base al numero di core del processore del dispositivo
- Mostra il testo di ogni pagina non appena viene letto e lo conserva anche se annulli l’operazione
- Funziona nel browser, quindi il PDF non lascia mai il tuo dispositivo
Come funziona
Lo strumento apre il PDF con PDF.js e disegna ogni pagina orientata correttamente a 300 dpi, includendo immagini, testo e disegni. La pagina viene trasformata in un’immagine in scala di grigi; Tesseract individua le colonne e i blocchi di testo, quindi riconosce ogni riga. Poiché il testo viene letto dall’immagine, i font e il testo memorizzato nel PDF non hanno importanza.
Quando Tesseract ha poca fiducia nel testo letto su una pagina, questa potrebbe essere capovolta. Lo strumento la legge quindi di nuovo ruotata e mantiene la versione riconosciuta con maggiore sicurezza da Tesseract.
La lingua del documento viene impostata inizialmente sulla lingua di questo sito, se lo strumento è in grado di leggerla, e sull’inglese in caso contrario. La prima volta che estrai testo in una lingua, il browser scarica da questo sito i relativi dati di riconoscimento.
Suggerimenti
- Seleziona la lingua in cui è scritto il documento. Se scegli la lingua sbagliata, lettere come ä, ß o é vengono spesso interpretate in modo errato.
- Se riesci a copiare correttamente il testo dal PDF, l’Estrattore di testo PDF legge direttamente il testo memorizzato: è più veloce e mantiene esattamente gli stessi caratteri.
- Il risultato è testo semplice: vengono mantenuti i capoversi di ogni pagina e le righe vuote tra i paragrafi, ma non i font, il grassetto o l’impaginazione.
- Le pagine molto grandi, come i poster, vengono disegnate a una risoluzione più bassa, quindi il testo piccolo potrebbe non essere riconosciuto.
- Un avviso indica quante pagine non contenevano testo, ad esempio le pagine vuote.
- Non è possibile leggere i PDF protetti da password. Rimuovi prima la password.