Henter ut tekst fra PDF med OCR
Hent ut teksten fra en PDF ved å lese sidene som bilder med OCR. Fungerer med skannede PDF-filer og PDF-filer der teksten kopieres som forvanskede tegn på grunn av ødelagt eller uvanlig skrifttypekoding.
Inndata
Utdata
Les meg
Hva er OCR-tekstekstraksjon fra PDF?
Noen PDF-filer viser tekst som ikke kan kopieres eller hentes ut på riktig måte. Et skannet dokument lagrer hver side som et bilde, så det finnes ingen tekst å kopiere. Andre PDF-filer lagrer teksten, men med en ødelagt eller uvanlig fontkoding: Bokstavene ser riktige ut på siden, men når du kopierer dem, får du tilfeldige tegn, tomme bokser eller ingenting. Dette skjer når en font ikke angir hvilken bokstav hvert tegn i fonten står for, eller angir det feil.
OCR (optisk tegngjenkjenning) leser teksten slik en person gjør, ut fra bokstavformene på siden. OCR bruker ikke teksten som er lagret i PDF-filen, så den henter ut riktig tekst fra begge typer filer.
Verktøybeskrivelse
Dette verktøyet henter ut teksten fra en PDF med OCR, direkte i nettleseren. Det tegner hver side som et bilde og gjenkjenner bokstavene på den med OCR-motoren Tesseract. Velg PDF-filen og dokumentets språk, hent ut teksten, og kopier den eller last den ned som en .txt-fil. Teksten på hver side begynner med en sideoverskrift, og du kan følge fremdriften side for side.
Eksempel
En rapportside med to kolonner der teksten kopieres som uleselige tegn, for eksempel «еКпФщЮФГиНтЮЧьФщ», blir til:
Side 1
Kvartalsrapport
Den første kolonnen begynner her. Inntektene økte
i rapporteringsperioden fordi det nye
lageret åpnet i mars, og leveringstidene ble to
dager kortere.
Kostnadene holdt seg stabile. Teamet ansatte fire
ingeniører og flyttet faktureringssystemet til de nye
serverne uten nedetid for kundene.
Den andre kolonnen fortsetter rapporten. Kundetilfredsheten
steg til 87 prosent, og kundestøtteteamet
besvarte de fleste henvendelsene innen én time.
Neste kvartal planlegger selskapet å åpne et kontor i
Lisboa, oversette nettstedet til portugisisk og
lansere mobilappen for nettbrett.Funksjoner
- Henter ut tekst fra skannede PDF-filer og PDF-filer med ødelagt eller uvanlig fontkoding
- Gjenkjenner tekst på 19 språk, inkludert arabisk, kinesisk, hindi, japansk, koreansk og russisk
- Leser sider med flere kolonner, én kolonne om gangen
- Leser sider som er skannet sidelengs eller opp ned
- Leser opptil fire sider samtidig, avhengig av hvor mange prosessorkjerner enheten din har
- Viser teksten fra hver side så snart den er lest, og beholder den hvis du avbryter
- Kjører i nettleseren din, så PDF-filen forlater aldri enheten din
Slik fungerer det
Verktøyet åpner PDF-filen med PDF.js og tegner hver side riktig vei med 300 dpi, inkludert bilder, tekst og tegninger. Siden gjøres om til et gråtonebilde, og Tesseract finner kolonnene og tekstblokkene på den og gjenkjenner deretter hver linje. Siden teksten leses fra bildet, spiller det ingen rolle hvilke fonter og hvilken tekst som er lagret i PDF-filen.
Når Tesseract er lite sikker på teksten den har lest på en side, kan siden være opp ned. Derfor leser verktøyet den på nytt etter å ha snudd den, og beholder lesingen Tesseract er mest sikker på.
Dokumentspråket settes først til språket på dette nettstedet hvis verktøyet kan lese det, og ellers til engelsk. Første gang du henter ut tekst på et språk, laster nettleseren ned gjenkjenningsdataene for det fra dette nettstedet.
Tips
- Velg språket dokumentet er skrevet på. Hvis du velger feil språk, blir bokstaver som ä, ß eller é ofte feiltolket.
- Hvis du kan kopiere teksten fra PDF-filen slik den er, leser PDF-tekstekstraktoren den lagrede teksten direkte. Det går raskere og beholder de nøyaktige tegnene.
- Resultatet er ren tekst: Linjene på hver side og tomme linjer mellom avsnittene beholdes, men ikke fonter, fet skrift eller oppsett.
- Svært store sider, for eksempel plakater, tegnes med lavere oppløsning, så liten skrift kan bli oversett.
- En advarsel viser hvor mange sider som ikke inneholdt tekst, for eksempel blanke sider.
- Passordbeskyttede PDF-filer kan ikke leses. Fjern passordet først.