Wat is OCR-teksextractie uit PDF's?

Sommige PDF's tonen tekst die niet correct kan worden gekopieerd of geëxtraheerd. Een gescand document slaat elke pagina op als afbeelding, waardoor er helemaal geen tekst is om te kopiëren. Andere PDF's bevatten wel tekst, maar gebruiken een defecte of ongebruikelijke fontcodering: de letters zien er op de pagina goed uit, maar als je ze kopieert, krijg je willekeurige tekens, lege vakjes of helemaal niets. Dit gebeurt wanneer een lettertype niet aangeeft voor welk teken elke lettervorm staat, of dit verkeerd aangeeft.

OCR (optische tekenherkenning) leest tekst zoals een mens dat doet: aan de hand van de vormen van de letters op de pagina. OCR gebruikt de tekst die in de PDF is opgeslagen niet, waardoor het de juiste tekst uit beide soorten bestanden haalt.

Beschrijving van de tool

Deze tool extraheert OCR-gewijs tekst uit een PDF, rechtstreeks in je browser. De tool tekent elke pagina als afbeelding en herkent de letters erop met de OCR-engine Tesseract. Kies de PDF en de taal van het document, extraheer de tekst en kopieer deze of download deze als .txt-bestand. De tekst van elke pagina begint met een paginakop en je kunt de voortgang per pagina volgen.

Voorbeeld

Een rapportpagina met twee kolommen waarvan de tekst als onleesbare tekens wordt gekopieerd, zoals "еКпФщЮФГиНтЮЧьФщ", wordt als volgt uitgelezen:

Pagina 1

Kwartaalrapport

De eerste kolom begint hier. De omzet steeg
in de verslagperiode doordat het nieuwe
magazijn in maart werd geopend en de verzendtijd
met twee dagen afnam.

De kosten bleven gelijk. Het team nam vier engineers aan en
verhuisde het factureringssysteem naar de nieuwe servers zonder
enige onderbreking voor klanten.

De tweede kolom vervolgt het rapport. De klanttevredenheidsscores
stegen naar 87 procent en het ondersteuningsteam
beantwoordde de meeste tickets binnen een uur.

Volgend kwartaal is het bedrijf van plan een kantoor te openen in
Lissabon, de website naar het Portugees te vertalen en
de mobiele app voor tablets te lanceren.

Functies

  • Extraheert tekst uit gescande PDF's en uit PDF's met defecte of ongebruikelijke fontcodering
  • Herkent tekst in 19 talen, waaronder Arabisch, Chinees, Hindi, Japans, Koreaans en Russisch
  • Leest pagina's met meerdere kolommen kolom voor kolom
  • Leest pagina's die zijwaarts of ondersteboven zijn gescand
  • Leest maximaal vier pagina's tegelijk, afhankelijk van het aantal processorkernen van je apparaat
  • Toont de tekst van elke pagina zodra deze is uitgelezen en bewaart de tekst als je de bewerking annuleert
  • Werkt in je browser, dus de PDF verlaat je apparaat nooit

Zo werkt het

De tool opent de PDF met PDF.js en tekent elke pagina rechtop op 300 dpi, inclusief afbeeldingen, tekst en tekeningen. De pagina wordt omgezet in een afbeelding in grijstinten. Tesseract vindt vervolgens de kolommen en tekstblokken en herkent daarna elke regel. Omdat de tekst uit de afbeelding wordt gelezen, zijn de lettertypen en de tekst die in de PDF zijn opgeslagen niet van belang.

Als Tesseract weinig vertrouwen heeft in de tekst die het op een pagina heeft gelezen, staat de pagina mogelijk ondersteboven. De tool leest de pagina dan opnieuw, maar gedraaid, en gebruikt de lezing waarin Tesseract meer vertrouwen heeft.

De documenttaal is standaard de taal van deze website als de tool die kan lezen, en anders Engels. De eerste keer dat je tekst in een bepaalde taal extraheert, downloadt de browser de herkenningsgegevens voor die taal vanaf deze website.

Tips

  • Kies de taal waarin het document is geschreven. Als je de verkeerde taal kiest, worden letters zoals ä, ß of é vaak verkeerd gelezen.
  • Als je de tekst uit de PDF gewoon kunt kopiëren, leest de PDF-teksextractor de opgeslagen tekst rechtstreeks uit. Dat is sneller en behoudt de exacte tekens.
  • Het resultaat is platte tekst: de regels van elke pagina en de lege regels tussen alinea's blijven behouden, maar lettertypen, vetgedrukte tekst en de indeling niet.
  • Zeer grote pagina's, zoals posters, worden op een lagere resolutie getekend, waardoor kleine letters mogelijk niet worden herkend.
  • Er verschijnt een waarschuwing met het aantal pagina's waarop geen tekst stond, bijvoorbeeld lege pagina's.
  • PDF's die met een wachtwoord zijn beveiligd, kunnen niet worden gelezen. Verwijder eerst het wachtwoord.