PDF-tekstextractor
Haal ingesloten tekst uit elke pagina van een PDF-bestand rechtstreeks in uw browser.
Invoer
Uitvoer
Readme
Wat is PDF-teksextractie?
PDF-teksextractie haalt machineleesbare tekens op die in een PDF-document zijn opgeslagen. In tegenstelling tot optische tekenherkenning (OCR) leest de tool de tekstlaag die al in het bestand is ingebed, in plaats van letters uit pagina-afbeeldingen te herkennen.
Geëxtraheerde tekst kan worden doorzocht, gekopieerd, geïndexeerd, geanalyseerd of in andere documenten worden hergebruikt. De volgorde van het resultaat hangt af van de manier waarop de PDF de tekst opslaat. Complexe lay-outs, zoals kolommen, tabellen en gepositioneerde labels, volgen daarom mogelijk niet de visuele leesvolgorde.
Beschrijving van de tool
Deze tool haalt rechtstreeks in je browser ingesloten tekst uit een PDF. Selecteer een PDF om elke pagina te verwerken, bekijk de voortgang van de extractie en kopieer of download het resultaat als een .txt-bestand. Paginakoppen houden de inhoud van verschillende pagina's gescheiden en een waarschuwing geeft aan welke pagina's geen ingesloten tekst bevatten.
Voorbeelden
Een PDF van twee pagina's met een titel op de eerste pagina en een korte alinea op de tweede pagina kan het volgende opleveren:
Pagina 1
Kwartaalrapport
Pagina 2
De omzet is tijdens de verslagperiode toegenomen.Functies
- Haalt ingesloten tekst op van elke leesbare pagina in een PDF
- Toont de voortgang per pagina en vermeldt pagina's zonder tekstlaag
- Werkt lokaal in de browser en laat je het resultaat als tekstbestand downloaden
Hoe het werkt
De tool laadt de PDF in je browser, leest de tekstitems die op elke pagina zijn opgeslagen en voegt ze samen tot platte tekst. Regeleinden uit de PDF blijven waar mogelijk behouden en vóór de geëxtraheerde inhoud worden paginakoppen toegevoegd.
Beperkingen
- Voor gescande pagina's of pagina's die alleen uit afbeeldingen bestaan, is OCR vereist. Deze tool kan daaruit geen tekst genereren.
- Documenten met meerdere kolommen, tabellen en sterk gepositioneerde lay-outs kunnen worden geëxtraheerd in een onverwachte leesvolgorde.
- Beschadigde of met een wachtwoord beveiligde PDF's kunnen mogelijk niet worden gelezen.