PDF-textutvinning
Extrahera inbäddad text från varje sida i en PDF-fil direkt i din webbläsare.
Inmatning
Utdata
Readme
Vad är extrahering av PDF-text?
Extrahering av PDF-text hämtar maskinläsbara tecken som lagras i ett PDF-dokument. Till skillnad från optisk teckenigenkänning (OCR) läser den textlagret som redan finns inbäddat i filen, i stället för att känna igen bokstäver från sidbilder.
Den extraherade texten kan sökas i, kopieras, indexeras, analyseras eller återanvändas i andra dokument. Resultatets ordning beror på hur PDF-filen lagrar sin text, så komplexa layouter som kolumner, tabeller och positionerade etiketter kanske inte följer den visuella läsordningen.
Beskrivning av verktyget
Det här verktyget extraherar inbäddad text direkt från en PDF i din webbläsare. Välj en PDF för att bearbeta varje sida, följa extraheringsförloppet och kopiera eller ladda ner resultatet som en .txt-fil. Sidrubriker håller innehållet från olika sidor åtskilt, och en varning identifierar sidor som inte innehåller någon inbäddad text.
Exempel
En PDF på två sidor som innehåller en titel på den första sidan och ett kort stycke på den andra kan ge följande resultat:
Sida 1
Kvartalsrapport
Sida 2
Intäkterna ökade under rapportperioden.Funktioner
- Extraherar inbäddad text från varje läsbar sida i en PDF
- Visar förloppet sida för sida och rapporterar sidor utan textlager
- Körs lokalt i webbläsaren och låter dig ladda ner resultatet som en textfil
Så fungerar det
Verktyget läser in PDF-filen i din webbläsare, läser textobjekten som lagras på varje sida och sammanfogar dem till oformaterad text. Radbrytningar från PDF-filen bevaras när det är möjligt, och sidrubriker läggs till före det extraherade innehållet.
Begränsningar
- Skannade sidor eller sidor som endast består av bilder kräver OCR och genererar ingen text med det här verktyget.
- Dokument med flera kolumner, tabeller och layouter med mycket exakt positionering kan extraheras i en oväntad läsordning.
- Skadade eller lösenordsskyddade PDF-filer kanske inte går att läsa.