OCR-textextraherare för PDF
Extrahera text från en PDF genom att läsa sidorna som bilder med OCR. Fungerar med skannade PDF-filer och med PDF-filer där kopierad text visas som förvanskade tecken på grund av felaktig eller ovanlig teckenkodning.
Inmatning
Utdata
Readme
Vad är OCR-textutvinning från PDF?
Vissa PDF-filer visar text som inte går att kopiera eller extrahera på rätt sätt. Ett skannat dokument lagrar varje sida som en bild och innehåller därför ingen text att kopiera. Andra PDF-filer innehåller text, men med en felaktig eller ovanlig teckenkodning för teckensnittet: bokstäverna ser rätt ut på sidan, men när du kopierar dem får du slumpmässiga tecken, tomma rutor eller ingenting alls. Det händer när ett teckensnitt inte anger vilken bokstavsform som motsvarar vilket tecken, eller anger det fel.
OCR (optisk teckenigenkänning) läser texten på samma sätt som en människa gör, utifrån bokstävernas former på sidan. OCR använder inte texten som lagras i PDF-filen, så den hämtar rätt text från båda typerna av filer.
Verktygsbeskrivning
Det här verktyget extraherar text från en PDF med OCR direkt i webbläsaren. Det återger varje sida som en bild och identifierar bokstäverna på den med OCR-motorn Tesseract. Välj PDF-filen och dokumentets språk, extrahera texten och kopiera den eller ladda ned den som en .txt-fil. Texten på varje sida börjar med en sidh rubrik, och du kan följa förloppet sida för sida.
Exempel
En rapportsida med två spalter vars text kopieras som förvrängda tecken, till exempel "еКпФщЮФГиНтЮЧьФщ", blir:
Sida 1
Kvartalsrapport
Den första spalten börjar här. Intäkterna ökade
under rapportperioden eftersom det nya
lagret öppnade i mars och leveranstiderna minskade
med två dagar.
Kostnaderna låg stilla. Teamet anställde fyra ingenjörer och
flyttade faktureringssystemet till de nya servrarna utan
några avbrott för kunderna.
Den andra spalten fortsätter rapporten. Kundernas
nöjdhetsbetyg steg till 87 procent, och supportteamet
besvarade de flesta ärenden inom en timme.
Nästa kvartal planerar företaget att öppna ett kontor i
Lissabon, översätta webbplatsen till portugisiska och
lansera mobilappen för surfplattor.Funktioner
- Extraherar text från skannade PDF-filer och från PDF-filer med felaktig eller ovanlig teckenkodning
- Känner igen text på 19 språk, däribland arabiska, kinesiska, hindi, japanska, koreanska och ryska
- Läser sidor med flera spalter, en spalt i taget
- Läser sidor som har skannats på sidan eller upp och ned
- Läser upp till fyra sidor samtidigt, beroende på hur många processorkärnor enheten har
- Visar texten för varje sida så snart den har lästs och behåller den om du avbryter
- Körs i webbläsaren, så PDF-filen lämnar aldrig enheten
Så fungerar det
Verktyget öppnar PDF-filen med PDF.js och återger varje sida rättvänd med 300 dpi, inklusive bilder, text och teckningar. Sidan omvandlas till en gråskalebild. Därefter hittar Tesseract spalterna och textblocken på sidan och identifierar sedan varje rad. Eftersom texten läses från bilden spelar teckensnitten och texten som lagras i PDF-filen ingen roll.
När Tesseract har låg tilltro till texten som lästs på en sida kan sidan vara upp och ned. Då läser verktyget den igen efter att ha vänt den och behåller den läsning som Tesseract har störst tilltro till.
Dokumentets språk är till en början samma som webbplatsens språk, om verktyget kan läsa det, och annars engelska. Första gången du extraherar text på ett språk hämtar webbläsaren igenkänningsdata för språket från den här webbplatsen.
Tips
- Välj det språk som dokumentet är skrivet på. Om du väljer fel språk kan bokstäver som ä, ß eller é ofta bli feltolkade.
- Om du kan kopiera texten från PDF-filen som den är, läser PDF-textutvinnaren den lagrade texten direkt. Det går snabbare och bevarar de exakta tecknen.
- Resultatet är oformaterad text: sidornas rader och tomma rader mellan stycken bevaras, men inte teckensnitt, fetstil eller layout.
- Mycket stora sidor, till exempel affischer, återges med lägre upplösning, så liten text kan missas.
- En varning visar hur många sidor som saknade text, till exempel tomma sidor.
- Lösenordsskyddade PDF-filer kan inte läsas. Ta bort lösenordet först.