Mitä OCR-pohjainen PDF-tekstin poiminta tarkoittaa?

Joissakin PDF-tiedostoissa olevaa tekstiä ei voi kopioida tai poimia oikein. Skannattu asiakirja tallentaa jokaisen sivun kuvana, joten siinä ei ole lainkaan kopioitavaa tekstiä. Toiset PDF-tiedostot sisältävät tekstiä, mutta fontin koodaus on virheellinen tai poikkeava: kirjaimet näyttävät sivulla oikeilta, mutta kopioitaessa tuloksena on satunnaisia merkkejä, tyhjiä ruutuja tai ei mitään. Näin käy, kun fontti ei määritä, mitä merkkiä kukin kirjainmuoto vastaa, tai määrittää sen väärin.

OCR (optinen tekstintunnistus) lukee tekstiä samalla tavalla kuin ihminen: se tunnistaa sivulla olevien kirjainten muodot. Se ei käytä PDF-tiedostoon tallennettua tekstiä, joten se poimii oikean tekstin kummankintyyppisistä tiedostoista.

Työkalun kuvaus

Tämä työkalu poimii PDF-tiedoston tekstin OCR:n avulla suoraan selaimessasi. Se piirtää jokaisen sivun kuvaksi ja tunnistaa sen kirjaimet Tesseract-OCR-moottorilla. Valitse PDF-tiedosto ja asiakirjan kieli, poimi teksti ja kopioi se tai lataa se .txt-tiedostona. Kunkin sivun teksti alkaa sivuotsikolla, ja voit seurata etenemistä sivu kerrallaan.

Esimerkki

Kaksipalstaisen raporttisivun teksti kopioituu virheellisinä merkkeinä, kuten ”еКпФщЮФГиНтЮЧьФщ”, mutta poiminnan tulos näyttää tältä:

Sivu 1

Neljännesvuosiraportti

Ensimmäinen palsta alkaa tästä. Liikevaihto kasvoi
raportointijakson aikana, koska uusi varasto avattiin
maaliskuussa ja toimitusajat lyhenivät
kahdella päivällä.

Kustannukset pysyivät ennallaan. Tiimi palkkasi neljä
insinööriä ja siirsi laskutusjärjestelmän uusille
palvelimille ilman asiakkaille aiheutuneita
käyttökatkoja.

Toinen palsta jatkaa raporttia. Asiakastyytyväisyyden
arvosana nousi 87 prosenttiin, ja tukitiimi vastasi
useimpiin tukipyyntöihin tunnin kuluessa.

Ensi vuosineljänneksellä yritys aikoo avata toimiston
Lissaboniin, kääntää verkkosivuston portugaliksi ja
julkaista mobiilisovelluksen tableteille.

Ominaisuudet

  • Poimii tekstiä skannatuista PDF-tiedostoista sekä PDF-tiedostoista, joiden fontin koodaus on virheellinen tai poikkeava
  • Tunnistaa tekstiä 19 kielellä, muun muassa arabiaksi, kiinaksi, hindiksi, japaniksi, koreaksi ja venäjäksi
  • Lukee monipalstaiset sivut palsta kerrallaan
  • Lukee sivuja, jotka on skannattu kyljellään tai ylösalaisin
  • Lukee kerralla enintään neljä sivua sen mukaan, kuinka monta prosessoriydintä laitteessasi on
  • Näyttää kunkin sivun tekstin heti, kun se on luettu, ja säilyttää sen, vaikka peruuttaisit toiminnon
  • Toimii selaimessasi, joten PDF-tiedosto ei koskaan poistu laitteeltasi

Näin se toimii

Työkalu avaa PDF-tiedoston PDF.js:n avulla ja piirtää jokaisen sivun oikein päin 300 dpi:n tarkkuudella kuvineen, teksteineen ja piirroksineen. Sivu muunnetaan harmaasävykuvaksi, ja Tesseract tunnistaa sen palstat ja tekstilohkot sekä lukee sitten jokaisen rivin. Koska teksti luetaan kuvasta, PDF-tiedoston fontilla ja siihen tallennetulla tekstillä ei ole merkitystä.

Jos Tesseract ei ole varma sivulta lukemastaan tekstistä, sivu saattaa olla ylösalaisin. Tällöin työkalu lukee sen uudelleen käännettynä ja valitsee tulkinnan, johon Tesseract luottaa enemmän.

Asiakirjan oletuskielenä on tämän sivuston kieli, jos työkalu pystyy lukemaan sitä; muussa tapauksessa oletuskielenä on englanti. Kun poimit tekstiä jollakin kielellä ensimmäistä kertaa, selain lataa kyseisen kielen tunnistustiedot tältä sivustolta.

Vinkkejä

  • Valitse asiakirjan kirjoituskieli. Väärällä kielellä esimerkiksi kirjaimet ä, ß ja é tunnistetaan usein väärin.
  • Jos pystyt kopioimaan PDF-tiedoston tekstin sellaisenaan, PDF-tekstin poimija lukee suoraan tallennetun tekstin. Se on nopeampaa ja säilyttää merkit täsmälleen alkuperäisinä.
  • Tulos on pelkkää tekstiä: kunkin sivun rivit ja kappaleiden väliset tyhjät rivit säilyvät, mutta fontit, lihavointi ja asettelu eivät.
  • Erittäin suuret sivut, kuten julisteet, piirretään pienemmällä tarkkuudella, joten niiden pienikokoinen teksti saattaa jäädä tunnistamatta.
  • Varoitus kertoo, kuinka monella sivulla ei ollut tekstiä, esimerkiksi tyhjillä sivuilla.
  • Salasanasuojattuja PDF-tiedostoja ei voi lukea. Poista salasana ensin.