PDF-tekstin poimija
Poimi upotettu teksti PDF-tiedoston jokaiselta sivulta suoraan selaimessasi.
Syöte
Tuloste
Lue lisää
Mitä PDF-tekstin poiminta on?
PDF-tekstin poiminta hakee PDF-dokumentin sisälle tallennetut koneellisesti luettavat merkit. Toisin kuin optinen merkintunnistus (OCR), se lukee tiedostoon valmiiksi upotetun tekstikerroksen sen sijaan, että tunnistaisi kirjaimia sivukuvista.
Poimittua tekstiä voidaan hakea, kopioida, indeksoida, analysoida tai käyttää uudelleen muissa asiakirjoissa. Tuloksen järjestys riippuu siitä, miten PDF tallentaa tekstinsä, joten monimutkaiset asettelut, kuten sarakkeet, taulukot ja sijoitetut otsikot, eivät välttämättä noudata visuaalista lukemisjärjestystä.
Työkalun kuvaus
Tämä työkalu poimii PDF-tiedostoon upotetun tekstin suoraan selaimessasi. Valitse PDF käsitelläksesi sen jokaisen sivun, seuraa poiminnan edistymistä ja kopioi tai lataa tulos .txt-tiedostona. Sivujen otsikot pitävät eri sivujen sisällön erillään, ja varoitus ilmoittaa sivuista, jotka eivät sisällä upotettua tekstiä.
Esimerkkejä
Kaksisivuinen PDF, jonka ensimmäisellä sivulla on otsikko ja toisella lyhyt kappale, voi tuottaa seuraavan tuloksen:
Sivu 1
Neljännesvuosiraportti
Sivu 2
Liikevaihto kasvoi raportointikauden aikana.Ominaisuudet
- Poimii upotetun tekstin PDF-tiedoston jokaiselta luettavalta sivulta
- Näyttää edistymisen sivu kerrallaan ja ilmoittaa sivuista, joilla ei ole tekstikerrosta
- Suoritetaan paikallisesti selaimessa, ja tuloksen voi ladata tekstitiedostona
Näin se toimii
Työkalu lataa PDF-tiedoston selaimeesi, lukee kullekin sivulle tallennetut tekstikohteet ja yhdistää ne pelkäksi tekstiksi. PDF-tiedoston rivinvaihdot säilytetään mahdollisuuksien mukaan, ja sivujen otsikot lisätään ennen poimittua sisältöä.
Rajoitukset
- Skannatut tai pelkkiä kuvia sisältävät sivut edellyttävät OCR:ää, eikä tämä työkalu tuota niistä tekstiä.
- Monisarakkeiset asiakirjat, taulukot ja tarkasti sijoitellut asettelut voidaan poimia odottamattomassa lukemisjärjestyksessä.
- Vioittuneet tai salasanalla suojatut PDF-tiedostot eivät välttämättä ole luettavissa.