Ekstraktor tekstu z PDF
Wyodrębnia osadzony tekst z każdej strony pliku PDF bezpośrednio w przeglądarce.
Wejście
Wyjście
Instrukcja
Czym jest ekstrakcja tekstu z PDF?
Ekstrakcja tekstu z PDF pobiera znaki możliwe do odczytu maszynowego zapisane w dokumencie PDF. W przeciwieństwie do optycznego rozpoznawania znaków (OCR) odczytuje warstwę tekstową już osadzoną w pliku, zamiast rozpoznawać litery na podstawie obrazów stron.
Wyodrębniony tekst można wyszukiwać, kopiować, indeksować, analizować lub ponownie wykorzystywać w innych dokumentach. Kolejność wyniku zależy od sposobu przechowywania tekstu przez PDF, dlatego złożone układy, takie jak kolumny, tabele i etykiety umieszczone w określonych miejscach, mogą nie być ułożone zgodnie z wizualną kolejnością czytania.
Opis narzędzia
To narzędzie bezpośrednio w przeglądarce wyodrębnia osadzony tekst z pliku PDF. Wybierz plik PDF, aby przetworzyć każdą stronę, śledzić postęp ekstrakcji oraz skopiować lub pobrać wynik jako plik .txt. Nagłówki stron oddzielają treści z różnych stron, a ostrzeżenie wskazuje strony, które nie zawierają osadzonego tekstu.
Przykłady
Dwustronicowy plik PDF zawierający tytuł na pierwszej stronie i krótki akapit na drugiej może wygenerować:
Strona 1
Raport kwartalny
Strona 2
Przychody wzrosły w raportowanym okresie.Funkcje
- Wyodrębnia osadzony tekst z każdej strony PDF, którą można odczytać
- Pokazuje postęp przetwarzania strona po stronie i informuje o stronach bez warstwy tekstowej
- Działa lokalnie w przeglądarce i umożliwia pobranie wyniku jako pliku tekstowego
Jak to działa
Narzędzie ładuje plik PDF w przeglądarce, odczytuje elementy tekstowe zapisane na każdej stronie i łączy je w zwykły tekst. W miarę dostępności zachowuje znaki końca wiersza z pliku PDF, a przed wyodrębnioną treścią dodaje nagłówki stron.
Ograniczenia
- Strony zeskanowane lub zawierające wyłącznie obrazy wymagają OCR i nie zostaną przekształcone w tekst za pomocą tego narzędzia.
- Dokumenty wielokolumnowe, tabele i układy z precyzyjnie rozmieszczonymi elementami mogą zostać wyodrębnione w nieoczekiwanej kolejności czytania.
- Uszkodzone pliki PDF lub pliki PDF chronione hasłem mogą być nieczytelne.