Wyodrębnianie tekstu z PDF za pomocą OCR
Wyodrębnij tekst z pliku PDF, odczytując jego strony jako obrazy za pomocą OCR. Narzędzie działa ze skanowanymi plikami PDF oraz z plikami, w których skopiowany tekst zawiera zniekształcone znaki z powodu nieprawidłowego lub nietypowego kodowania czcionki.
Wejście
Wyjście
Instrukcja
Czym jest wyodrębnianie tekstu z PDF za pomocą OCR?
Niektóre pliki PDF wyświetlają tekst, którego nie można skopiować ani poprawnie wyodrębnić. Zeskanowany dokument przechowuje każdą stronę jako obraz, więc nie zawiera tekstu, który można skopiować. Inne pliki PDF przechowują tekst, ale używają błędnego lub nietypowego kodowania czcionki: litery na stronie wyglądają poprawnie, ale po skopiowaniu pojawiają się losowe znaki, puste kwadraty albo nic. Dzieje się tak, gdy czcionka nie określa, jaki znak reprezentuje każdy z jej kształtów liter, albo określa to nieprawidłowo.
OCR (optyczne rozpoznawanie znaków) odczytuje tekst tak jak człowiek — na podstawie kształtów liter na stronie. Nie korzysta z tekstu zapisanego w pliku PDF, dlatego poprawnie odczytuje tekst z obu rodzajów plików.
Opis narzędzia
To narzędzie wyodrębnia tekst z pliku PDF za pomocą OCR, bezpośrednio w przeglądarce. Wyświetla każdą stronę jako obraz i rozpoznaje znajdujące się na niej litery za pomocą silnika OCR Tesseract. Wybierz plik PDF i język dokumentu, wyodrębnij tekst, a następnie skopiuj go lub pobierz jako plik .txt. Tekst każdej strony zaczyna się od nagłówka ze wskazaniem strony, a postęp możesz śledzić strona po stronie.
Przykład
Tekst ze strony dwukolumnowego raportu, który kopiuje się jako zniekształcone znaki, na przykład „еКпФщЮФГиНтЮЧьФщ”, zostaje odczytany w następujący sposób:
Strona 1
Raport kwartalny
Tutaj zaczyna się pierwsza kolumna. Przychody wzrosły
w okresie sprawozdawczym, ponieważ nowy magazyn
został otwarty w marcu, a czas dostawy skrócił się
o dwa dni.
Koszty pozostały na tym samym poziomie. Zespół zatrudnił czterech inżynierów i
przeniósł system rozliczeń na nowe serwery bez
żadnych przerw w działaniu dla klientów.
Druga kolumna zawiera dalszą część raportu. Wyniki
badania zadowolenia klientów wzrosły do 87 procent, a zespół
wsparcia odpowiadał na większość zgłoszeń w ciągu godziny.
W przyszłym kwartale firma planuje otworzyć biuro w
Lizbonie, przetłumaczyć witrynę na portugalski i
uruchomić aplikację mobilną na tablety.Funkcje
- Wyodrębnia tekst ze zeskanowanych plików PDF oraz z plików PDF z błędnym lub nietypowym kodowaniem czcionki
- Rozpoznaje tekst w 19 językach, w tym po arabsku, chińsku, hindi, japońsku, koreańsku i rosyjsku
- Odczytuje strony z kilkoma kolumnami, po kolei, kolumna po kolumnie
- Odczytuje strony zeskanowane bokiem lub do góry nogami
- Odczytuje jednocześnie maksymalnie cztery strony, w zależności od liczby rdzeni procesora w urządzeniu
- Wyświetla tekst każdej strony zaraz po jej odczytaniu i zachowuje go w przypadku anulowania
- Działa w przeglądarce, więc plik PDF nigdy nie opuszcza urządzenia
Jak to działa
Narzędzie otwiera plik PDF za pomocą PDF.js i wyświetla każdą stronę we właściwej orientacji w rozdzielczości 300 dpi, razem z obrazami, tekstem i rysunkami. Strona jest przekształcana w obraz w skali szarości. Następnie Tesseract wykrywa kolumny i bloki tekstu, po czym rozpoznaje poszczególne wiersze. Ponieważ tekst jest odczytywany z obrazu, czcionki i tekst zapisane w pliku PDF nie mają znaczenia.
Gdy Tesseract ma niewielką pewność co do tekstu odczytanego ze strony, strona może być odwrócona do góry nogami. W takim przypadku narzędzie odczytuje ją ponownie po obróceniu i zachowuje wynik, co do którego Tesseract ma większą pewność.
Domyślnie językiem dokumentu jest język tej witryny, jeśli narzędzie go obsługuje; w przeciwnym razie jest to angielski. Przy pierwszym wyodrębnianiu tekstu w danym języku przeglądarka pobiera z tej witryny dane rozpoznawania dla tego języka.
Wskazówki
- Wybierz język, w którym napisano dokument. W przypadku wyboru niewłaściwego języka litery takie jak ä, ß czy é są często błędnie rozpoznawane.
- Jeśli możesz skopiować tekst bezpośrednio z pliku PDF, narzędzie do wyodrębniania tekstu z PDF odczyta zapisany tekst, co jest szybsze i pozwala zachować dokładne znaki.
- Wynik jest zwykłym tekstem: zachowane są wiersze na każdej stronie oraz puste wiersze między akapitami, ale nie czcionki, pogrubienie ani układ.
- Bardzo duże strony, takie jak plakaty, są wyświetlane w niższej rozdzielczości, więc drobny tekst może nie zostać rozpoznany.
- Ostrzeżenie informuje, ile stron nie zawierało tekstu, na przykład pustych stron.
- Nie można odczytać plików PDF chronionych hasłem. Najpierw usuń hasło.