Что такое извлечение текста из PDF с помощью OCR?

Некоторые PDF-файлы содержат текст, который нельзя скопировать или извлечь правильно. В отсканированном документе каждая страница сохранена как изображение, поэтому скопировать из него текст невозможно. В других PDF-файлах текст есть, но кодировка шрифта повреждена или необычна: на странице буквы выглядят правильно, однако при копировании появляются случайные символы, пустые квадраты или ничего не происходит. Так случается, когда шрифт не указывает, какой символ соответствует каждой из его форм букв, или указывает его неправильно.

OCR (оптическое распознавание символов) считывает текст так же, как человек: по формам букв на странице. OCR не использует текст, сохранённый в PDF, поэтому позволяет правильно извлечь текст из файлов обоих типов.

Описание инструмента

Этот инструмент извлекает текст из PDF с помощью OCR прямо в браузере. Он отображает каждую страницу как изображение и распознаёт буквы с помощью движка OCR Tesseract. Выберите PDF и язык документа, извлеките текст, а затем скопируйте его или скачайте в виде файла .txt. Текст каждой страницы начинается с заголовка страницы, а за ходом обработки можно следить постранично.

Пример

В отчёте с двумя колонками текст может копироваться в виде нечитаемых символов, например «еКпФщЮФГиНтЮЧьФщ». После обработки получается:

Страница 1

Квартальный отчёт

Первая колонка начинается здесь. Выручка выросла
за отчётный период, поскольку в марте открылся
новый склад, а сроки доставки сократились
на два дня.

Расходы остались на прежнем уровне. Команда наняла четырёх инженеров и
перенесла систему выставления счетов на новые серверы без
простоев для клиентов.

Во второй колонке продолжается отчёт. Оценка
удовлетворённости клиентов выросла до 87 процентов, а команда
поддержки отвечала на большинство обращений в течение часа.

В следующем квартале компания планирует открыть офис в
Лиссабоне, перевести сайт на португальский язык и
запустить мобильное приложение для планшетов.

Возможности

  • Извлекает текст из отсканированных PDF-файлов и PDF-файлов с повреждённой или необычной кодировкой шрифта
  • Распознаёт текст на 19 языках, включая арабский, китайский, хинди, японский, корейский и русский
  • Считывает страницы с несколькими колонками, переходя от одной колонки к другой
  • Считывает страницы, отсканированные боком или вверх ногами
  • Обрабатывает до четырёх страниц одновременно — в зависимости от количества ядер процессора на вашем устройстве
  • Показывает текст каждой страницы сразу после распознавания и сохраняет его, даже если вы отмените обработку
  • Работает в браузере, поэтому PDF не покидает ваше устройство

Как это работает

Инструмент открывает PDF с помощью PDF.js и отображает каждую страницу в правильной ориентации с разрешением 300 dpi, включая изображения, текст и рисунки. Страница преобразуется в изображение в оттенках серого. Затем Tesseract находит на ней колонки и текстовые блоки, а после распознаёт каждую строку. Поскольку текст считывается с изображения, шрифты и текст, сохранённый в PDF, не имеют значения.

Если Tesseract недостаточно уверен в распознанном тексте страницы, возможно, она перевёрнута. В этом случае инструмент повторно считывает её, повернув на 180 градусов, и оставляет тот вариант, в котором Tesseract уверен больше.

По умолчанию выбран язык этого сайта, если инструмент его поддерживает; в противном случае выбирается английский. При первом извлечении текста на выбранном языке браузер скачивает с этого сайта данные для распознавания.

Советы

  • Выберите язык, на котором написан документ. Если выбрать неправильный язык, такие буквы, как ä, ß или é, часто распознаются неверно.
  • Если текст из PDF можно скопировать как есть, используйте инструмент извлечения текста из PDF: он считывает сохранённый текст напрямую, работает быстрее и сохраняет символы без изменений.
  • Результат представляет собой обычный текст: строки на каждой странице и пустые строки между абзацами сохраняются, а шрифты, полужирное начертание и макет — нет.
  • Очень большие страницы, например плакаты, отображаются с более низким разрешением, поэтому мелкий текст может не распознаться.
  • Предупреждение показывает, сколько страниц не содержало текста, например пустых страниц.
  • PDF-файлы, защищённые паролем, прочитать нельзя. Сначала удалите пароль.