Что такое извлечение текста из PDF?

Извлечение текста из PDF позволяет получить машиночитаемые символы, сохранённые внутри PDF-документа. В отличие от оптического распознавания символов (OCR), этот процесс считывает текстовый слой, уже встроенный в файл, а не распознаёт буквы на изображениях страниц.

Извлечённый текст можно искать, копировать, индексировать, анализировать или повторно использовать в других документах. Порядок результата зависит от того, как PDF хранит текст, поэтому сложные макеты, такие как колонки, таблицы и размещённые в определённых позициях подписи, могут отображаться не в визуальном порядке чтения.

Описание инструмента

Этот инструмент извлекает встроенный текст из PDF непосредственно в браузере. Выберите PDF-файл, чтобы обработать каждую страницу, отслеживать ход извлечения и скопировать или скачать результат в виде файла .txt. Заголовки страниц отделяют содержимое разных страниц, а предупреждение указывает на страницы, не содержащие встроенного текста.

Примеры

Двухстраничный PDF-файл, содержащий заголовок на первой странице и короткий абзац на второй, может дать следующий результат:

Страница 1

Квартальный отчёт

Страница 2

Выручка увеличилась за отчётный период.

Возможности

  • Извлекает встроенный текст с каждой доступной для чтения страницы PDF-файла
  • Показывает ход обработки по страницам и сообщает о страницах без текстового слоя
  • Работает локально в браузере и позволяет скачать результат в виде текстового файла

Как это работает

Инструмент загружает PDF-файл в браузере, считывает текстовые элементы, сохранённые на каждой странице, и объединяет их в обычный текст. Переносы строк из PDF сохраняются, если это возможно, а перед извлечённым содержимым добавляются заголовки страниц.

Ограничения

  • Для отсканированных страниц или страниц, содержащих только изображения, требуется OCR, поэтому этот инструмент не сможет извлечь из них текст.
  • Многостраничные документы, таблицы и макеты со сложным позиционированием элементов могут быть извлечены в неожиданном порядке чтения.
  • Повреждённые PDF-файлы или PDF-файлы, защищённые паролем, могут быть недоступны для чтения.