Извлечение текста из PDF
Извлекайте встроенный текст с каждой страницы файла PDF непосредственно в браузере.
Ввод
Вывод
Документация
Что такое извлечение текста из PDF?
Извлечение текста из PDF позволяет получить машиночитаемые символы, сохранённые внутри PDF-документа. В отличие от оптического распознавания символов (OCR), этот процесс считывает текстовый слой, уже встроенный в файл, а не распознаёт буквы на изображениях страниц.
Извлечённый текст можно искать, копировать, индексировать, анализировать или повторно использовать в других документах. Порядок результата зависит от того, как PDF хранит текст, поэтому сложные макеты, такие как колонки, таблицы и размещённые в определённых позициях подписи, могут отображаться не в визуальном порядке чтения.
Описание инструмента
Этот инструмент извлекает встроенный текст из PDF непосредственно в браузере. Выберите PDF-файл, чтобы обработать каждую страницу, отслеживать ход извлечения и скопировать или скачать результат в виде файла .txt. Заголовки страниц отделяют содержимое разных страниц, а предупреждение указывает на страницы, не содержащие встроенного текста.
Примеры
Двухстраничный PDF-файл, содержащий заголовок на первой странице и короткий абзац на второй, может дать следующий результат:
Страница 1
Квартальный отчёт
Страница 2
Выручка увеличилась за отчётный период.Возможности
- Извлекает встроенный текст с каждой доступной для чтения страницы PDF-файла
- Показывает ход обработки по страницам и сообщает о страницах без текстового слоя
- Работает локально в браузере и позволяет скачать результат в виде текстового файла
Как это работает
Инструмент загружает PDF-файл в браузере, считывает текстовые элементы, сохранённые на каждой странице, и объединяет их в обычный текст. Переносы строк из PDF сохраняются, если это возможно, а перед извлечённым содержимым добавляются заголовки страниц.
Ограничения
- Для отсканированных страниц или страниц, содержащих только изображения, требуется OCR, поэтому этот инструмент не сможет извлечь из них текст.
- Многостраничные документы, таблицы и макеты со сложным позиционированием элементов могут быть извлечены в неожиданном порядке чтения.
- Повреждённые PDF-файлы или PDF-файлы, защищённые паролем, могут быть недоступны для чтения.