Что такое извлекатель изображений из PDF?

В PDF изображения на страницах хранятся внутри документа как отдельные файлы: фотографии, логотипы, диаграммы, иллюстрации, а в отсканированном документе — сканы всех страниц. Извлекатель изображений из PDF извлекает эти изображения, чтобы вы могли сохранить и использовать их с исходным разрешением, вместо того чтобы делать снимки страниц экрана.

Описание инструмента

Инструмент находит все изображения в PDF и показывает их в виде сетки, указывая размер каждого изображения в пикселях и размер файла. Вы можете скачать каждое изображение отдельно или скачать их все одним ZIP-файлом. Фотографии, хранящиеся в формате JPEG, сохраняются точно в том виде, в каком они находятся в PDF, а все остальные изображения сохраняются в формате PNG.

Возможности

  • Извлекает фотографии, логотипы, диаграммы и отсканированные страницы из любого PDF
  • Сохраняет фотографии JPEG без повторного кодирования, сохраняя исходное качество и размер файла
  • Сохраняет все остальные изображения в формате PNG без потерь, сохраняя прозрачность
  • Выводит изображение, которое встречается на многих страницах, например логотип, только один раз
  • Присваивает каждому файлу имя по номеру страницы, например page-3-image-2.jpg
  • Позволяет скачать отдельные изображения или все изображения одним ZIP-файлом
  • Работает в браузере, поэтому PDF никогда не покидает ваше устройство

Как это работает

Инструмент читает PDF с помощью PDF.js и последовательно обрабатывает страницы, собирая изображения, которые выводит каждая из них, в том числе изображения в полях форм и штампах. PDF.js декодирует все форматы изображений, которые могут содержаться в PDF, применяет маску прозрачности и преобразует цвета в RGB.

Если изображение хранится как обычный файл JPEG в оттенках серого или в RGB, инструмент копирует исходные данные JPEG из PDF, не декодируя их, поэтому фотография остается побайтно идентичной оригиналу. Другие изображения, например фотографии CMYK, изображения с прозрачностью и сжатые растровые изображения, после декодирования сохраняются в формате PNG. Изображения, которые встречаются в PDF несколько раз, сравниваются по содержимому и отображаются только один раз — на первой странице, где они встречаются.

Черно-белые трафаретные изображения, которые PDF часто использует для отсканированных текстовых страниц, сохраняются как черные на белом фоне.

Примечания

  • Защищенные паролем PDF прочитать нельзя. Сначала снимите защиту паролем.
  • PDF с ограничениями, например на копирование или печать, зашифрован, даже если открывается без пароля. Изображения из него извлекаются как обычно, но фотографии JPEG сохраняются в формате PNG, поскольку их данные зашифрованы и их нельзя скопировать в исходном виде.
  • Векторная графика, например диаграммы, нарисованные линиями и фигурами, а также текст не являются изображениями, поэтому они не извлекаются. Чтобы сохранить страницу целиком как изображение, преобразуйте ее в PNG.
  • Изображения сохраняют разрешение, в котором они хранятся в PDF, — оно может быть выше или ниже разрешения, с которым они отображаются на странице. Обрезанное или масштабированное изображение извлекается целиком.
  • Очень большие изображения могут быть уменьшены до максимального размера, который способен отобразить ваш браузер.