¿Qué es un extractor de imágenes de PDF?

Un PDF guarda las imágenes de sus páginas como archivos de imagen independientes dentro del documento: fotos, logotipos, gráficos, ilustraciones y, en el caso de un documento escaneado, el escaneo de cada página. Un extractor de imágenes de PDF extrae estas imágenes para que puedas guardarlas y reutilizarlas con la resolución que tienen en el PDF, en lugar de hacer capturas de pantalla de las páginas.

Descripción de la herramienta

Esta herramienta encuentra todas las imágenes de un PDF y las muestra en una cuadrícula, junto con las dimensiones de cada imagen en píxeles y su tamaño de archivo. Puedes descargar cada imagen por separado o descargarlas todas a la vez en un archivo ZIP. Las fotos almacenadas como JPEG se guardan exactamente como están en el PDF, y todas las demás imágenes se guardan como PNG.

Funciones

  • Extrae fotos, logotipos, gráficos y páginas escaneadas de cualquier PDF
  • Guarda las fotos JPEG sin volver a codificarlas, para que conserven toda su calidad y tamaño de archivo
  • Guarda todas las demás imágenes como PNG sin pérdida, conservando la transparencia
  • Incluye una sola vez las imágenes que aparecen en muchas páginas, como los logotipos
  • Asigna a cada archivo un nombre basado en su página, como page-3-image-2.jpg
  • Descarga imágenes individuales o todas a la vez en un archivo ZIP
  • Se ejecuta en tu navegador, por lo que el PDF nunca sale de tu dispositivo

Cómo funciona

La herramienta lee el PDF con PDF.js y recorre las páginas una por una, recopilando las imágenes que dibuja cada página, incluidas las imágenes de los campos de formulario y los sellos. PDF.js decodifica todos los formatos de imagen que puede contener un PDF, aplica su máscara de transparencia y convierte sus colores a RGB.

Cuando una imagen está almacenada como un archivo JPEG sin modificaciones y en escala de grises o en RGB, la herramienta copia los datos JPEG originales del PDF en lugar de decodificarlos, de modo que la foto se conserva byte a byte. Otras imágenes, como las fotos CMYK, las imágenes con transparencia y los mapas de bits comprimidos, se guardan como PNG después de decodificarse. Las imágenes que aparecen más de una vez en el PDF se comparan por su contenido y se incluyen en la lista solo en la primera página donde aparecen.

Las imágenes monocromáticas tipo máscara, que los PDF suelen usar para las páginas escaneadas con texto, se guardan en negro sobre fondo blanco.

Notas

  • No se pueden leer los PDF protegidos con contraseña. Primero, quítales la contraseña.
  • Un PDF con restricciones, como la prohibición de copiar o imprimir, está cifrado aunque se abra sin contraseña. Sus imágenes se extraen con normalidad, pero las fotos JPEG se guardan como PNG porque sus datos almacenados están cifrados y no se pueden copiar tal cual.
  • Los gráficos vectoriales, como los gráficos dibujados con líneas y formas, y el texto no son imágenes, por lo que no se extraen. Para guardar una página completa como imagen, conviértela a PNG.
  • Las imágenes conservan la resolución con la que están almacenadas en el PDF, que puede ser mayor o menor que el tamaño con el que aparecen en la página. Las imágenes recortadas o escaladas se extraen completas.
  • Es posible que las imágenes muy grandes se reduzcan al tamaño máximo que puede dibujar tu navegador.