O que é um extrator de imagens de PDF?

Um PDF armazena as imagens de suas páginas como arquivos de imagem separados dentro do documento: fotos, logotipos, gráficos, ilustrações e, em um documento digitalizado, a imagem digitalizada de cada página. Um extrator de imagens de PDF extrai essas imagens para que você possa salvá-las e reutilizá-las na resolução em que estão no PDF, em vez de fazer capturas de tela das páginas.

Descrição da ferramenta

Esta ferramenta encontra todas as imagens em um PDF e as exibe em uma grade, com o tamanho de cada imagem em pixels e o tamanho do arquivo. Você pode baixar cada imagem individualmente ou baixar todas de uma vez em um arquivo ZIP. As fotos armazenadas como JPEG são salvas exatamente como estão no PDF, e todas as outras imagens são salvas como PNG.

Recursos

  • Extrai fotos, logotipos, gráficos e páginas digitalizadas de qualquer PDF
  • Salva fotos JPEG sem recodificação, preservando a qualidade e o tamanho original do arquivo
  • Salva todas as outras imagens como PNG sem perdas, mantendo a transparência
  • Lista apenas uma vez as imagens que aparecem em várias páginas, como um logotipo
  • Nomeia cada arquivo com base na página em que aparece, como page-3-image-2.jpg
  • Baixa imagens individuais ou todas de uma vez em um arquivo ZIP
  • Funciona no seu navegador, então o PDF nunca sai do seu dispositivo

Como funciona

A ferramenta lê o PDF com o PDF.js e percorre as páginas uma a uma, coletando as imagens exibidas em cada página, incluindo imagens em campos de formulário e carimbos. O PDF.js decodifica todos os formatos de imagem que um PDF pode conter, aplica a máscara de transparência e converte as cores para RGB.

Quando uma imagem está armazenada como um arquivo JPEG simples em tons de cinza ou em cores RGB, a ferramenta copia os dados JPEG originais do PDF em vez de decodificá-los, para que a foto permaneça exatamente igual, byte por byte. Outras imagens, como fotos CMYK, imagens com transparência e bitmaps compactados, são salvas como PNG após a decodificação. As imagens que aparecem mais de uma vez no PDF são comparadas pelo conteúdo e listadas na primeira página em que aparecem.

Imagens de estêncil em preto e branco, frequentemente usadas em PDFs de páginas com texto digitalizado, são salvas em preto sobre fundo branco.

Observações

  • PDFs protegidos por senha não podem ser lidos. Remova a senha primeiro.
  • Um PDF com restrições, como a proibição de copiar ou imprimir, é criptografado mesmo quando pode ser aberto sem senha. As imagens são extraídas normalmente, mas as fotos JPEG são salvas como PNG, pois os dados armazenados estão criptografados e não podem ser copiados como estão.
  • Gráficos vetoriais, como gráficos desenhados com linhas e formas, e textos não são imagens e, portanto, não são extraídos. Para salvar uma página inteira como imagem, converta a página para PNG.
  • As imagens mantêm a resolução em que estão armazenadas no PDF, que pode ser maior ou menor do que parecem na página. Uma imagem cortada ou redimensionada é extraída por inteiro.
  • Imagens muito grandes podem ser redimensionadas para o maior tamanho que o seu navegador consegue exibir.