O que é a extração de texto de PDF?

A extração de texto de PDF recupera os caracteres legíveis por máquina armazenados em um documento PDF. Ao contrário do reconhecimento óptico de caracteres (OCR), ela lê a camada de texto já incorporada ao arquivo, em vez de reconhecer letras a partir de imagens das páginas.

O texto extraído pode ser pesquisado, copiado, indexado, analisado ou reutilizado em outros documentos. A ordem do resultado depende de como o PDF armazena o texto, portanto, layouts complexos, como colunas, tabelas e rótulos posicionados, podem não seguir a ordem visual de leitura.

Descrição da ferramenta

Esta ferramenta extrai diretamente no navegador o texto incorporado em um PDF. Selecione um PDF para processar cada página, acompanhe o progresso da extração e copie ou baixe o resultado como um arquivo .txt. Os títulos das páginas mantêm separados os conteúdos de páginas diferentes, e um aviso identifica as páginas que não contêm texto incorporado.

Exemplos

Um PDF de duas páginas, contendo um título na primeira página e um parágrafo curto na segunda, pode produzir:

Página 1

Relatório trimestral

Página 2

A receita aumentou durante o período do relatório.

Recursos

  • Extrai texto incorporado de todas as páginas legíveis de um PDF
  • Mostra o progresso página por página e informa quais páginas não têm uma camada de texto
  • Funciona localmente no navegador e permite baixar o resultado como um arquivo de texto

Como funciona

A ferramenta carrega o PDF no navegador, lê os itens de texto armazenados em cada página e os combina em texto simples. As quebras de linha do PDF são preservadas quando disponíveis, e os títulos das páginas são adicionados antes do conteúdo extraído.

Limitações

  • Páginas digitalizadas ou que contêm apenas imagens exigem OCR e não produzirão texto com esta ferramenta.
  • Documentos com várias colunas, tabelas e layouts com posicionamento complexo podem ser extraídos em uma ordem de leitura inesperada.
  • PDFs danificados ou protegidos por senha podem não ser legíveis.