Extractor de texto de PDF
Extrae el texto incrustado de cada página de un archivo PDF directamente en tu navegador.
Entrada
Salida
Leerme
¿Qué es la extracción de texto de PDF?
La extracción de texto de PDF recupera los caracteres legibles por máquina almacenados dentro de un documento PDF. A diferencia del reconocimiento óptico de caracteres (OCR), lee la capa de texto ya integrada en el archivo en lugar de reconocer letras a partir de imágenes de las páginas.
El texto extraído se puede buscar, copiar, indexar, analizar o reutilizar en otros documentos. El orden del resultado depende de cómo el PDF almacena su texto, por lo que los diseños complejos, como columnas, tablas y etiquetas posicionadas, pueden no seguir el orden de lectura visual.
Descripción de la herramienta
Esta herramienta extrae directamente en el navegador el texto integrado en un PDF. Selecciona un PDF para procesar cada página, revisa el progreso de la extracción y copia o descarga el resultado como archivo .txt. Los encabezados de página mantienen separado el contenido de las distintas páginas, y una advertencia identifica las páginas que no contienen texto integrado.
Ejemplos
Un PDF de dos páginas que contenga un título en la primera página y un breve párrafo en la segunda puede producir:
Página 1
Informe trimestral
Página 2
Los ingresos aumentaron durante el período del informe.Funciones
- Extrae el texto integrado de todas las páginas legibles de un PDF
- Muestra el progreso página por página e informa sobre las páginas sin capa de texto
- Se ejecuta localmente en el navegador y permite descargar el resultado como archivo de texto
Cómo funciona
La herramienta carga el PDF en el navegador, lee los elementos de texto almacenados en cada página y los combina en texto sin formato. Cuando están disponibles, se conservan los saltos de línea del PDF y se añaden encabezados de página antes del contenido extraído.
Limitaciones
- Las páginas escaneadas o compuestas únicamente por imágenes requieren OCR y no producirán texto con esta herramienta.
- Los documentos con varias columnas, las tablas y los diseños con elementos altamente posicionados pueden extraerse en un orden de lectura inesperado.
- Es posible que los archivos PDF dañados o protegidos con contraseña no se puedan leer.