Extractor de texto de PDF con OCR
Extrae el texto de un PDF leyendo sus páginas como imágenes mediante OCR. Funciona con PDF escaneados y con aquellos cuyo texto se copia como caracteres ilegibles debido a una codificación de fuentes defectuosa o inusual.
Entrada
Salida
Leerme
¿Qué es la extracción de texto de PDF mediante OCR?
Algunos PDF muestran texto que no se puede copiar ni extraer correctamente. Un documento escaneado almacena cada página como una imagen, por lo que no contiene texto que se pueda copiar. Otros PDF sí almacenan el texto, pero usan una codificación de fuente dañada o inusual: las letras se ven bien en la página, pero al copiarlas aparecen caracteres aleatorios, cuadros vacíos o nada. Esto ocurre cuando una fuente no indica qué carácter representa cada una de sus formas de letra, o lo indica incorrectamente.
El OCR (reconocimiento óptico de caracteres) lee el texto como lo haría una persona, a partir de las formas de las letras de la página. No usa el texto almacenado en el PDF, por lo que puede extraer correctamente el texto de ambos tipos de archivos.
Descripción de la herramienta
Esta herramienta extrae el texto de un PDF mediante OCR, directamente en el navegador. Dibuja cada página como una imagen y reconoce las letras con el motor de OCR Tesseract. Selecciona el PDF y el idioma del documento, extrae el texto y luego cópialo o descárgalo como archivo .txt. El texto de cada página comienza con un encabezado de página, y puedes seguir el progreso página por página.
Ejemplo
Una página de un informe con dos columnas cuyo texto se copia como caracteres ilegibles, por ejemplo, «еКпФщЮФГиНтЮЧьФщ», queda así:
Página 1
Informe trimestral
La primera columna comienza aquí. Los ingresos aumentaron
durante el período del informe porque el nuevo
almacén abrió en marzo y los tiempos de envío se redujeron
en dos días.
Los costos se mantuvieron estables. El equipo contrató a cuatro ingenieros y
trasladó el sistema de facturación a los nuevos servidores sin
ninguna interrupción para los clientes.
La segunda columna continúa el informe. Los índices de
satisfacción de los clientes subieron al 87 por ciento, y el equipo de
soporte respondió a la mayoría de las solicitudes en menos de una hora.
El próximo trimestre, la empresa planea abrir una oficina en
Lisboa, traducir el sitio web al portugués y
lanzar la aplicación móvil para tabletas.Características
- Extrae texto de PDF escaneados y de PDF con codificación de fuente dañada o inusual
- Reconoce texto en 19 idiomas, incluidos árabe, chino, hindi, japonés, coreano y ruso
- Lee las páginas con varias columnas, una columna después de otra
- Lee páginas escaneadas de lado o al revés
- Lee hasta cuatro páginas al mismo tiempo, según la cantidad de núcleos del procesador de tu dispositivo
- Muestra el texto de cada página en cuanto lo lee y lo conserva si cancelas el proceso
- Se ejecuta en el navegador, por lo que el PDF nunca sale de tu dispositivo
Cómo funciona
La herramienta abre el PDF con PDF.js y dibuja cada página en posición vertical a 300 dpi, con sus imágenes, texto y dibujos. La página se convierte en una imagen en escala de grises; Tesseract detecta las columnas y los bloques de texto, y luego reconoce cada línea. Como el texto se lee a partir de la imagen, las fuentes y el texto almacenados en el PDF no importan.
Cuando Tesseract tiene poca confianza en el texto que ha leído en una página, es posible que esta esté al revés. Por eso, la herramienta vuelve a leerla girada y conserva la lectura en la que Tesseract tiene más confianza.
El idioma del documento se establece inicialmente en el idioma de este sitio, si la herramienta puede leerlo, y en inglés en caso contrario. La primera vez que extraes texto en un idioma, el navegador descarga los datos de reconocimiento correspondientes desde este sitio.
Consejos
- Elige el idioma en el que está escrito el documento. Si el idioma no es el correcto, a menudo se interpretan mal letras como ä, ß o é.
- Si puedes copiar el texto del PDF tal cual, el extractor de texto de PDF lee directamente el texto almacenado, lo que es más rápido y conserva los caracteres exactos.
- El resultado es texto sin formato: se conservan las líneas de cada página y las líneas en blanco entre párrafos, pero no las fuentes, la negrita ni el diseño.
- Las páginas muy grandes, como los pósteres, se dibujan con una resolución más baja, por lo que puede que no se lea el texto pequeño.
- Se muestra una advertencia con el número de páginas que no tenían texto, como las páginas en blanco.
- No se pueden leer los PDF protegidos con contraseña. Primero, quítales la contraseña.