Qu’est-ce que l’extraction de texte PDF ?

L’extraction de texte PDF récupère les caractères lisibles par une machine stockés dans un document PDF. Contrairement à la reconnaissance optique de caractères (OCR), elle lit la couche de texte déjà intégrée au fichier au lieu de reconnaître les lettres à partir des images des pages.

Le texte extrait peut être recherché, copié, indexé, analysé ou réutilisé dans d’autres documents. L’ordre du résultat dépend de la manière dont le PDF stocke son texte. Les mises en page complexes, comme les colonnes, les tableaux et les libellés positionnés, peuvent donc ne pas suivre leur ordre de lecture visuel.

Description de l’outil

Cet outil extrait directement dans votre navigateur le texte intégré à un PDF. Sélectionnez un PDF pour traiter chaque page, suivre la progression de l’extraction, puis copier ou télécharger le résultat sous forme de fichier .txt. Les titres de page permettent de séparer le contenu des différentes pages, et un avertissement identifie les pages qui ne contiennent aucun texte intégré.

Exemples

Un PDF de deux pages contenant un titre sur la première page et un court paragraphe sur la seconde peut produire :

Page 1

Rapport trimestriel

Page 2

Le chiffre d’affaires a augmenté au cours de la période concernée.

Fonctionnalités

  • Extrait le texte intégré de chaque page lisible d’un PDF
  • Affiche la progression page par page et signale les pages dépourvues de couche de texte
  • Fonctionne localement dans le navigateur et permet de télécharger le résultat sous forme de fichier texte

Fonctionnement

L’outil charge le PDF dans votre navigateur, lit les éléments de texte stockés sur chaque page et les combine en texte brut. Les retours à la ligne du PDF sont conservés lorsqu’ils sont disponibles, et des titres de page sont ajoutés avant le contenu extrait.

Limitations

  • Les pages numérisées ou composées uniquement d’images nécessitent l’OCR et ne produiront pas de texte avec cet outil.
  • Les documents à plusieurs colonnes, les tableaux et les mises en page avec des éléments fortement positionnés peuvent être extraits dans un ordre de lecture inattendu.
  • Les fichiers PDF endommagés ou protégés par mot de passe peuvent être illisibles.