Qu’est-ce que l’extraction de texte PDF par OCR ?

Certains PDF affichent du texte qui ne peut pas être copié ou extrait correctement. Un document numérisé stocke chaque page sous forme d’image : il n’y a donc aucun texte à copier. D’autres PDF stockent bien leur texte, mais avec un encodage de police défectueux ou inhabituel : les lettres s’affichent correctement sur la page, mais leur copie donne des caractères aléatoires, des carrés vides ou rien du tout. Cela se produit lorsqu’une police n’indique pas à quel caractère correspond chacune de ses formes de lettres, ou l’indique incorrectement.

L’OCR (reconnaissance optique de caractères) lit le texte comme le ferait une personne, en se basant sur la forme des lettres sur la page. Il n’utilise pas le texte stocké dans le PDF : il peut donc extraire le texte correctement dans les deux types de fichiers.

Description de l’outil

Cet outil extrait le texte d’un PDF par OCR, directement dans votre navigateur. Il transforme chaque page en image et en reconnaît les lettres à l’aide du moteur OCR Tesseract. Choisissez le PDF et la langue du document, extrayez le texte, puis copiez-le ou téléchargez-le au format .txt. Le texte de chaque page commence par un titre indiquant son numéro, et vous pouvez suivre la progression page par page.

Exemple

Une page de rapport sur deux colonnes dont le texte est copié sous forme de caractères illisibles, comme « еКпФщЮФГиНтЮЧьФщ », donne le résultat suivant :

Page 1

Rapport trimestriel

La première colonne commence ici. Le chiffre d’affaires a augmenté
au cours de la période concernée, car le nouvel entrepôt
a ouvert en mars et les délais de livraison ont diminué
de deux jours.

Les coûts sont restés stables. L’équipe a recruté quatre ingénieurs et
a transféré le système de facturation vers les nouveaux serveurs sans
aucune interruption de service pour les clients.

La deuxième colonne poursuit le rapport. Les scores de
satisfaction client ont atteint 87 %, et l’équipe d’assistance
a répondu à la plupart des demandes en moins d’une heure.

Le trimestre prochain, l’entreprise prévoit d’ouvrir un bureau à
Lisbonne, de traduire le site web en portugais et de
lancer l’application mobile pour tablettes.

Fonctionnalités

  • Extrait le texte des PDF numérisés et des PDF dont l’encodage de police est défectueux ou inhabituel
  • Reconnaît le texte dans 19 langues, dont l’arabe, le chinois, l’hindi, le japonais, le coréen et le russe
  • Lit les pages à plusieurs colonnes en traitant une colonne après l’autre
  • Lit les pages numérisées de côté ou à l’envers
  • Lit jusqu’à quatre pages simultanément, selon le nombre de cœurs de processeur de votre appareil
  • Affiche le texte de chaque page dès qu’il est lu et le conserve si vous annulez
  • Fonctionne dans votre navigateur : le PDF ne quitte donc jamais votre appareil

Fonctionnement

L’outil ouvre le PDF avec PDF.js et transforme chaque page en image à l’endroit, à 300 ppp, avec ses images, son texte et ses dessins. La page est convertie en image en niveaux de gris. Tesseract y repère les colonnes et les blocs de texte, puis reconnaît chaque ligne. Comme le texte est lu à partir de l’image, les polices et le texte stockés dans le PDF n’ont pas d’importance.

Lorsque Tesseract n’est pas très sûr du texte lu sur une page, celle-ci est peut-être à l’envers. L’outil la lit alors de nouveau après l’avoir tournée de 180° et conserve la lecture dont Tesseract est le plus sûr.

La langue du document est par défaut celle de ce site si l’outil peut la lire, et l’anglais dans le cas contraire. La première fois que vous extrayez du texte dans une langue, le navigateur télécharge les données de reconnaissance correspondantes depuis ce site.

Conseils

  • Choisissez la langue dans laquelle le document est rédigé. Si la langue sélectionnée est incorrecte, les lettres comme ä, ß ou é sont souvent mal reconnues.
  • Si vous pouvez copier le texte du PDF tel quel, l’outil d’extraction de texte PDF lit directement le texte stocké. C’est plus rapide et les caractères restent exactement les mêmes.
  • Le résultat est du texte brut : les lignes de chaque page et les lignes vides entre les paragraphes sont conservées, mais pas les polices, le gras ni la mise en page.
  • Les pages très grandes, comme les affiches, sont converties à une résolution plus faible : les petits caractères risquent donc de ne pas être reconnus.
  • Un avertissement indique le nombre de pages sans texte, comme les pages vierges.
  • Les PDF protégés par mot de passe ne peuvent pas être lus. Supprimez d’abord le mot de passe.