OCR PDFテキスト抽出とは?

PDFによっては、テキストをコピーできなかったり、正しく抽出できなかったりすることがあります。スキャンした文書は各ページが画像として保存されるため、コピーできるテキストがありません。また、テキスト自体は保存されていても、フォントのエンコードが壊れていたり、通常とは異なっていたりするPDFもあります。ページ上では文字が正しく見えるのに、コピーすると無関係な文字や空白の四角、あるいは何も出てこないことがあります。これは、フォントに各文字の形がどの文字を表すのかが記録されていなかったり、誤って記録されていたりする場合に起こります。

OCR(光学文字認識)は、ページ上の文字の形をもとに、人が読むのと同じようにテキストを読み取ります。PDFに保存されたテキストは使わないため、どちらの種類のファイルからも正しいテキストを抽出できます。

ツールの説明

このツールは、ブラウザー上でPDFをOCR処理し、テキストを抽出します。各ページを画像として描画し、Tesseract OCRエンジンで文字を認識します。PDFと文書の言語を選択してテキストを抽出し、コピーするか .txt ファイルとしてダウンロードしてください。各ページのテキストはページ見出しから始まり、ページごとに進捗を確認できます。

例

テキストをコピーすると「еКпФщЮФГиНтЮЧьФщ」のような文字化けが起こる、2段組みのレポートページからは、次のようにテキストを抽出できます。

ページ 1

四半期レポート

第1段はここから始まります。報告期間中に売上が増加しました。
3月に新しい倉庫が開設され、
配送にかかる時間が2日短縮されたためです。

コストは横ばいでした。チームはエンジニアを4人採用し、
顧客へのサービスを停止することなく、
請求システムを新しいサーバーに移行しました。

第2段では、レポートの続きが述べられています。顧客
満足度は87%に上昇し、サポート
チームはほとんどの問い合わせに1時間以内に回答しました。

来四半期、同社はリスボンにオフィスを開設し、
ウェブサイトをポルトガル語に翻訳して、
タブレット向けのモバイルアプリを公開する予定です。

機能

  • スキャンしたPDFや、フォントのエンコードが壊れていたり通常とは異なっていたりするPDFからテキストを抽出
  • アラビア語、中国語、ヒンディー語、日本語、韓国語、ロシア語を含む19言語のテキストを認識
  • 複数段組みのページを、段ごとに読み取り
  • 横向きや上下逆さまにスキャンされたページを読み取り
  • お使いのデバイスのプロセッサコア数に応じて、最大4ページを同時に読み取り
  • 読み取りが終わったページから順にテキストを表示。処理をキャンセルしても、表示済みのテキストは保持
  • ブラウザー上で処理するため、PDFがデバイスの外部に送信されることはありません

仕組み

このツールはPDF.jsでPDFを開き、画像、テキスト、図形を含む各ページを正しい向きで300 dpiで描画します。ページはグレースケール画像に変換され、Tesseractが段やテキストブロックを検出してから、各行を認識します。画像からテキストを読み取るため、PDFに保存されたフォントやテキストの状態には左右されません。

ページ上のテキストに対するTesseractの確信度が低い場合、ページが上下逆さまの可能性があるため、向きを反転して再度読み取ります。そして、Tesseractの確信度がより高い方の読み取り結果を採用します。

文書の言語は、ツールが対応している場合はこのサイトの言語に設定され、対応していない場合は英語に設定されます。ある言語で初めてテキストを抽出するときは、その言語の認識データがこのサイトからブラウザーにダウンロードされます。

ヒント

  • 文書の作成言語を選んでください。言語が正しくないと、ä、ß、éなどの文字が誤認識されやすくなります。
  • PDFからテキストをそのままコピーできる場合は、PDFテキスト抽出ツールを使うと保存済みのテキストを直接読み取れるため、処理が速く、文字も正確に保持されます。
  • 抽出結果はプレーンテキストです。各ページの行や段落間の空行は保持されますが、フォント、太字、レイアウトは保持されません。
  • ポスターなどの非常に大きなページは、低い解像度で描画されるため、小さな文字を読み取れないことがあります。
  • テキストがないページ(白紙のページなど)の枚数は、警告で通知されます。
  • パスワードで保護されたPDFは読み取れません。先にパスワードを解除してください。