PDFテキスト抽出とは?

PDFテキスト抽出は、PDFドキュメント内に保存されている機械可読文字を取得します。光学文字認識(OCR)とは異なり、ページ画像から文字を認識するのではなく、ファイルにあらかじめ埋め込まれているテキストレイヤーを読み取ります。

抽出されたテキストは、検索、コピー、インデックス作成、分析、または他のドキュメントでの再利用が可能です。結果の順序はPDF内でのテキストの保存方法によって異なるため、段組み、表、配置されたラベルなどの複雑なレイアウトでは、画面上での見た目の読み順と一致しない場合があります。

ツールの説明

このツールは、ブラウザ上でPDFから埋め込みテキストを直接抽出します。PDFを選択すると、各ページを処理し、抽出の進行状況を確認できます。結果はコピーまたは.txtファイルとしてダウンロードできます。ページ見出しによって異なるページの内容が区切られ、埋め込みテキストがないページには警告が表示されます。

1ページ目にタイトル、2ページ目に短い段落が含まれる2ページのPDFでは、次のように出力される場合があります。

1ページ

四半期報告書

2ページ

報告期間中に収益が増加しました。

特徴

  • PDF内の読み取り可能なすべてのページから埋め込みテキストを抽出
  • ページごとの進行状況を表示し、テキストレイヤーのないページを報告
  • ブラウザ上でローカルに実行され、結果をテキストファイルとしてダウンロード可能

動作の仕組み

このツールはブラウザ上でPDFを読み込み、各ページに保存されているテキスト項目を読み取ってプレーンテキストに結合します。PDF内の改行は、利用可能な場合は保持され、抽出されたコンテンツの前にページ見出しが追加されます。

制限事項

  • スキャンされたページや画像のみで構成されたページにはOCRが必要であり、このツールではテキストを生成できません。
  • 複数段組みのドキュメント、表、高度に配置されたレイアウトでは、予期しない読み順で抽出される場合があります。
  • 破損したPDFやパスワードで保護されたPDFは読み取れない場合があります。