PDF画像抽出ツールとは?

PDFでは、ページ内の写真、ロゴ、グラフ、イラストなどの画像が、文書内の個別の画像ファイルとして保存されています。スキャン文書の場合は、各ページのスキャン画像も保存されています。PDF画像抽出ツールを使うと、ページのスクリーンショットを撮る代わりに、PDF内に保存されている解像度のまま画像を取り出して、保存・再利用できます。

ツールの説明

このツールはPDF内のすべての画像を検出し、各画像のピクセル単位のサイズとファイルサイズとともに一覧表示します。画像を1つずつダウンロードすることも、すべてをZIPファイルとして一括ダウンロードすることもできます。JPEG形式で保存されている写真はPDF内のデータをそのまま保存し、それ以外の画像はPNGとして保存します。

機能

  • あらゆるPDFから写真、ロゴ、グラフ、スキャンされたページを抽出
  • JPEG形式の写真は再エンコードせずに保存するため、画質とファイルサイズを維持
  • それ以外の画像は、透明度を保持したロスレスPNGとして保存
  • ロゴのように複数のページに表示される画像は、1回だけ一覧表示
  • page-3-image-2.jpgのように、ページ番号に基づいたファイル名を付与
  • 画像を個別に、またはすべてまとめてZIPファイルとしてダウンロード
  • ブラウザー内で動作するため、PDFがデバイスの外部に送信されることはありません

仕組み

このツールはPDF.jsでPDFを読み込み、ページを1枚ずつ処理して、フォームフィールドやスタンプ内の画像も含め、各ページに描画される画像を収集します。PDF.jsはPDFで使用できるあらゆる画像形式をデコードし、透明度マスクを適用して、色をRGBに変換します。

画像がグレースケールまたはRGBの通常のJPEGファイルとして保存されている場合、写真をバイト単位で完全に同じ状態に保てるよう、デコードせずにPDFから元のJPEGデータをコピーします。CMYKの写真、透明度のある画像、圧縮ビットマップなど、その他の画像はデコード後にPNGとして保存されます。PDF内に複数回表示される画像は、内容を比較して、最初に表示されるページにのみ一覧表示します。

PDFでスキャンしたテキストページによく使われる白黒のステンシル画像は、白地に黒で保存されます。

注意事項

  • パスワードで保護されたPDFは読み込めません。先にパスワードを解除してください。
  • コピーや印刷が禁止されているなどの制限が設定されたPDFは、パスワードなしで開ける場合でも暗号化されています。画像は通常どおり抽出されますが、保存データが暗号化されていてそのままコピーできないため、JPEG形式の写真はPNGとして保存されます。
  • 線や図形で描かれたグラフなどのベクター画像やテキストは画像ではないため、抽出されません。ページ全体を画像として保存するには、ページをPNGに変換してください。
  • 画像はPDF内に保存されている解像度のまま抽出されます。解像度は、ページ上での見た目より高い場合も低い場合もあります。切り抜かれた画像や拡大・縮小された画像も、全体が抽出されます。
  • 非常に大きな画像は、ブラウザーで描画可能な最大サイズまで縮小される場合があります。