PDF抽出ツールが1つのファイルでは98%の精度なのに、
別のファイルでは使い物にならない結果になるのはなぜ? — 3つのPDFタイプを解説
画面上ではまったく同じに見える2つのPDFを処理したとします。1つは98%の精度で綺麗に抽出できました。もう1つは列がずれ、フィールドが欠落しためちゃくちゃな結果になりました。その違いは何でしょうか? 1つはテキストベースのPDF、もう1つは画像のみのPDF — 抽出ツールはこの2つをまったく異なる方法で処理していたのです。

重要なポイント
- 同じ抽出ツールで、あるPDFは98%の精度、別のPDFは使い物にならない結果になる — 画面上は同じに見えても、PDFは1つの形式ではなく、構造が異なる3つのコンテナ形式なのです。
- ハイブリッドPDFは1ページ目にテキストレイヤー、3ページ目にスキャン画像が埋め込まれているため、ツールは半分のページで誤ったデータソースを読み取り、正しく見えるが実際には正しくない数値を返してしまいます。
- カーソルでテキストを選択してみてください — 10秒のテストで、自分のPDFが3タイプのどれに該当するか、どの抽出戦略を適用すべきかが正確にわかります。
抽出の成否を左右する3つのPDFタイプ

2つのPDFを並べて開き、同じ種類の情報が含まれていることを確認し、同じ抽出ツールに通したのに、結果がまったく異なっていた経験はありませんか?これは文書抽出ツールに関する最も一般的な不満であり、ほとんどの場合、ツールのせいではありません。
問題は、PDFが単一の形式ではないことです。PDFはテキストを3つの根本的に異なる方法で格納できるコンテナであり、ほとんどの抽出ツールはそのうちの1つか2つしかうまく処理できません。重要な違いは、ファイルの拡張子が.pdfであるかどうかではなく、埋め込みテキストレイヤー、テキストのフラットな画像、またはその両方がファイルに含まれているかどうかです。各タイプの内部構造は次のとおりです。
ソフトウェアによって作成されます。Word文書をPDFとして保存したもの、QuickBooksのエクスポート、ERPが生成したレポートなどです。実際の文字データ、フォント情報、位置座標を含む埋め込みテキストレイヤーが含まれています。マウスで個々の単語をハイライト、選択、コピーできます。
標準抽出での精度:>95%。OCRは不要です。
紙の文書を撮影またはスキャンしてPDFとして保存したものです。テキストレイヤーは存在せず、すべての文字は単にパターンで配置されたピクセルです。テキストを選択しようとすると、カーソルは中空の長方形を描くだけで、何もハイライトされません。この文書は本質的に、PDFラッパー内の写真です。
OCRまたはビジョンAIが必要です。精度:スキャン品質に応じて85〜99%。
両方の混合:テキストレイヤーと埋め込み画像の両方を含みます。一般的な例としては、スキャンした署名ページを含む契約書や、1ページ目がシステム生成の要約で、その後に領収書の写真が続く買掛金パケットなどがあります。
最も危険なタイプです。ツールが誤ったレイヤーを読み取り、もっともらしく見えるが意味不明な出力を生成する可能性があります。
重要な洞察:画面上の見た目でPDFを判断することはできません。同じように表示される2つのファイルでも、形式レベルでは構造が異なる場合があります。抽出ツールが最初のファイルを完璧に処理し、2番目のファイルでめちゃくちゃな結果を生成した場合、最も可能性の高い説明は、それらが異なるPDFタイプに属しており、ツールが誤った抽出戦略を適用したことです。
10秒で自分のPDFを診断する方法 — 3つのテスト

PDFの種類を見分けるのに、PDF解析ツールや開発者は必要ありません。すべてのOSには、必要なツールが標準搭載されています。それはPDFリーダーです。以下の3つのテストは、オンライン解析ツールにファイルをアップロードするより短い時間で完了します。
テスト1:テキスト選択テスト(最も信頼性が高い)
PDFを任意のリーダー(Adobe Acrobat、Chrome、macOSのプレビュー、モバイルPDFアプリなど)で開きます。テキスト選択ツール(通常はIビームカーソルまたはTアイコン)をクリックし、文章または数字をドラッグして選択してみてください。
- 個々の単語がハイライトされ、コピーできる場合:そのPDFには利用可能なテキストレイヤーがあります。ネイティブのテキストベースPDFか、OCR処理済みのPDFです。標準的な抽出で問題なく処理できます。
- カーソルが中空の長方形を描き、何もハイライトされない場合:そのPDFは画像のみで構成されています。抽出できるテキストレイヤーは存在せず、ピクセルだけがあります。OCRまたはビジョンAIが必要です。
このテストは決定的です。スキャン文書は、目にはテキストがはっきり見えても、選択可能なテキストはゼロです。人間の視覚システムはピクセルパターンをテキストとして読み取りますが、コンピューターには画像としてしか見えません。
テスト2:検索テスト(簡単な補助手段)
Ctrl+F(MacではCmd+F)を押して、文書内に存在することがわかっている単語を入力します。たとえば、請求書の「Total」や契約書の「Date」などです。
- 単語が見つかりハイライトされた場合:そのPDFには検索可能なテキストが含まれています。標準的な方法で抽出は成功するはずです。
- 単語がページ上に明らかに表示されているのに検索結果がゼロの場合:その文書は画像のみで構成されています。
テスト3:混合結果テスト(ハイブリッドPDF検出用)
このテストはほとんどの人が省略するテストであり、ハイブリッドPDFが見逃される原因です。 テスト1を最初のページだけでなく、すべてのページで実行してください。1ページ目でテキストを選択し、次に3ページ目、5ページ目までスクロールします。
- 一部のページでテキストが選択でき、他のページではできない場合: それはハイブリッドPDFです。これは最も不可解な抽出エラーを引き起こすシナリオです — ツールは1ページ目と2ページ目を完璧に処理します(クリーンなテキストレイヤーがあるため)、その後、同じファイル内のスキャン画像である3ページ目で列のずれやフィールドの欠落が発生します。ファイル名が同じで、視覚的なレイアウトも一貫しているように見えるため、ツールが処理の途中で「壊れた」ように感じられます。
PDFの種類を特定できれば、修正方法は明確になります。それぞれの種類に異なる根本原因と異なる解決策があります。
原因1:テキストベースPDFなのに出力が乱れる場合
症状: テキストは選択可能で、PDFはソフトウェアで作成されているのに、抽出結果に列の順序の乱れ、テーブルセルの結合、画面上の表示と一致しない文字が含まれます。
原因: PDFはWord文書のようにテキストを保存しません。定義された読書順序を持つ線形の段落ではなく、PDFはテキストを一連の描画命令としてエンコードします — 文字「I」を座標(72, 540)に配置、「n」を(78, 540)に配置、というように。段落、読書順序、テーブル構造という概念はフォーマットに組み込まれていません。PDFは各文字がページ上のどこにあるかは認識していますが、テキストの意味や読み方については理解していません。
抽出ツールは、これらの低レベルの位置情報から論理構造を再構築する必要があります。PDFが特殊なフォントエンコーディング、カスタム文字マッピング(CMap)、または非標準のPDF生成プログラムで作成された場合、ファイルに技術的にテキストレイヤーが含まれていても、再構築の際に出力が乱れることがあります。これは以下の場合に最も一般的です:
- ERP生成PDF: 一部のエンタープライズシステムは、非標準の方法でテキストをエンコードするカスタムPDFジェネレーターを使用しています — PDFリーダーが独自のテキストレンダリングを適用するため画面上では文字は正しく見えますが、基盤となるエンコーディングが非標準であり、抽出ツールはそれを正しく解釈できません。
- 埋め込みフォントサブセットを含むPDF: フォント文字のサブセットのみが埋め込まれている場合、抽出ツールがグリフを誤ったUnicode文字にマッピングし、実際の内容にアルファベット順で隣接するが意味的には正しくない「テキスト」を生成することがあります。
- 複数列レイアウト: 適切に形成されたテキストベースPDFでも、抽出ツールが2つの列を上から下へ読み取ると、出力が乱れることがあります。文が左列の末尾から右列の末尾へ飛び、完全に読めなくなります。
修正方法: エンコーディングやレイアウトの問題で抽出がうまくいかないテキストベースPDFの場合、PDFを画像にフラット化し、ビジョンAIツールを使用してください。PDFページを高解像度画像(300 DPI以上)に変換し、ページをテキストストリームではなく視覚的なシーンとして扱うビジョン言語モデルに入力することで、エンコーディングと読書順序の問題全体を回避できます。AIは人間と同じ方法でドキュメントを読み取ります:ページを見て、その視覚的構造を理解します。
ImageToTable.aiはこれを自動的に処理します:PDFをアップロードすると、そのビジョンモデルはテキストレイヤーではなく、レンダリングされたページを画像として読み取ります。つまり、エンコーディングが不十分なテキストベースPDFでも、抽出がPDFの内部テキストストリームに依存しないため、正しく処理されます。
原因2:画像のみのPDF — テキストレイヤーが一切ない
症状:どのページでもテキストを選択できません。ファイルは表示上は問題なく見えますが、すべての抽出ツールが空の結果またはOCRの誤認識を返します。このドキュメントは、実質的にPDFラッパーに貼り付けられた写真の集合です。
発生理由:これは実際のビジネスで最も一般的なPDFのシナリオです。ベンダーが請求書を印刷し、署名し、捺印し、デジタルファイルにスキャンし直します。または、現場の検査員が紙のフォームに記入し、スマートフォンで撮影し、PDFとして保存した画像をメールで送信します。このPDFの内部構造には、ページごとに1つのオブジェクト(単一のフラット化された画像)のみが含まれています。文字オブジェクトはゼロ、フォント参照はゼロ、テキスト描画命令もゼロです。
従来の抽出ツール(pdfplumberやPyMuPDFのテキスト抽出モードなどのPythonライブラリ、およびExcelの組み込みPDFインポートを含む)は、テキストレイヤーのみを読み取ります。画像のみのPDFを開くと、抽出するものが見つからず、空白の結果を返します。これはツールのバグや制限ではありません。ツールは正しく動作しています。ドキュメントにツールが必要とするものが単に含まれていないだけです。
修正方法:画像のみのPDFには、OCR(光学文字認識)またはビジョンAIが必要です。抽出ツールは、ページを画像として読み取り、ピクセルパターンを文字として認識し、テキストを再構築できなければなりません。ここで、スキャンの品質が結果の精度を直接左右します。
高解像度スキャン(300 DPI以上)で、コントラストが良く、影がなく、傾きが最小限であれば、最新のツールで95%以上の抽出精度が得られます。低解像度スキャン(悪い照明下でくしゃくしゃのレシートをスマートフォンで撮影したものなど)では、精度が70%未満に低下する可能性があります。スキャンPDFからのAI抽出は、ビジョンモデルが完璧なスキャンだけでなく、実際の状況下のドキュメントを読むように訓練されているため、通常この範囲を処理できます。
重要な違い:画像のみのPDFは一貫して解決可能です。すべてのページに同じアプローチ(視覚的読み取り)が必要で、結果の品質はソースの品質に基づいて予測可能です。本当の落とし穴は、一貫性のない動作をするタイプです。原因3:すべてを台無しにする隠れたハイブリッドPDF
症状:一部のページは正常に抽出されるが、他のページは文字化け、列のずれ、フィールド欠落が発生する。失敗するページは成功するページと見た目が同じ。抽出ツールがバッチ処理の途中で「ランダムに」壊れたように見える。
原因:ハイブリッドPDFは通常のPDFと見た目がまったく同じであるため、抽出失敗の原因として最も見落とされがちです。ハイブリッドPDFにはテキスト層と埋め込み画像の両方が含まれており、多くの場合、ページごとに異なります。このようなシナリオで発生します:
- 建設業者がAIA G702支払申請書を提出。1ページ目は会計ソフトで生成(テキストベース)。2~5ページ目は署名済み変更指示書のスキャンコピー(画像のみ)。全体が1つのPDFファイルに結合されている。
- 保険ブローカーが保険証明書を送付。1ページ目はシステムからのデジタル出力。2ページ目は元の保険約款のスキャンコピー。
- サプライヤーが「完全な請求書パケット」をメールで送信。実際の請求書はデジタルPDFだが、添付の梱包明細と配送確認書は同じ文書に保存されたスキャン写真。
従来のツールがハイブリッドPDFを処理する場合、ファイル全体に単一の抽出戦略を適用します。ツールがテキスト層を読み取ると、2~5ページ目は何も返しません(テキスト層がないため)。ツールがすべてにOCRを適用すると、すでにテキスト層があるページからテキストを二重抽出し、重複またはマージされたデータを生成する可能性があります。一部のツールは両方の層を同時に読み取ろうとし、テキスト層の列とOCR層の列がランダムに混ざり合った混乱した出力を生成します。
これが最も危険な障害モードです。出力が本物のデータのように見えるからです。セルに数値があり、日付が一致し、名前が正しく表示されます。しかし、合計が間違っており、明細項目がずれており、自動化の目的を無効にする完全な手動検証なしでは抽出を信頼できません。
修正方法 — 2つのオプション:
ハイブリッドPDFのすべてのページを高解像度画像に変換し(Adobe Acrobatの「すべての画像を書き出し」や無料コンバーターなどを使用)、画像を再結合して画像のみのPDFを作成します。これで全ページが均一に画像になり、抽出ツールを混乱させる混合層がなくなります。
最適なケース:画像ベースのPDFをうまく処理できるが、混合層に混乱するツールを使用しているユーザー。
ImageToTable.aiを含む一部のAI抽出ツールは、デフォルトでレンダリングされたページを画像として読み取ることでPDFを処理します。つまり、テキスト層を事実上無視し、文書全体を視覚的に扱います。これにより、ツールが2つの異なるデータソースを調整しようとしないため、ハイブリッド問題を完全に回避できます。
最適なケース:大量のベンダー文書を処理し、処理前に各ファイルを検査する余裕がないユーザー。
いつフラット化すべきか、いつ切り替えるべきか — 実践的な判断フレームワーク

ここでは、特定したタイプに基づいてPDF抽出の問題を診断・解決するためのクイックリファレンスを紹介します:
| 診断結果 | 修正方法 | 期待される精度 |
|---|---|---|
| テキストベース、正常に抽出できる | 対応不要 — ツールとファイルは互換性があります | >95% |
| テキストベース、列が乱れて抽出される | 画像にフラット化し、ビジョンAIツールを使用する | フラット化後 >95% |
| 画像のみ、スキャン品質が良好 | OCRまたはビジョンAI対応のツールを使用する | 90–99% |
| 画像のみ、スキャン品質が不良 | まず元の文書を改善し、その後ビジョンAIを使用する | 70–90%(元の文書に依存) |
| ハイブリッド(ページ混在) | ファイル全体をフラット化するか、画像のみモードを使用する | 修正後は画像のみの場合と同等 |
フラット化アプローチ — すべてのページをクリーンな画像に変換すること — は、3種類すべてのPDFタイプで機能する汎用的な回避策です。これはハックではありません。抽出パイプラインから形式の曖昧さを取り除くための意図的な戦略です。すべてのページが均一に画像になれば、抽出ツールは単一の一貫した方法を適用し、出力は予測可能になります。
この判断フレームワークはPDFタイプの問題を対象としています。列が正しく構造化され、PDFタイプも正しいのに、抽出された数値が一貫して間違っている場合 — 合計が小計として出力されたり、日付が別の日付と入れ替わったりする場合 — 問題は抽出列の定義方法にある可能性があります。曖昧な列名は抽出数値の誤りの最も一般的な原因の1つです。修正は通常、「Total」を「Total Amount Due」に変更するだけの簡単なものです。
よくある質問
「全ページでテキスト選択が可能なのに、抽出結果が文字化けするのはなぜ?」
テキスト選択ができるということはテキストレイヤーが存在する証拠ですが、それが適切に構成されているとは限りません。一部のPDF生成ツールは、標準外の文字エンコーディングやCMapテーブルを使用してテキストレイヤーを作成します。これらは画面上では正しく表示されますが(PDFリーダーが独自のフォントレンダリングを適用するため)、抽出ツールが解析するのは困難です。この場合は、ファイルを画像のみのPDFと同様に扱い、画像に変換してページを視覚的に読み取るツールを使用してください。
「1つのツールで3種類すべてのPDFを処理できますか?」
はい、テキストレイヤーに依存せず、ドキュメントを視覚的に読み取るツールであれば可能です。テキストレイヤーの抽出のみに依存するツール(ほとんどのPDF変換ライブラリやExcelの標準PDFインポート機能など)は、テキストベースのPDFしか処理できません。ImageToTable.aiのようなビジョンAI搭載ツールは、各ページを画像としてレンダリングし、人間と同じように読み取るため、すべてのPDFタイプを一律に処理できます。
「使っているツールがどのタイプに対応しているか分かりません。どうすれば確認できますか?」
画像のみのPDF(何もハイライトされないスキャン文書)でテキスト選択テストを実行してください。ツールがデータを抽出できれば、何らかの視覚的読み取りまたはOCRを使用しています。空の結果が返ってきた場合は、テキストレイヤーに依存しています。ほとんどの単純なPDFパーサーは後者に該当します。
「紙の書類をすべて高解像度でスキャンすれば問題は解決しますか?」
高解像度にすると画像のみのPDFに対するOCR精度は向上しますが、根本的な問題は変わりません。画像のみのPDFには、従来のツールが読み取るためのテキストレイヤーが依然として存在しません。抽出ツールが視覚的読み取りに対応していなければ、600 DPIでスキャンしても何も抽出されません。スキャン品質だけでなく、ツール自体をアップグレードしてください。
「受け取る前に誰かがOCR処理したPDFの場合はどうなりますか?」
OCR処理済みのPDFには、スキャン画像の上に不可視のテキストレイヤーが追加されています。テキスト選択テストは機能し(テキストがハイライトされます)、ほとんどの抽出ツールも成功します。ただし、元の画像品質は依然として重要です。元のスキャンが低品質だった場合、OCRテキストレイヤーに文字誤りが含まれ、抽出ツールがそれを継承する可能性があります。一部のビジョンAIツールは、埋め込まれたテキストレイヤーを信頼する代わりに、画像を直接再OCRするように設定でき、OCR品質が低いドキュメントでは精度が向上します。
自分が扱っているPDFのタイプがわからない場合は、サンプルをアップロードしてビジョンベースのツールがどのように処理するか確認してみてください — 登録は不要です。
ファイルでPDF抽出をテストする