文書タイプ別のOCR精度:デジタルPDF、スキャン、
手書き文字とテーブルのベンチマーク(2026年)
最終レビュー:2026-08-10 · データ範囲:一部 · 情報源:16件の独立した調査
このページの対象外: 手動データ入力のエラー率(人間によるデータ入力エラー率を参照)、OCR自体の仕組み(OCRとは?を参照)、または以下に記載されたベンチマーク数値を超える、特定の製品に関するベンダー固有の主張。
以下のすべての数値は、方法論セクションで引用されている公開された第三者調査および業界レポートに基づいています。情報源によって数値が異なる場合は、保守的な範囲(報告された最小値~最大値)を使用しています。このページは方向性を示すベンチマークであり、特定のエンジンや組織の正確な予測ではありません。
すべてのOCRベンダーが、「99%精度」という言葉を引用しています。16件の独立した調査を通じて、この数値が真実であるのは、まさに1つの文書条件、つまり鮮明なデジタル生成テキストの場合のみで、そこでは主要なエンジンはすべて99.2%を上回ります。そして、他のすべての条件では、その精度は次第に低下します。鮮明なスキャンでは98~99%、歴史的・劣化したスキャンでは71~98%、手書き文字ではソリューションによって46~95%のばらつき、破損原稿では72.7%という低さになります。この数値は嘘ではありません。文書タイプ固有の測定値が、あたかも普遍的なものであるかのように提示されているのです。
「99%」という数字の由来と、それが誤解を招く理由
99%という数字は、鮮明な印刷文書に対する文字レベルの測定値であり、文字精度は最も有利な指標です。この点と、実際に使われている他の3つの指標を理解すれば、同じシステムで「OCR精度99%」と「フィールド精度78%」が同時に成り立つ理由がわかります。
文字誤り率(CER)は、誤って読み取られた個々の文字を数えます。CER 1%は、100文字あたりおよそ1文字の誤りを意味します。印刷文書で広く採用されているベンチマーク基準は、オーストラリア国立図書館の新聞デジタル化プログラムによって体系化され、優れたOCRは98〜99%の精度(CER 1〜2%)、平均は90〜98%(CER 2〜10%)、不良は90%未満と定義しています(Holley, 2009)。欧州データ保護委員会(EDPB)のOCRガイダンスも、一般的な印刷文書の性能を文字精度95〜99%とし、98〜99%を本番グレードの保証水準と位置づけています(EDPB, 2024)。
問題は、文字精度が使用中の指標の中で最も要求水準が低いことです。2,000文字の文書で文字精度99%でも、約20文字の誤りが含まれます。単語レベルでは、1文字の誤読で単語全体が失敗とみなされるため、同じ出力でも96〜98%程度になる可能性があります。フィールドレベル(請求書番号や日付の抽出に重要な指標)では、1桁の誤りでフィールド全体が失敗するため、文字精度99%のシステムでも、エンジンによってはフィールド精度78〜98%にしかなりません(BusinessWareTechベンチマーク, 2025)。表については4つ目の指標、ツリー編集距離類似度(TEDS)が適用されます。これは抽出された表構造とセル内容が原本と一致するかを評価するもので、文字精度とはまったく異なる軸です。
歴史的記録は、鮮明なテキストの上限がどれほど難しいかを示しています。UNLVの情報科学研究所在は1992年から1995年にかけて、機械印刷された英語ページで毎年OCR精度テストを実施しました。最高の商用システムは、文字精度がおよそ94%から98%以上に向上し、その後ほぼ横ばいとなりました(Rice, Jenkins & Nartker, 1995)。NISTも1998年の評価で同じ結論に達しています。文字誤り率1%は、ソースが鮮明で固定フォーマットのタイプ原稿の場合にのみ達成可能です(NIST IR 6101, 1998)。25年にわたるディープラーニングの進歩がこの上限を押し上げましたが、それは最も鮮明な入力に限られます。
文書タイプはOCR精度の最大の決定要因であり、エンジンの選択よりも重要です。以下のチャートは、各文書クラスの公表された範囲を示しています。最低値と最高値の差が正直な答えであり、単一の「平均値」ではありません。劣化・歴史的文書や手書き文字は範囲が非常に広いため、点推定値はかえって誤解を招く恐れがあります。
文書タイプ別の内訳
出典:IntuitionLabs(2025年) — すべてのエンジンで、容易なタイプ文字に対して >99.2%; Holley(2009年) — 鮮明な文書で98〜99%の「良好」ベンチマーク;オーストラリアの新聞(1803〜1954年)における生の文字信頼度で71〜98.02%; AIMultiple(2026年) — 12のソリューションにおける手書き文字で46〜95%; GatedLexiconNet(2024年) — IAM単語精度 約94.3%; IJSAT(2026年) — 破損原稿で300 DPI時に72.7〜94.7%。 出典間で数値に相違がある場合は、保守的な範囲を使用しています。
| 文書タイプ/状態 | 精度範囲 | 中間値 | 出典 | 年 | サンプル |
|---|---|---|---|---|---|
| デジタル生成PDF(ERP/タイプ出力) | 99.2–99.8% | 99.5% | IntuitionLabs;ABBYY(ベンダー主張) | 2025 | 簡単なタイプ文字で全エンジン >99.2% |
| 鮮明なスキャン印刷文書(300 DPI) | 98–99% | 98.5% | Holley;EDPB | 2009/2024 | 「良好なOCR」ベンチマーク;NLAデジタル化コレクション |
| スキャン — 劣化・歴史的文書 | 71–98% | 約85% | Holley | 2009 | 新聞30以上のタイトル、1803–1954年、生の文字信頼度 |
| 手書き文字 — 最新の高性能システム(ベンチマーク) | 単語精度94–99% | 96% | GatedLexiconNet;LLM HTRベンチマーク | 2024–2025 | IAM(執筆者657名、13,353行);RIMES(フランス語の手紙) |
| 手書き文字 — ソリューション間の範囲 | 46–95% | 約70% | AIMultiple | 2026 | 12ソリューション、SBERT類似度スコアリング |
| 破損原稿の写真 | 72.7–94.7% | 約84% | IJSAT | 2026 | EasyOCR;通常 vs しわ・汚れ・濡れ、300 DPI |
| テーブル — 構造(デジタル生成) | TEDS 0.91–0.97 | 0.94 | PubTabNetリーダーボード(MuTabNet 0.969);TrOCR-ctx(0.909) | 2024–2025 | PubTabNetコーパス、TEDS構造類似度 |
| テーブル — 検出(アーカイブ/手書き) | 重み付きF1(wF1)0.49–0.53 | 0.51 | ICDAR 2019 cTDaR | 2019 | アーカイブトラック、IoU 0.6–0.9での重み付きF1 |
上表に記載の出典を参照。文字・単語の数値は査読済み研究および政府機関の調査に基づくもので、ベンダー公称値はその旨を明記している。TEDSおよびwF1は構造レベルの指標であり、文字精度と直接比較できるものではない — 精度の幅が広い理由を参照。最も劣化が激しい行について、71%という下限値は、最も性能が低かった歴史的な新聞タイトルに対する2009年の測定値(公表されている最新の生データ)である。同様の文書に対する最新エンジンのスコアは、これより大幅に高い(方法論を参照)。
解像度は最も制御しやすい精度向上の要素だが、公表されているエビデンスはベンダーのブログが示唆するほど厚くはない。唯一の厳密な政府調査 — 米国政府印刷局(GPO)による古い文書や変色した文書を対象としたテスト — では、高いDPIではなくカラー(RGB)キャプチャが決定的な要因であることが判明した。RGBスキャンはGPOの99%の文字精度要件を満たした一方、同じ文書の二値(白黒)スキャンは約77%にとどまり、300から200 DPIへのダウンサンプリングでは精度向上は見られなかった(US GPOホワイトペーパー)。
DPIとスキャン品質別の内訳
| スキャン解像度/モード | 確認された影響 | 出典 | 年 |
|---|---|---|---|
| 300 DPI以上(標準) | 鮮明な印刷物で98〜99%の文字精度を達成。10pt未満のフォントには400〜600 DPIを推奨 | ピッツバーグ大学OCRガイド;US GPO | 2024/約2022 |
| 200 DPI | 鮮明な印刷物では十分。GPOのテストでは300からのダウンサンプリングで認識結果に変化なし | US GPO | 約2022 |
| 150 DPI未満 | 影響の大きい劣化要因と評価。小さなフォントは認識に失敗し、精度は98〜99%のクリーン帯域を下回る | LlamaIndex用語集;劣化下限はIJSAT(2026)による | 2026 |
| 72 DPI(画面キャプチャ) | 文字を確実に判別するには画素密度が不十分。精度への影響は「大」と分類 | LlamaIndex用語集 | 2026 |
| 経年文書のカラー(RGB)スキャン vs 二値スキャン | 古い・変色した原稿では、RGBが99%に対し二値は約77% | US GPO | 約2022 |
上表に記載の出典をご参照ください。正直な注意点として、他のすべての要因を一定に保ったままDPIのみを切り離した査読済み研究は存在しません。そのため「150 DPI未満」の行は、LlamaIndexリファレンス用語集の低DPIに関する明示的なガイダンスと、IJSAT(2026年)が300 DPIで測定した物理的損傷による精度下限を組み合わせたものであり、代理指標であることを明記します。
フィールドの種類によって、読み取りエラーが問題になるかどうかが決まります。段落内の単語の誤読はほとんどのワークフローで気づかれませんが、請求書番号の数字の誤読はフィールド全体を失敗させます。複数のエンジンにわたってフィールドタイプを切り離して検証した唯一の公開ベンチマークは2025年の請求書抽出研究であり、そのばらつきはフィールドタイプとエンジンによって40〜98%と、「OCR精度」が単一の数値ではないことを示す最も明確な証拠となっています(BusinessWareTech、2025年)。
フィールドタイプ別の内訳
| フィールドタイプ | 精度範囲 | コンテキスト | 出典 | 年 |
|---|---|---|---|---|
| キー・バリューテキストフィールド(請求書ヘッダー) | エンジン別に78〜98% | GPT-4o + OCR 98%、Azure Document Intelligence 93%、Google Document AI 82%、AWS Textract 78% | BusinessWareTech | 2025 |
| 明細行/テーブル行 | エンジン別に40〜82% | 明細行の検出:同じテストでTextract 82%に対しGoogle Document AI 40% | BusinessWareTech | 2025 |
| 数値フィールド(日付、合計、ID) | 78〜98%(フィールド帯域内) | 形式が制約されていると精度は向上するが、1桁の誤読でもフィールド全体が失敗する | BusinessWareTech;AIMultiple請求書ベンチマーク | 2025〜2026 |
| チェックボックス/マークシート | 信頼できる公開ベンチマークなし | データギャップ — 制限事項で指摘;従来のマークシート文献はAI OCRより前のもの | — | — |
| 署名(認識) | 公開精度ベンチマークなし | データギャップ — ベンダーは認識精度ではなく検出精度のみを報告 | — | — |
上表の出典一覧。78〜98%および40〜82%という数値は、単一の独立したベンチマーク(BusinessWareTech、2025年、実請求書テストセット)に基づくもので、Cグレードの出典です。AIMultipleの請求書ベンチマークも同様の傾向を示しており、文書品質が低いほど全ツールで精度が急激に低下することが確認されています(AIMultiple、2026年)。「データギャップ」と記載された行には、引用可能な第三者による測定値がなく、ベンダー数値ではなく実態として記載しています。
言語は最も公表が進んでいない精度の側面です。ほぼすべてのベンダーが言語別のベンチマークを公開していないためです。唯一の査読済み多言語比較研究(2021年、英語とアラビア語の文書画像18,568枚を対象)では、同一エンジンにおいて英語の精度がアラビア語より「かなり高い」ことが判明し、その差は標準設定での認識で10〜25ポイント程度でした(Hebert et al.、2021年)。手書き文字のベンチマークも追加のデータポイントを提供します。フランス語(RIMES)と英語(IAM)の手書き文字は、最高性能のシステムでは印刷品質に近い水準に達していますが、それは鮮明で標準化されたコーパスの手書き文字に限られます。
言語・文字体系別の内訳
| 言語/文字体系 | 精度 | 根拠 | 出典 | 年 |
|---|---|---|---|---|
| 英語 — 印刷(鮮明) | 96〜99.5% | 鮮明なテキストにおける主要エンジンすべての基準値 | Hebert et al.;EDPB | 2021/2024 |
| アラビア語 — 印刷 | 英語より約10〜25ポイント低い | 同一エンジン、単一共通フォントのコーパス。依然としてかなり低い | Hebert et al. | 2021 |
| 英語の手書き文字(IAMベンチマーク) | 単語精度SOTA約94.3% | WER 5.73%(GatedLexiconNet);GPT-4o-miniでWER 3.34% | GatedLexiconNet;LLM HTRベンチマーク | 2024〜2025 |
| フランス語の手書き文字(RIMESベンチマーク) | 文字精度約97〜99% | ビジネスレターにおけるCER 0.9〜1.7% | GatedLexiconNet | 2024 |
| CJK、デーヴァナーガリーおよびその他の文字体系 | 比較可能な公開ベンチマークなし | データギャップ — 査読済みのエンジン間比較は見つからず | — | — |
出典は上表のとおり。IAMとRIMESは標準化された手書き文字コーパスです。実際の乱雑な手書き文字、特に印刷体と筆記体が混在したものは、これらのクリーンなコーパスの数値よりも低いスコアになります(文書タイプ表の46〜95%のクロスソリューション帯域が実際の参考値です)。アラビア語のギャップは、単一の共通フォントコーパスにおける「英語の精度はアラビア語よりかなり高かった」という公表結果の保守的な解釈です。より困難なコーパスでは、その差はさらに広がる可能性があります。
精度の範囲がこれほど広い理由:4つの指標、1つの言葉
OCR精度データにおける最も大きな見かけ上の矛盾は、測定誤差ではなく、異なる文書条件に異なる指標を適用した結果です。「文字精度99%」と「フィールド精度78%」は同じシステムを表しています。「テーブル検出のwF1 0.49」と「テーブル構造のTEDS 0.96」は、異なるコーパスにおける同じ技術を表しています。
使用されている4つの指標は、難易度の厳格な階層を形成しています。文字精度(99%以上)は最も簡単に高く見せられます。単語精度は、1文字の誤りで単語全体が失敗するため、より低くなります。オーストラリアの新聞修正研究では、生の歴史的文書出力で単語精度81.7%を測定し、手動修正後に97.6%まで上昇しました(Cassidy, 2019、マッコーリー大学による同種コーパスの研究)。フィールド精度は、1桁の誤りでフィールド全体が失敗するため、さらに低くなります。上記のエンジン範囲78〜98%がこれに該当します。構造指標(テーブルのTEDS、検出のwF1)は、まったく別の軸です。テーブルは完全な文字で読み取られても、行・列構造の再構築が誤っていれば低いスコアになります。そのため、アーカイブのテーブル検出はwF1 0.49〜0.53で頭打ちになる一方、現代のテーブル構造認識はTEDS 0.91〜0.97に達します(TrOCR-ctx, 2025;PubTabNetリーダーボード)。
ノイズはばらつきをさらに拡大します。査読済みのHebertらの研究では、クリーンな書籍スキャンに人工ノイズ層を1つ追加するだけで、最良のエンジンの単語精度はおよそ96%から82.5%に低下し、オープンソースのTesseractでは58.4%まで低下しました。ノイズ層を2つ追加するとさらに低下しました(Hebert et al., 2021)。これが「OCRの精度はどのくらいか」という問いへの誠実な答えが、常に文書タイプに応じた範囲になる理由であり、単一の数値による主張は、普遍的な衣装をまとったクリーンテキストの測定値として扱うべき理由です。
このデータの使い方
「OCR精度は99%と聞いている」— どのベンダーも繰り返す主張であり、このページが検証する内容 — を、自社文書に対する妥当な期待値に変えるために、完全な監査は必要ありません。上記の範囲を使った3ステップの簡易計算で十分であり、それによって、見出しの数字が実際に処理する文書には当てはまらないことが通常明らかになります。
- 文書構成を分類する。 ボリュームを上記の帯域に分類します。例:月1,000件の請求書がある一般的な買掛金フローの場合、70%がデジタル生成PDF(99.2〜99.8%)、20%が鮮明なスキャン(98〜99%)、10%が劣化スキャンまたは手書き注釈付きファイル(中間値約85%)。
- 文字精度をフィールド精度に変換する。 文字レベルの数値は抽出ワークフローを過大評価します。代わりに、エンジンの階層に応じた測定済みのフィールドレベルの帯域を使用します:中級クラウドプロセッサで93%、LLM支援パイプラインで98%、下位エンジンで78〜82%(BusinessWareTech 2025)。
- 月間エラー数を推定する。 フィールド精度93%、請求書あたり12フィールド、1,000件の請求書の場合、レビュー前の月間エラー数はおよそ840フィールド(1,000 × 12 × 7%)になります。ボリュームの10%が劣化または手書き文書の場合、そのエラー数は帯域の差、通常はフィールド精度の15〜30ポイント分、増加します。
- その数値が許容できるか判断する。 月間840件の誤フィールドが下流システムの吸収能力を超える場合、公開されている対策は次のとおりです:スキャン品質を300-DPI/RGB帯域に引き上げる(GPOはこれだけで古い文書の77%→99%のギャップを解消することを確認)、低信頼度フィールドを人手レビューに回す、または過去の単語精度を81.7%から97.6%に引き上げた補正ステージを適用する(Cassidy, 2019)。
これらは概算の計算式であり、自社文書のベンチマーク測定の代わりにはなりません。このページのすべての公開範囲は、他社のコーパスで測定されたものです。ワークフローに適用できる唯一の精度数値は、自社で測定したものです。このページの価値は、測定前に期待値を設定することにあります。
よくある質問
OCRの平均精度はどのくらいですか?
平均精度は文書の種類に完全に依存します。このページの情報源全体を通して、鮮明なデジタル生成テキストの平均は99.2~99.8%の文字精度(IntuitionLabs 2025年;ABBYY)、鮮明なスキャン文書は98~99%(Holley 2009年;EDPB 2024年)、劣化・歴史的文書のスキャンは71~98%(Holley 2009年)、手書き文字はソリューション全体で46~95%(AIMultiple 2026年)です。単一の「平均OCR精度」という数値は意味がありません。範囲こそが答えです。
良いOCR精度とはどのくらいですか?
オーストラリア国立図書館が広く採用している尺度では、印刷テキストのOCR精度が良いとされるのは98~99%の文字精度(CER 1~2%)で、平均は90~98%、不良は90%未満と定義されています(Holley, 2009年)。ビジネスデータにとって重要な指標であるフィールドレベルの抽出では、より現実的な「良い」水準は93~98%であり、2025年の請求書ベンチマークでトップクラスのエンジンのみが到達しました。
スキャン文書とデジタルPDFでは、OCR精度はどのように異なりますか?
印刷テキストの鮮明なスキャンは98~99%の文字精度で、デジタル生成テキストの99.2~99.8%に近いものの、同等ではありません。スキャンが劣化するとその差は急激に広がります。歴史的な新聞スキャンは71~98%の生精度(Holley 2009年)で、破損原稿は300 DPIでも72.7~94.7%に低下しました(IJSAT 2026年)。低DPI、二値(白黒)取り込み、経年劣化した紙は、それぞれスキャン精度を下げる要因となります。
手書き文字のOCR精度はどのくらいですか?
最先端のシステムは、IAMやRIMESのような鮮明なベンチマークコーパスで約94~99%の単語精度に達します(GatedLexiconNet 2024年;LLM HTRベンチマーク2025年)が、全ソリューションを通した範囲は46~95%(AIMultiple 2026年)です。レガシーエンジンは下限付近に位置し、乱雑な実世界の手書き文字、印刷と筆記の混在、歴史的な筆記体は、鮮明なコーパスの数値を大きく下回ります。
OCR精度に最適なDPIは?
300 DPIが標準的な推奨値です。鮮明な印刷文書では98〜99%の文字精度帯を満たし、10pt未満のフォントでは400〜600 DPIが推奨されます(ピッツバーグ大学OCRガイド)。特筆すべきは、GPOの調査で、経年文書では解像度よりもスキャンの色モードが重要であることが判明した点です。RGBキャプチャは99%に達した一方、二値(白黒)は約77%にとどまり、300から200 DPIへのダウンサンプリングでは変化は見られませんでした。
テーブルでOCR精度が低くなるのはなぜ?
テーブルは文字認識に加えて構造認識のステップが加わります。エンジンはコンテンツを利用可能にする前に、行、列、結合セルを再構築する必要があります。最新システムはデジタル生成のテーブルコーパスでTEDS 0.91〜0.97を記録していますが(PubTabNetリーダーボード、TrOCR-ctx 2025)、アーカイブ文書や手書きのテーブルでは検出精度がwF1 0.49〜0.53に低下し(ICDAR 2019 cTDaR)、実際の請求書テストでの明細行抽出はエンジンによって40〜82%の範囲でした(BusinessWareTech 2025)。
OCR精度は言語によって異なる?
はい、大きく異なります。査読済みの唯一の言語間比較研究では、同じエンジンとコーパスにおいて、英語の精度がアラビア語より10〜25パーセントポイント高いことが判明しました(Hebert et al. 2021)。手書き文字ベンチマークでは、フランス語と英語のコーパスがトップシステムで印刷品質に近い水準に達していますが、CJK、デーヴァナーガリー文字、その他の文字体系については同等の公開ベンチマークが存在せず、これは真のデータギャップです(制限事項を参照)。
方法論と出典
このページの作成方法
このページは、1995年から2026年にかけての16件の独立した研究からデータを集約しています。情報源は次の3つの基準で選定しました:(1) サンプルサイズが明記された公開済みの方法論、(2) 可能な場合は過去3年以内に収集されたデータ(古い情報源は本文中に年号を明記)、(3) マーケティング上の主張ではなく文書処理への関連性。複数の情報源が同じ指標を報告している場合は、控えめな範囲(報告値の最低値〜最高値)を使用しています。過大主張は避ける方針です。情報源間で大きな食い違いがある場合は、その相違を指標レベルまたはコーパスの違いとして説明し、平均化して誤魔化すことはしません。
指標の区別がこのページの骨格です。文字レベル、単語レベル、フィールドレベル、構造レベル(TEDS/wF1)の数値は、決して単一の数値に混ぜることはありません。ベンダー自己報告の数値(ABBYYの99.8%)はベンダー主張として明記し、上限参照としてのみ使用します。これはDグレードの引用ルールに従い、裏付けが必要となるためです。この場合、IntuitionLabsの独立測定により、すべてのエンジンが簡単なタイプ文字で99.2%を超えることが確認されています。
情報源一覧
- Holley, R. —「How Good Can It Get?」D-Lib Magazine 15(3/4)(2009年)。オーストラリア国立図書館の新聞デジタル化プログラム。1803年〜1954年の30以上の歴史的新聞タイトルにわたる生の文字信頼度測定値。71〜98.02%の劣化スキャン範囲、98〜99%/90〜98%/<90%の良好・普通・不良スケール、および1〜2%のCER「良好」ベンチマークを提供。
- Hebert, J. 他 —「OCR with Tesseract, Amazon Textract, and Google Document AI: a benchmarking experiment」Journal of Computational Social Science(2021年)。査読済み。英語書籍スキャン322件+アラビア語記事スキャン100件×43種類のノイズ=18,568文書、51,304リクエスト。クリーンからノイズ入りへの単語精度低下(約96%→82.5%→58.4%)、英語とアラビア語の差、サーバー型とオープンソースの比較を提供。
- Rice, S.V.、Jenkins, F.R. & Nartker, T.A. —「The Fourth Annual Test of OCR Accuracy」UNLV ISRI(1995年)。商用OCRを対象とした年次独立評価。DOEサンプル460ページ+雑誌サンプル200ページを使用。クリーンテキストの上限を支える1992〜1995年の文字精度の向上(約94%→98%以上)を提供。
- NIST IR 6101 —「Impact of image quality on machine print optical character recognition」(1998年)。米国国立標準技術研究所による、Federal Registerページを対象とした3つの商用OCR製品の評価。「1%の誤り率には固定フォーマットのクリーンな原稿が必要」という制約を提供。
- 欧州データ保護委員会 —「AI Possible Risks & Mitigations: OCR」(2024年)。EU規制機関による技術ガイダンス。一般的な印刷文書の95〜99%レンジと、98〜99%の本番保証レベルを提供。
- 米国政府印刷局 —「Optimizing OCR Accuracy on Older Documents」ホワイトペーパー。経年・変色文書に対するスキャンモードと画質向上の公式テスト。GPOの99%精度要件に照らして実施。RGB 99%と二値(白黒)約77%の比較結果、および300→200 DPIのダウンサンプリング結果を提供。
- 「Optical Character Recognition Accuracy on Degraded Documents」IJSAT(2026年)。査読済み。300 DPIで4種類の物理的状態に対するEasyOCRの評価。94.7%正常/86.9%しわ/80.9%汚れ/72.7%濡れの精度ラダーを提供。
- AIMultiple —「OCR Benchmark: Text Extraction / Capture Accuracy」(2026年)。ベンダー中立のアナリストベンチマーク。Sentence-BERTコサイン類似度を使用。12以上のソリューションを評価。46〜95%の手書き文字帯域と、ソリューション別トップ(GPT-5 95%、olmOCR-2-7B 94%、Gemini 2.5 Pro 93%)を提供。
- AIMultiple —「Invoice OCR Benchmark: Extraction Accuracy of LLMs vs OCRs」(2026年)。ベンダー中立のベンチマーク。公開されている20件の請求書から400以上のキー・バリューペアを使用。低品質と高品質の間の精度低下の知見を提供。
- Gao, L. 他 — 「ICDAR 2019 Competition on Table Detection and Recognition (cTDaR)」、ICDAR(2019年)。学術コンペティション、11チーム参加、手書き・手描きテーブルを含む近代・アーカイブデータセット。 アーカイブトラックのテーブル検出下限値 wF1 0.49(後続モデルでは0.53)を提供。
- OpenCodePapers — 「Table Recognition on PubTabNet」リーダーボード(2024年)。PubTabNetコーパス上の公開TEDS結果を追跡する技術ベンチマーク集約サイト。 TEDSの上限値を提供:MuTabNet 0.9687(2024年)、TableMaster 0.9676、SLANet 0.963。
- 「Tabular context-aware OCR and tabular data reconstruction for historical records」(2025年)。査読済み。PubTabNet、SROIE、CORD、歴史的コーパスにわたるTrOCR-ctx。 テーブル構造スコアとしてTEDS 0.909(PubTabNet)、0.967(SROIE)、0.986(CORD)を提供。
- 「Enhancing handwritten text recognition accuracy with gated mechanisms」(2024年)。査読済み。IAM、RIMES、READ-2016上のGatedLexiconNet。 手書き文字の最先端数値として、IAM WER 5.73%/CER 2.27%、RIMES CER 0.9%を提供。
- 「Benchmarking Large Language Models for Handwritten Text Recognition」(2025年、Journal of Documentation)。査読済み。7つのコーパスにわたるプロプライエタリ・オープンLLMとTranskribusの比較。 GPT-4o-mini IAM 1.71% CER/3.34% WER、GPT-4o RIMES 1.69% CER/3.66% WER、および現代のCER<5%品質フレーミングを提供。
- BusinessWareTech — 「AWS Textract vs Google, Azure, and GPT-4o: Invoice Extraction Benchmark」(2025年)。実際の請求書を用いた独立ベンチマーク。Cグレード(単一テストセット、透明な手法)。 エンジン別のフィールド精度78〜98%、エンジン別の明細行検出率40〜82%を提供。
- IntuitionLabs — 「Pharma Document AI & OCR Accuracy: A Benchmark Report」(2025年4月)。混合文書ベンチマークをまとめた業界調査。Cグレード。 簡単なタイプ文字に対する全エンジン>99.2%の検出精度と、Google Cloud Visionの総合約98%を提供。
- ABBYY FineReader(ベンダー主張)。Dグレードの自己報告数値。クリーンなテキストの上限値としてのみ使用され、その旨明記。 「鮮明なスキャンで最大99.8%の精度」、またFAX・低解像度での改善主張も記載。
- LlamaIndex — 「What is OCR Accuracy Rate?」用語集(2026年)。要因影響テーブル付きの参考用語集。 DPI表で使用されるDPI段階(72 vs 300 vs 600 DPI)と300 DPI最小推奨値を提供。
- ピッツバーグ大学 — 「Best Practices: OCR」ライブラリガイド。大学のデジタル化ガイダンス。 300 DPI標準と、<10ptフォント向け400〜600 DPIの推奨を提供。
- Cassidy, S. — 「OCR品質がデジタル化歴史テキストの利用に与える影響」(マッコーリー大学)。歴史新聞におけるOCR後修正に関する査読済み研究。単語精度の修正効果81.7%→97.6%を提供しています。
限界
- 地理的カバレッジ: 情報源は北米、EU、オーストラリア、および(手書き文字については)欧州のコーパスに集中しています。ラテンアメリカやアフリカに関する信頼できる一次データは見つかりませんでした。また、CJK/デーヴァナーガリー文字の比較は、当方が確認した査読済み文献には存在しません。
- 方法論の制約: クラウドベンダー(Google、Azure、Amazon)は、文書タイプ別の方法論が透明な精度ベンチマークを公開していません。彼らの「99%以上」という数値はマーケティングであり測定値ではないため、独立した研究が測定した場合を除き、ここからは除外しています。いくつかの主要な数値は単一研究のデータポイント(BusinessWareTechのフィールド精度、IJSATの劣化)に依存しており、そのグレードを明記しています。ABBYYの99.8%は、裏付けのある上限としてのみ使用されるベンダー主張です。
- 時間的ギャップ: UNLV ISRI(1995年)とNIST(1998年)のデータは27年以上前のものですが、クリーンなテキスト精度の上限に関する唯一の公開された長期的記録であり、年号を明記して歴史的文脈として使用しています。Holley(2009年)の劣化スキャンの下限値は、歴史的な新聞に関する公開された生データとしては最も新しいものです。現代のエンジンはそのような文書でより良いスコアを出します(Hebert et al. 2021)。そのため、表には両方を示しています。
- 見つからなかったもの: (1) 現代のAI OCRにおけるチェックボックス/マークシート認識に関する信頼できる公開ベンチマーク(既存文献はレガシーOMRのみ)、(2) 署名認識の精度(ベンダーは検出を報告するが、認識精度は報告しない)、(3) 他の要因を一定に保ちながらDPIを分離した査読済みの管理研究、(4) スクリーンキャプチャ(スクリーンショット)OCRの標準化されたベンチマーク、(5) 明細行の数値以外の混在レイアウト文書(1ページにテキスト+表+画像)— 明細行の数値が唯一の公開された代理指標です。これらのギャップは、検証不可能なベンダー数値で埋めるのではなく、明示しています。
関連参考文献: タイプ別・役割別の手動データ入力エラー率 · 光学文字認識(OCR)とは?
関連記事: OCR精度を向上させる方法:実践的な10のヒント · AI文書抽出の精度は実際どのくらい? · ABBYY FineReaderと最新AI OCRの比較