レシートOCR精度:感熱紙、しわくちゃ、色あせた、および多通貨ベンチマーク(2026年)

最終確認日: 2026-08-10 · データ範囲: 一部 · ソース: 独立した研究14件

このページの対象: 査読付き論文やコンペティション(ICDAR SROIE、CORD、KORIE、ReceiptSense、IJSAT)、実世界のベンダーエンジン研究(スマートフォン撮影されたレシートに対するAWS Textract)、および方法論が透明な業界ベンチマーク(BusinessWareTech、Google Developer Forum、Doubleword)から集約された、レシート固有のOCRおよびキー情報抽出精度ベンチマーク。物理的なレシートの状態、フィールドタイプ、エンジンティア、言語別に分類し、すべての数値に文字/単語/フィールドの指標の区別を明記しています。すべてのソースは第三者によるもので、独立して検証可能です。
このページの対象外: 文書タイプ別の一般的なOCR精度(文書タイプ別の内訳を参照)、手書き文字認識の精度(手書き文字認識の精度を参照)、または以下に引用するベンチマーク数値を超えるベンダー固有の主張。

以下のすべての数値は、方法論セクションで引用されている公開された第三者の研究および業界レポートに基づいています。ソース間で矛盾がある場合は、保守的な範囲(報告された最低値~最高値)を使用しています。指標レベル(文字/単語/フィールド)は図ごとにラベル付けされ、単一の数値に混在されることはありません。このページは方向性を示すベンチマークであり、特定のエンジンや組織に対する正確な予測ではありません。

レシートOCRの物語は、ベースラインではなく上限から始まります。唯一の標準化されたレシートベンチマークであるICDAR 2019のSROIEでは、最良のキー情報抽出システムがクリーンなスキャンレシートで90.49%のF1スコアを記録し、18の参加チームの半数以上が80%未満のスコアでした(Huang et al., 2019)。実際の経費ワークフローは、そこから物理的な劣化ラダーを下っていきます。色あせた感熱紙はオープンソースの単語精度を55~73%に低下させ(KORIE、2026年)、スマートフォンで撮影された実世界のレシートでは66.7~68.7%の店舗名精度しか得られません(RMIT Textract研究、2025年)。ベンダーが主張する「99%のレシート精度」は、レシートがめったに維持できない状態を説明しています。

90.49%
ICDAR 2019 SROIEレシートベンチマーク(クリーンなスキャンレシート、2019年当時の手法)における最高のフィールドレベルF1 — 18チーム中90%超えは唯一(Huang et al., 2019)
55–73%
実際の色あせた・しわのある感熱レシートに対するオープンソースエンジンの単語精度 — PaddleOCRが最高の73.3%、Tesseractが64.7%(KORIE、2026年、韓国語感熱レシート748枚)
66.7–68.7%
実際のレシート118枚における店舗名の完全一致精度、約65%がスマートフォン撮影、約50%が折りたたみ・しわくちゃ(RMIT Textract調査、2025年)

レシートの状態別分析:劣化ラダー

レシートのOCR精度は、エンジンそのものよりも、紙の物理的な状態と撮影方法に左右されます。同じレシートでも、新品で平らな状態から、色あせ、しわくちゃ、スマートフォン撮影へとラダーを下るにつれ、各段階で5〜30ポイントの精度が失われます。

レシートが請求書と異なる点は、レイアウト以上に重要なことがあります。それは、媒体そのものが不安定だということです。ほとんどのレシートは感熱紙に印刷されており、光、熱、時間にさらされると徐々に色あせていく熱感応性コーティングが施されています。購入当日は読み取れたレシートも、数週間後には税額、日付、明細行の一部が判読できなくなることがあり、紙から物理的に消えてしまった文字は、どんなOCRエンジンでも復元できません。SROIEの主催者は、ベンチマークの主要な課題として「紙質の悪さ、インクと印刷品質の低さ、低解像度スキャナとスキャン歪み、折り曲げられた請求書」を明示的に挙げています(Huang et al., 2019)。下のグラフは、ラダーの各段階における公開済みの精度帯を示しています。各研究で使用された指標は行にラベル付けされています。なぜなら、文字レベル、単語レベル、フィールドレベルの数値は互換性がないからです。SROIEの数値はF1スコア、つまり適合率と再現率の調和平均(Hmean)であり、検出された単語の大部分が正しいことと、グラウンドトゥルースの単語の大部分が見つかることが両方必要です。

レシートの状態別OCR精度:平らでクリーンな原本は文字精度94.7%、しわくちゃの原本は86.9%、色あせた感熱紙はオープンソースエンジン全体で単語精度64.7〜73.3%、実際のスマートフォン撮影レシートはフィールドレベルの店舗名精度66.7〜68.7%。

出典:IJSAT (2026) — 印刷文書に対する300 DPIでのEasyOCR、文字精度(平らな状態94.7%、しわくちゃの状態86.9%;同研究では汚れた状態80.9%、濡れた状態72.7%を測定); KORIE (2026) — 748枚の劣化した韓国語感熱紙レシート、17,587クロップに対する単語精度、オープンソースエンジン(Tesseract 64.7%、EasyOCR 68.6%、PaddleOCR 73.3%); RMIT Textract研究 (2025) — 118枚の実レシートに対する完全一致の店舗名フィールド精度(65%がスマートフォン写真、50%が折り曲げ・しわくちゃ、44%が傾き)。 文字レベルの数値は単語レベルやフィールドレベルの数値と直接比較できません — 指標が重要な理由を参照してください。

レシートの状態精度の範囲指標(研究ごと)出典年サンプル
クリーンなスキャンレシート(ベンチマーク上限)>90%(24チーム中7チーム)、最高 <99%単語レベルF1(Hmean)SROIE / Huang et al.2019スキャンレシート1,000枚、24チーム
平らでクリーンな原本(印刷文書)94.7%文字精度IJSAT2026EasyOCR、300 DPI
しわくちゃの原本86.9%(平らな場合と比べて−7.8ポイント)文字精度IJSAT2026EasyOCR、300 DPI
色あせた・折り目のある感熱紙レシート55–73%(PaddleOCR 73.3%が最高)単語精度KORIE2026韓国語の感熱紙レシート748枚、17,587クロップ、4エンジン
実環境でのスマートフォン撮影(店舗名フィールド)66.7–68.7%フィールドレベルの完全一致RMIT Textract研究2025オーストラリアのレシート118枚、約65%がスマホ写真

出典は上表のとおりです。KORIEの行は、合成による劣化ではなく、実際の感熱紙の劣化(インクの色あせ、プリントヘッドのバンディング、摩擦による摩耗、折り目)を保持した唯一の公開ベンチマークです。その300 DPIのフラットベッドスキャンは、「スキャン済み」の最良ケースでも紙自体の劣化が埋め込まれていることを意味します。SROIEの上限行は2019年当時の技術であり、同じデータセットに対する最新のLLMエンジンでは、全体的なフィールド精度84.3–93.0%に達します(Doubleword、2026年。エンジン層別表を参照)。

フィールドタイプ別の内訳:合計金額は簡単、店舗名は難しい

フィールドタイプは2番目に大きな要因であり、報告されたすべての研究で驚くほど一貫しています。数値の集計フィールド(特に合計金額)は、店舗名やベンダー名などのテキスト識別フィールドよりもはるかに高い精度で抽出されます。下のグラフは、5つの最新LLMエンジンを626件のレシートからなるSROIEテストセット全体で評価し、すべて同じフィールドレベルの完全一致プロトコルで測定したものです(Doubleword、2026年)。

SROIEテストセットにおける5つのLLMエンジンのフィールドレベルの完全一致精度:合計金額94.9〜98.9%、日付84.3〜92.5%、店舗名73.1〜87.7%。

出典:Doubleword(2026年) — 626件のSROIEテストレシート、フィールドレベルの完全一致、5エンジン(Qwen3-VL-235B/30B、GPT-5-mini/5.2/5-nano)。方法論を完全開示したDグレードのベンダーベンチマーク。方向性はReceiptSense(2024年)によっても裏付けられており、アラビア語・英語レシートで数値の#Unitsフィールドが93.42 F1に達する一方、テキストのBrandフィールドは62.30 F1に低下することが判明しています。

このパターンは、まったく異なる条件と言語でも成立します。RMIT Textractの研究(クリーンなコーパスではなく、実際のスマートフォン撮影レシートを使用)では、合計金額は「一貫して検出」された一方、店舗名は誤検出(近くのテキストを誤分類、または存在しない場合は「Unknown」)され、Doublewordのランキングと完全に一致しました(2025年)。実務上の意味は、「レシートOCR精度」という見出しが最も簡単なフィールドと最も難しいフィールドを1つの数値に平均化しているということです。そして、合計金額だけを必要とする経費ワークフローは、店舗名と明細行を必要とするワークフローよりも根本的に簡単なタスクを扱っていることになります。

エンジン層別の内訳

エンジンの選択は、状態やフィールドタイプほど重要ではありませんが、各状態が到達できる上限を決定します。以下の表は、測定コンテキストが互換性のない4つの層に分けています:レシートコーパスでファインチューニングされた研究モデル(CORD/SROIEベンチマークでのフィールドレベルF1)、ファインチューニングなしの汎用LLM、実世界の文書を扱うクラウドAPI、そしてレガシー/従来型エンジンです。

エンジン層精度指標・コンテキスト出典年
ファインチューニング済み文書AI(CORDでSOTA)フィールドF1 91.3~97.5%Donut 91.3%、LayoutLMv2 96.0%、LayoutLMv3 97.5% — クリーンなインドネシアのレシート、タスクで学習済みDonut; LayoutLMv2; MDPI調査2021~2022
ファインチューニング済み文書AI(SROIE)フィールドF1 97.8%(LayoutLMv2);論文平均約0.95クリーンなスキャン済み英語レシート;系統的レビュー平均F1 0.95LayoutLMv2; KIE SLR2021 / 2024
汎用LLM、ファインチューニングなし(3ショット)CORD 80.9% / SROIE 83.9% フィールドF1インコンテキスト学習のみ、タスク学習なし — 正直な「セットアップ不要」のベースラインLLM-TKIE2025
最新LLMエンジン(SROIE、2026年)総合フィールド精度 84.3~93.0%Qwen3-VL-235B 93.0%、GPT-5-mini 87.7%、GPT-5-nano 84.3% — 完全な626件のテストセットDoubleword2026
多様な実文書でのクラウドAPIF1 0.75~0.85Google Invoice/Expense Parser、約1,500種類の多様なレイアウト(ユーザー報告)Google Developer Forum2024
実在のスマートフォン撮影レシートでのクラウドAPI店舗名フィールド 66.7~68.7%実在のオーストラリアのレシート118件に対するAWS Textract AnalyzeExpenseRMIT Textract調査2025
クラウドAPI — 請求書コンテキスト(比較的容易な参考値)フィールド精度 78~98%GPT-4o+OCR 98%、Azure 93%、Google 82%、Textract 78% — レシートではなく請求書;より容易な上限値として表示BusinessWareTech2025
レシートでのレガシー/従来型OCR約64%(業界報告の下限値)ベンダーのホワイトペーパーによる層別主張;Dグレードの下限参照としてのみ使用DATABASICS2024

上表に記載の出典。CORDとSROIEの数値は、モデルをタスクにファインチューニングしたクリーンなベンチマークコーパスにおけるフィールドレベルF1です。これらは楽観的な上限値であり、実世界での期待値ではありません。実世界の行(Googleフォーラム、RMIT Textract)は異なる文書母集団を測定しており、直接比較はできません。両方とも条件付きで表示されています。DATABASICSの数値は単一ベンダーの階層クレームであり、下限の参考値としてのみ表示されています。

多通貨・多言語レシート

グローバルな経費ワークフローには第3の次元があります。このページのすべてのベンチマークデータセットは単言語またはバイリンガルであり、フィールド別の数値を公表している唯一の多言語研究でも、合計額とテキストのギャップに加えて、スクリプト(文字体系)によるペナルティが追加で見られます。20,000枚のアラビア語・英語レシートでは、ファインチューニングしていない一般的なLLMはゼロショットでF1 32.07〜42.98にしか達せず、フィールドごとに3つの例を与えるとF1 60.60〜80.26まで上昇しました。一方、数値の#UnitsフィールドはF1 93.42に達したのに対し、テキストのBrandフィールドはF1 62.30でした(ReceiptSense、2024年)。RMITの研究でも、本番環境で同じスクリプト効果が観察されています。英語以外の商品名を含むレシートは「部分的に解析」され、明細データが黙って欠落しました(2025年)。

言語 / コーパス精度指標出典年
英語(SROIE、マレーシア/シンガポール小売店)最高KIE F1 90.49%(2019年);LLM全体84.3〜93.0%(2026年)フィールドレベルF1 / 完全一致SROIE;Doubleword2019年 / 2026年
インドネシア語(CORD)フィールドF1 91.3〜97.5%(ファインチューニング済み)フィールドレベルF1Donut;LayoutLMv22021〜2022年
韓国語(KORIE、感熱紙劣化)単語精度55〜73%(オープンソース)単語精度KORIE2026年
アラビア語・英語混合(ReceiptSense)ゼロショットF1 32〜43%;3ショット61〜80%;数値フィールド93.4 vs テキストフィールド62.3フィールドレベルF1ReceiptSense2024年
英語以外の商品名(実世界)明細が部分的または完全に欠落定性的(精度指標なし)RMIT Textract調査2025年

上表に記載の出典。通貨記号・小数点形式・3文字コードなど、通貨要素のみを分離し、文字体系を一定に保ったまま検証した査読付き研究は存在しません。実際のワークフローにおける「複数通貨」のギャップは主に文字体系とレイアウトの差異に起因し、数値そのものは認識されれば精度よく抽出されます。これはベンダー数値で補完するのではなく、制限事項にデータギャップとして明記しています。

指標が重要な理由:文字・単語・フィールドは3つの異なる答え

このページの幅広い帯域は測定ノイズではありません。同じ「精度」という言葉で表される3つの異なる問いなのです。1枚のレシートが文字精度98%、単語精度約85%、フィールド精度約75%を同時に達成することは可能で、その3つの数値はすべて正しいのです。

文字精度は個々の文字を数えます。誤り率1%は100文字につき1文字の誤りを意味します。単語精度は、1文字でも誤読すると単語全体が失敗とみなされます。これは単語誤り率(WER)として測定され、KORIEの最良エンジンでも文字誤り率(CER)は15.84%なのにWERは26.73%と、単語レベルではほぼ2倍の誤り率になる理由です(KORIE, 2026)。フィールド精度は、店舗名・日付・合計金額などのフィールド全体が、その中の1文字でも誤ると失敗とみなされます。SROIEの主催者が「レシートOCRは一般的なOCRタスクよりもはるかに高い精度要件を要する」と結論づけ、フィールドレベルのF1が経費ワークフローで実際に消費される指標である理由もここにあります(Huang et al., 2019)。このページのすべての数値にはそのレベルが明記されています。これらを1つの「レシートOCR精度」という数値に混ぜることが、まさに99%という主張が作り出される仕組みなのです。

このデータの使い方

経費フローでレシートOCRがどのような成果をもたらすかを推定するのに、パイロットプロジェクトは必要ありません。上記の範囲を使った4ステップの概算で、「ベンダーが99%と言う」を、妥当な予想エラー数に変換できます。そして、その計算は通常、結果を左右するのはエンジンではなく、レシートの状態であることを明らかにします。

  1. レシートの状態別に構成を分類する。毎月のボリュームを上記のラダーに分類します。一般的な営業経費フローは次のようになります:40%が鮮明なスマートフォン撮影(単語換算で約70%)、30%が折りたたみ・しわくちゃ(文字換算で約87%)、20%が色あせた感熱紙(単語で55〜73%)、10%が多言語または手書き注釈付き(最悪ケース)。
  2. 実際に必要なフィールドを選ぶ。ワークフローで合計金額と日付だけが必要な場合は、94.9〜98.9%および84.3〜92.5%の帯域(Doubleword 2026)を使用します。ポリシーチェックやベンダー分析のために店舗名が必要な場合は、73.1〜87.7%の帯域を使用し、実世界の下限は67%近くになると想定します(RMIT Textract調査 2025)。
  3. 月間の予想エラー数に換算する。レシート1枚あたり6フィールド、月1,000枚で平均フィールド精度80%の場合、レビュー前に月間およそ1,200件の誤フィールド(1,000 × 6 × 20%)が発生します。レシート全体ではなく、低信頼度のフィールドのみを人間のレビューに回します。ほとんどのエンジンが公開しているフィールド単位の信頼度スコアにより、全件再入力のワークフローが小さな例外キューに変わります。
  4. 購入前に期待値を設定する。そのエラー数を、現在の手入力エラー率(通常フィールドの1〜4%)および誤フィールド1件あたりのレビューコストと比較します。このページの帯域を上回るベンダーの見積もりは、お客様のレシートを使ったフィールドレベルのベンチマークが提示されるべきです。

これらは概算の計算式であり、ご自身のドキュメントのベンチマークに代わるものではありません。このページに掲載されているすべての公開範囲は、他社のコーパスで測定されたものです。お客様のレシートフローに適用される唯一の精度数値は、お客様自身が測定したものです。このページの価値は、測定前に期待値を設定し、どの指標を求めるべきかを知ることです。

よくある質問

レシートOCRの精度はどのくらいですか?

正直な答えは、単一の数値ではなく「段階的なもの」です。清潔なスキャン済みレシートでは単語精度90%以上(2019年SROIE最高チーム、Huangら)、実際に色あせた感熱レシートでは単語精度55〜73%(KORIE 2026)、実際にスマートフォンで撮影されたレシートの店舗名ではフィールド精度66.7〜68.7%(RMIT Textract調査2025)です。ベンダーが主張する97〜99%という数字は、新品で平らで明るく撮影された簡単なフィールドを指しており、これは「はしご」の最上段であって中段ではありません。

OCRは色あせた感熱紙のレシートを読み取れますか?

部分的に読み取れますが、その損失は物理的なものです。色あせた感熱紙の文字は紙から永久に消えてしまうため、どのエンジンでも復元できません。実際の色あせやしわのアーティファクトが残る韓国の感熱レシートでは、オープンソースエンジンの単語精度はわずか55〜73%(KORIE 2026)で、最高のエンジン(PaddleOCR、73.3%)でも4語に1語は失敗します。唯一の確実な対策は、レシートが色あせる前に取り込むことです。

レシートをしわくちゃにするとOCR精度に影響しますか?

はい、測定可能なほど影響します。管理された300 DPIテストでは、しわくちゃにすることで文字精度が94.7%から86.9%へ、約8ポイント低下しました。さらに、汚れや水による損傷で80.9%と72.7%まで低下します(IJSAT 2026)。RMIT調査の実在レシートの約50%は折りたたまれたりしわくちゃになったりしており、約67%という店舗名フィールドの結果と一致しています。

OCRで抽出が最も難しいレシートのフィールドはどれですか?

店舗(ベンダー)名が一貫して最も難しく、5つのLLMエンジン全体でフィールド精度73.1〜87.7%であるのに対し、合計金額が最も簡単で94.9〜98.9%、日付はその中間の84.3〜92.5%です(Doubleword 2026、SROIEレシート626件)。同じ順位は、実際にスマートフォンで撮影されたレシート(RMIT 2025)や、アラビア語と英語のレシート(ReceiptSense 2024:数値フィールド93.4、テキストフィールド62.3 F1)でも確認されています。

レシートOCRは請求書OCRよりも精度が低いのですか?

はい、実際にはその通りです。請求書は標準化されたレイアウトの管理されたPDFやフラットベッドスキャンで届きますが、レシートは感熱紙、スマートフォン撮影、しわくちゃ、レイアウト自由です。その差は同等のクラウドエンジンで顕著に現れます。請求書では、フィールド精度はエンジンごとに78〜98%(BusinessWareTech 2025)ですが、同じエンジンクラスを実際のスマートフォン撮影のレシートに適用した場合、店舗名フィールドで66.7〜68.7%でした(RMIT Textract調査 2025年)。

スマートフォン撮影は、スキャンと比べてレシートOCRの精度にどの程度影響しますか?

同一のレシートを用いた査読付きの比較対照研究は存在しません。これは真のデータギャップです(「制限事項」を参照)。存在する証拠は次の通りです。RMIT調査のレシートは約65%がスマートフォン写真で、44%が傾いた状態、12.7%がぼやけた状態であり、店舗名フィールドの精度は66.7〜68.7%でした。一方、より高いスコアを記録したSROIEおよびKORIEベンチマークはフラットベッドスキャンを使用していました。方向性としては、スマートフォン撮影は傾き、影、ぼやけを追加し、それぞれが精度を劣化ラダーで下げますが、正確なペナルティは公表された文献では測定されていません。

SROIEとは何ですか?なぜ重要なのでしょうか?

SROIE(Scanned Receipt OCR and Information Extraction)は、ICDAR 2019コンペティションで、最初の標準化されたレシートOCRベンチマークを作成しました。1,000枚の実際のスキャン済みレシートに、テキスト位置特定、OCR、主要フィールド(会社名、住所、日付、合計金額)のタスクが含まれます(Huang et al., 2019)。これは、公開されたチーム間比較結果を持つ唯一のレシートベンチマークであるため重要です。2019年の最良の手法でも、レシートアプリケーションが要求する99%の精度には届きませんでした。同じデータセットに対する現代のLLMは、全体で84.3〜93.0%を記録しています(Doubleword 2026)。

方法論と情報源

このページの作成方法

このページは、2019年~2026年にわたる14件の独立した研究のデータを集約しています。情報源は3つの基準で選定しました:(1) サンプルサイズが明記された公開済みの方法論、(2) 可能な限り直近3年以内に収集されたデータ(古い情報源は本文中に年号を明記)、(3) 一般的な文書に関する主張ではなく、レシート固有のOCR・抽出に関連する内容。複数の情報源が同じ指標を報告している場合は、控えめな範囲(報告値の最低~最高)を使用しています。過大評価は避けたいからです。情報源間で大幅に食い違う場合は、その相違を平均化してごまかすのではなく、指標レベル・文書状態・コーパスの違いによって説明しています。

指標の区別がこのページの背骨です。文字レベル・単語レベル・フィールドレベルの数値は決して1つの数字に混ぜず、各グラフと表の行にはその指標を明記しています。ベンダー自己申告の数値(DATABASICS 約64%のティア下限)はDグレードと表示し、裏付けのある参考値としてのみ使用しています。SROIEベンチマークの結果は2019年当時の技術であり、年号を明記しています。同じデータセットに対する最新のLLM結果(Doubleword 2026)も最新性のために併記しています。

情報源一覧

  1. Huang, Z. et al. — 「ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction」(2019)。査読付きコンペティション報告書。スキャンされたレシート1,000枚、3つのタスクに対して29/24/18件の有効な提出。 タスク3の最高F1 90.49%、「18チーム中90%超は1チームのみ」「半数以上が80%未満」という結果、およびタスク2の「最良の手法でも99%の要件を達成できない」という記述の出典。
  2. Park, S. et al. — 「CORD: A Consolidated Receipt Dataset for Post-OCR Parsing」(2019)。学術データセット論文。インドネシアのレシート11,000枚以上、4つのスーパークラス下の30フィールド。公開サブセットは800/100/100。 研究モデル行で使用されるコーパス定義とフィールドレベルF1評価プロトコルの出典。
  3. Xu, Y. et al. — 「LayoutLMv2」(ACL 2021)。査読付き論文。 CORDフィールドF1 96.01%(426Mパラメータ)とSROIEフィールドF1 97.81%の出典。
  4. Kim, G. et al. — 「Donut: OCR-free Document Understanding Transformer」(ECCV 2022)。査読付き論文および公式モデルリポジトリ。 CORDフィールドF1 91.3%(donut-base-finetuned-cord-v2)の出典。
  5. 「KORIE: A Multi-Task Benchmark for Detection, OCR, and Information Extraction on Korean Retail Receipts」— MDPI Mathematics (2026)。査読付きジャーナル。実際の色あせ・バンディング・折れ目アーティファクトを含む韓国の感熱紙レシート748枚、OCRクロップ17,587件。 実劣化データに基づく唯一の単語精度数値の出典:PaddleOCR WER 26.73%(単語精度73.3%)、EasyOCR 31.43%、Tesseract 35.26%、BiGRU 44.47%。
  6. 「Towards Analysing Invoices and Receipts with Amazon Textract」(RMIT, 2025)。学術ケーススタディ(プレプリント)。オーストラリアのレシート118枚、約65%がスマートフォン撮影、約50%が折りたたみ・しわくちゃ、44%が傾きあり。 店舗名の完全一致 68.7%(テキストレイアウト)/ 66.7%(ロゴレイアウト)、「合計金額は一貫して検出される」という結果、および言語制限に関する観察の出典。
  7. Abdallah, A. et al. — 「ReceiptSense: Beyond Traditional OCR」(2024)。学術プレプリント。アラビア語・英語のレシート20,000枚、OCR画像30,000枚。 ゼロショットF1 32.07–42.98%、3ショットF1 60.60–80.26%、および数値フィールドとテキストフィールドの差(93.42 vs 62.30)の出典。
  8. 「Optical Character Recognition Accuracy on Degraded Documents」— IJSAT 17(2) (2026)。査読付き。300 DPIでのEasyOCR、4つの物理的条件。 物理的損傷行で使用される文字精度ラダー(通常94.7% / しわくちゃ86.9% / 汚れ80.9% / 濡れ72.7%)の出典。
  9. 「Deep Learning based Key Information Extraction from Business Documents: Systematic Literature Review」(2024)。学術系統的レビュー。 発表論文全体の平均フィールドF1の出典:CORD 0.94、SROIE 0.95。
  10. 「Large language model driven transferable key information extraction mechanism for nonstandardized tables」(2025)。査読付き。LLM-TKIE、ファインチューニングなし、3ショット。 セットアップ不要のLLMベースラインとしてCORD F1 80.9 / SROIE F1 83.9の出典。
  11. Doubleword — 「構造化データ抽出」SROIEベンチマーク(2026年)。方法論を完全開示したベンダーベンチマーク。全626枚のSROIEテストセット、フィールドレベルの完全一致、5つのLLMエンジンを採用。全体で84.3〜93.0%、フィールド別では合計金額94.9〜98.9%、日付84.3〜92.5%、店舗名73.1〜87.7%を提供。
  12. Google Developer Forum — 「多様な請求書・経費レイアウトにおけるDocument AIの低いF1スコアについて」(2024年)。Google公式フォーラムでのユーザーによる実測報告。約1,500件の多様なドキュメントを対象。クラウドAPI実環境でのF1 0.75〜0.85の帯域を提供。
  13. BusinessWareTech — 「AWS Textract vs Google、Azure、GPT-4o:請求書抽出ベンチマーク」(2025年)。独立系第三者によるベンチマーク(Cグレード、透明な方法論、実請求書を使用)。請求書コンテキストのエンジン階層を提供:GPT-4o+OCR 98%、Azure 93%、Google 82%、Textract 78% — レシートにとってはより容易な上限値。
  14. DATABASICS — 「経費精算のためのレシート取得とOCR」ホワイトペーパー。ベンダーのホワイトペーパー(Dグレード)。下限参照としてのみ使用。従来型OCR約64% / AI強化85〜95% / LLM 97〜99%の階層フレーミングを提供。精度は画像品質、レイアウト、手書き文字によって変動するという注意点付き。

限界

  • 地理的カバレッジ:情報源はアジア太平洋地域と中東(マレーシア/シンガポール、インドネシア、韓国、エジプト/アラビア語、オーストラリア)に集中しています。北米・ラテンアメリカ・アフリカを対象としたレシート固有の学術ベンチマークは見つかりませんでした。米国/英国のレシートOCR精度は現在、ベンダーの主張とフォーラムの逸話的報告によってのみ裏付けられており、査読付き研究によるものではありません。
  • 方法論の制約:指標レベル(文字/単語/フィールド)は研究によって異なり、行ごとに表示し、混ぜていません。いくつかの重要な数値は単一の研究に依存しています(KORIEの感熱紙劣化、RMITのTextract店舗名フィールド、ReceiptSenseの多言語対応)。また、DoublewordとGoogleフォーラムの数値はD/Cグレード(ベンダーまたは逸話的)であり、グレードを開示した上で使用しています。IJSATのしわくちゃ/色あせた数値は印刷文書からのものであり、レシートからのものではありません。感熱紙のレシートはさらに劣化が進むと予想されますが、これは推論であり、その旨を明記しています。
  • 時間的ギャップ:SROIEコンペティションのデータは2019年のものです。その絶対数値は2019年当時の方法を反映しており、年号を明記し、同じデータセットに対する最新のLLM結果(Doubleword 2026)を併記しています。SROIE 2019以降、クロスチームの結果が公表された新しい標準化されたレシートコンペティションは見つかりませんでした。
  • 見つけられなかったもの:(1) 同一レシートに対するスマートフォン撮影とフラットベッドスキャンを比較した査読付き管理研究(ベンダーマーケティングで最も頻繁に引用される変数)、(2) レシート固有の明細行抽出ベンチマーク(唯一の明細行数値は請求書コンテキストで、エンジン別40~82%、BusinessWareTech 2025)、(3) スクリプトを一定に保ちながら通貨効果(記号、小数表記)を分離した研究、(4) 手書きのレシート追記(チップ、メモ、修正)のベンチマーク、(5) 電子レシート/スクリーンショットと撮影した紙の比較に関する公開ベンチマーク。これらのギャップは、検証不能なベンダー数値で埋めるのではなく、そのまま明記しています。

関連リファレンス: 文書タイプ別のOCR精度 · 手書き文字認識の精度 · 文書処理コストの内訳 · 手動データ入力のエラー率

関連記事: 手書きレシートの手動データ入力にかかるコスト · AI手書き抽出精度が向上し続ける仕組み

📮 contact email: [email protected]