レシートOCRベンチマーク結果:
5つのオープンソースOCRモデルの精度・レイテンシ・コスト比較(2026年)
最終確認日:2026-08-12 · 実行区分:公式 · 実行回数:10回(5モデル × 2データセット)· レシート数:461
このページの対象外:レシートOCR精度に関する第三者集計(レシートOCR精度を参照)、クラウド/APIモデル(AWS Textract、Google Document AI、Azure — 未実行)、vLLMベースのモデル(Surya2、Unlimited-OCR — 次回バッチで予定)、および元のSROIEコンペティションのファインチューニング済み研究モデル。
これはファーストパーティのベンチマークリファレンスです。すべての数値は、2026年8月11日–12日にバージョン管理されたプロトコル(方法論を参照)に基づき生成された凍結済みベンチマークアーティファクトに遡ることができます。完全なアーティファクトパッケージ(予測、メトリクス、マニフェスト、パフォーマンスログ)はリクエストに応じて提供されます。モデルに該当しないメトリクスはゼロではなく該当なしとして報告されます。
このベンチマークの見出しは逆転現象です:docTRはレシートのテキスト読み取り精度が最も高い(CER 19.7%)一方、構造化フィールドの抽出精度は最も低く(フィールドF1 7.7%)、PaddleOCRはテキスト精度がやや低い(CER 20.5%)ものの、フィールド抽出精度は4倍優れています(フィールドF1 32.5%)。テキスト精度はフィールド精度ではありません — 単一の「精度」数値だけでモデルを選定すると、この乖離を見逃してしまいます。
パラドックス:最高のテキスト読み取り、最低のフィールド抽出
同じベンチマーク実行で、同じ361枚のレシートに対して最高と最低のフィールド抽出結果の両方が生まれました。その違いはデータ品質ではなく、テキストを読むこととフィールドを抽出することの違いです。
2つの精度指標は異なる質問に答えます。文字誤り率(CER)は、正解の書き起こしに対して誤って読まれた個々の文字の割合を測定します。19.7%のCERは、5文字に1文字程度の誤りを意味します。単語誤り率(WER)は、単語内の1文字でも誤読すると単語全体を失敗とみなすため、WERの値は常にCERより高くなります。このベンチマークのフィールドレベルF1は、固定の正規表現後処理によってOCRテキストから4つのSROIEフィールド(会社名、日付、住所、合計金額)を復元できるかどうかを測定し、361ドキュメントのフィールドセット全体での適合率と再現率の調和平均として計算されます。
docTRは最もクリーンな書き起こし(CER 19.7%、WER 32.0%)を生成しましたが、フィールド復元はF1 7.7%にまで落ち込みました。クリーンなテキストに対する正規表現パスでも、値の形式(通貨記号、カンマ小数の合計、複数行の住所)が抽出パターンと一致しない場合には失敗し得ます。PaddleOCRの書き起こしはわずかにノイズが多かったものの(CER 20.5%)、その出力はフィールドパターンとより良く一致し、F1 32.5%を達成しました。どちらの結果も誤りではありません。これらは同じパイプラインの異なる2つの層であり、このバッチのどのモデルも4つのフィールドすべてで完全に正しいドキュメントを1件も達成しませんでした(全モデルでドキュメントレベルのフィールド完全一致 = 0)。これが、OCRテキスト精度はフィールド精度ではないという主張の実際的な意味です。
SROIE 2019 結果:テキスト精度、フィールドF1、レイテンシ、コスト
主要なランキングセットはSROIE 2019(スキャンされたレシートのOCRと情報抽出、ICDAR 2019コンペティションデータセット)です。固定された公式テスト分割の361枚の英語スキャンレシートを、同じ実行グループ内の同じGPU上で5つのモデルすべてでスコアリングしました。CER/WERは低いほど良く、フィールドF1は高いほど良いです。
出典:ImageToTable.ai Receipt OCR Benchmark v1、SROIE 2019テスト分割(361サンプル)。実行:公式ティア、warm_then_scoredプロトコル、RTX 4090。ブートストラップ95%信頼区間(2,000回のリサンプリング)。完全なアーティファクトパッケージはリクエストに応じて提供。データセット:ICDAR 2019 SROIEコンペティション。
| モデル(バージョン) | CER(95%信頼区間) | WER(95%信頼区間) | フィールドF1 | p50レイテンシ | p95レイテンシ | ページ/分(実測) | 1,000ページあたりのドル |
|---|---|---|---|---|---|---|---|
| docTR v1.0.1 | 19.7% (18.5–21.0) | 32.0% (30.4–33.5) | 7.7% | 153 ms | 455 ms | 256.0 | $0.049 |
| PaddleOCR 3.7.0 | 20.5% (19.2–21.7) | 32.6% (31.0–34.1) | 32.5% | 219 ms | 612 ms | 157.8 | $0.080 |
| EasyOCR 1.7.2 | 28.3% (27.1–29.5) | 61.6% (59.5–63.5) | 14.8% | 660 ms | 1,440 ms | 77.4 | $0.164 |
| Tesseract 5.3.4 | 33.6% (31.2–35.9) | 56.2% (53.4–58.9) | 23.2% | 939 ms | 2,314 ms | 54.4 | $0.233 |
| Docling 2.119.0 | 58.4% (52.8–64.6) | 75.1% (69.6–81.2) | 22.3% | 1,196 ms | 4,834 ms | 33.2 | $0.381 |
出典:ImageToTable.ai Receipt OCR Benchmark v1、SROIE 2019テスト分割。すべての指標は固定されたベンチマークアーティファクトに基づく(モデルあたりn=361、成功率100%)。CER/WER:正解テキストに対する文字誤り率/単語誤り率。フィールドF1:OCRテキストから固定正規表現による後処理で抽出したフィールドの精度 — ネイティブなモデルのフィールド出力ではない(5モデルいずれもネイティブな構造化フィールドを出力しない)。信頼区間:ブートストラップ百分位95%、2,000回のリサンプリング。コスト:RunPod RTX 4090を$0.76/時間で使用した場合の計算値(価格記録日:2026-08-11)。完全なアーティファクトはリクエストに応じて提供。
フィールドF1がテキスト精度よりはるかに低い理由
このバッチの全モデルはテキストをある程度正確に読み取るものの、ほとんどのレシートで実用的な構造化フィールドを生成できていません。最高のフィールドF1は32.5%で、完全に正しい文書(会社名・日付・住所・合計金額がすべて正確)を生成したモデルは1つもありませんでした。
ここでのSROIEフィールド指標は正規表現による後処理を適用しています。ベンチマークは各モデルのOCRテキストに対して、4つのフィールドを抽出する固定パターンベースの処理を適用します。これはモデル本来の構造化フィールド出力とは意図的に異なります。このバッチの5つのオープンソースOCRエンジンはいずれもレシートレイアウト向けのネイティブな構造化フィールドを出力しないため、後処理が唯一のフィールド抽出経路となります。CER 19.7%とフィールドF1 7.7%の差は、実際の抽出パイプラインが構造化出力層の欠如に対して支払うコストです。高品質なテキストでも、フィールド化にはレイアウト理解と値の正規化が必要です。
モデル間の順位逆転は安定しています。PaddleOCRがフィールドF1でトップの32.5%(95%信頼区間30.5〜34.5%)、以下Tesseract 23.2%、Docling 22.3%、EasyOCR 14.8%、docTR 7.7%と続きます。一方、テキスト指標の順位は上位でほぼ逆転しています(docTRのCER 19.7%に対しPaddleOCRは20.5%)。「OCR精度」だけを報告するパイプラインは、実際のばらつきが存在するフィールド抽出層を隠しています。
CORD v2:言語ストレステスト
インドネシア語のレシート100枚(CORD v2)では、全モデルのCERが90〜95%に急落しました。英語で学習されたOCRスタックは他の言語に転用できず、このベンチマークはそのペナルティを曖昧にせず数値化しています。
CORD v2(OCR後解析用に構築された統合レシートデータセット)は、言語横断ストレステストを提供します。レビュー済みテストサンプル100件はインドネシア語のレシートで、このバッチの全モデルは主に英語データで学習されています。以下の結果はモデル品質のランキングではありません。CORDのテキスト指標はレシート・言語・レイアウトの堅牢性の証拠として位置づけられ、SROIEと統合した単一の総合ランキングにまとめてはなりません。CORDでは、ネイティブな構造化フィールドを出力するモデルがなく、このバッチ向けのCORD後処理も定義されていないため、フィールド指標は該当しません。
| モデル(バージョン) | CER | WER | p50レイテンシ | 1,000ページあたりのドル |
|---|---|---|---|---|
| PaddleOCR 3.7.0 | 90.8% | 94.1% | 123 ms | $0.067 |
| docTR v1.0.1 | 91.0% | 93.7% | 123 ms | $0.055 |
| EasyOCR 1.7.2 | 91.8% | 96.2% | 6,450 ms | $1.445 |
| Docling 2.119.0 | 92.2% | 95.3% | 524 ms | $0.244 |
| Tesseract 5.3.4 | 95.2% | 97.7% | 652 ms | $0.161 |
出典:ImageToTable.ai Receipt OCR Benchmark v1、CORD v2テスト分割(100サンプル)。全実行は公式ティア、RTX 4090、成功率100%。注意:言語不一致ストレステストのため、CORDのCER値とSROIEのCER値を直接比較しないでください。データセット:CORD v2(Clova AI)。
速度とコスト:7.7倍の差
同一ハードウェア上で、スループットは7.7倍、1,000ページあたりのコストは7.8倍の差があります。レシートのボリュームを考えると、最速のモデルを選ぶだけで、精度を考慮する前にOCR計算コストを約87%削減できます。
このベンチマークでは、スループットを2つの方法で報告しています。1ページあたりのp50/p95レイテンシ(成功した予測レコードから算出、ランナー初期化を除く)と、エンドツーエンドのウォールクロック時間による1分あたりのページ数(warm_then_scoredモードでのランナープロセス起動を含む)です。1,000ページあたりのコストは、記録されたRunPod RTX 4090のレート$0.76/時間で実行ウォールタイムから計算されます。以下のチャートはSROIEのウォールクロックスループットとコストを示しており、CORDも同様の傾向で、docTRとPaddleOCRが再び最速かつ最安です。
出典:ImageToTable.ai Receipt OCR Benchmark v1、SROIE 2019テスト分割(361サンプル)。ランナー初期化を含むタイムドベンチマーク実行によるウォールクロックの1分あたりのページ数。全実行は公式ティア、RTX 4090。
出典:ImageToTable.ai Receipt OCR Benchmark v1、SROIE 2019テスト分割。コスト = 実行ウォールタイム × $0.76/時間(RunPod RTX 4090、2026-08-11記録価格)。実行ごとの初期化オーバーヘッドを含む。
これらの結果からモデルを選ぶ方法
このベンチマークに単一の「最良」モデルはありません。結果は優先順位による選択を支持しており、同じテーブルが異なる質問に答えます。3つの一般的な優先順位がデータに直接対応しています:
- 生の転写精度が目標の場合(全文インデックス、人間が読めるデジタル化):docTRが19.7%のCERでリードし、256.0ページ/分と1,000ページあたり$0.049で最速かつ最安でもあります。テキスト精度、速度、コストの3つすべてを同時に制覇します。
- 構造化フィールド抽出が目標の場合(会社名/日付/合計を必要とする下流システムへの供給):PaddleOCRが32.5%のフィールドF1でリードしますが、それでも約3分の2のフィールド失敗率です。正直な結論は、これらのオープンソースOCRエンジン単体では、構造化抽出レイヤーなしに本番グレードのレシートフィールド抽出を実現できないということです。
- ボリューム時のコストが制約の場合:7.8倍のコスト差により、100万ページはdocTRで約$49、Doclingで約$381になります。同一ハードウェアで100万ページあたり約$332の差です。
どの優先順位が該当する場合でも、プロトコルとアーティファクトにより、コミットする前に自分のGPUでこのテーブルのすべての数値を再現できます。多言語レシートフローでは、CORDの結果は、英語トレーニング済みモデルを最初に対象言語でストレステストすべきという警告です。
よくある質問
レシートで最も正確なオープンソースOCRモデルはどれですか?
指標によって異なります:docTRはテキスト精度が最も高く(361件のSROIEレシートでCER 19.7%)、PaddleOCRはフィールド抽出が最も優れています(ImageToTable.ai Receipt OCR BenchmarkでフィールドF1 32.5%)。両方でトップのモデルはありません — テキスト精度とフィールド抽出は異なるパイプライン層です。
docTRのテキスト精度がPaddleOCRより優れているのに、フィールド抽出が劣るのはなぜですか?
2つの指標が異なるパイプライン層を測定しているためです。docTRは文字をより正確に読み取りましたが(CER 19.7% vs 20.5%)、その出力は会社名・日付・住所・合計金額の固定正規表現フィールドパターンに一致せず、後処理後のフィールドF1は7.7%に低下しました。一方、PaddleOCRは32.5%に達しました。値の形式(通貨記号、カンマ区切り、複数行レイアウト)が抽出パターンと異なる場合、よりクリーンなテキストが必ずしも優れたフィールド抽出を保証するわけではありません。
レシートOCRではPaddleOCRはTesseractより優れていますか?
はい、このベンチマークのすべての指標で優れています:PaddleOCRはTesseractをCER(20.5% vs 33.6%)、WER(32.6% vs 56.2%)、フィールドF1(32.5% vs 23.2%)、速度(157.8 vs 54.4ページ/分)、コスト(1,000ページあたり$0.080 vs $0.233)で上回っています(361件のSROIEテストセット)。
非英語のレシートではOCR精度は低下しますか?
大幅に低下します:100件のインドネシア語CORD v2レシートでは、英語で訓練されたすべてのモデルが90–95%のCER(PaddleOCRが最良の90.8%、Tesseractが最悪の95.2%)でした。一方、英語のSROIEレシートでは20–58%でした。これはモデルランキングではなく、言語ストレステストとして扱ってください — 同じモデルはインドネシア語向けに訓練されていません。
GPU上でのオープンソースOCRの1ページあたりのコストはいくらですか?
記録されたRunPodレート$0.76/時間でのRTX 4090上で、1,000ページあたり$0.049から$0.381の間です — モデルにもよりますが、実行起動を含めて1ページあたりおよそ$0.00005から$0.0004です。
SROIEとは何ですか。また、何をテストするものですか。
SROIE 2019(Scanned Receipt OCR and Information Extraction)は、ICDAR 2019コンペティションデータセットであり、転写とキーフィールドの正解データが付いた実際のスキャンされた英語のレシートで構成されています。このベンチマークでは、その固定された361サンプルのテスト分割を使用します。OCRモデルがレシートのテキスト(CER/WER)を読み取り、会社名、日付、住所、合計金額のフィールドを復元できるかどうかをテストします。ここでのオープンソースモデルについては、ネイティブの構造化フィールドを出力するものがないため、固定の正規表現後処理を介してフィールドを復元しました。
これらのベンチマーク数値を自分で再現できますか。
はい。ベンチマークプロトコルはバージョン管理され、固定されています。すべてのデータセットは公開されており(SROIEはICDAR 2019、CORD v2はClova AI)、5つのモデルはすべて公開されたバージョンのオープンソースです。完全なアーティファクトパッケージ(予測、メトリクス、マニフェスト、パフォーマンスログ)はリクエストに応じて提供されます。1つの注意点として、現在のマニフェストはスキーマv2環境フィンガープリントより前のものであり、完全なバイト単位の再現性を得るには、正確なモデル環境での再実行が必要です。制限事項を参照してください。
方法論と情報源
プロトコル
このベンチマークは、バージョン管理され固定されたプロトコル(v0.1、2026-08-11)に従います。このページのすべての数値は、プロトコルに基づいて生成された特定の予測アーティファクトに由来し、すべての実行は同じ一連の公開ゲートを満たします:run_tier=official、expected_split=test、欠落した予測がないこと、およびすべてのnot_applicableメトリクスがそのまま保持されること(ゼロに変換されない)。品質監査(2026-08-12)により、すべての予測契約、サンプルハッシュ、およびパフォーマンスハッシュが検証されました。
実行環境
| コンポーネント | 詳細 |
|---|---|
| GPU | NVIDIA GeForce RTX 4090、24 GB VRAM、ドライバー 570.211.01 |
| GPUプロバイダー | RunPod、$0.76/時間(2026-08-11T18:30:00Z時点の価格) |
| Python | 3.12.3 |
| PyTorch | 2.8.0+cu128(EasyOCR、docTR、Doclingで使用。Tesseract、PaddleOCRでは未使用) |
| 測定モード | warm_then_scored:データセットごとに5サンプルのウォームアップ後、テスト分割全体を実行 |
| 分割 | テストのみ。トレーニングまたは検証サンプルはスコアリング対象外 |
| 手動監査 | すべての予測コントラクトが合格 — 欠落・重複・不正なサンプルIDなし(監査日:2026-08-12) |
再現方法
ベンチマークコード、ランナースクリプト、評価器はImageToTable.ai benchmark-ocrリポジトリ(Gitコミット 8bdc616、公開予定)で管理されています。このページのすべての数値を生成した正確なコマンドは以下の通りです:
SROIE 2019(英語レシート、テストサンプル361件):
export BENCHMARK_RUN_TIER=official
export BENCHMARK_EXPECTED_SPLIT=test
export BENCHMARK_MEASUREMENT_MODE=warm_then_scored
export BENCHMARK_GPU_LABEL="rtx_4090"
export BENCHMARK_GPU_PROVIDER="runpod"
export BENCHMARK_GPU_HOURLY_USD="0.76"
export BENCHMARK_FIELD_POSTPROCESSOR=sroie_receipt_regex
for model in tesseract paddleocr easyocr doctr docling; do
BENCHMARK_WARMUP_SAMPLES=sroie_warmup_5.jsonl \
bash server/run_model.sh "$model" sroie 361 "receipt-v1-sroie-${model}"
doneCORD v2(インドネシア語レシート、テストサンプル100件):
unset BENCHMARK_FIELD_POSTPROCESSOR
for model in tesseract paddleocr easyocr doctr docling; do
BENCHMARK_WARMUP_SAMPLES=cord_v2_warmup_5.jsonl \
bash server/run_model.sh "$model" cord_v2 100 "receipt-v1-cord-v2-${model}"
doneすべてのモデルはデフォルト設定のまま、そのままの状態で使用しました。ファインチューニング、カスタム言語パック、学習後適応は一切行っていません。モデル別のランナースクリプトと環境設定については、ベンチマークリポジトリを参照してください。
指標の定義
- CER(文字誤り率): 文字レベルのレーベンシュタイン編集距離を正解文字数で割った値(低いほど良い)。ブートストラップ95%信頼区間は2,000回のリサンプリング、シード20260811を使用。
- WER(単語誤り率): 単語レベル(空白区切り)のレーベンシュタイン編集距離を正解単語数で割った値(低いほど良い)。CERと同じ信頼区間法を使用。
- フィールドF1(SROIEのみ): SROIEの4フィールド(会社名、日付、住所、合計金額)における適合率と再現率の調和平均。固定の正規表現後処理器(
sroie_receipt_regex)でOCRテキストから抽出。ネイティブなモデル構造化フィールド出力ではなく、5モデルすべてでネイティブフィールド指標は該当なし。 - p50 / p95レイテンシ: 成功した予測レコードの1ページあたりの推論時間(ミリ秒)。ランナー初期化を除く。
- ウォールクロックのページ/分: 総スコアリングサンプル数を総実行時間で割った値。ランナープロセス起動を含む。高いほど良い。
- 1,000ページあたりのコスト: 実行時間(時間)× $0.76 ×(1,000 / サンプル数)。推定レートではなく、実際のプロバイダー価格メタデータを使用。
- 成功率: このバッチの全10実行で100%(エラー0件、タイムアウト0件、予測欠落0件)。
データセット
- SROIE 2019(スキャンされたレシートのOCRと情報抽出)— ICDAR 2019 Robust Reading Competition、タスク3。行レベルのテキスト転写と4つのキーフィールドの正解ラベル(会社名、日付、住所、合計金額)を持つ361件の実スキャン英語レシート。固定テスト分割。
- CORD v2(統合レシートデータセット)— Clova AI Research、NAVER Corp。公開テスト分割からレビュー済みのインドネシア語レシートサンプル100件を、言語横断ストレステストとして使用。ネストされたメニュー明細項目と小計/合計の正解を含む(このバッチではスコアリング対象外—ネイティブな構造化フィールド出力が必要)。
テスト済みモデル
| モデル | バージョン | タイプ | ソース |
|---|---|---|---|
| Tesseract | 5.3.4 | クラシックOCRエンジン(CPU+GPU) | GitHub |
| PaddleOCR | 3.7.0 | ディープラーニングOCR(PaddlePaddle) | GitHub |
| EasyOCR | 1.7.2 | ディープラーニングOCR(PyTorch) | GitHub |
| docTR | v1.0.1 | ニューラルOCR(TensorFlow / PyTorch) | GitHub |
| Docling | 2.119.0 | ドキュメントパーサー(IBM) | GitHub |
アーティファクトへのアクセスと再現性
ベンチマークソースコード:benchmark-ocrリポジトリ(Gitコミット8bdc616)で管理されています。このリポジトリには、モデル別のランナースクリプト、評価器(CER/WER、フィールドメトリクス、ブートストラップ信頼区間)、SHA256ハッシュ付きのデータセットサンプルマニフェスト、および固定プロトコルが含まれています。公開は準備中です — 公開され次第、このページのすべての数値は、リポジトリをクローンし、公開データセットを取得し、RTX 4090上で上記のコマンドを実行することで、独立して再現可能になります。
完全なアーティファクトパッケージ:モデル別の予測(*.jsonl)、95%信頼区間付きメトリクス(metrics.csv)、フィールドレベルの診断情報(field_details.csv)、ウォールクロックパフォーマンスログ(performance.json)、および実行マニフェスト(manifest.json)は、プロトコルに基づいてバージョン管理され、ソースコードとともに利用可能です。公開前の早期アクセスについては、[email protected]までお問い合わせください。
スキーマv1に関する注記:現在のマニフェストは、スキーマv2の環境フィンガープリント(実行時にOS、CUDAバージョン、モデル別のPythonパッケージバージョンを取得)より前のものです。上記の環境テーブルはスキーマv1が記録する内容を反映しています。完全なバイトレベルの再現性には、スキーマv2での再実行が必要です。これは報告されたメトリクスの正確性には影響しません。
制限事項
- マニフェストスキーマv1: 現在の実行マニフェストは、実行時の正確なPython環境を記録するスキーマv2の環境フィンガープリントより前のものです。完全なバイト単位の再現性には、正確なモデル環境でのスキーマv2の再実行が必要です。
- SROIEフィールドメトリクスは正規表現による後処理であり、ネイティブ抽出ではありません: フィールドF1は、固定パターンを介したOCRテキストからのフィールド復元を測定するものであり、モデルのネイティブな構造化フィールド機能(このバッチのどのモデルでも利用不可)を測定するものではありません。
- CORDの結果は言語不一致のストレステストであり、精度ランキングではありません: 5つのモデルはすべて英語でトレーニングされています。CORDのCER値(90%以上)は言語横断的な崩壊を定量化するものであり、SROIEと単一のリーダーボードに統合してはなりません。
- PaddleOCR-VLはランキングから除外: パイプラインの直接的な問題により除外されました。その結果はランキングされた5つのモデルとは比較できません。
- Surya2とUnlimited-OCRは含まれていません: これらはvLLMサーバーポッドを必要とし、v1.1バッチで計画されています。現在のリリースは
local_torchグループのみを対象としています。 - シングルGPUティアのみ: すべての実行はRTX 4090です。マルチGPUまたはRTX 3090/A100の比較はまだ利用できないため、コスト/スループットの結論はこの1つのティアに固有のものです。
- オープンソースモデルのみ: クラウド/APIモデル(AWS Textract、Google Document AI、Azure Form Recognizer)は含まれていません。それらの比較は別途計画されているベンチマークです。
関連リファレンス: レシートOCR精度 · 文書タイプ別のOCR精度 · OCRとは?
関連資料: ABBYY FineReaderと最新AI OCRの比較 · Adobe Acrobat OCRとAI抽出の比較 · OCR精度の主張の読み方