1,000ページあたりのOCRコスト
8つのオープンソースエンジンをベンチマーク(2026年)
最終確認: 2026-08-18 · 実行ティア: 公式 · 自社ベンチマーク · 8エンジン × 2つのレシートデータセット
このページの対象外: レシート以外のドキュメントタイプ — 請求書、フォーム、契約書、長文書は含みません。クラウド/API OCRサービス(AWS、Google、Azureおよびその呼び出しごとの料金)、ファインチューニング済みモデル、GPUの調達/償却(ハードウェアを直接購入する場合と時間単位でレンタルする場合)、ストレージとエグレス、およびLLMフィールド抽出のドルコスト(トークン数のみ)は対象外です。8エンジンの完全な精度/レイテンシー比較は、8エンジンOCR vs VLMベンチマークにあります。
範囲の説明: このページのすべてのドル金額は、1つのGPUティア(RTX 4090)の1つの価格タイムスタンプ(2026年8月、$0.76/時間、実行マニフェストにprice_recorded_at_utc 2026-08-13T08:00:00Zとして記録)に基づいています。予算を立てる前に、現在のレートで再計算してください。レシートデータセットのみ(SROIE 2019、CORD v2)。コスト = ウォールクロック実行時間 × 時間単価(モデル初期化を含む)。
同じGPU、同じレシート、同じ$0.76/時間の課金ベースで、8つのオープンソースエンジン間の1,000ページあたりのOCRコストは22.2倍の範囲に及びます — SROIE 2019で$0.0479(docTR)から$1.0609(Surya2)まで。エンジンの選択だけで、オープンソースOCRのコストは1桁以上変動し、ランキングは精度ではなくウォールクロック時間に従います。最も安価なエンジン(docTR)は2番目に良い文字誤り率を持ち、最も高価なエンジン(Surya2)は最良の文字誤り率を持ちます。
ライターが最も頻繁に必要とする2つの数値: 測定された最も安価なエンジン(docTR、449.3ページ/分)では1,000ページあたり$0.048、最も高価なエンジン(Surya2、12.1ページ/分)では1,000ページあたり$1.061 — 同じテスト分割、同じGPUティア、同じ価格タイムスタンプ。TesseractはCPUのみ: 課金されるGPU時間を消費せず、そのコストセルはソースCSVで設計上空です — ゼロでも無料でもありません。
1,000ページあたりのコストは、記録された時間単価で1,000ページを処理する際のGPU課金時間です — ウォールクロック実行時間 × $0.76/時間。ここでウォールクロック時間にはモデル初期化が含まれます。このページのコストランキング全体は正確にその方法で計算されており、具体的な計算はコストの見積もり方セクションと各テーブルのソース行に示されています。
請求は時間単位で計上されるため、コストは精度ではなく時間に連動します:1ページを109ミリ秒で読むエンジンは、同じ時間単価で2,668ミリ秒かかるエンジンよりも約25倍安くなります。バッチサイズが大きくなるほど、モデル初期化の一回限りのコストがより多くのページに分散されるため、すべてのエンジンのコストはさらに下がります — 以下の金額はベンチマークの実行パターン(固定テスト分割、warm_then_scored測定)を反映したものであり、ご自身の実行コストとは異なります。
SROIE 2019:1,000ページあたりのコストランキング
361枚の英語レシートでは、従来型の2段階OCRエンジンが低コスト側、文書解析VLMが高コスト側に位置します — しかし、各ファミリー内の差が驚きです:コンパクトな0.9B VLMであるPaddleOCR-VLは$0.2048で最安エンジンの4.3倍以内に収まる一方、同じVLM系のSurya2は最安の22.2倍 — VLMクラスター内だけで5.2倍の開きがあります。
出典:summary_metrics.csv — cost_per_1000_pages列、sroie_2019行。docTR 0.0479、EasyOCR 0.1098、PaddleOCR-VL 0.2048、PaddleOCR 0.2214、Unlimited-OCR 0.3879、Docling 0.3978、Surya2 1.0609。TesseractはCPUのみ:CSVではセルが空(GPU課金時間なし)。コスト = ウォールクロック実行時間 × $0.76/時間(RunPod RTX 4090、価格は2026年8月時点)、モデル初期化を含む。
| 順位 | モデル | タイプ | コスト / 1Kページ | ページ/分 | 出典 |
|---|---|---|---|---|---|
| 1 | docTR | 従来型OCR(GPU) | $0.0479 | 449.3 | summary_metrics.csv · doctr/sroie_2019行 |
| 2 | EasyOCR | 従来型OCR(GPU) | $0.1098 | 124.5 | summary_metrics.csv · easyocr/sroie_2019行 |
| 3 | PaddleOCR-VL | 文書解析VLM | $0.2048 | 68.2 | summary_metrics.csv · paddleocr_vl_vllm/sroie_2019行 |
| 4 | PaddleOCR | 従来型OCR(GPU) | $0.2214 | 79.7 | summary_metrics.csv · paddleocr/sroie_2019行 |
| 5 | Unlimited-OCR | 文書解析VLM | $0.3879 | 34.4 | summary_metrics.csv · unlimited_ocr/sroie_2019行 |
| 6 | Docling | パイプラインパーサー | $0.3978 | 56.7 | summary_metrics.csv · docling/sroie_2019行 |
| 7 | Surya2 | 文書解析VLM | $1.0609 | 12.1 | summary_metrics.csv · surya2/sroie_2019行 |
| — | Tesseract | 従来型OCR(CPU) | 該当なし(CPUのみ、GPU課金なし) | 78.6 | summary_metrics.csv · tesseract/sroie_2019行 |
表: summary_metrics.csv — cost_per_1000_pages / pages_per_minute、sroie_2019行(各361サンプル、error_rate 0.0)。GPUは$0.76/時間(RTX 4090、価格はマニフェストにタイムスタンプ付き)で実行。TesseractはCPUのみで実行(コストセルは設計上空白 — GPU課金時間なし、ゼロコストではない)。コストにはモデル初期化が含まれるため、バッチが大きいほどページあたりのコストは下がる。
コストは精度ではなくスループットに従う
エンジンをコスト順と文字精度順に並べると、両者の順位はほとんど一致しない。SROIEでの最高の生テキスト品質はSurya2(CER 0.1915)— 最も高価なエンジンで$1.0609 — であり、2番目に良いのはdocTR(CER 0.1971)— 最も安価な$0.0479 — である。コストは時間に対する請求書だ:Surya2の12.1ページ/分は、同じ時間単価でdocTRの449.3ページ/分と比較して約37倍のスループットしか得られない。
アーキテクチャの重みの相関は実在するが緩い。クラスとして、文書解析VLM(Surya2、Unlimited-OCR、PaddleOCR-VL)は従来の2段階OCRエンジン(docTR、EasyOCR、PaddleOCR)の上に位置し、パイプライン型パーサーのDoclingはその間に位置する。しかし各クラス内でのばらつきは大きい — VLMクラスは5.2倍($0.2048〜$1.0609)、従来クラスは4.6倍($0.0479〜$0.2214)— そして、実行中で最小のVLMである0.9BパラメータのPaddleOCR-VLは、最も安価なエンジンの4.3倍以内に収まる一方、Surya2は22.2倍である。実用的な教訓:「精度が高い=コストが高い」は、自社の文書で測定するまで誤りだと想定せよ;このベンチマークでは、コスト順位と精度順位の関係は事実上切り離されている。
出典:summary_metrics.csv — pages_per_minute列、sroie_2019行。モデル初期化を含むウォールクロックのページ/分。TesseractはCPUのみで実行(CPUハードウェアで78.6ページ/分)。
| モデル | タイプ | CER(低いほど良い) | レイテンシ p50(ms) | ページ/分 | コスト / 1Kページ | docTR比コスト | 出典 |
|---|---|---|---|---|---|---|---|
| docTR | 従来型OCR | 0.1971 | 108.7 | 449.3 | $0.0479 | 1.00× | summary_metrics.csv · doctr/sroie_2019行 |
| EasyOCR | 従来型OCR | 0.2833 | 413.6 | 124.5 | $0.1098 | 2.29× | summary_metrics.csv · easyocr/sroie_2019行 |
| PaddleOCR | 従来型OCR | 0.2045 | 297.0 | 79.7 | $0.2214 | 4.62× | summary_metrics.csv · paddleocr/sroie_2019行 |
| Tesseract | 従来型OCR(CPU) | 0.3347 | 670.9 | 78.6 | n/a(CPU) | n/a | summary_metrics.csv · tesseract/sroie_2019行 |
| PaddleOCR-VL | 文書解析VLM | 0.3370 | 694.3 | 68.2 | $0.2048 | 4.28× | summary_metrics.csv · paddleocr_vl_vllm/sroie_2019行 |
| Docling | パイプライン型パーサー | 0.5909 | 732.0 | 56.7 | $0.3978 | 8.31× | summary_metrics.csv · docling/sroie_2019行 |
| Unlimited-OCR | 文書解析VLM | 0.6552 | 1,600.7 | 34.4 | $0.3879 | 8.10× | summary_metrics.csv · unlimited_ocr/sroie_2019行 |
| Surya2 | 文書解析VLM | 0.1915 | 2,668.0 | 12.1 | $1.0609 | 22.16× | summary_metrics.csv · surya2/sroie_2019行 |
表: summary_metrics.csv — cer / latency_p50_ms / pages_per_minute / cost_per_1000_pages、sroie_2019行。コスト比率はdocTRの0.0479に対する単純除算で算出(例: 1.0609 / 0.0479 = 22.16)。Surya2のCERは、方法論に記載のケースフォールディングの注意点を踏まえて解釈する必要がある(VLM出力はケース正規化されており、CERはVLMのエラーを過大評価する)。TesseractのレイテンシはCPUハードウェアでの値であり、コスト欄は設計上空白(GPU課金なし)。
レイテンシ列はインタラクティブワークロードの視点を加える。ボリュームあたりのコストとページあたりのレイテンシは、同じウォールクロックの事実を2つの視点から見たものである。docTRのp50 108.7 msは、1,000ページあたりのコストが最も安く、かつインタラクティブ応答に近い唯一のエンジンであることを示す。Surya2のp50 2,668 msは、最も高価であり、レシートではバッチ専用ワークロードであることを示す。レイテンシの詳細は、姉妹記事の8エンジン総覧で分析されている。
CORD(インドネシアのレシート):コストはデータセットに依存する
ドキュメントセットを変えるとコストランキングは入れ替わる。これは、1,000ページあたりのコストがエンジンの定数ではないことを証明している。CORD v2では、EasyOCRが最も安いエンジン($0.0863)となり、docTRは2位($0.0939)に後退する。一方、両端のアンカーは維持される。docTRは最安値付近に留まり、Surya2は最も高価なまま($1.1616)である。CORDの差は13.5倍に縮まる。
その仕組みは、実際のドキュメントセットでのスループットにある。CORDのインドネシアのレシートは、SROIEの英語のものより短く、テキスト密度も低いため、すべてのエンジンの1分あたりのページ数が変化し、1,000ページあたりのコストもそれに追随する。このベンチマークでは、2つのデータセットは意図的に分離されている。CORDはまた、そのグラウンドトゥルースにアノテーション構造のインフレーションがあり、CERの読み取り値を信頼できないものにしている(方法論を参照)。したがって、SROIEとCORDの列は、1つのランキングではなく、2つの独立したデータポイントとして扱うこと。
出典:summary_metrics.csv — cost_per_1000_pages列、cord_v2行。EasyOCR 0.0863、docTR 0.0939、Unlimited-OCR 0.2063、PaddleOCR-VL 0.2409、PaddleOCR 0.3419、Docling 0.5382、Surya2 1.1616。TesseractはCPUのみ(空セル)。同じRTX 4090 @ $0.76/時(価格はタイムスタンプ付き)、モデル初期化込みのコスト。
| 順位 | モデル | タイプ | コスト / 1Kページ | 出典 |
|---|---|---|---|---|
| 1 | EasyOCR | 従来型OCR(GPU) | $0.0863 | summary_metrics.csv · easyocr/cord_v2行 |
| 2 | docTR | 従来型OCR(GPU) | $0.0939 | summary_metrics.csv · doctr/cord_v2行 |
| 3 | Unlimited-OCR | 文書解析VLM | $0.2063 | summary_metrics.csv · unlimited_ocr/cord_v2行 |
| 4 | PaddleOCR-VL | 文書解析VLM | $0.2409 | summary_metrics.csv · paddleocr_vl_vllm/cord_v2行 |
| 5 | PaddleOCR | 従来型OCR(GPU) | $0.3419 | summary_metrics.csv · paddleocr/cord_v2行 |
| 6 | Docling | パイプラインパーサー | $0.5382 | summary_metrics.csv · docling/cord_v2行 |
| 7 | Surya2 | 文書解析VLM | $1.1616 | summary_metrics.csv · surya2/cord_v2行 |
| — | Tesseract | 従来型OCR(CPU) | 該当なし(CPUのみ、GPU課金なし) | summary_metrics.csv · tesseract/cord_v2行 |
表: summary_metrics.csv — cost_per_1000_pages、cord_v2行(各100サンプル)。CORDはSROIEランキングとは別に扱う(言語が異なり、正解データの構造も異なる)。この比較の目的は、1,000ページあたりのコストが文書セットに応じて変動することを示すことであり、どちらかのランキングが「優れている」と主張することではない。
月次ボリュームシナリオ(推定値)
1,000ページあたりの数値は、予算担当者が必要とするボリューム計算に直接掛け合わせることができます。SROIEコスト基準で月間100,000ページの場合、docTRのGPU時間は月額$4.79、Surya2は月額$106.09となり、その差はおよそ月額$101です。この差は100万ページでは約$1,013/月に拡大します。これらは測定された1,000ページあたりの数値の算術的な拡張であり、追加の実行ではありません。
| 月間ボリューム | docTR GPU時間(算術) | Surya2 GPU時間(算術) | 差 | 基準 |
|---|---|---|---|---|
| 10,000ページ | $0.48 (10 × $0.0479) | $10.61 (10 × $1.0609) | $10.13 | summary_metrics.csv cost_per_1000_pages、doctr / surya2 sroie_2019行。単純な掛け算による導出 — 測定実行ではありません |
| 100,000ページ | $4.79 (100 × $0.0479) | $106.09 (100 × $1.0609) | $101.30 | |
| 1,000,000ページ | $47.88 (1,000 × $0.0479) | $1,060.85 (1,000 × $1.0609) | $1,012.97 |
表: SROIE 2019コスト基準による推定値 — 測定実行ではありません。 各セルは、測定されたcost_per_1000_pages(docTR 0.0479、Surya2 1.0609、summary_metrics.csvのsroie_2019行)に千単位のボリュームを掛けた単純な乗算であり、同じ$0.76/時間のRTX 4090レート、価格タイムスタンプは2026年8月です。GPU時間のみ — CPU、ストレージ、出力転送、オーケストレーション、LLM後処理は含みません。月間1,000万ページの場合、Surya2単独でこの基準ではおよそ月額$10,609に達します(10,000 × $1.0609)。
Tesseractの実際のコストプロファイル:GPU費用なし、ただし無料ではない
Tesseractはベンチマークで唯一のCPU専用エンジンであり、そのコスト欄は意図的に空欄です。課金対象のGPU時間を消費していないため、$0.76/hrで請求するものがありません。これは無料という意味ではありません。実行されるCPUインフラ(自社ハードウェアまたはレンタルしたCPUインスタンス)は実際のコストであり、このベンチマークでは定量化されていません。また、フィールド復元の上限により、後工程でコストが発生する可能性があります。
SROIEでは、TesseractはCPU上で78.6 pages/minを維持しました。これは7つのGPUエンジンのうち4つ(PaddleOCR-VL 68.2、Docling 56.7、Unlimited-OCR 34.4、Surya2 12.1)より高い値です。既にプロビジョニング済みのCPUインフラで低ボリュームを処理する場合、GPUレンタルが不要なため、真にコスト効率が良いと言えます。問題は、テキストだけでなくフィールドが成果物となる場合に顕在化します。Tesseractの弱いベーステキストは、後段のLLMが復元できる内容を制限します。CORD LLMフィールドF1は0.163(CORD CER 0.9523時、field_method_comparison.csv、tesseract/cord_v2行)であり、GPUコストの削減は、後処理や修正にかかるコストで相殺される可能性があります。CPU対GPUのトレードオフは、専用のTesseract vs PaddleOCRの直接比較で取り上げています。後処理の上限については、ルールベースとLLM抽出の比較で説明しています。
パイプラインコスト ≠ エンジンコスト:LLM後処理の境界
このページのすべての数値は、OCRエンジンのGPU費用のみを示しています。本番の抽出パイプラインでは、OCRテキストの上にLLMフィールド抽出パスを追加するのが一般的です。ベンチマークでは全16ランで1回(deepseek-v4-flash)実行しましたが、このパスはトークン単位の別途APIコストであり、ここに示すエンジン費用には含まれません。
比較CSVには、SROIEでの後処理パスのトークン数が記録されています。例えば、docTRのOCRテキストは4つのレシートフィールドを抽出するために151,131プロンプトトークン + 25,377完了トークンを消費しました。これらのトークン数が追加費用の見積もりの基礎となります。このページでは意図的にトークンをドルに換算していません。LLMの価格はプロバイダー、プラン、モデルによって異なり、ドル換算の数値はすぐに陳腐化するためです。エンジンコストとパイプラインコストは予算上の2つの項目であり、LLMの項目はプロンプト設計とプロバイダーに依存するもので、OCRエンジンには依存しません。
| OCRエンジン | プロンプトトークン | 完了トークン | ソース |
|---|---|---|---|
| Tesseract | 128,285 | 24,561 | field_method_comparison.csv · tesseract/sroie_2019 row |
| PaddleOCR | 134,746 | 26,059 | field_method_comparison.csv · paddleocr/sroie_2019 row |
| EasyOCR | 138,689 | 25,607 | field_method_comparison.csv · easyocr/sroie_2019 row |
| docTR | 151,131 | 25,377 | field_method_comparison.csv · doctr/sroie_2019 row |
| Surya2 | 130,262 | 26,372 | field_method_comparison.csv · surya2/sroie_2019 row |
| Docling | 157,191 | 26,087 | field_method_comparison.csv · docling/sroie_2019 row |
| Unlimited-OCR | 185,705 | 25,876 | field_method_comparison.csv · unlimited_ocr/sroie_2019 row |
| PaddleOCR-VL | 148,973 | 26,301 | field_method_comparison.csv · paddleocr_vl_vllm/sroie_2019 row |
表: field_method_comparison.csv — llm_prompt_tokens / llm_completion_tokens、sroie_2019行。llm_model = deepseek-v4-flash。トークン数は、SROIEテスト分割の361ページに対する1回のフィールド抽出パス(レシート4フィールド)を対象としています。これらはLLM後処理コストの見積もり根拠であり、LLM価格はプロバイダーやプランによって異なるため、ドル換算は行っていません。
ご自身のコストを見積もる方法
8つのエンジンによるベンチマークを再実行しなくても、ご自身のワークロードに対する妥当なコスト見積もりを得ることができます。ベンチマークの方法(ウォールクロック時間 × 時間単価)は、4つのステップと1つの計算例で再現できます。
- エンジンとその測定済みスループットを選択します。 同じ文書タイプの代理指標として、1分あたりのページ数(例:SROIEにおけるdocTR 449.3、Surya2 12.1ページ/分、summary_metrics.csvのsroie_2019行)を使用します。ご自身の文書構成の場合は、小さなサンプルでスループットを測定してください。上記のランキングは、1,000ページあたりのコストがデータセットに依存することを示しています。
- ボリュームをウォールクロック時間に変換します。 Nページの場合、
時間 = / 60。モデルの初期化はプロセス/バッチごとに一度だけ発生するため、分子に含める必要があります。 - 時間単価を掛けます。
コスト = 時間 × 単価。ベンチマークの単価は$0.76/時(RunPod RTX 4090、2026年8月時点の価格)でした。 ベンチマーク自体からの計算例: docTRのSROIE実行は、361ページで81,867ミリ秒のウォールクロック時間(その編集済みマニフェストのperformance.run_wall_time_ms)を要し、0.0227時間 × $0.76 = 実行あたり$0.0173、× 1,000 / 361 = 1,000ページあたり$0.0479となり、CSVの行と正確に一致します。 - 初期化の償却とバッチサイズを考慮します。 上記の81,867ミリ秒には361ページのバッチの初期化が含まれます。1,000,000ページでは同じ初期化は約2,770倍に希薄化され、ページあたりのコストは純粋な定常状態のスループットに近づきます。小さなバッチは初期化コストを繰り返し支払うことになります。10ページのバッチは10,000ページの実行と同じ初期化コストを支払うため、バッチサイズが小さいと1,000ページあたりのコストは急上昇します。ワークロードが断続的な場合は、バッチを大きくするか、初期化コストが高い経済性を受け入れてください。
- パイプラインコストは別の行に追加します。 LLMフィールド抽出はトークン単位(比較CSVのトークン数)、ストレージと出力はバイト単位、TesseractタイプのCPU専用スタックはCPU時間単位で請求されます。これらは、このページの1,000ページあたりの数値には含まれていません。
これは、ベンチマーク自身のコスト基準(ウォールクロック時間 × 単価、モデル初期化を含む)から導出された概算方法です。金融アドバイスではなく、正確な数値はハードウェア、文書構成、バッチサイズ、使用率によって異なります。$0.76/時という単価は2026年8月時点のオンデマンド価格です。現在のレートで再計算してください。
よくある質問
OCRの費用は1,000ページあたりいくらですか?
SROIE 2019で1,000ページあたり$0.048(docTR)から$1.061(Surya2)の範囲で、RTX 4090で$0.76/時間、価格は2026年8月時点(summary_metrics.csv cost_per_1000_pages、sroie_2019行)。費用にはモデル初期化が含まれるため、バッチサイズが大きくなるほどページあたりのコストは下がります。CORD v2では同じエンジンで$0.086(EasyOCR)から$1.162(Surya2)の範囲です。
最も安価に実行できるオープンソースOCRエンジンはどれですか?
docTRはSROIEで1,000ページあたり$0.0479(449.3ページ/分、summary_metrics.csv doctr/sroie_2019行)と、測定されたGPUエンジンの中で最も安価でした — ただし、データセット依存の注意点があります:CORD v2ではEasyOCR($0.0863)がdocTR($0.0939)をわずかに上回りました。「最も安い」の答えはドキュメントセットに依存します。アンカー(docTRが低価格帯、Surya2が高価格帯)は両方で維持されました。
最速のエンジンが最も安価なのはなぜですか?
請求が$0.76/時間のウォールクロック時間に基づくためです:109 msで1ページを処理するエンジン(docTR)は、2,668 msかかるエンジン(Surya2)のページあたり時間の約1/25を支払います(summary_metrics.csv latency_p50_ms / cost_per_1000_pages、sroie_2019行)。従量制GPU課金では、スループットがコストです — そのためコスト順位とスループット順位はほぼ鏡像関係になります。
Tesseract OCRは無料ですか?
いいえ — TesseractはCPU専用のため、課金対象のGPU時間を消費せず、ベンチマークCSVのコスト欄は設計上空白ですが、それはゼロではありません:実行されるCPUインフラは実際のコストであり、フィールド復元の上限(CORD LLMフィールドF1 0.163、field_method_comparison.csv tesseract/cord_v2行)により、後段の後処理に費用がかかる可能性があります。既存のCPUハードウェアでの低ボリューム利用では、実際にコスト効率が良い場合があります — SROIEで78.6ページ/分、7つのGPUエンジンのうち4つより高速 — ただし「GPU請求なし」と「無料」は別の意味です。
Surya2が1,000ページあたりこれほど高額なのはなぜですか?
ベンチマークで最も遅いエンジンだからです:SROIEで12.1ページ/分ということは、同じ$0.76/時間のレートで1,000ページあたりのウォールクロック時間が最も多いことを意味します(summary_metrics.csvのpages_per_minute / cost_per_1000_pages、surya2/sroie_2019行)。特筆すべきは、文字精度も最高(CER 0.1915)であることです — コストが精度ではなく時間に比例することを示す、ベンチマークで最も明確な例です。
ページ数が増えると、OCRのページあたりコストは下がりますか?
はい、下限までは下がります。ここでのコストにはモデル初期化が含まれており、これはプロセス/バッチごとに一度だけ支払われます。ベンチマークのdocTR実行では、361ページに対して81,867ミリ秒の初期化が含まれていました(manifest performance.run_wall_time_ms)。そのため、100万ページではこの初期化はほぼゼロに希釈され、コストは純粋な定常状態のスループットに近づきます。下限は定常状態のコストそのものです — docTRのSROIEでの$0.0479/1Kはすでに下限に近く、Surya2の$1.0609は初期化オーバーヘッドだけでなく、実際に遅い定常状態の推論を反映しています。
これらの1,000ページあたりの数値に含まれていないものは何ですか?
LLM後処理(トークンごとの別途APIコスト。トークン数はfield_method_comparison.csvに記載)、Tesseract系スタックのCPU/インフラ、ストレージとエグレス、オーケストレーション、GPU利用ギャップ、クラウド/API OCRサービス — これらはすべて、これらの数値が表すエンジンGPU請求には含まれていません。クラウドAPIも機能別の価格設定で呼び出しごとに請求され、レンタルGPUのウォールクロック時間とは異なるコストモデルです。これらはこのページではベンチマーク対象外です。
これらの数値はどこから来ていますか?
すべての数値は、ファーストパーティベンチマークの公開CSVの行です — results/summary_metrics.csv(1,000ページあたりのコスト、スループット、レイテンシ、精度)とresults/field_method_comparison.csv(LLM後処理トークンとフィールドF1) — はImageToTableai/benchmark-ocrでホストされており、各実行には$0.76/時間のレート、2026年8月の価格タイムスタンプ、モデルバージョン、環境ハッシュを記録した1つの編集済みmanifest.jsonが含まれています。
方法論と情報源
プロトコル
このページは、独立した再現可能なベンチマーク実行(公式ティア)のコスト面を報告するものであり、第三者による主張の調査ではありません。固定テスト分割のみを使用:SROIE 2019テスト(英語レシート361件、フラットなフィールド:会社名/日付/住所/合計)とCORD v2テスト(インドネシア語レシート100件、ネストされたフィールド:メニュー/小計/合計)。トレーニング分割は評価されていません。すべての(エンジン×データセット)ペアは、同じ画像、同じグラウンドトゥルース、同じ測定プロトコル(warm_then_scored:固定のウォームアップパスがスコアリングパスに先行)を使用しました。全16回の実行はerror_rate 0.0で完了しました(summary_metrics.csvのerror_rate列)。
実行環境とコスト基準
- ハードウェア:すべてのGPU実行はNVIDIA RTX 4090(24 GB)上で実施。GPUコストはRunPodのオンデマンドレート$0.76/hrで計算され、各実行の編集済みマニフェストに価格タイムスタンプ(
price_recorded_at_utc 2026-08-13T08:00:00Z)が記録されています。TesseractはCPUのみで実行され、GPUコストはありません(CSVのコストセルは空欄 — 設計上のものであり、ゼロではありません)。 - コスト計算式:1,000ページあたりのコスト = ウォールクロック実行時間 × $0.76/hr ×、モデル初期化を含む。コスト見積もり方法セクションのdocTRの計算例(81,867 ms → $0.0479/1K)で検証済みです。
- エンジン:すべてのモデルは追加調整なしでそのまま実行。バージョンは実行マニフェストに従って固定(Tesseract 5.3.4、PaddleOCR 3.7.0、EasyOCR 1.7.2、docTR v1.0.1、Docling 2.119.0、Surya2 0.22.1、Unlimited-OCR vLLM提供、PaddleOCR-VL 1.6)。
- LLM後処理:deepseek-v4-flashをAPI経由で温度0に設定して使用(field_method_comparison.csvのllm_model列)。そのトークン数は別のパイプラインコストの基準として報告されており、OCRエンジンのコスト数値には含まれません。
- フィールド後処理:SROIEフィールドメトリクスは
postprocessed_sroie_receipt_regex_*/ LLMバリアントです — フィールドはOCRのテキストから抽出され、ネイティブな構造化出力からではありません。 - CORDに関する注意:CORDのグラウンドトゥルーステキストには注釈構造が埋め込まれており、すべてのエンジンで生のCERが膨らみます。そのため、CORD行はSROIEランキングとは別に保持されています。コスト数値(ウォールクロックベース)はCERの注意事項の影響を受けませんが、両データセットともレシートのみです。
指標の定義
- 1,000ページあたりのコスト: 記録された$0.76/時間のレートで1,000ページを処理する際のGPU利用時間(モデル初期化を含む壁時計時間)。CPUのみのTesseractでは空欄。
- 1分あたりのページ数: モデル初期化を含む壁時計スループット。
- レイテンシ p50/p95: 定常状態での1ページあたりの推論時間(ウォームアップ後に計測、モデル読み込みは除外)。
- CER/WER: 正解テキストの文字/単語に対する編集距離(挿入+削除+置換)。大文字小文字や書式の慣習に影響される — VLM出力はケース正規化されるため、CERはVLMのエラーを過大評価する(概要ページ参照)。
- フィールド値F1: 抽出されたフィールド値に対する適合率/再現率の調和平均。ポストプロセッサ(正規表現またはLLM)ごとに算出。
ソース一覧
- summary_metrics.csv (GitHub raw)。16行 = 8エンジン × 2レシートデータセット(sroie_2019, cord_v2)。列: model, compute_type, dataset, cer, wer, field_f1_regex, field_acc_regex, latency_p50_ms, latency_p95_ms, cost_per_1000_pages, pages_per_minute, error_rate。 このページのすべてのコスト、スループット、レイテンシ、CERの数値はここに遡る。
- field_method_comparison.csv (GitHub raw)。16行; 列はmodel, dataset, llm_model (= deepseek-v4-flash), regex/LLMフィールド値の精度とF1, document-fields-exact, llm_median_latency_ms, llm_prompt_tokens, llm_completion_tokens。 すべてのトークン数とLLMフィールドF1の数値はここに遡る。
- ImageToTableai/benchmark-ocr リポジトリ。結果CSV、編集済み実行マニフェスト、固定プロトコル、データセットサンプルリスト(固定テスト分割)を公開し、再現を可能にするパブリックリポジトリ。
- results/manifests/ (GitHub)。公開された各実行(16実行)につき1つの編集済みmanifest.json。環境フィンガープリント、モデルバージョン、コストメタデータ(
gpu_hourly_usd,price_recorded_at_utc)、壁時計時間、アーティファクトハッシュを含む。 - Huang et al., "ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction" (2019)。SROIE 2019データセットの定義、タスク構造、ライセンス(CC-BY-4.0)。
- Park et al., "CORD: A Consolidated Receipt Dataset for Post-OCR Parsing" (2020)。CORD v2データセットの定義、ネストされたフィールドスキーマ、ライセンス(CC-BY-4.0)。
制限事項
- 単一GPUティアと単一の価格時点: すべてのGPU数値は、$0.76/時間のRTX 4090 1台に基づき、価格は2026年8月時点のもの。GPUのスポット/オンデマンド価格は変動するため、現在のレートで再計算すること。他のGPU、マルチGPUサーバー、バッチスケジューリングでは、スループットとコストが変わる。
- レシートのみ: SROIE(英語)とCORD(インドネシア語)のレシートが対象。請求書、フォーム、契約書、長文ドキュメントのコスト、スループット、精度は未測定であり、上記のランキングはレシート以外には一般化できない。
- コストにモデル初期化を含む — バッチサイズ依存: 数値はベンチマークの実行パターン(361/100ページの固定分割、ウォームアップ後にスコアリング)を反映。バッチが小さいと初期化が繰り返され、1,000ページあたりのコストが上がる。バッチが大きいと定常状態の下限に近づく。
- CPU/GPUの非対称性: Tesseract(CPU)はGPUアクセラレーションエンジンと比較されている。そのコスト優位性はGPU課金がゼロであることを反映したもので、コストゼロを意味するものではない — CPUインフラ、電力、スタッフ時間は定量化されておらず、フィールド復元の上限(CORD LLMフィールドF1 0.163)により後処理にコストがかかる可能性がある。
- クラウド/APIモデルなし: AWS Textract、Google Document AI、Azure AI Document Intelligence、ホスト型OCR/VLM APIは含まれていない。これらは呼び出し単位・機能単位の課金であり、レンタルGPUのウォールクロック課金とは根本的に異なるため、比較を意図したものではない。
- 稼働率とアイドル時間はモデル化されていない: 数値は、GPUが実行のウォールクロック時間で課金され、それ以外は未使用であることを前提としている。アイドル状態、マルチテナント、低稼働率のGPUを伴う実際のデプロイでは、実効コストが異なる。
- LLM後処理コストはドル換算されていない: トークン数(field_method_comparison.csv)が基準。LLMの価格はプロバイダーとプランによって異なるため、意図的に読者に委ねている。
- 導出シナリオは測定されていない: 月間ボリューム表はSROIEコスト基準の単純な算術であり、追加のベンチマーク実行ではなく、導出推定値として表示されている。
- サンプルサイズとバージョン固定: 361 + 100サンプル。結果は上記の2026年8月のモデルバージョンに適用される。新しいエンジンリリースによりコスト/スループットが変わる可能性があり、一桁台のパーセント差はノイズとして扱うべき。
関連リファレンス: 従来のOCR vs ドキュメント解析VLM · docTR vs Surya2: CERタイ、コスト差 · Tesseract vs PaddleOCR: CPUコストプロファイル · regexとLLMによるフィールド抽出方法 · ドキュメント処理コストの内訳
関連記事: AIドキュメント抽出の価格(2026年) · AI OCRと従来型OCRのフィールドレベル精度 · AIビジョン抽出がOCRと異なる画像の読み取り方