Surya2 vs Unlimited-OCR vs PaddleOCR-VL:レシートVLMベンチマーク(2026)

最終確認: 2026-08-18 · 実行ティア: 公式 · 自社実施の三者VLMベンチマーク · 3エンジン × 2レシートデータセット

このページの対象: 基盤となる8エンジンベンチマークに含まれる3つの文書解析VLM(視覚言語モデル)、すなわちSurya2(surya-ocr 0.22.1、650M)、Unlimited-OCR(vLLM経由)、PaddleOCR-VL(1.6、0.9B)を、2つのレシートデータセット(SROIE 2019英語レシート361テストサンプル、CORD v2インドネシア語レシート100テストサンプル)で比較した、自社実施・再現可能な三者比較です。エンジンごとの比較指標: 文字誤り率(CER)、単語誤り率(WER)、2つの後処理方法(固定正規表現パターンとLLM)によるフィールド抽出F1値、p50/p95レイテンシ、1分あたりの処理ページ数、1,000ページあたりのコスト。すべての数値は、公開OCRベンチマークリポジトリ(ImageToTableai/benchmark-ocr)の公開CSV行に基づいています。第三者レポートの集計ではなく、再現可能な実験データです。
このページの対象外: レシート以外の文書タイプ(テーブル、フォーム、請求書、契約書、長文ドキュメントは対象外)。3エンジンの宣伝上の強み(レイアウト解析、テーブル認識、数式解析、Unlimited-OCRの40ページ以上対応のシングルパス解析)はここでは測定していません。クラウド/API OCRサービス、基盤となる実行の他の5エンジン、ファインチューニング済みモデルも対象外です。完全な8エンジン比較はテキストエンジンと文書理解モデルの比較をご覧ください。

このページのすべての数値の対象範囲: レシート(SROIE 2019英語、CORD v2インドネシア語)、1つのGPUティア(RTX 4090、$0.76/時間)、2026年8月時点のモデルバージョン。 これらの結果を請求書、テーブル、複雑なレイアウトに外挿しないでください。ベンチマークはレシートOCRとレシートフィールド抽出のみを測定しています。すべての数値は、ベンチマークのresults/summary_metrics.csvおよびresults/field_method_comparison.csvに基づいており、公開GitHubリポジトリにミラーリングされ、行ごとに引用されています。

3つの文書解析VLMが同じ361枚の英語レシートを読み取り、生の文字誤り率(CER)は3.4倍の開きがあります — SROIE 2019のCERは0.1915(Surya2)に対し0.6552(Unlimited-OCR)、PaddleOCR-VLは中間の0.3370です。この差は主に出力形式の違いであり、読解力の差ではありません:VLMは大文字小文字を揃え、ラベルと値を結合し、テキストを並べ替えます。CERはこうした正規化のすべてをエラーとして数えます(ベンチマーク自身の分解によると、SROIEのCER予算の約5分の1は大文字小文字の置換だけで占められています)。3つのエンジンを、その出力が本来想定されている指標 — フィールド抽出 — で評価すると、差は縮まります:3者間のそのままの正規表現フィールドF1値は0.3183–0.3376で、LLM後処理がテキストを読むと0.5921–0.6139に収束します。3者が本当に分かれるのは、インドネシア語のレシート(PaddleOCR-VLのCORD正規表現フィールドF1値0.3412は、ベンチマーク内の全8エンジン中で最高)と、動作環境の差(同一ハードウェアで3.8倍のレイテンシ差と5.2倍のコスト差)です。

このトレードオフを1組の数字で表すと:PaddleOCR-VLはレシート1ページを694.3 ms(p50)で読み取り、1,000ページあたり$0.205。Surya2は2,668.0 ms(p50)で読み取り、1,000ページあたり$1.061 — 同じレシート、同じテスト分割、同じRTX 4090です。3者の中で最も安く、最も遅いのは同じマシンであり、レシートでは文字レベルの「品質」リーダーが最も実行コストが高いのです。3者のどれもがすべての場面で「勝つ」わけではありません。このページの目的は、ベンチマークの各軸がどのようにエンジンを分けるかを示すことです。

3.4倍
SROIE 2019における3つのVLM間の生CERの差(0.1915 → 0.6552)— 主に出力形式の違い(大文字小文字の統一、ラベル結合)によるもので、読解力の差ではありません(summary_metrics.csv、cer、surya2/unlimited_ocr/paddleocr_vl_vllmのsroie_2019行)
0.3412
PaddleOCR-VLのCORD正規表現フィールドF1値 — ベンチマーク内の全8エンジン中で最高であり、LLMの支援なしでインドネシア語レシートのフィールドを実用的な水準で抽出できる唯一のエンジンです(summary_metrics.csv、field_f1_regex、cord_v2行)
$0.205 vs $1.061
PaddleOCR-VLの1,000ページあたりのコスト vs Surya2 — 同じRTX 4090上で5.2倍安く、3.8倍高速(694.3 vs 2,668.0 ms p50)(summary_metrics.csv、cost_per_1000_pages / latency_p50_ms、sroie_2019行)

3つのエンジンはすべて文書解析型の視覚言語モデル(VLM)です。文書画像全体を読み取り、理解されたテキストを出力するニューラルモデルです。具体的には、大文字小文字を揃え、ラベルと値を1行に結合し、行を読み順に並べ替えたテキストを出力します。これは、従来のOCRエンジン(Tesseract、PaddleOCR、EasyOCR、docTR — 基盤となる実行環境に含まれる他のエンジン)が返す、元の大文字小文字を保持した生の文字ストリームとは異なります。この出力形式こそが、フィールド抽出の数値を初期状態で強力にし、生の文字誤り率の数値を誤解を招くものにしている理由であり、次のセクションで示します。VLMファミリー内でも、この3つはサイズと学習目標が大きく異なります。Surya2は6億5000万パラメータのテキスト中心モデルで、クリーンな全ページ文字起こし(90以上の言語)に最適化されています。PaddleOCR-VLは9億パラメータのコンパクトな汎用モデルで、言語、表、数式にわたる幅広い対応を目指しています。Unlimited-OCRは長文書とバッチ解析を指向しており(40ページ以上の文書の一括読み取りが売りの中核です)。以下のすべてのCER数値に当てはまる重要な注意点があります。文字誤り率(CER)は、正解文字に対する挿入、削除、置換を数えるため、VLMが実行するように訓練された正規化を正確にペナルティとして課します。フィールドレベルのF1値こそが、VLM間のより公平な比較基準であり、このページの中心です。

VLMにCERを使わない理由:3.4倍の差は出力形式の問題であり、読解力の問題ではない

生のCER列だけを見ると、Unlimited-OCRは失敗したモデル(SROIEで0.6552)に見え、Surya2は世界クラス(0.1915、従来のdocTRの0.1971と並び、8エンジン実行中で最良の生CER)に見えます。どちらの読み取りも出力スタイルの産物です。CERが0.6552の同じUnlimited-OCRテキストは、WERは0.4779です。つまり、文字は壊れて見えても単語は生き残っています。これは、大文字小文字の正規化が単語を壊さずに文字を置き換えるためです。PaddleOCR-VLの数値はこのパターンを逆転させます。CORDのCERが1.0805で全8エンジン中最悪なのに対し、CORDのフィールドF1は0.3412で全8エンジン中最良です。ベンチマーク自身のCSVがCERランキングと矛盾しています。

このメカニズムには2つの層があります。層1 — 正規化コスト:文書解析型VLMは「理解された」テキストを出力します。TAN CHAY YEEはtan chay yeeになり、INVOICE NO : PEGIVはラベルと値を1行に結合します。CERは完全一致の文字マッチングであるため、折りたたまれた大文字小文字や結合された行は、フィールド値が正しい場合でもすべてエラーとしてカウントされます。公開されたSROIE予測のエラー分解分析によると、生のCER予算の約5分の1が大文字小文字の置換、約10分の1が行の結合・欠落に起因します。3つのエンジンはこのコストを異なる割合で支払います。Unlimited-OCRの積極的な折りたたみは、CERをWERをはるかに超えて膨らませます。一方、PaddleOCR-VLの行・ラベル結合は、WER(0.6462)を自身のCER(0.3370)より上に押し上げます。層2 — CORDの正解データ構造によるインフレーション:CORDの正解テキストには注釈構造(メニュー項目、座標、フィールドラベル)が埋め込まれているため、CERは真の言語ミスマッチに加えて、すべてのエンジンで体系的にインフレーションします。全エンジンのCORD CERが0.90〜1.08のクラスター(従来のTesseract 0.9523、docTR 0.9101、およびすべてのVLMを含む)を形成していることは、このインフレーションがモデル固有ではなくコーパス全体に及ぶことを裏付けています。

指標(SROIE 2019、n=361)Surya2Unlimited-OCRPaddleOCR-VL出典
文字誤り率(CER)0.19150.65520.3370summary_metrics.csv · cer、surya2/unlimited_ocr/paddleocr_vl_vllm sroie_2019 行
単語誤り率(WER)0.27350.47790.6462summary_metrics.csv · wer、同様の行

表: summary_metrics.csv — cer および wer 列、sroie_2019 行。正確な値: Surya2 cer 0.19147 / wer 0.27352; Unlimited-OCR cer 0.65524 / wer 0.47788; PaddleOCR-VL cer 0.33696 / wer 0.64623。低いほど良好。3回の実行はすべて error_rate 0.0 で完了。CERでVLMをランク付けしないでください: Unlimited-OCRのCER/WER乖離(0.6552 vs 0.4779)やPaddleOCR-VLのCORDにおけるCERとフィールドF1の逆転(下記参照)は、このベンチマークのプロトコルがVLM行に対して指摘する種類の出力形式のアーティファクトです。

レイヤー1と2の結果として、このページの残りのセクションでは、3つのVLMをフィールド抽出F1(構造化出力が直接供給する指標)と動作範囲(レイテンシ、スループット、コスト)で比較し、CERはその注意点とともにのみ引用します。これは文書解析VLM行に対するベンチマークのプロトコル規則であり、正しい視点です。レシートパイプラインは文字ストリームではなくフィールド(会社名、日付、住所、合計)を消費します。

初期状態のフィールド抽出:構造化出力はVLMファミリーの共通特性

各エンジンの生テキストを、SROIEの4つのレシートフィールド(会社名、日付、住所、合計金額)に対して同じ固定の正規表現パターンで処理します(従来のOCR+ルールベースのキー情報抽出(KIE)アプローチ)。すると、3つのVLMは0.02ポイント差の範囲に収まります:Unlimited-OCR 0.3376、PaddleOCR-VL 0.3368、Surya2 0.3183。3つすべてが8エンジン実行の上位4位以内に入り、うち2つは最良の従来エンジン(PaddleOCRの0.3254)を上回り、残る1つも0.007ポイント差で追走します。彼らの「理解されたテキスト」は、LLM後処理なしでフィールド消費者に届きます——これは生の文字を出力するOCRエンジンにはないファミリー特性です。

フィールド値のF1値は、抽出されたフィールド値の適合率と再現率の調和平均で、正解データと比較します:1.0はすべてのレシートフィールドが完全に復元されたことを意味し、0は何も抽出できなかったことを意味します。VLMファミリーが優位に立つメカニズムは、前述の出力形式にあります——CERを押し上げるのと同じ、ケース正規化・ラベル構造化されたテキストが、たまたま抽出パターンに適合するのです。「正規表現フィールド抽出」列は、ベンチマークのpostprocessed_sroie_receipt_regex_*メトリクスです:これはOCRテキスト+下流のルールベース抽出を測定するもので、ネイティブな構造化出力ではなく、同じパターンセットが全エンジンに適用されました。比較のため、従来エンジンの正規表現フィールドF1値は、docTR 0.0766、EasyOCR 0.1477、Docling 0.2237、Tesseract 0.2335です——VLM以外の7エンジンのうち6つが、3つのVLMの最低値以下に位置します。

SROIE 2019の後処理方法別フィールドF1値:正規表現パターンでは、3つのVLMはSurya2 31.8%、Unlimited-OCR 33.8%、PaddleOCR-VL 33.7%;LLM後処理(deepseek-v4-flash)では61.4%、60.5%、59.2%に収束。

出典:field_method_comparison.csv — regex_field_value_f1 / llm_field_value_f1列、sroie_2019行(0〜1の小数を%で表示)。LLM後処理:deepseek-v4-flash(llm_model列)。エンジンあたり361サンプル(llm_ok_count)。

正規表現後処理(SROIE 2019、n=361)Surya2Unlimited-OCRPaddleOCR-VL出典
フィールド値のF1値(正規表現)0.31830.33760.3368field_method_comparison.csv · regex_field_value_f1、surya2/unlimited_ocr/paddleocr_vl_vllm の sroie_2019 行
フィールド値の精度(正規表現)0.29990.30890.3102field_method_comparison.csv · regex_field_value_accuracy、同様の行
文書フィールド完全一致(正規表現)0.01940.00280.0028field_method_comparison.csv · regex_document_fields_exact、同様の行

表: field_method_comparison.csv — 正規表現列、sroie_2019 行。これらは postprocessed_sroie_receipt_regex_* メトリクスです。各エンジンのOCR テキスト(ネイティブ抽出ではなく後処理)に適用される固定パターンです。Surya2 の 0.3183 は3者の中で最も低いものの、8エンジン中4位に位置し、最良の従来型エンジン(PaddleOCR 0.3254、summary_metrics.csv の field_f1_regex、paddleocr/sroie_2019 行)より 0.007 低い値です。

LLMレバー:3つのエンジンが収束する

3つのエンジンすべてのOCRテキストを、構造化抽出プロンプトを備えたLLM後処理(deepseek-v4-flash、温度0)に渡すと、初期性能の差はほぼ互角にまで縮まります:Surya2 0.6139、Unlimited-OCR 0.6054、PaddleOCR-VL 0.5921 — その差は0.022ポイントで、健全なエンジンのベンチマーク収束帯(0.57〜0.62)に完全に収まります。決定要因となるのはVLMではなく、後処理プロセッサです。

これは、全8エンジンでの実行でも見られるのと同じ収束パターンです。LLMは文字の形状を照合するのではなく、意味(数値、日付、名前)を理解するため、テキストが十分に読み取れる限り、上流のテキスト品質の差異のほとんどを吸収します。3つのVLMはすべてその条件を満たし、すべて収束帯内に収まります。このレバーにはコストが伴います:LLM呼び出しは、OCR時間(PaddleOCR-VLのテキストで1,946.7 ms、Unlimited-OCRで1,982.0 ms、Surya2で2,261.7 ms — API起因で同種)に加えて、ドキュメントあたりの中央値レイテンシがおよそ1.9〜2.3秒増加します。これは、同期式のページ単位の待機よりも、非同期バッチ処理を推奨するものです。ドキュメントレベルの完全一致 — 4つのフィールドすべてが一致したレシートの割合 — は、3つすべてで低いまま(0.1219〜0.1551)であり、フィールド単位のF1値が実運用上の意味のある数値であることを示しています。

LLM後処理(SROIE 2019、n=361)Surya2Unlimited-OCRPaddleOCR-VL出典
フィールド値F1(LLM)0.61390.60540.5921field_method_comparison.csv · llm_field_value_f1、surya2/unlimited_ocr/paddleocr_vl_vllm sroie_2019行
フィールド値精度(LLM)0.61360.60460.5852field_method_comparison.csv · llm_field_value_accuracy、同様の行
ドキュメントフィールド完全一致(LLM)0.15510.13020.1219field_method_comparison.csv · llm_document_fields_exact、同様の行
LLM中央値レイテンシ(ms)2,261.71,982.01,946.7field_method_comparison.csv · llm_median_latency_ms、同様の行

表:field_method_comparison.csv — llm_* 列、sroie_2019行。LLMモデル:deepseek-v4-flash、温度0(llm_model列)。LLMレイテンシはAPI起因で、エンジンレイテンシ(summary_metrics.csv latency_p50_ms)とは別です。

CORD(インドネシアのレシート):コンパクトな汎用モデルが勝利

CORD v2(インドネシアのレシート100枚、ネストされたフィールド menu/sub_total/total)は、このベンチマークにおける言語横断的なストレステストであり、3つのVLM(視覚言語モデル)が明確に差をつけるポイントです。同じ英語形式の正規表現パターンを通して、PaddleOCR-VLはインドネシアのレシートフィールドを0.3412のフィールドF1値で抽出します — これは全8エンジンの中でベンチマーク全体で最高値です — 一方、Surya2は0.2458、Unlimited-OCRは0.1079に留まります。コンパクトな汎用モデルの学習の広さは、テキスト中心モデルと長文書モデルが劣る点を正確に示しています。

すべてのCORDのCER値は、ベンチマークプロトコルによって隔離され、いかなるSROIEランキングにも統合されません。CORDの正解データには注釈構造が埋め込まれており(真の言語不一致に加えて、全エンジンの生のCERを膨らませます — 全エンジンのCORD CERは0.90〜1.08のクラスターを形成)、また正規表現パターンは英語形式用に書かれています。以下のCORD比較はフィールドメトリクスのみです。LLMポストプロセッサーの下では、SROIEと同様に言語のギャップが吸収され、3モデルは0.4678〜0.5203のフィールドF1値に再収束します(Surya2 0.5203、PaddleOCR-VL 0.5198、Unlimited-OCR 0.4678)— 言語横断的な重労働を行うのはエンジンではなく、ポストプロセッサーです。

エンジン別のCORD v2正規表現フィールドF1値:PaddleOCR-VL 34.1% — ベンチマーク内の全8エンジン中最高 — 対Surya2 24.6%、Unlimited-OCR 10.8%。フィールドメトリクスのみ。CORDのCERはプロトコルにより隔離。

出典:summary_metrics.csv — field_f1_regex列、cord_v2行(0〜1の格納小数を%で表示)。PaddleOCR-VLの0.3412は、ファイルの全16行にわたるfield_f1_regexの最大値です。CORD正規表現での次点はSurya2の0.2458です。

CORD v2、インドネシアのレシート(n=100)Surya2Unlimited-OCRPaddleOCR-VL出典
フィールド値F1(正規表現)0.24580.10790.3412summary_metrics.csv · field_f1_regex、surya2/unlimited_ocr/paddleocr_vl_vllm cord_v2行
フィールド値F1(LLM)0.52030.46780.5198field_method_comparison.csv · llm_field_value_f1、同様の行
文字誤り率(CER)— 隔離済み0.89590.92241.0805summary_metrics.csv · cer、同様の行

表: summary_metrics.csv(field_f1_regex / cer)および field_method_comparison.csv(llm_field_value_f1)、cord_v2 行。CORD の数値を SROIE のランキングに混在させないでください: CORD の CER は、実際の言語不一致と、正解データにおけるアノテーション構造の膨張が組み合わさったものです(全エンジンが 0.90〜1.08 に集中 — 従来型の Tesseract 0.9523、docTR 0.9101 も含む)。PaddleOCR-VL の CER 1.0805 が 8 エンジン中で最も高いのは、そのクリーンで正規化された出力が、CORD の構造を多用した正解データから最も遠いためです — 一方、その正規表現フィールド F1 はベンチマークで最高値です。

運用範囲: 3.8倍のレイテンシ、5.2倍のコスト

フィールド精度は収束しますが、運用コストは収束しません。同じ RTX 4090 で、同じ記録済みの $0.76/時間のレートでは、PaddleOCR-VL は 毎分68.2ページ、ページあたり694.3 ms p50、1,000ページあたり$0.205 を維持します。Unlimited-OCR は中間の運用範囲に位置し、毎分34.4ページ、1,600.7 ms p50、1,000ページあたり$0.388。Surya2 は価格とレイテンシの外れ値で、毎分12.1ページ、2,668.0 ms p50、1,000ページあたり$1.061 です。最速の VLM は、同一ハードウェア上で最遅のものより 3.8倍 高速で、5.2倍 安価です。

コストは、ウォールクロック実行時間 × RunPod RTX 4090 レート($0.76/時間、価格は実行マニフェストにタイムスタンプ付きで記録)として計算され、モデル初期化を含みます — これは GPU 時間に対して実際に支払う価格です。スループットは、同じ初期化を含むウォールクロックの毎分ページ数です。レイテンシ p50/p95 は、ウォームアップ後にスコアリングされた定常状態のページあたり推論時間です(モデル読み込みは除外)。Surya2 のテールは比例的に悪く — PaddleOCR-VL の 1,154.3 ms に対して 5,872.2 ms p95 — これは、VLM のプリフィル/デコードのスパイクが最初のページでテールを支配するためです。互いに対立させるのではなく、一緒に読むべき 2 つの数値: PaddleOCR-VL は最低の p50 を持ちますが、CORD では Unlimited-OCR にウォールクロックスループットで上回られます(73.99 対 67.13 ページ/分)— ウォールクロック数値にはモデル初期化が含まれ、Unlimited-OCR の vLLM バッチ処理が効率的で、そこで順序が逆転します。

SROIE 2019 におけるページあたりの中央値レイテンシ(p50、ms): PaddleOCR-VL 694.3 ms、Unlimited-OCR 1,600.7 ms、Surya2 2,668.0 ms — 最速と最遅の間の 3.8 倍の差。定常状態、ウォームアップ後にスコアリング(モデル読み込みは除外)。

出典: summary_metrics.csv — latency_p50_ms 列、sroie_2019 行。Surya2 2667.9800、Unlimited-OCR 1600.7459、PaddleOCR-VL 694.2519。定常状態のレイテンシ(warm_then_scored 測定モード)。

SROIE 2019 における 1,000 ページあたりのコスト(RTX 4090、$0.76/時間): PaddleOCR-VL $0.205、Unlimited-OCR $0.388、Surya2 $1.061 — 5.2 倍の差。コストにはモデル初期化が含まれます。正確な値は以下の表に記載されています。

出典: summary_metrics.csv — cost_per_1000_pages 列、sroie_2019 行。Surya2 1.0609、Unlimited-OCR 0.3879、PaddleOCR-VL 0.2048。コスト = ウォールクロック実行時間 × $0.76/時(モデル初期化を含む)。価格は実行マニフェストにタイムスタンプ付きで記録(2026年8月)。

動作環境(SROIE 2019、n=361)Surya2Unlimited-OCRPaddleOCR-VL出典
レイテンシ p50(ms)2,668.01,600.7694.3summary_metrics.csv · latency_p50_ms、surya2/unlimited_ocr/paddleocr_vl_vllm sroie_2019 行
レイテンシ p95(ms)5,872.22,521.91,154.3summary_metrics.csv · latency_p95_ms、同様の行
1分あたりのページ数12.134.468.2summary_metrics.csv · pages_per_minute、同様の行
1,000ページあたりのコスト$1.061$0.388$0.205summary_metrics.csv · cost_per_1000_pages、同様の行

表: summary_metrics.csv — latency_p50_ms / latency_p95_ms / pages_per_minute / cost_per_1000_pages、sroie_2019 行。3エンジンともGPU(RTX 4090、$0.76/時、価格はマニフェストにタイムスタンプ付き)。コストにはモデル初期化が含まれ、純粋な定常状態のスループットではありません。正確な値: Surya2 p50 2668.0 / p95 5872.2 / 12.1 pg/min / $1.0609; Unlimited-OCR p50 1600.7 / p95 2521.9 / 34.4 pg/min / $0.3879; PaddleOCR-VL p50 694.3 / p95 1154.3 / 68.2 pg/min / $0.2048。

誰が勝つか:まとめ表

“優れている”はワークロード次第であり、この3つのVLMの間で軸は明確に分かれます:フィールド精度は収束(regexとLLM)、生の文字テキストはSurya2、クロスランゲージフィールドはPaddleOCR-VL、そしてコスト・レイテンシ・スループットのすべての軸でPaddleOCR-VLが優位で、Unlimited-OCRは中間に位置します。正直な結論としては、レシートでは、パイプラインにどのポストプロセッサを入れても、VLMの選択はほとんど重要ではありません—そして、ポストプロセッサなしでは、安価でコンパクトな汎用モデルが、通常重要となる軸で高価な専門モデルを上回ります。

クリーンな英語の生テキストCER — Surya2
0.1915 vs 0.3370 vs 0.6552
SROIE CERは、8エンジン実行で最高の生文字精度を伝統的なdocTR(0.1971)とタイで記録—ただし、PaddleOCR-VLの3.8倍のレイテンシを代償とします(summary_metrics.csv、cer / latency_p50_ms、sroie_2019行)。
ネイティブなクロスランゲージフィールド — PaddleOCR-VL
0.3412 regex F1(CORD)
ベンチマークの全8エンジン中で最高のCORD regexフィールドF1—LLMの助けなしでインドネシア語のレシートフィールドを実用的なレベルで抽出できる唯一のエンジンです。次点はSurya2の0.2458(summary_metrics.csv、field_f1_regex、cord_v2行)。
初期状態のSROIEフィールドF1 — タイ
0.3183 – 0.3376
3モデル間のregexポストプロセスフィールドF1帯域—0.02ポイント差で、3つすべてが8エンジン中トップ4に入ります。2つは最高の伝統的エンジン(PaddleOCR 0.3254)を上回り、Surya2は0.007差でそれに続きます(field_method_comparison.csv、regex_field_value_f1、sroie_2019行)。
LLMポストプロセッサ使用時 — タイ
0.5921 – 0.6139
SROIEでのLLMポストプロセス(deepseek-v4-flash)フィールドF1—ベンチマークの0.57–0.62収束帯域内で0.022ポイントの差。今や決定するのはVLMではなくポストプロセッサです(field_method_comparison.csv、llm_field_value_f1、sroie_2019行)。
最安+最速のVLM — PaddleOCR-VL
694.3 ms · $0.205
SROIEで3モデル中最低のp50レイテンシと1,000ページあたりの最低コスト—同じRTX 4090上でSurya2より3.8倍高速で5.2倍安価($0.76/hr)(summary_metrics.csv、latency_p50_ms / cost_per_1000_pages、sroie_2019行)。
中量バランス — Unlimited-OCR
1,600.7 ms · $0.388
中間帯域の動作点(34.4ページ/分)で、3モデル中最高の初期状態SROIEフィールドF1(0.3376)—どちらの極端も必要ない場合の賢明なデフォルトです(summary_metrics.csv、latency_p50_ms / pages_per_minute / cost_per_1000_pages、sroie_2019行)。

よくある質問

レシート解析で最も正確な文書解析VLMはどれですか?

フィールド抽出では、英語のレシートで3者がほぼ互角です:Surya2、Unlimited-OCR、PaddleOCR-VLのSROIE正規表現フィールドF1値は0.3183~0.3376、LLMフィールドF1値は0.5921~0.6139です(field_method_comparison.csv、sroie_2019行)。インドネシア語のレシートでは答えが変わります:PaddleOCR-VLのCORD正規表現フィールドF1値0.3412は、ベンチマーク内の全8エンジン中で最高です(summary_metrics.csv、field_f1_regex、cord_v2行)。生のCERはVLMのランク付けに使用すべきではありません。出力規約(大文字小文字の統一、行の結合)を誤りとして数えるためです(上記の「CERを使わない理由」セクションを参照)。

なぜUnlimited-OCRはSROIEで最悪のCERなのに、正規表現フィールドF1が最高なのですか?

2つの指標は異なる出力を評価するためです。Unlimited-OCRの強い大文字小文字の統一は文字レベルの誤りを膨らませます。CER 0.6552 に対してWER 0.4779という差がその証拠です。一方、同じ正規化されたテキストは、固定抽出パターンに他のどのエンジンよりもよく一致します:SROIE正規表現フィールドF1 0.3376 は、8エンジン実行中で最高です(summary_metrics.csv cer / wer、field_method_comparison.csv regex_field_value_f1、sroie_2019行)。

なぜPaddleOCR-VLのCORD CERはベンチマークで最悪なのに、CORDフィールドF1は最高なのですか?

CORDの正解データには注釈構造が埋め込まれており、PaddleOCR-VLの出力は最もクリーンで正規化されているためです。その構造を含むテキストから最も遠く、編集距離が最大になります(CER 1.0805)。同じ出力スタイルは抽出パターンにうまく適合します:CORD正規表現フィールドF1 0.3412 は全8エンジン中で最高です(summary_metrics.csv、cer / field_f1_regex、cord_v2行)。この逆転は、CORD CERがモデルごとの品質指標ではないことをベンチマーク自身が示しているものです。

PaddleOCR-VLはSurya2よりどれくらい速く、安いですか?

3.8倍低いp50レイテンシ(694.3 ms対2,668.0 ms)、5.6倍高いスループット(68.2対12.1ページ/分)、そして5.2倍低い1,000ページあたりのコスト($0.205対$1.061)を、同じRTX 4090で$0.76/時間の条件下で実現しています(summary_metrics.csv、latency_p50_ms / pages_per_minute / cost_per_1000_pages、sroie_2019行)。

LLM後処理を追加すると、3つのVLMは同等になりますか?

ほぼ同等です — SROIEでのLLMフィールドF1値は0.5921〜0.6139で、ベンチマークの収束帯(0.57〜0.62)内の0.022ポイント差に収まります(field_method_comparison.csv、llm_field_value_f1、sroie_2019行)。この収束のコストは、文書あたり約1.9〜2.3秒の追加の中央値LLMレイテンシです(llm_median_latency_ms、同様の行)。これは非同期バッチ処理に適しています。

レシートパイプラインは3つのVLMのうちどれを選ぶべきですか?

パイプラインが消費する軸によって異なります。後処理なしのネイティブなクロスランゲージフィールドの場合、PaddleOCR-VLのCORD正規表現F1値(0.3412)が測定された唯一の有用なレベルです。最も安く、最速のVLM提供の場合も、PaddleOCR-VLです(694.3 ms、$0.205/1Kページ)。コストとレイテンシが制約にならない場合のクリーンな生の英語テキストには、Surya2のCER(0.1915)が最も強力です。中量のバランスの取れたポイントには、Unlimited-OCR(1,600.7 ms、$0.388/1Kページ、最高の初期状態のSROIEフィールドF1値)です。パイプラインにLLM後処理を追加する場合、レシートでは選択の重要性は低くなります — 3つすべてが収束帯に入ります。これらの結果は、2026年8月の1つのGPU層での英語とインドネシア語のレシートに基づいています。本番環境での決定は、対象コーパスで再実行する必要があります(制限事項を参照)。

このページの数値はどこから来ていますか?

すべての数値は、ファーストパーティのベンチマークで公開されているCSVの行です — results/summary_metrics.csv(CER/WER、フィールドF1、レイテンシ、コスト、スループット)と results/field_method_comparison.csv(regex vs LLM後処理、llm_model = deepseek-v4-flash)— これらは ImageToTableai/benchmark-ocr でホストされており、実行ごとに1つの編集済み manifest.json が環境フィンガープリントとして含まれています。データセットの定義は、以下に引用するSROIE 2019およびCORDの論文に基づいています。

方法論と出典

プロトコル

このページは、独立した再現可能なベンチマーク実行(公式ティア)の3方向のスライスを報告しています — 第三者による主張の調査でも、ベンダー比較ページでもありません。固定テスト分割のみを使用:SROIE 2019テスト(英語のレシート361件、フラットフィールド company/date/address/total)とCORD v2テスト(インドネシア語のレシート100件、ネストフィールド menu/sub_total/total);トレーニング分割は評価されていません。3つのエンジンすべてが同じ画像、同じグラウンドトゥルース、同じ測定プロトコル(warm_then_scored:固定ウォームアップパスがスコアリングパスの前に行われるため、レイテンシ数値は定常状態)を見ました。3つの実行すべてが error_rate 0.0 で完了しました(summary_metrics.csv の error_rate 列)。基盤となる実行には合計8つのエンジンが含まれています;このページでは名前の挙がった3つのVLMのみを比較し、完全な8エンジンの結果は「Traditional OCR vs Document Parsing VLMs」で別途公開されています。

実行環境

  • ハードウェア: 3つのエンジンすべてが同じNVIDIA RTX 4090(24 GB)で実行されました;GPUコストはRunPodのオンデマンドレート $0.76/hr で計算され、価格は各実行の編集済みマニフェスト(2026年8月)にタイムスタンプ付きで記録されています。
  • エンジン: そのままの状態で、ファインチューニングなし。バージョン固定:Surya2 (surya-ocr 0.22.1) と PaddleOCR-VL 1.6、両方ともvLLMでサーブ;Unlimited-OCR はvLLMでサーブされ、公開されたピン留めバージョンなし(制限事項を参照)— 公開リポジトリのモデルテーブル(README.md)と実行マニフェストに基づく。
  • LLM後処理: deepseek-v4-flash をAPI経由で温度0で使用し、決定論的な出力を実現(field_method_comparison.csv の llm_model 列);これは3つのエンジンすべてのLLMフィールド行に使用された単一モデルです。
  • コスト基準: ウォールクロック実行時間 × $0.76/hr、モデル初期化を含む — バッチ処理によりページあたりのコストが下がります。
  • フィールド後処理: SROIE regexフィールドメトリクスは postprocessed_sroie_receipt_regex_*(field_method_comparison.csv の regex_* 列)— フィールドは固定パターンセットによってOCR テキストから抽出されます。これらはOCR + ダウンストリーム抽出を測定しており、いかなるモデルによるネイティブな構造化出力ではありません;LLM_* 列はOCRテキスト + LLM抽出を測定します。2つのパイプラインが混在することはありません。

指標の定義

  • CER(文字誤り率): OCRテキストと正解データ間の編集距離(挿入+削除+置換)を、正解データの文字数で割った値。低いほど良い。 文書解析VLMには不利: フィールド値が正しくても、大文字小文字の変換、ラベルと値の結合、行の並び替えを誤りとしてカウントします。このページでは、その注意点とともにのみ掲載しています。
  • WER(単語誤り率): 同じ編集距離の計算を単語単位で行ったもの。CERとWERが大きく乖離する場合(Unlimited-OCR: 0.6552 vs 0.4779)、その差は誤読ではなく出力の正規化が原因であることを示しています。
  • フィールド値F1(正規表現): OCRテキスト上の固定正規表現パターンを用いて抽出したフィールド値に対する適合率・再現率の調和平均(従来のOCR+ルールベースKIEパイプライン)。列名: regex_field_value_f1。スコア0はフィールド値が一切取得できなかったことを意味します。
  • フィールド値F1(LLM): LLM後処理の出力(OCRテキスト → deepseek-v4-flash → フィールド)に対する同じ指標。列名: llm_field_value_f1。 2つのパイプラインは異なり、混在することはありません。
  • 文書フィールド完全一致: 全対象フィールドが完全に一致した文書の割合 — フィールドごとのF1よりもはるかに厳しい基準です。
  • レイテンシ p50/p95 と ページ/分: 定常状態の1ページあたりの推論時間(ウォームアップ後に計測、モデル読み込みは除く)と、モデル初期化を含む実時間スループット。
  • 1,000ページあたりのコスト: 記録された$0.76/時間のレートで1,000ページを処理する際のGPU利用時間の請求額。

出典一覧

  1. summary_metrics.csv(GitHub raw)。16行=8モデル×2データセット。列:model、compute_type、dataset、cer、wer、field_f1_regex、field_acc_regex、latency_p50_ms、latency_p95_ms、cost_per_1000_pages、pages_per_minute、error_rate。このページのすべてのCER/WER、レイテンシ、コスト、スループット数値は、surya2、unlimited_ocr、paddleocr_vl_vllmの各行に由来します。
  2. field_method_comparison.csv(GitHub raw)。16行。列:model、dataset、llm_model(=deepseek-v4-flash)、regex/llmフィールド値の精度とF1値、document-fields-exact、llm_median_latency_ms、トークン数。すべてのregex/LLMフィールドF1値は、ここに記載された3つの指定エンジンの行に由来します。
  3. ImageToTableai/benchmark-ocrリポジトリ。結果CSV、匿名化された実行マニフェスト、固定プロトコル、再現用のデータセットサンプルリスト(固定テスト分割)を公開するパブリックリポジトリです。
  4. results/manifests/(GitHub)。公開された各実行(16回)につき1つの匿名化されたmanifest.json。モデルバージョン、GPU/ドライバ、torch/CUDA/Pythonバージョン、価格タイムスタンプ付きのコストメタデータ、アーティファクトハッシュが含まれます。
  5. Huang et al.、「ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction」(2019)。SROIE 2019データセットの定義、タスク構造、ライセンス(CC-BY-4.0)。
  6. Park et al.、「CORD: A Consolidated Receipt Dataset for Post-OCR Parsing」(2020)。CORD v2データセットの定義、ネストされたフィールドスキーマ、ライセンス(CC-BY-4.0)。

制限事項

  • VLMに対するCERの不公平さが、このページがフィールド指標を基盤とする理由です:文書解析VLMは大文字小文字を統一し、ラベル行と値行を統合し、テキストを並べ替えるため、生のCERスコアは出力形式を誤りとしてカウントします — Unlimited-OCRのCER(0.6552)とWER(0.4779)の乖離、およびPaddleOCR-VLのCORD逆転(最も悪いCER 1.0805、最も良いフィールドF1 0.3412)は、いずれもそのペナルティの影響です。CERでVLMをランク付けする比較(このページも含む)は、読み取り能力ではなく出力スタイルの指標として扱うべきです。
  • ドキュメント範囲 — レシートのみ:SROIE + CORD。ここでは、文書解析VLMが最大の強みと主張するレイアウト・表・数式・長文書処理は一切測定されていません。3つのエンジンのマーケティング上の強み(Unlimited-OCRの40ページ以上の単一パス解析を含む)はすべて未測定です。このページを使って「VLM Xがすべてに勝つ」と結論づけないでください。
  • サンプルサイズ:英語361件 + インドネシア語100件のレシート。フィールドF1とCERはコーパスに敏感であり、数百分の1の一桁台の差(0.022ポイントのLLM-F1差を含む)はノイズとして扱い、工学的な真実と見なさないでください。
  • 単一GPUティアと単一価格:すべての数値は$0.76/hrのRTX 4090 1基から得られ、価格は実行マニフェストで2026年8月のタイムスタンプが付けられています。他のGPU、マルチGPUサーバー、バッチスケジューリング、または価格変更により、レイテンシ、スループット、コストは変動します — 予算策定前に現在のレートでコストを再計算してください。
  • 単一LLM後処理:すべてのLLM行はtemperature 0のdeepseek-v4-flashを使用しています。異なるLLMでは絶対的なフィールドF1が変化します。収束の順序はわずかに変動する可能性があります。LLMのレイテンシ(中央値約1.9–2.3秒、field_method_comparison.csvのllm_median_latency_ms)はAPI起因であり、いずれのエンジン自体のレイテンシには含まれません。
  • CORD隔離:CORDの正解データには注釈構造が埋め込まれており、正規表現パターンは英語形式用に書かれています。CORDのCER(すべてのエンジンで0.90–1.08)は、言語のミスマッチと正解データの膨張を反映したものであり、モデルごとの品質ではありません。CORDの行はフレーミング付きで引用され、SROIEランキングには決して統合されません(プロトコル規則)。
  • バージョン固定:結果はSurya2 0.22.1、PaddleOCR-VL 1.6、およびUnlimited-OCR(vLLM提供、2026年8月)に限定されます。Unlimited-OCRにはベンチマーク公開のモデル表に公開固定されたバージョン番号がないため、その行を正確なリリースに紐付けることはできません。いずれかのエンジンの新しいリリースにより、このページのすべての数値が変わる可能性があります。
  • 正規表現チューニング:パターンセットはデータセットごとに1回作成されました。フォーマットごとに高度にチューニングされたパターンライブラリは、独自のレイアウトでより高いスコアを獲得できる可能性があります — ただし、LLMが排除するメンテナンスコストがかかります。

関連リファレンス: docTR vs Surya2レシートベンチマーク · 従来のOCR vs 文書解析VLM · 乱雑なレイアウトで勝つ抽出方法はどれか · フィールド単位スコアリング vs 文字単位スコアリング · レシートOCR精度

関連記事: AI OCRと従来のOCRの比較 · 画像データ抽出とOCRエンジンの比較 · AIドキュメント抽出の価格(2026年)

📮 contact email: [email protected]