フィールド単位の精度と文字単位の精度:違いは何か?
最終確認日: 2026-08-13 · 対象: 文書データ抽出 / OCR評価 / APおよびデータ入力ワークフロー
別名: フィールド単位の精度は「フィールド精度」「フィールド抽出精度」「フィールド単位の抽出精度」と呼ばれることもあります。文字単位の精度は通常、その逆数である文字誤り率(CER)として表現されます。
フィールド単位の精度は、抽出された各フィールドが完全に正しいかどうかを測定し、文字単位の精度は、個々の文字が正しく読み取られたかを測定します。 1文字の誤読がフィールド全体を壊すため、この2つの指標はまったく異なるものを表します。
2つの精度指標の仕組み
どちらの指標も比率ですが、数える対象が異なります。文字単位の精度は「この文書の文字のうち、何文字が正しく読み取られたか」を問い、フィールド単位の精度は「実際に必要なデータフィールドのうち、いくつが1つのエラーもなく抽出されたか」を問います。
文字単位の精度 = 正しく認識された文字数 ÷ 総文字数。 標準的な正式定義はOCR評価コミュニティに由来します。文字誤り率(CER)は、認識されたテキストと正解データとの間のレーベンシュタイン編集距離(一方を他方に変換するために必要な置換・削除・挿入の最小回数)を総文字数で割ったものです(OCR-Dプロジェクト仕様)。文字精度は単純に 100% − CER です。NIST自身の評価フレームワーク(TRAIT)も、文字精度を全アノテーションにわたる 100 × として同じように定義しています(NISTIR 8199, 2017)。
フィールド単位の精度 = 正しく抽出されたフィールド数 ÷ 総フィールド数。 フィールド(請求書合計、日付、仕入先名、口座番号)は二値の単位としてスコアリングされます。つまり、正解データと完全に一致するか、失敗するかのどちらかです。学術ベンチマークで使用される正式なバージョンはフィールド単位のF1で、適合率と再現率の調和平均です:F1 = 2 × / (適合率 + 再現率)。ここで適合率は抽出されたフィールドのうち正しかった割合、再現率は期待されたフィールドのうち見つかった割合です(LlamaIndex用語集、10フィールドの計算例)。請求書番号の1桁の誤りでもそのフィールドは誤りとなり、部分点は適用されません。
ここで2つの指標は分岐します。N文字のフィールドがC%の文字精度を持つ場合、完全に正しい確率はおよそC^Nとなり、文字精度がフィールド精度の予測に役立たないことを示す複合効果が生じます。 9桁の請求書番号で文字精度99%の場合:0.99^9 ≈ 91.3% のフィールド精度になります。同じ番号で文字精度99.9%の場合、99.1% に上昇します。20文字のフィールドで文字精度95%の場合、フィールド精度はわずか 35.9% に低下します。これはエラーが独立して均等に分布するという近似であり、実際のシステムではエラーが重要なフィールド(数字、コード、識別子)に集中するため、実際のフィールド精度は通常モデルの予測よりも悪くなります。NIST自身のOCR研究でもこれを直接観察しており、ページ番号の認識で 12%のフィールド誤り率 が発生した一方で、全体的な文字認識は良好に見えました(NISTIR 6101)。
このギャップは理論上のものではありません。ICDAR 2019 SROIEベンチマーク(同一画像に対して単語単位のOCR(タスク2)とフィールド単位のキー情報抽出(タスク3)の両方でスコアリングされた1,000枚のスキャン済みレシート)では、提出された24件中7件の手法が90%超の単語単位Hmeanを達成しましたが、18件中わずか1件のみが90%超のフィールド単位F1(90.49%)を達成し、フィールド単位の提出の半数以上が80%未満でした(Huang et al., ICDAR 2019)。タスク2で最高のOCR手法でさえ、レシートアプリケーションが要求する厳格な99%の精度を満たせませんでした。そして、フィールド単位の抽出はさらに困難でした。CORDレシートベンチマークにおける現代のフィールド単位F1は、モデルに応じて78%〜97%の範囲にあります(LayoutLM 78.4、LayoutLMv2 78.9、Donut 84.1、LayoutLMv3 約96.6)。これは元のモデル論文によるものです(Kim et al., Donut, 2022)。
この区別が重要な理由
ベンダーは文字精度を提示します。それは最も高く、最も簡単に算出できる数値だからです。一方、ビジネス上の意思決定は、常に低くなるフィールド精度に依存します。
マーケティングと現実のギャップは系統的です。クリーンな印刷文書では、98〜99.5%の文字単位精度の主張は一般的です。そして、ICDAR 2019 SROIEベンチマークへの最高のOCR提出でさえ、レシートアプリケーションが要求する99%の精度には及びませんでした(Huang et al., ICDAR 2019)。しかし、同じ画像で測定されたフィールド単位の精度ははるかに低く、SROIEのフィールド単位手法の18件中わずか1件のみが90%超のF1を達成し、24件中7件の単語単位OCR手法が90%を超えました。同じ文書で、2つの非常に異なるスコアです(Huang et al., ICDAR 2019)。上記のC^Nモデルがこのギャップを説明します。文字精度95%では、20文字のフィールドが完全に正しくなるのは35.9%の確率だけです。同じレシートで両方の数値が真実であり得ます。高い文字精度と、はるかに低いフィールド精度。それらは異なる質問に答えているからです。
フィールド精度が重要となる数値である理由は、ダウンストリームシステムが文字ではなくフィールドを消費するからです。請求書の合計の誤った数字は支払いを破壊し、誤った口座番号は転記を破壊します。他の文字がどれだけ正しく読み取られたかに関係なくです。NIST自身のOCR技術は、文書変換研究でこの点を実証しました。連邦官報のページ番号を認識すると、全体的な文字認識が立派に見える一方で、12%のフィールドエラー率が発生しました(NISTIR 6101)。
運用上の結果は、レビューキューのサイズ設定です。すべてのフィールドレベルのエラーは、検出して修正しなければならない文書です。現代のモデルは、ベンチマークレシートでフィールド単位F1を90年代半ばに到達します。LayoutLMv3はCORDで約96.6%をスコアリングし、初期のモデルの78〜84%に対抗します(Kim et al., Donut, 2022)。しかし、実際の精度は文書タイプ、画像品質、フィールド設計に依存し、100%未満のフィールド精度のすべての文書は誰かをレビューキューに送ります。文字精度のみでツールを評価するチームは、未処理で通過できる文書の数を一貫して過大評価します。これはまさに、調達チームとAPチームが、パイプラインにコミットする前に、自社の文書タイプに対するフィールド単位の精度を要求すべき理由です。
よくある誤解
- 誤解:「精度99%なら、データの99%が正しいということだ」
- 現実:それは何を測定したかに完全に依存します。99%の文字精度は99%のフィールド精度を意味しません。文字の読み間違いが1文字でもあれば、フィールド全体が壊れます。文字精度99%の場合、9桁の請求書番号が完全に正しい確率は91.3%(0.99^9)しかなく、20文字のフィールドが完全に正しいのは81.8%のケースだけです。同じ文書でも、文字レベルでは高いスコアを出しながら、かなりの割合のフィールドが誤っていることがあります。SROIEベンチマークでは、単語レベルの手法24件中7件が90%超だったのに対し、フィールドレベルの手法は18件中わずか1件でした(Huang et al., ICDAR 2019)。
- 誤解:「文字精度とフィールド精度は換算可能だ。一定の割合を引けばいい」
- 現実:換算はフィールドの長さとエラー分布に依存するため、固定の換算係数は存在しません。C^Nモデルは、フィールドが長くなるほどペナルティが大きくなることを示しています。文字精度99%の場合、9文字のフィールドは91.3%のフィールド精度を維持しますが、同じ文字精度でも20文字のフィールドは81.8%に低下し、文字精度95%では20文字のフィールドはわずか35.9%まで落ち込みます。同じ文書内でもフィールドごとに長さもエラー率も異なるため、単一の換算係数は存在しません。
- 誤解:「文字精度が高いほど、優れたツールだ」
- 現実:フィールドレベルの性能は、単純な文字読み取りだけに依存するわけではありません。文脈、構造理解、検証によって、フィールド精度は文字精度の予測を上回ることも、下回ることもあります。システムがほぼすべての文字を正しく読み取っても、値を誤ったフィールドに割り当てることがあります。これは構造エラーであり、文字精度では測定すらできません。正しい値が正しい場所に入ったかどうかを問わないからです。フィールド単位のF1はこれを捉えます。誤った値と、抽出されたがラベルが誤っている値の両方にペナルティを課すため、ベンチマークでは生の文字精度ではなくF1でスコアリングされるのです(LlamaIndex glossary)。自社の文書でフィールド精度を直接評価してください。
よくある質問
フィールド単位の精度と文字単位の精度の違いは何ですか?
文字単位の精度は、個々の文字が正しく読み取られた頻度(正しい文字数の全文字数に対する割合)を測定します。一方、フィールド単位の精度は、請求書番号、日付、合計金額、仕入先名などの完全なデータフィールドが単位として正しく抽出された頻度を測定します。1文字でも誤りがあればフィールド全体が誤りとみなされるため、同じ文書ではフィールド単位の精度は常に文字単位の精度よりも低くなります。実際のワークフローで重要となるのはフィールド単位の精度です。
99%の精度とは、データの99%が正しいということですか?
その99%がフィールド単位で測定された場合に限ります。ベンダーのマーケティングにおける「99%の精度」は通常、文字単位の精度を指します。なぜなら、それが最も高く、最も簡単に算出できる数値だからです。そして、それはフィールド単位の精度に換算できません。文字精度99%の場合、9桁の請求書番号が完全に正しい確率は約91.3%(0.99^9)に過ぎず、フィールドごとのエラーリスクは各文書のフィールド数に応じて累積します。
文書抽出ツールを評価する際には、どの精度指標を使用すべきですか?
自社の文書タイプで測定されたフィールド単位の精度を求めてください。文字精度はOCRエンジンがテキストをどれだけうまく読み取るかを示すものであり、正しい値が正しいフィールドに格納されたかどうか——つまり下流システムが消費するもの——については何も示しません。見出しとなる精度の主張を見たときは、何が、どの文書で、どのフィールドについて測定されたのかを尋ねてください。フィールド単位のF1(適合率と再現率を組み合わせた指標)は、抽出されたものの誤ったラベルが付けられたフィールドも検出できるため、標準的な正式指標です(LlamaIndex用語集)。
フィールド単位の精度はどのように計算しますか?
フィールド単位の精度=正しく抽出されたフィールド数 ÷ 期待されるフィールド総数 × 100%。フィールドが一致するのは、正解データと完全に一致した場合のみで、1文字でも誤りがあるとそのフィールドは不合格となります。学術的な標準はフィールド単位のF1です:F1 = 2 × / (適合率 + 再現率)。ここで適合率は抽出されたフィールドのうち正しかった割合、再現率は期待されるフィールドのうち見つかった割合です(LlamaIndex用語集)。これはSROIEおよびCORDベンチマークが使用するものと同じスコアリングです。
フィールド単位の精度が文字単位の精度より常に低いのはなぜですか?
フィールドはその文字のいずれか1つが失敗すると不合格となり、長いフィールドはすぐに失敗するためです。累乗モデルC^Nでは、99%の文字精度で9文字のフィールドは91.3%のフィールド精度しか維持できず、ペナルティはフィールド長に応じて増加します(0.99^20 ≈ 81.8%)。実際のシステムでは数値フィールドに誤りが集中し、1桁の誤りが致命的となります。NISTは自社のOCR作業でこれを観察しており、文字認識は良好であったにもかかわらず、ページ番号で12%のフィールド誤り率が発生しました(NISTIR 6101)。
典型的なフィールド単位の精度ベンチマークはどのようなものですか?
学術ベンチマークでは、フィールド単位のF1はモデルに応じて78%から97%の範囲です。ICDAR 2019 SROIEコンペティションでは、18件の提出のうち90%超のフィールド単位F1を達成したのはわずか1件で(半数以上が80%未満)、CORDベンチマークの最良モデルは約96〜97%に達しています(Huang et al., 2019;Kim et al., 2022)。実際の文書はベンチマークより複雑なため、本番環境の数値はベンチマークよりもばらつきが大きくなります。単一の数値は文書およびフィールドに依存するものとして扱い、ご自身の文書でテストしてください。
出典
- Huang, Z., et al. — 「ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction」(IEEE ICDAR, 2019). スキャンされたレシート1,000枚のベンチマークで、OCR提出24件、フィールド単位の抽出提出18件を評価。OCR方式24件中7件がHmean 90%超を達成した一方、フィールド単位の方式では18件中わずか1件(90.49%)で、半数以上が80%未満でした。 同一文書における文字単位とフィールド単位のギャップに関する主要な出典です。
- Kim, G., et al. — 「OCR-free Document Understanding Transformer」(ECCV, 2022). CORDレシートベンチマークにおけるフィールド単位のF1:LayoutLM 78.4、LayoutLMv2 78.9、Donut 84.1、LayoutLMv3(base)約96.6。 フィールド単位のF1が78〜97%の範囲となる出典です。
- NIST — 「The Text Recognition Algorithm Independent Evaluation (TRAIT)」(NISTIR 8199, 2017). NIST公式の文字精度の定義:文字精度 = 100/アノテーション数。 文字精度の正式な定義に関する出典です。
- NIST — 「Impact of Image Quality on Machine Print OCR」(NISTIR 6101, 2001). NIST自身のOCRは、文字単位の認識精度が良好であったにもかかわらず、Federal Registerのページ番号で12%のフィールド誤り率を記録しました。 フィールド誤り率の例に関する出典です。
- OCR-Dプロジェクト — 品質保証仕様. 正式なCER = / 総文字数、およびWERの類似式。 CER計算式の出典です。
- LlamaIndex — 「What is F1 Score for Document Extraction?」. F1 = 2·(P·R)/(P+R) で、10フィールドの請求書の具体例を示し、フィールド単位と文書単位のスコアリングの違いを解説。 F1計算式と具体例の出典です。
関連用語
- 光学文字認識(OCR)とは?: 混乱の原因となる文字単位の精度を持つ読み取り技術です。OCRはピクセルを文字に変換しますが、それ自体で正しいフィールドを生成するわけではありません。
- 文書タイプ別の文字精度: 文書タイプ別に分類された文字単位の精度ベンチマークです。フィールド単位の精度を支える層であり、それと同等になることはありません。
- ストレートスルー処理(STP)率とは?: フィールド単位(および文書単位)の精度に依存するエンドツーエンドの指標です。人間の介入なしで文書を処理するには、システムのフィールド精度がほぼ100%である必要があります。
関連記事: 4レベルの精度ガイド:文字、フィールド、文書、STP · 「精度99%」がほぼ常に文字単位である理由 · 実際のフィールド単位の精度の測定方法