リファレンス
ドキュメントAIに関するデータリファレンスと用語定義です。各ページは出典検証済みで、引用可能な内容です。
統計
ファーストパーティ直接比較:docTR vs Docling、361件のSROIE + 100件のCORDレシートで検証 — レイテンシ6.7倍、コスト8.3倍、CER 3.0倍、正規表現フィールド反転2.9倍。方法論。
自社実施の直接比較:docTR vs Surya2をSROIE 361件+CORD 100件のレシートで検証 — CERは互角、フィールドF1は4.2倍の逆転、コスト差は22倍、検証方法も解説。
自社ベンチマーク:EasyOCR vs docTRを361件のSROIE + 100件のCORDレシートで比較 — docTRはCERが30%低く、LLMフィールドF1が1.66倍、EasyOCRは正規表現F1が1.93倍。
自社ベンチマーク:RTX 4090上での8つのオープンソースエンジンの1,000ページあたりのOCRコスト — $0.048(docTR)〜$1.061(Surya2)。SROIE + CORD、方法論。
RTX 4090上の8つのオープンソースOCRエンジンにおけるページあたりのレイテンシー — p50で108.7ms(docTR)から2,668ms(Surya2)。p95テール、スループット、方法論。
両者を直接比較:レシートにおけるPaddleOCR vs EasyOCR — CER 0.204 vs 0.283、正規表現F1で2.2倍、コスト差2倍、LLMのパラドックス。方法論。
自社ベンチマーク:Surya2 vs Unlimited-OCR vs PaddleOCR-VLを361件のSROIE + 100件のCORDレシートで比較 — フィールドF1値、CERの公平性、コスト、レイテンシ。
公式対決:361枚のSROIE + 100枚のCORDレシートにおけるTesseract(CPU)vs PaddleOCR(GPU)— CER、フィールドF1、スループット比較、コスト。方法論。
自社ベンチマーク:8つのオープンソースOCRエンジンと文書解析VLMを、361件のSROIE + 100件のCORDレシートで比較 — CER、フィールドF1、レイテンシ、コスト。方法論も掲載。
VLMのCERが過大評価される理由:大文字小文字の統一と正解の構造が幻のエラーを生む。自社取得のSROIE+CORDデータで検証 — フィールドF1こそ公平なクロスファミリー指標。
自社ベンチマーク:LLM後処理はレシートのフィールド抽出でregexを上回り、SROIE + CORD上の8つのOCRモデルのフィールドF1、方法論を含みます。
オープンソースOCRモデル5種を461枚のレシート(SROIE + CORD)で検証した自社ベンチマーク:CER、WER、フィールドF1、レイテンシ、1,000ページあたりのコスト。
ドキュメント自動化における例外発生率:ベストインクラス9% vs 平均22%、根本原因、レビューコスト、閾値のトレードオフを全ソース引用付きで解説します。
文書処理のレコードあたりコストに関する独立系ベンチマーク:手動8〜16ドル、テンプレート2〜5ドル、AIは1ページあたり0.02ドルから。文書タイプ、規模、地域別に解説。
手書きOCR精度データ:IAM 文字誤り率(CER)1.2〜1.7%、アラビア語 8.9〜16%、歴史的文書 71〜82%。用字系・モデル・文書タイプ別に分析。引用可能な情報源15件。
請求書処理時間のベンチマーク:手動タッチ12.5分、サイクル9.2日。方法別・複雑度別・段階別に、引用元付きで解説。
データ入力自動化のROIに関する独立系ベンチマーク:投資回収期間3〜12ヶ月、削減率60〜80%、損益分岐点の処理量、さらに自社の投資収益を試算するための計算式を紹介します。
文書タイプ別のOCR精度に関する独立ベンチマーク:デジタルPDF 99.2〜99.8%、スキャン 98〜99%、手書き 46〜95%、表のTEDS。引用可能な情報源15件。
状態・フィールド別のレシートOCR精度:クリーンなスキャン90%+、色あせた感熱紙55-73%、スマートフォン撮影67-69%。合計金額95-99%、店舗名73-88%。14件の情報源。
手動データ入力の誤り率に関する独立したベンチマーク:フィールドレベル1〜4%、レコードレベル最大40%、文書タイプ・業界・役割別。
定義
データキャプチャは、紙、スキャン、PDF、写真を機械可読なデータに変換します。その仕組み、種類、誤解について解説します。
ICRは、手書き印刷文字を認識するための機械学習ベースの文字認識技術です。OCRからの進化、ICRとOCR・IWRの違い、そしてその用途について解説します。
キー情報抽出(KIE)は、請求書番号や日付などのフィールドをドキュメントから構造化データに抽出します。仕組み、境界、誤解について解説します。
検索可能なPDFとは、OCRによる不可視のテキストレイヤーを持つスキャン文書です。テキストの選択・コピー・Ctrl+F検索が可能です。仕組み、PDF/Aルール、よくある落とし穴を解説します。
フィールド単位の精度は正しく抽出されたフィールドを数え、文字単位の精度は正しく読み取られた文字を数えます。文字精度99%は、データ精度99%を意味しません。
IDPは、文書からデータを取得、分類、抽出、検証するAIソフトウェアです。仕組み、OCRからLLMへの進化、誤解について解説します。
STP率は、人間のタッチを一切介さずに処理されたドキュメントの割合を測定します。業界平均は32%、ベスト・イン・クラスは49%、AIでは60〜80%です。計算式と誤解について解説します。
OCRは、印刷・手書き・タイプされたテキストの画像を、機械で読み取り可能なデータに変換します。仕組み、OCRの4つの種類、歴史、そしてユースケースをご紹介します。