光学文字認識(OCR)とは何か?

最終レビュー日:2026-08-08 · 対象:文書自動化 / データ抽出 / コンピュータビジョン

範囲:この定義は、文書データ抽出における光学文字認識(OCR)を対象としています。スキャンされた文書、写真、画像のみのPDFを、下流システムが検索・編集・処理できる機械読み取り可能なテキストに変換します。インテリジェント文書処理(IDP)プラットフォーム、コンピュータビジョン全般、文書ワークフローではなく一般的な画像処理でのOCRの使用など、関連はあるものの異なる概念は対象外です。
別名:「テキスト認識」または「文書デジタル化」と呼ばれることもあります。
好的,我将按照您的要求,将这段HTML片段中的用户可见英文文本翻译成自然、简洁的日语。 ```html

光学文字認識(OCR)は、印刷、手書き、またはタイプされたテキストの画像を、機械が読み取れるテキストに変換する技術です。これにより、スキャンした文書、写真、PDFの内容を、手動で再入力することなく、コンピューターで検索、編集、処理できるようになります。

OCRの仕組み

OCRは4つの段階で機能します。まず、スキャナーまたはカメラが文書を画像(明暗を記録したピクセルのグリッド)として取り込みます。次に、前処理でその画像を補正します。傾き補正(斜めにスキャンされたページをまっすぐにする)、ノイズやごみの除去、コントラストの補正、そしてテキストが背景から明確に分離されるようにすべてを白黒に変換します。3番目に、認識エンジンが各形状を既知の文字パターンまたは特徴ルールと照合して分析します。最後に、後処理で辞書と文脈を使用して明らかな誤りを修正します。つまり、生の一致結果「cl0ud」を、辞書にゼロで始まる単語がないため「cloud」に戻します。

認識段階の内部には、2つの古典的なアルゴリズムがあります(IBM Think)。パターン認識(パターンマッチング)は、スキャンされた各文字を、既知のすべてのグリフ(文字の一意の形状/サイズ/フォントの組み合わせを指す「グリフ」)の保存済みテンプレートと比較し、最も近い一致を返します。これは、学習済みのフォントでは高速かつ正確ですが、未知のフォントでは失敗します。特徴認識(特徴抽出)は、代わりに文字の構造に関するルール(斜線、交差点、ループ、曲線の数など。「A」が2本の斜線と1本の水平線で構成される、など)を適用するため、これまで見たことのないフォントでも認識できます。最新のシステムは両方を組み合わせ、その後、テキストを言語モデルに通して、文法と単語頻度の文脈を使用して残りのエラーを修正します。

重要な違いは、OCRが意味のないテキストを生成することです。ページ上にどのような文字があるかはわかりますが、文書が何を意味するかはわかりません。従来のOCRエンジンは「INVOICE TOTAL: $1,250.00」を文字列「INVOICE TOTAL: $1,250.00」に変換しますが、これが請求書であることや、$1,250.00が合計金額であることは理解しません。認識されたテキストを構造化されたフィールドに変換する、この理解レイヤーは、AI時代になって初めて実用的になった、別の技術です。

OCRが重要な理由

OCRは、ほぼすべての文書自動化ワークフローにおける取り込み層であり、市場もそれを反映しています。世界のOCR市場は2025年に158億ドルと評価され、2034年までに481億ドルに達すると予測されています(IMARC Group、2025年)。OCRが登場する前は、スキャンされた請求書、フォーム、契約書はすべて画像にすぎず、検索も編集もできず、人間にしか読めませんでした。米国議会図書館のChronicling Americaプログラムは、OCRが可能にする規模を示しています。1,600万ページ以上の歴史的な米国新聞(1789〜1963年)が機械可読なOCRテキスト層でデジタル化され、200年分の新聞を誰でもキーワード検索できるようになりました(米国議会図書館)。

OCRが重要な2つ目の理由は、精度の主張があいまいになりがちな領域であり、ベンダーがそのあいまいさを日常的に利用していることです。欧州データ保護会議(EDPB)の技術ガイダンスは、きれいな印刷文書では、OCR精度は95〜99%が一般的に達成可能であり、100%の精度を提供するシステムは存在しないと指摘しています。正確性を保証する唯一の方法は人間によるレビューです(EDPB、2024年)。「99%の精度」という主張は、何が測定されたかを知って初めて意味を持ちます。きれいな印刷物の文字か、乱雑な実世界の文書のフィールドか。これらは大きく異なる数値です(精度評価のFAQについては以下を参照)。

OCRの歴史と進化

OCRの起源は1914年に遡ります。物理学者のエマニュエル・ゴールドバーグが文字を読み取り、標準的な電信コードに変換する機械を製作しました。これは、文書化された最も初期のテキスト読み取り装置の1つです。1920年代後半から1930年代にかけて、彼はこれをマイクロフィルムアーカイブ検索用の「統計機械」に改良し、1931年に米国特許第1,838,389号を取得しました。この特許は後にIBMが取得しました(Wikipedia)。IBM自身は1959年にこの用語を正式に定義し、1966年に手書き数字を読み取れる初の商用スキャナーであるIBM 1287を発表しました(RPA Technologies)。

転換点は1974年に訪れました。レイ・カーツワイルがカーツワイル・コンピュータ・プロダクツを設立し、事実上あらゆるフォントで印刷されたテキストを認識できる初のオムニフォントOCRを開発しました。1976年には視覚障害者向けの読み上げマシンとして製品化し、全米盲人連盟とともに発表しました。商用版は1978年に続き、1980年にゼロックスが同社を買収しました(Veriff)。1990年代から2000年代にかけて、OCRは大規模デジタル化の原動力となりました。全米デジタル新聞プログラムと米国議会図書館はChronicling AmericaをOCR上に構築し、数千万ページの検索可能な新聞を実現しました。また、米国国立標準技術研究所(NIST)は1989年から1998年にかけて、米国内国歳入庁(IRS)および米国国勢調査局と連携して独自のOCR研究プログラムを実施し、1990年と2000年の国勢調査を直接支援しました(NIST)。

2010年代には深層学習が登場し、ニューラルネットワークが手作業による特徴ルールに取って代わり、印刷テキストの認識精度は90%台後半にまで向上し、手書き文字認識も実用化されました。2020年代には視覚言語モデル(VLM)が登場しました。これは視覚的理解と言語理解を組み合わせたマルチモーダルAIシステムで、単一のモデルでテキストを読み取るだけでなく、文書の構造と意味も理解できます。GPT-4Vの学術的評価では、ラテン文字のテキスト認識と表構造の理解において高い性能を示す一方、多言語対応や複雑なレイアウトには限界があることも明らかになり、VLMがOCRの役割を単に置き換えるのではなく、再形成していることが示されています(SCUT-DLVCLab、2023年)。

OCRの種類

OCRは単一の技術ではなく、4つの認識アプローチからなるファミリーであり、最も単純なものから最も高度なものへと分類されます。IBMとCourseraはどちらも同じ4つの分類を説明しています(IBM Think;Coursera):

シンプルOCR

保存されたフォントテンプレートに対する文字単位のパターンマッチング。クリーンで既知のフォントや標準的な印刷文書では高速かつ信頼性が高い一方、学習していないもの(一般的でないフォント、劣化したスキャン、手書き文字など)には対応が困難です。

光学マーク認識(OMR)

文字ではなくマークを検出します。塗りつぶされた丸、チェックボックス、チェックマークなど、フォーム上の定義済みマークを認識します。標準化されたテスト、調査、投票用紙の集計などで使用され、重要なのは領域が塗りつぶされているかどうかであり、その内容ではありません。

インテリジェント文字認識(ICR)

機械学習を応用したOCRの一種で、手書きの活字体(分離した文字)をグリフ単位で読み取り、固定テンプレートではなく事例から学習します。人間の手書き文字の自然なばらつきに対応できますが、文字の境界が曖昧になる筆記体は依然として困難です。

インテリジェント単語認識(IWR)

孤立した文字ではなく、単語やフレーズ全体を単位として読み取り、文脈を利用します。特に、個々の文字の境界が曖昧でも単語全体としては認識可能な筆記体に有効です。4つのアプローチの中で最も高度です。

実際の文書処理スタックのほとんどはハイブリッド型です。OMRがチェックボックスを処理し、シンプルOCRがクリーンな印刷物を処理し、ICR/IWR(または最新のAIモデル)が手書きフィールドを処理します。多くの場合、これらは同じフォーム内で組み合わせて使用されます。

OCRの活用分野

OCRは、他のどの認識技術よりも多くの業界で利用されています。最も重要な5つの応用分野は以下のとおりです。

  • 買掛金/財務:OCRは仕入先請求書、発注書、経費精算書をデジタル化し、自動抽出を可能にします。1枚の請求書あたり数時間かかっていた手作業の入力が数秒に短縮され、再入力エラーも削減されます。
  • 医療:患者受付フォーム、診療記録、処方箋、保険請求書がOCRでスキャン・読み取られ、電子カルテや請求システムに再入力なしで情報が流れ込みます。
  • 法務:契約書レビューや電子情報開示(eDiscovery)は、スキャンされた文書を検索可能にするためにOCRに依存しています。数百万ページにわたるキーワード検索は、すべてのページに機械可読なテキスト層が存在して初めて可能になります。
  • 物流:配送ラベル、追跡番号、ナンバープレート、コンテナコードは輸送中にOCRで読み取られ、人間には到底かなわないベルト速度で荷物を処理する仕分け・追跡システムにデータを供給します。
  • 銀行:モバイルで預け入れされる小切手は、OCRによって口座番号、ルーティング番号、金額までエンドツーエンドで読み取られます。これが遠隔小切手預入の仕組みであり、KYC(本人確認)の書類検証にも同じ技術が使われています。
  • 政府アーカイブ:国勢調査記録、不動産文書、新聞は大規模にデジタル化されています。Chronicling AmericaだけでもOCR処理済みの新聞ページは1,600万ページを超え、数世紀分の歴史がオンラインで検索可能になっています。
  • アクセシビリティ:OCRは視覚障害者やロービジョン利用者向けテキスト読み上げの読み取り層です。1976年にカーツワイルが最初の読み上げマシンを構築したのと同じ技術が、現在もスクリーンリーダーや読書アプリの基盤となっています。

よくある誤解

  • 誤解:「OCRはAIであり、文書を理解している。」
  • 現実:OCRは文字を認識するものであり、意味を理解するものではありません。従来のOCRの出力は文脈のないテキストであり、ページに「$1,250.00」と書かれていることはわかっても、それが請求書の合計額であることはわかりません。読むことと理解することは別の能力であり、理解のレイヤー(構造化抽出)こそが、現代のAIシステムがOCRの上に追加するものです(IBM Think)。
  • 誤解:「99%の精度とは、文書の99%が完璧に処理されることを意味する。」
  • 現実:「99%」という数値は、通常、きれいな印刷テキストに対する文字レベルの精度です。文書には多くの文字が含まれるため、文字精度が99.9%でも、文字数の多いページには複数のエラーが含まれる可能性があります。また、文書抽出においては、請求書番号や金額の1文字の誤りがフィールド全体を無効にします。EDPBのガイダンスは明確です:100%の精度を達成するOCRシステムは存在せず、唯一の保証は人間によるレビューです(EDPB、2024年)。
  • 誤解:「OCRは印刷物と同じくらい手書き文字も読める。」
  • 現実:従来のOCRは印刷テキストとタイプ文字を対象としており、手書き文字は別の問題クラスであり、ICR(分離した手書き文字)またはIWR(筆記体)を必要としますが、それらも印刷テキストの精度には及びません。ベンダーの印刷文書の精度数値は、手書きフォームの処理能力については何も示していません。
  • 誤解:「OCRは最近のAIの発明である。」
  • 現実:OCRは100年以上の歴史があります。エマニュエル・ゴールドバーグのテキスト読み取り機は1914年に遡り、商用OCRシステムは1950年代までに存在していました。新しいのは、深層学習によって実際のワークフローを自動化できるほど正確になったことであり、技術自体は現代のコンピューティングより前から存在しています(Wikipedia)。

よくある質問

OCRとは何の略ですか?

OCRは光学文字認識(OCR)の略で、印刷、手書き、またはタイプされたテキストの画像を機械可読なテキストに変換する技術です。「テキスト認識」と呼ばれることもあります。

OCRとICRの違いは何ですか?

OCRは印刷・タイプされたテキストを読み取り、ICR(インテリジェント文字認識)は手書き文字を読み取ります。OCRは保存されたフォントテンプレートと文字を照合するのに対し、ICRは機械学習を用いて人間の手書き文字の自然なばらつきを解釈します。ただし、ICRは分離された手書き文字(活字体)に対応しており、筆記体には対応していません。筆記体には、関連するIWR(インテリジェント単語認識)アプローチが文脈に基づいて単語全体を読み取ります。

OCRの精度はどのくらいですか?

きれいな印刷文書の場合、OCRの精度は95〜99%が一般的に達成可能であり、これは欧州データ保護会議(EDPB)の技術ガイダンスに基づいています。また、100%に達するシステムはありません。唯一の保証は人間によるレビューです(EDPB、2024年)。精度は、スキャン品質、特殊なフォント、手書き文字、複雑なレイアウトによって大幅に低下します。きれいな印刷物での文字レベル精度は、実際の文書でのフィールドレベル精度と同じではありません。請求書の合計金額で1文字の誤読があれば、文字の99%が正しくてもフィールド全体が間違ってしまいます。

OCRの精度に関する主張はどのように評価すればよいですか?

精度の数値を信頼する前に、3つの質問をしてください。(1)どのレベルが測定されたか?文字レベル、単語レベル、フィールドレベルのいずれかです。99%の文字精度の主張は、80%のフィールド抽出率を隠している可能性があります。なぜなら、エラーは最も重要な数字やコードに集中するからです。(2)どのような文書がテストされたか?きれいなデジタルPDFとくしゃくしゃの感熱レシートでは、結果が大きく異なります。精度の主張は、ご自身の文書タイプに基づいている必要があります。(3)どのような条件下か?EDPBは、解像度、傾き、コントラスト、ノイズを精度の決定要因として挙げています(EDPB、2024年)。また、ベンダーが信頼度スコア(文字単位・フィールド単位の確信度評価)を公開しているかどうか、低信頼度の結果をどのように扱うかを確認してください。レビュー対象としてフラグが付けられた出力は、黙って誤った出力よりも信頼できるからです。

OCRはAIと同じですか?

いいえ。従来のOCRは認識技術であり、パターンマッチングや特徴ルールに基づくもので、現代のAIより数十年早く登場しました。AI時代に変わったのは、機械学習(そして最近では視覚言語モデル)によって、手書き文字や複雑なレイアウトといった難しい入力に対するOCRの精度が飛躍的に向上し、認識したテキストを構造化データに変換する理解レイヤーが追加されたことです。OCRは構成要素であり、AIによる文書理解はその上に構築されます。

OCRは現在どのように使われていますか?

OCRは文書自動化の取り込みレイヤーであり、請求書、領収書、フォーム、契約書を画像から検索可能で編集可能な機械可読テキストに変換します。実際には、銀行でのモバイル小切手入金、法務分野での電子情報開示(eDiscovery)検索、医療・政府機関での記録のデジタル化(Chronicling Americaの1,600万ページ以上の新聞アーカイブ)、物流での配送ラベル読み取り、アクセシビリティのためのテキスト読み上げなどに利用されています。

出典

  1. IBM Think — 「光学文字認識(OCR)とは」。IBM公式の解説記事:定義、パターン認識と特徴認識のアルゴリズム、前処理パイプライン、4種類のOCR方式を解説。定義と仕組みの解説の主要出典。
  2. Wikipedia — 「光学文字認識」。OCRの定義、歴史(ゴールドバーグ1914年、カーツワイル1974年、ゼロックス1980年)、4つの方式分類を網羅的に解説。歴史年表と方式分類の主要出典。
  3. 欧州データ保護会議(EDPB)— 「AIの潜在的リスクと対策:光学文字認識」(2024年)。EU公式の技術ガイダンス:印刷文書で一般的に達成可能な精度95〜99%、100%を達成するシステムは存在しないこと、信頼度スコアの仕組み、精度に影響する要因を解説。精度に関する主張の主要出典。
  4. 米国議会図書館 — Chronicling Americaコレクション。全米デジタル新聞プログラムのアーカイブ:機械可読なOCRテキスト層を持つ1,600万ページ以上のデジタル化新聞を収録。デジタル化規模に関する主張の主要出典。
  5. 米国国立標準技術研究所(NIST)— 光学文字認識(OCR)研究プログラム。米国政府の研究史:1989年から1998年にかけて、米国内国歳入庁(IRS)および米国国勢調査局と協力して実施したNISTのOCRおよび手書き文字認識研究。NISTのOCR関与の主要出典。
  6. SCUT-DLVCLab — 「大規模マルチモーダルモデルにおけるOCRの隠された謎」(2023年)。シーン文字、手書き文字、表構造、文書抽出にわたるGPT-4VのOCR能力を査読付きで評価。視覚言語モデル時代の主張の主要出典。
  7. IMARC Group — 光学文字認識市場レポート(2025年)。市場調査:2025年の市場規模158億ドル、2034年までに481億ドルに達する見込み。市場規模に関する主張の主要出典。
  8. Veriff — 「光学文字認識(OCR)とは」。ゴールドバーグ1914年、1931年の特許、カーツワイル1974年、1976年の読書機を網羅した歴史解説。Wikipediaの歴史年表を裏付ける。
  9. Coursera — 「光学文字認識とは」。4方式の分類(簡易OCR、OMR、ICR、インテリジェント単語認識)を確認できる教育用解説。IBMの方式分類を裏付ける。
  10. RPA Technologies — 「OCR技術:電信コードからAIインテリジェンスへ」。1959年のIBMによるOCR命名と、手書き数字を読み取る初の商用スキャナーであるIBM 1287(1966年)を確認できる歴史解説。初期のIBMに関する主張を裏付ける。

関連記事: ABBYYの従来型OCRと最新AI OCRの比較 · AIによる手書き文字処理とテンプレート型OCRの違い · 手書き文書向けAI OCR

📮 contact email: [email protected]