手書き文字認識の精度:用字系・モデル・文書タイプ別(2026年)

最終確認日:2026-08-10 · データ範囲:一部 · 出典:15件の独立した研究

このページの対象:査読付き研究および学術コンペティション(IAM、RIMES、CVL、KHATT、READ-2016、ICDAR 2013 中国語)から得られた手書き文字認識精度ベンチマーク、査読付きTPAMIサーベイ、コンペティションのリーダーボード、および方法論が明確な業界ベンチマーク(AIMultiple)を集約しています。用字系・言語、筆記スタイル、モデルアーキテクチャ、文書タイプ別に分類し、ほとんどの「手書き文字認識精度99%」という主張が省略している文字誤り率(CER)と単語誤り率(WER)の区別も示します。すべての出典は第三者によるもので、独立して検証可能です。
このページの対象外:印刷テキストのOCR精度(文書タイプ別のOCR性能を参照)、OCR/HTR自体の仕組み(OCRとは?を参照)、手動データ入力のエラー率(手動キー入力のエラー率を参照)、または以下に引用する独立した測定値を超える特定製品のベンダー固有の性能主張。

以下のすべての数値は、方法論セクションで引用されている公開された第三者研究および業界ベンチマークに基づいています。出典によって数値が異なる場合は、保守的な範囲(報告された最小値~最大値)を使用しています。このページは、手書き文字認識の研究および文書デジタル化計画のための方向性を示すベンチマークであり、特定のエンジンやコーパスに対する正確な予測ではありません。

2026年の最高性能システムは、IAMベンチマークにおいて現代英語の手書き文字を1.22~1.71%の文字誤り率(CER)で読み取ります。これは印刷テキストの品質に近い水準です。同じ世代のモデルを15~19世紀の歴史的文書に適用すると、エラー率は71~82%のCERに跳ね上がります(Crosilla et al., 2025)。手書き文字認識の精度は単一の数値ではありません。それは、用字系、筆記スタイル、モデルアーキテクチャ、文書タイプによって、おおよそその順序で影響度が決まる難易度のはしごなのです。

1.2–1.7%
現代英語の手書き文字における最高水準のCER(IAM、657名の筆記者)— GPT-5 約1.22%(CodeSOTA 2026)、GPT-4o-mini 1.71%(Crosilla 2025)、HTR-JAND 1.23%(辞書補正あり)
8.9–16%
アラビア語の手書き文字における最高水準のCER(KHATT)— 公開ベンチマークがある中で最も難しい現代の用字系。WERは27–44%(IIETA 2024; MDPI 2024)
71–82%
歴史的文書(Bentham、READ-2016)における汎用大規模言語モデルのCER — 同じ文書タイプに対するタスク特化型エンジンの3.6–6.2%と比較(Crosilla 2025; arXiv 2409.17095)

手書きが印刷テキストより難しい理由

印刷テキストは標準化されたグリフの閉じた集合ですが、手書きは個々の癖を持つ開いた集合です。このページのすべてのモデルは、同じ3つの構造的な違いに直面しています。そして、それが各用字系、スタイル、アーキテクチャの挙動が異なる理由を説明しています。

まず、筆記者によるばらつきです。同じ文字を同じように書く人は二人といません。IAMコーパスだけでも、13,353行のテキストにわたって657人の異なる筆記者の手書き文字が含まれています(Heyberger & Guyeux, 2024)。同じ文字が数百通りのかなり異なる表現で現れるため、特定の筆記者の筆跡に対する精度は、汎用認識には意味がありません。次に、文字の連結です。筆記体や完全に連結された用字系では、文字が合字に融合し、明確な分割境界がありません。認識エンジンは、ある文字が終わり次の文字が始まる位置を決定しなければならず、印刷テキストでは決して必要とされない判断です。アラビア語は極端な例です。単語内で完全に連結され、右から左に書かれ、文字の形が単語内の位置によって変化します。これがアラビア語のベンチマークがラテン語系を下回る大きな理由です(IIETA比較研究、2024)。第三に、文脈依存で曖昧な文字形状です。雑な「u」と「n」はセリフの向きだけが異なり、周囲の単語だけがそれらを判別できます。これが、ほぼすべての最新システムが視覚モデルと言語モデルを組み合わせる理由です。IAMコーパスでは、辞書や言語モデルを追加すると、通常、単語誤り率が3分の1以上削減されます(検出ベースのテキスト行認識、2024)。

実際的な結果として、持続的なメトリクス格差が生じます。文字誤り率(CER)は100文字あたりの誤読文字数を数えます。CER 2%は、100文字あたりおよそ2文字の誤りを意味します。単語誤り率(WER)は、誤って転写された単語全体を数えます。1文字の誤読が単語全体を失敗させるため、手書きのWERは通常、CERの2〜4倍になります。アラビア語のKHATTコーパスでは、CER 8.9%とWER 37.6%が共存しています(IIETA、2024)。どのメトリクスでどのコーパスに対してかを明示せずに1つの数値だけを引用する精度の主張は、せいぜい不完全です。

用字系は、手書き文字認識における最大の精度決定要因であり、モデルの選択よりも重要です。以下のチャートは、各主要ベンチマークコーパスについて、公表されているCER帯域(最良報告値から典型的なクロスモデル値まで)を示しています。その傾向は階段状です。現代のラテン文字の手書きは印刷品質に近く、アラビア語と中国語は一桁難しく、歴史的文書は崖のように急峻です。ただし、モデルがそれら向けにトレーニングされている場合を除きます。

用字系・言語別の内訳

手書きコーパス別の文字誤り率(最高公表値から一般的なクロスモデルまで):英語IAM 1.2〜5.5%、フランス語RIMES 1.6〜4.2%、ドイツ語CVL 3.3〜10.9%、中国語ICDAR-2013 6.8〜11.2%、アラビア語KHATT 8.9〜16.3%、タスク特化型エンジンによる歴史的文書 3.6〜6.2%、汎用大規模言語モデルによる歴史的文書 71〜82%。

出典:Crosillaら(2025年) — IAM/RIMES/READ-2016/Benthamを対象としたLLMベンチマーク、8つのマルチモーダル大規模言語モデル; CodeSOTA IAMリーダーボード(2024〜2026年) — 論文出典付きのモデル別CER/WER; Heyberger & Guyeux(2024年) — 行レベルの最高水準(SOTA)に関する調査(RIMESでVAN 1.91% CER); Springer SNCS(2023年) — CVLクロスコーパス結果; IIETA(2024年) & MDPI(2024年) — KHATT結果; ICDAR 2013中国語コンペティション & PMC11951872(2024年) — 中国語の文字正解率; arXiv 2409.17095(2024年) — READ-2016タスク特化型WER。中国語の行は文字誤り率(CER)ではなく文字正解率(CR)を使用しています。表下の注記を参照してください。

用字系 / コーパス文字誤り率(CER)(最良–標準)単語誤り率(WER)(最良–標準)出典年サンプル
英語 — IAM(現代)1.2–5.5%3.3–16.3%CodeSOTA; Crosilla2024–2026執筆者657名、13,353行、115,320語
フランス語 — RIMES(現代、筆記体)1.6–4.2%2.0–7.7%Crosilla; Heyberger2024–2025フランス語のビジネスレター;1,500ページ、12,723行
ドイツ語 — CVL(現代、筆記体)3.3–10.9%10.4–26.2%Springer SNCS2023ドメイン内でCER約3.3%;IAM学習モデルのクロス転送でCER 10.89% / WER 26.24%
アラビア語 — KHATT(現代)8.9–16.3%27.3–43.9%IIETA; MDPI2024執筆者1,000名、文書4,000点;完全連結の右から左への用字系
中国語 — CASIA-HWDB / ICDAR-2013(現代)6.8–11.2% 文字誤り率—ICDAR 2013; PMC119518722013–2024執筆者1,020名;オフライン文字認識でICDAR-2013テストセットの文字正解率(CR)88.76%(2013年)→ 93.18%(2024年)
歴史的ドイツ語 — READ-2016(タスク特化型エンジン)3.6–6.2%4.1–5.5%Heyberger; arXiv 2409.170952016–202415〜19世紀の議会議事録30,000ページ;VANでCER 3.59%、DANでWER 4.10%
歴史的英語/ドイツ語 — Bentham & READ(汎用大規模言語モデル)71–82%95–100%Crosilla2025マルチモーダル大規模言語モデル8種、ゼロショット/ファインチューニング済み;書き起こしは実用不可と判断

出典は上表のとおりです。指標に関する注記が2点あります。(1) 中国語の行は文字正解率(CR)を報告しています。これはICDAR 2013コンペティションおよびその後の論文で使用されている指標であり、正しく認識された文字を数える一方で、CERのように挿入をペナルティとして課しません。そのため、方向性としては比較可能ですが、CERと完全に同一ではありません。(2) 歴史的文書の行は意図的にモデルタイプ別に分けています。タスク特化型エンジンと汎用大規模言語モデルは、同じ文書に対しても異なる特性を持つためです。詳細はモデルアーキテクチャ別の内訳をご参照ください。

筆記スタイル(活字体、筆記体、またはその混在)は、実務者が最初に体感する次元でありながら、最も厳密なデータが整っていない次元でもあります。主要なベンチマークコーパスで各サンプルが活字体か筆記体かがラベル付けされているものはなく、活字体と筆記体の差については、業界ベンチマークとコーパス自体の構成(RIMESとCVLは筆記体、IAMは混在)に依存しています。

筆記スタイル別の内訳

筆記スタイル観測された精度根拠出典年
活字体(手書き原稿)比較的容易なベースライン。上位システムは印刷品質に近い精度AIMultiple:「手書き原稿スタイルのテキストは、文字がブロック体で個別に書かれているため認識しやすい」。管理された学術ベンチマークは存在しない(データギャップ)AIMultiple2025
筆記体(連結文字)100サンプルのベンチマーク:Gemini 3 Pro 100%、GPT-5およびolmOCR-2-7Bが最上位層10名の筆記者×10段落の筆記体。自然な連結性と傾斜を保持。14のソリューションを意味的類似度でランク付けAIMultiple筆記体ベンチマーク2025
筆記体(コーパスレベル、タスク特化型)文字誤り率(CER)1.6〜3.7%RIMES(フランス語の筆記体の手紙)とCVL(ドイツ語・英語の筆記体)は、モデルをそれらで学習させるとIAMに近いCERに到達。スタイルの難易度は本質的なものではなく、学習可能Crosilla;Springer SNCS2023〜2025
混在(1つのフォームに活字体+筆記体)最良モデルでも文書レベルで95%未満活字体・筆記体・混在スタイルにわたる実際の手書きフォーム10枚:GPT-5 MiniとGemini 2.5 Flash Liteが先頭に立ったが、「最良のモデルでも95%以上の業務レベルの精度に到達するのは困難」BusinessWareTech2025

上表に記載の出典に基づきます。データのギャップについて正直に述べます。活字体と筆記体の精度を、管理されたスタイルラベル付きコーパスで比較した査読付き研究は存在しません。RIMESとCVLはたまたま筆記体であり、IAMは混在していますが、各サンプルにラベルを付けたベンチマークはありません。したがって、このスタイルの側面は、AIMultipleの筆記体専用ベンチマークと、査読付き結果のコーパス構成に基づいています。直接的な学術的なスタイル比較はまだ存在しないという注意点があります(制限事項を参照)。

モデルアーキテクチャにより、同じIAMコーパスに対するエラー率は10年間で約5分の1に削減されました。以下のリーダーボードの推移(CTCベースのリカレントネットワーク、次にトランスフォーマー、そしてマルチモーダル大規模言語モデル)は、手書き文字認識の精度がどのように向上したかを示す最も明確な記録であり、また「精度」がモデルのトレーニング方法に最も依存する軸でもあります。

モデルアーキテクチャ別の内訳

アーキテクチャ時代IAM 文字誤り率(CER)(最高)IAM 単語誤り率(WER)(最高)代表的なモデル出典
CNN-LSTM + CTC2016–2022約4.1–5.5%5.0–16.3%DAN 5.01 WER; Start-Follow-Read 6.4; PyLaia 7.5–8.4; VAN 16.3(行WER)/ 4.45 CERarXiv 2409.17095; CodeSOTA
トランスフォーマー(エンコーダー・デコーダー)2021–20242.38–2.89%約2.4–2.9%(報告値)TrOCR 2.89% CER(2021年); DTrOCR 2.38% CER(WACV 2024年); HTR-VT 14.9 WER(事前学習なし)CodeSOTA; IIETA
マルチモーダル大規模言語モデル(VLM)2025–20261.22–1.75%3.34–3.59%GPT-5 約1.22% CER(2026年); GPT-4o-mini 1.71% CER / 3.34% WER(2025年); Claude 3.5 Sonnet 1.75% CERCodeSOTA; Crosilla
汎用OCRエンジン(未調整)2023–2026RIMESコーパス: 11–18% CER, 33–53% WERDOCSUMO 11% CER; Transkribus 18% CER; Ocelus 15% CER(RIMESでファインチューニングされていないスーパーモデル)Heyberger

上表に記載の出典に基づきます。各行は、最後の行を除き、同じIAMコーパスにおける公開された最高の結果を比較しています。最後の行は、調査による未調整の商用エンジンのRIMESでの評価結果であり、馴染みのないコーパスに対する未調整の商用エンジンが、2026年のモデルというよりは2016年の研究モデルのように動作することを示すために含められています。同一の分割でのアーキテクチャ間比較は稀です。IAMの「アーヘン分割」と標準分割では、同じモデルでも異なる数値が生成されます(例:DRetHTR-base はIAM-Aで6.55 WER、2026年)。

文書タイプによって、理論上の精度が実際の場面でどの程度維持されるかが決まります。クリーンなベンチマークコーパスは行区切りされ、普通の紙に書かれています。しかし実際の文書は、重なり合うフィールドを持つフォーム、欄外注釈のある手紙、略語やかすれたインクを含む原稿などとして届きます。計画を立てる際に基準とするべき数値は、ベンチマークの上限ではなく、文書タイプごとの公表範囲です。

文書タイプ別の内訳

文書タイプ精度の範囲背景出典年
標準的な手書きフォーム最良モデルで文書レベル95%未満実フォーム10件、活字体・筆記体・混在。GPT-5 MiniとGemini 2.5 Flash Liteが上位。構造化フィールド抽出では、読み取りエラーに加えてフィールドレベルの失敗が発生BusinessWareTech2025
自由形式の手紙(現代)文字誤り率(CER)1.2〜1.9%(最高水準(SOTA))、11〜18%(未調整の商用エンジン)IAMとRIMESは手紙が対象。同じコーパスにおける最高水準(SOTA)と未調整の商用エンジンの差は一桁に達するCrosilla; Heyberger2024〜2025
歴史的文書文字誤り率(CER)3.6〜6.2%(タスク特化型)/ 71〜82%(汎用大規模言語モデル)READ-2016、Bentham、グラゴル文字。略語、古い語彙、用字系の複雑さにより、専用エンジンでも最も難しい用字系では文字誤り率(CER)4.8〜6.05%に達するarXiv 2409.17095; PMC12202554; Crosilla2024〜2025
実世界のメモ/混在文書ソリューション全体で意味的類似度46〜95%AIMultipleの多様な手書き文字を対象とした12ソリューションのOCRベンチマーク。大規模言語モデルベースのソリューションが93〜95%で上位、従来型OCRエンジンは帯域の下限付近AIMultiple2026

出典は上表のとおりです。「自由形式の手紙」の行は文字誤り率(CER)、「実世界のメモ」は意味的類似度スコアを使用しています。測定尺度が異なるため、混ぜずに別々に示しています。46〜95%の帯域は、現代・歴史、クリーン・乱雑な文書を単一の測定でカバーする唯一の数値です。

このデータの使い方

「手書き文字認識の精度」をベンダーの数値から、ご自身の文書に対する妥当な見込みに変えるために、ベンチマークを実行する必要はありません。上記の表を使った4段階の概算チェックで十分です。そして、そのチェックによって、見出しの数値が、ご自身が処理する文書タイプとは異なる文書タイプで測定されたものであることが、たいてい明らかになります。

  1. 文書を分類します。4つの質問に答えてください。用字系(ラテン文字?アラビア文字?中国語?)、筆記スタイル(活字体、筆記体、または混在?)、文書タイプ(フォーム、手紙、または歴史的文書?)、そしてシステムが学習したコーパスがそれに似ているかどうか。ラテン文字の現代的なフォームは簡単な帯域、非ラテン文字の19世紀の歴史的文書は難しい帯域です。上記の表は、各帯域にそれぞれの範囲を示しています。
  2. 正直な指標を選びます。後続の処理が100文字あたり数文字の誤りを許容できる場合は文字誤り率(CER)の帯域を使用し、単語全体が重要(検索、固有名詞、住所)な場合は単語誤り率(WER)の帯域を使用し、1つの誤ったフィールドがレコードを無効にするフォームには文書レベルの精度を使用します。同じシステムでも、文字誤り率(CER)1.7%、単語誤り率(WER)3.3%、フィールドレベルの精度80%という結果は正当にあり得ます。
  3. モデル特化の割引を適用します。エンジンがご自身の文書タイプで学習またはファインチューニングされている場合、公開されている最高水準(SOTA)の文字誤り率(CER)に到達可能です(現代のラテン文字の手紙では1.2〜1.9%)。未調整の汎用システムの場合、馴染みのない筆記体では11〜18%の文字誤り率(CER)層(Heyberger 2024)、歴史的文書では71〜82%層(Crosilla 2025)を予算に組み込んでください。
  4. レビュー待ちの規模を把握します。50語の手書きページ200枚で単語誤り率(WER)3%の場合、修正前に1バッチあたりおよそ300語の誤りが予想されます(200 × 50 × 3%)。アラビア語文書で文字誤り率(CER)16%の場合、同じバッチには数千の疑わしい文字が含まれます。人手によるレビュー、信頼度しきい値、または辞書による後処理修正が経済的に必要かどうかは、この計算によって決まります。

これらは概算の計算式であり、ご自身の文書をベンチマークすることの代わりにはなりません。このページのすべての公開範囲は、他の誰かのコーパスで測定されたものです。ご自身のワークフローに適用できる唯一の精度数値は、ご自身が測定したものです。このページの価値は、測定する前に期待値を設定することにあります。

よくある質問

2026年の手書き文字認識の精度はどのくらいですか?

精度はほぼ用字系と文書タイプに依存します。現代英語の手書き文字(IAMベンチマーク)では、最高水準のシステムが1.22〜1.71%の文字誤り率(CER)を達成しています(CodeSOTA 2026; Crosilla 2025)。フランス語の筆記体も同様に1.63〜1.91%(Crosilla 2025; Heyberger 2024)、アラビア語は8.9〜16.3%のCER(IIETA 2024; MDPI 2024)、歴史的文書に対する汎用モデルは71〜82%のCER(Crosilla 2025)です。多様な実世界の手書き文字を対象とした12の商用ソリューションでは、意味的類似度は46〜95%の範囲です(AIMultiple 2026)。

IAM手書き文字データベースにおける最高水準(SOTA)はどのようなものですか?

2026年現在、GPT-5はIAMで約1.22%のCERを報告しており、GPT-4o-miniは1.71%のCER / 3.34%の単語誤り率(WER)(Crosilla 2025)、専門特化型のHTR-JANDは辞書補正により1.23%のCERを達成しています(CodeSOTA 2024)。同じコーパスでは、Transformer以前の最高水準は約8%の文字誤り率でした(Chowdhury & Vig, 2018)。また、一般的なCNN-LSTMシステムは7.5〜8.4%のWERでした(PyLaia — arXiv 2409.17095)。誤り率は数倍改善されましたが、IAMは今も英語手書き文字の参照ベンチマークであり続けています(657名の筆記者、13,353行)。

AIは筆記体を読めますか?

はい — 現在の主要なマルチモーダル大規模言語モデルは筆記体をうまく処理できます。AIMultipleの2025年ベンチマーク(意図的に乱雑に書かれた100件の筆記体サンプル)では、Gemini 3 Proが100%の意味的類似度を達成し、GPT-5とolmOCR-2-7Bが最上位層に入りました(AIMultiple, 2025)。従来のOCRエンジンはグループ内で遅れをとりました。筆記体は活字体より難しいままです — 文字が連結しているため、分割が曖昧だからです — しかし、その差はモデルの世代の問題であり、絶対的な障壁ではありません。

手書き文字の精度は、印刷テキストのOCRと比べてどうですか?

印刷テキストのOCRは、クリーンな文書で98〜99%以上の文字精度を達成します(文書タイプ別のOCR精度を参照)。一方、最高水準の手書き文字認識システムは、現代英語で98.3〜98.8%の文字精度(CER 1.2〜1.7%)と、ほぼ同等ながらわずかに劣り、アラビア語と中国語では83〜91%に低下し、歴史的文書に対する汎用モデルでは30%未満となります(Crosilla 2025; IIETA 2024; PMC11951872 2024)。印刷文字と手書き文字の差は、どの用字系でもおよそ一桁です。

なぜ歴史的文書では手書き文字認識の精度がこれほど低いのですか?

歴史的文書には、古い用字系、略語、かすれたインク、現代のトレーニングデータに含まれない語彙が組み合わさっています。その結果、顕著なモデル特化効果が生じます。タスク特化型エンジンはREAD-2016コーパスでCER 3.6〜6.2%、グラゴル文字のような最も難しい用字系では4.8〜6.05%に達しますが(Heyberger 2024; PMC12202554 2025)、8つの汎用大規模言語モデルはCER 71〜82%と、実用に耐えない文字起こし結果でした(Crosilla 2025)。認識は可能ですが、特定の歴史的コレクション向けにトレーニングされたモデルが必要です。

手書き文字認識における良好なCERとはどのくらいですか?

HTR文献で採用されているこの分野の実用的な基準では、CER 5%未満を「非常に良好」、5〜10%を「良好」、2.5%未満を「優秀」と定義しています(Muehlberger et al. 2019; Hodel et al. 2021、Crosilla et al. 2025による適用)。現代のラテン文字の手書き文字では、最高水準のシステムは「優秀」の範囲にあります。アラビア語、中国語、歴史的文書では、「非常に良好」(5〜10%)が現在の現実的な本番目標です。

手書き文字認識におけるCERとWERの違いは何ですか?

文字誤り率(CER)は個々の誤読文字を数えます。単語誤り率(WER)は単語全体を誤りとして数えるため、1文字の誤読で単語全体が失敗となります。手書き文字では、WERは通常CERの2〜4倍になります。アラビア語のKHATTでは、CER 8.9%とWER 37.6%が併存しています(IIETA 2024)。主張を確認する際は、必ずどの指標を使用しているかを確認してください。「95%の精度」は、CER、WER、文書レベルの精度として、大きく異なる意味を持ちます。

方法論と情報源

このページの作成方法

このページは、2013年から2026年にかけての15の独立した情報源からデータを集約しており、査読付き論文、学術コンペティションのレポート、査読付きTPAMIサーベイが中心です。情報源は次の3つの基準で選定しました:(1) コーパス規模が明記された公開方法論、(2) 名前付きベンチマークコーパス(IAM、RIMES、CVL、KHATT、READ-2016、ICDAR-2013)または透明性のある業界テストセットでの結果報告、(3) マーケティング主張ではなく手書き文字認識への関連性。複数の情報源が同じ指標を報告している場合、保守的な範囲(報告値の最低値〜最高値)を使用します — 過大主張は避けます。情報源間で大幅な相違がある場合、その相違は指標レベル、コーパス分割、または学習設定によって説明され、平均化によって消されることはありません。

指標の区別がこのページの背骨です。文字誤り率(CER)、単語誤り率(WER)、文字正解率(CR)は決して単一の数値に混ぜられず、タスク特化型モデルと汎用モデルは同じ文書に対する異なる測定方式であるため、別々の行として報告されます。ベンダー自己報告の数値は完全に除外しています — ベンダー公表の手書き文字認識精度の主張で、2つの独立した情報源による検証を通過したものはありませんでした。これ自体が一つの発見です(制限事項を参照)。

情報源一覧

  1. Crosilla, G., Klic, L. & Colavizza, G. — 「大規模言語モデルの手書き文字認識におけるベンチマーク評価」、Journal of Documentation 81(7) (2025)。査読付き。8つのマルチモーダル大規模言語モデル × 7つのコーパス(IAM、RIMES、READ-2016、Bentham、Leopardi、LAM、ICDAR-2017)。IAMで1.71%の文字誤り率(CER)/3.34%の単語誤り率(WER)(GPT-4o-mini)、RIMESで1.69%のCER(GPT-4o)、歴史的文書で71〜82%のCER、および<5%/<2.5%のCER品質帯域を提供します。
  2. Heyberger, L. & Guyeux, C. — 「手書き文字認識の進歩と課題:包括的サーベイ」、Journal of Imaging 10(1):18 (2024)。査読付きサーベイ。250以上の研究を収録。コーパス仕様(IAM 657名の筆記者/13,353行、READ 30,000ページ)、行レベルの最高水準(SOTA)(RIMESでVAN 1.91% CER)、および未調整の商用結果(RIMESでDOCSUMO 11% CER、Transkribus 18% CER)を提供します。
  3. Garrido-Muñoz, C., Ríos-Vila, A. & Calvo-Zaragoza, J. — 「手書き文字認識:サーベイ」、IEEE TPAMI 48(4) (2026)。査読付きサーベイ。IAMにおける段落レベルのSOTA(VAN 4.7%、OrigamiNet 4.6%)とCTCパラダイムによる58%の誤り削減、さらに現在のベンチマークに対する分布外汎化の批判を提供します。
  4. CodeSOTA — 「IAMリーダーボード」(2024–2026)。技術ベンチマーク集約サイト。各エントリは元の論文にリンクしています。IAMにおけるモデル別のCER/WER(GPT-5 約1.22% CER、HTR-JAND 1.23% CER/3.78% WER、GPT-4o-mini 3.34% WER、DRetHTR-base 6.55% WER(IAM-A)、MetaWriter 10.32% WER)と、TesseractクラスのOCRは手書き文字には不適切であるという指摘(約12.5% CER)を提供します。
  5. 「検出ベースの汎用テキスト行認識」。モデル間比較表付きプレプリント。IAM/READ/RIMESにおけるWER比較(IAMでDAN 5.01 WER、READで4.10、IAMでDTrOCR 2.38、RIMES最良は言語モデル使用時1.99)とIAMアーヘン分割の統計を提供します。
  6. 「オフライン手書き文字認識のためのデータ拡張:系統的文献レビュー」、SN Computer Science (2023)。査読付き。コーパス間汎化の数値を提供:IAMで学習したモデルは、IAM自体では8.62% CERであるのに対し、CVLでは10.89% CER / 26.24% WERを記録。また、CVLコーパスの説明(ドイツ語/英語の筆記体)も提供します。
  7. 「4つの手書き文字認識モデルの比較研究」、Ingénierie des Systèmes d'Information 29(6) (2024)。査読付き。KHATTに対するDAN/VAN/FCN/GFCN。KHATTの最良結果を提供:DAN 8.9% CER / 37.6% WER、VAN 10.7% CER / 43.9% WER、およびアラビア語用字系の課題(完全連結文字、位置依存字形)の分析。
  8. 「アラビア語手書き認識のための機械学習アプローチ」、Applied Sciences 14(19):9020 (2024)。査読付き。KHATTに対するBiLSTM-CTC。KHATT BiLSTMの結果(13.2〜15.8% CER / 27.31〜31.6% WER)と歴史的ベースライン(MDLSTM 31.3% WER、2015年)を提供。KHATTの1,000名の筆記者 / 4,000文書を記録しています。
  9. Yin, F. 他 — 「ICDAR 2013 中国語手書き文字認識コンペティション」(2013)。学術コンペティション(IEEE)。CASIA-HWDB由来のテストセット(筆記者1,020名)におけるオフライン文字認識結果として、文字正解率(CR)88.76%を提供。
  10. 「電力業界向け注意機構ベースの中国語手書き文字認識」(2024)。査読付き。2024年のICDAR-2013結果(AR 92.67% / CR 93.18%)とHWDB結果(AR 96.92% / CR 97.66%)を提供し、中国語オフラインテキストにおける2013年から2024年への改善を示す。
  11. 「歴史的文書デジタル化のための高度な手書き文字認識エンジンの評価」(2025)。査読付き。5エンジン×4用字系。用字系別の文字誤り率(CER)を提供:ローマン活字体 1.74–2.78%、クロアチア共和国 3.54–6.32%、グラゴル文字 4.83–6.05%、速記 9.53–11.9%。
  12. 「ゲート機構による手書き文字認識精度の向上」(2024)。査読付き。GatedLexiconNet。専用モデルによる2つ目のIAMデータポイント(WER 5.73% / CER 2.27%)とRIMESのCER 0.9% / WER 2.76%を提供。
  13. AIMultiple — 「手書き文字認識ベンチマーク:LLM vs OCR」(2025-11)。ベンダー中立のアナリストベンチマーク。10名の筆記者による筆記体サンプル100件。コサイン類似度パイプライン。筆記体限定のベンチマークを提供:Gemini 3 Pro 100%、GPT-5とolmOCR-2-7Bが14ソリューション中トップ層。
  14. AIMultiple — 「OCRベンチマーク:テキスト抽出・取得精度」(2026)。ベンダー中立。12以上のソリューション。ソリューション横断の手書き文字帯域46–95%と、ソリューション別トップ(GPT-5 95%、olmOCR-2-7B 94%、Gemini 2.5 Pro 93%)を提供。
  15. BusinessWareTech — 「手書きフォーム認識ベンチマーク」(2025)。独立ベンチマーク、Cグレード(単一テストセット、透明な手法)。実際に手書きされたフォーム10件。実フォームではトップモデルでも95%未満にとどまるという文書レベルの知見と、GPT-5 Mini / Gemini 2.5 Flash Liteがリードしたことを提供。

制限事項

  • 地理的・用字系のカバレッジ:ラテン文字系のコーパスが文献の主流を占めています(英語(IAM)、フランス語(RIMES)、ドイツ語(CVL、READ))。アラビア語(KHATT)と中国語(CASIA-HWDB)は一定のカバレッジがありますが、やや薄めです。日本語、韓国語、デーヴァナーガリー文字の手書き文字については、当方で確認できた文献には標準化されたCER/WERベンチマークが存在しません。ICDAR 2023 Indicコンペティション(10の用字系で文字認識率95.94%の優勝)は、集計された唯一のIndicデータですが、異なる指標と用字系セットを使用しているため、上記の表には含まれていません。
  • 方法論の制約:コーパスの分割方法は論文ごとに異なり(IAM標準 vs Aachen分割)、同じモデルでも数値が大きく異なります。上記の範囲は、公表されている両方の分割をカバーしています。主要なコーパスはサンプルごとの筆記スタイル(活字体 vs 筆記体)をラベル付けしていないため、スタイルの次元は管理された学術データではなく、業界ベンチマークに依存しています。クラウドベンダー(Google、Microsoft、Amazon)は手書き文字に特化した精度測定値を公開しておらず、彼らの「99%以上」という数値は印刷テキストに適用されるものです。また、手書き文字精度に関する独立したベンダー測定値が2つ以上見つからなかったため、このページにはDグレードのベンダー数値は掲載されていません。
  • 時間的なギャップ:ICDAR 2013中国語コンペティションの数値(88.76% CR)は13年前のもので、同じテストセットでの2024年の結果とともに歴史的な基準点として使用されています。IAMコーパスは1999年に遡りますが、英語手書き文字の事実上のベンチマークであり続けています。2025〜2026年のLLM結果(GPT-4o-mini、GPT-5)は最新のデータであり、今後変動することが予想されます。
  • 見つからなかったもの:(1)同じコーパスで活字体と筆記体の精度を分離した査読付き管理研究、(2)Google Document AI、Azure Document Intelligence、Amazon Textractに関する、方法論が透明でベンダーが公開した手書き文字精度ベンチマーク、(3)印刷物と手書き文字が混在する文書(最も一般的な実世界のケースで、現在はBusinessWareTechの10フォームセットのみがカバー)の標準化されたベンチマーク、(4)執筆者ごとの精度分散の集計、(5)IAMベースのCrosilla研究に匹敵する中国語またはアラビア語の手書き文字に関するLLM時代のベンチマーク。これらのギャップは、検証不可能な主張で埋めるのではなく、明示されています。

関連リファレンス: 文書タイプ別精度ベンチマーク · 人間の転写誤り率 · レコードあたりのドキュメント処理コスト · 光学文字認識(OCR)とは?

関連記事: 中小企業向けの手頃なAI手書き文字抽出 · AI手書き文字抽出精度の向上の歴史

📮 contact email: [email protected]