필기 인식 정확도:문자 체계, 모델 및 문서 유형별 (2026)

최종 검토: 2026-08-10 · 데이터 범위: 부분 · 출처: 독립 연구 15건

이 페이지에서 다루는 내용: 동료 검토 연구 및 학술 대회에서 집계한 필기 인식 정확도 벤치마크, 동료 검토 TPAMI 조사, 대회 리더보드, 방법론이 투명한 업계 벤치마크(AIMultiple)를 다룹니다. 문자 체계/언어, 필기 스타일, 모델 아키텍처, 문서 유형별로 세분화하며, 대부분의 "99% 필기 정확도" 주장이 생략하는 문자 오류율(CER)과 단어 오류율(WER)의 차이를 명확히 구분합니다. 모든 출처는 제3자 기관이며 독립적으로 검증 가능합니다.
이 페이지에서 다루지 않는 내용: 인쇄 텍스트 OCR 정확도(문서 유형별 OCR 정확도 참조), OCR/HTR 자체의 메커니즘(OCR이란? 참조), 수동 데이터 입력 오류율(수동 데이터 입력 오류율 참조), 또는 아래에 인용된 독립 측정을 넘어서는 특정 제품에 대한 공급업체별 성능 주장은 다루지 않습니다.

아래의 모든 수치는 방법론 섹션에 인용된 공개적으로 이용 가능한 제3자 연구 및 업계 벤치마크를 기반으로 합니다. 출처 간 불일치가 있는 경우 보수적 범위를 사용합니다. 이 페이지는 필기 인식 연구 및 문서 디지털화 계획을 위한 방향성 벤치마크이며, 특정 엔진이나 말뭉치에 대한 정밀한 예측이 아닙니다.

2026년 최고 수준의 시스템은 IAM 벤치마크에서 현대 영어 필기를 1.22–1.71% 문자 오류율(CER)로 읽어내며, 이는 인쇄 텍스트 품질에 근접합니다. 동일한 세대의 모델을 15~19세기 문서에 적용하면 오류율이 71–82% CER로 급증합니다. 필기 인식은 단일 정확도 수치가 아니라, 문자 체계, 필기 스타일, 모델 아키텍처, 문서 유형 순으로 영향력이 정해지는 난이도 사다리입니다.

1.2–1.7%
현대 영어 필기체 최고 문자 오류율(CER) (IAM, 657명 필기자) — GPT-5 약 1.22% (CodeSOTA 2026), GPT-4o-mini 1.71% (Crosilla 2025), HTR-JAND 1.23% (어휘 보정 적용)
8.9–16%
아랍어 필기체 최고 문자 오류율(CER) (KHATT) — 벤치마크가 공개된 가장 어려운 현대 문자 체계; 단어 오류율(WER)은 27–44% (IIETA 2024; MDPI 2024)
71–82%
역사적 문서에 대한 범용 LLM의 문자 오류율(CER) (Bentham, READ-2016) — 동일 문서 유형에서 작업 특화 엔진의 3.6–6.2%와 대비 (Crosilla 2025; arXiv 2409.17095)

손글씨가 인쇄 텍스트보다 어려운 이유

인쇄 텍스트는 표준화된 글리프의 폐쇄 집합이지만, 손글씨는 개인별 특성이 반영된 개방 집합입니다. 이 페이지의 모든 모델은 동일한 세 가지 구조적 차이와 씨름하고 있으며, 이는 아래의 모든 문자 체계, 필기 스타일, 모델 아키텍처가 서로 다른 성능을 보이는 이유를 설명합니다.

첫째, 필기자 변이입니다. 같은 글자라도 사람마다 쓰는 방식이 다릅니다. IAM 말뭉치만 해도 13,353개 텍스트 줄에 걸쳐 657명의 서로 다른 필기자의 손글씨가 포함되어 있습니다(Heyberger & Guyeux, 2024). 같은 글자가 수백 가지의 실질적으로 다른 형태로 나타나므로, 특정 필기자의 손글씨에 대한 정확도는 범용 인식에는 의미가 없습니다. 둘째, 연결된 문자입니다. 필기체 및 완전 연결 문자 체계에서는 글자가 합자로 결합되어 명확한 분할 경계가 없습니다. 인식 엔진은 한 문자가 끝나고 다음 문자가 시작되는 지점을 스스로 결정해야 하며, 인쇄 텍스트에서는 이런 결정이 필요하지 않습니다. 아랍어가 가장 극단적인 사례로, 단어 내에서 완전히 연결되어 오른쪽에서 왼쪽으로 쓰이며, 단어 내 위치에 따라 글자 형태가 달라집니다. 이것이 아랍어 벤치마크가 라틴어 벤치마크보다 뒤처지는 주요 이유입니다. 셋째, 문맥 의존적이고 모호한 글자 형태입니다. 흘려 쓴 "u"와 "n"은 세리프 방향만 다를 뿐이며, 주변 단어만이 이를 구분할 수 있습니다. 이것이 거의 모든 최신 시스템이 시각 모델과 언어 모델을 결합하는 이유입니다. IAM 말뭉치에서 어휘 사전이나 언어 모델을 추가하면 일반적으로 단어 오류가 3분의 1 이상 줄어듭니다.

실질적인 결과는 지속적인 지표 격차입니다. 문자 오류율(CER)은 백 자당 잘못 읽은 문자 수를 나타내며, CER 2%는 백 자당 약 두 개의 오류를 의미합니다. 단어 오류율(WER)은 잘못 전사된 전체 단어 수를 나타냅니다. 문자 하나를 잘못 읽으면 전체 단어가 실패하므로, 손글씨의 WER은 일반적으로 CER보다 2~4배 높게 나타납니다. 아랍어 KHATT 말뭉치의 경우 CER 8.9%와 함께 WER 37.6%가 보고되었습니다(IIETA, 2024). 어떤 지표와 어떤 말뭉치에 대한 것인지 명시하지 않고 숫자 하나만 인용하는 정확도 주장은 기껏해야 불완전한 것입니다.

문자 체계는 손글씨 인식에서 가장 큰 정확도 결정 요인이며, 모델 선택보다 더 큰 영향을 미칩니다. 아래 차트는 각 주요 벤치마크 말뭉치에 대해 발표된 CER 범위를 보여줍니다. 그 양상은 계단식입니다. 현대 라틴 문자 손글씨는 인쇄 품질에 가깝고, 아랍어와 중국어는 한 단계 더 어려우며, 역사적 문서는 절벽과 같습니다. 단, 해당 문서에 맞게 훈련된 모델은 예외입니다.

문자 체계 및 언어별 분석

필기 말뭉치별 문자 오류율(CER)(최고 발표 수치부터 일반적인 교차 모델 수치까지): 영어 IAM 1.2–5.5%, 프랑스어 RIMES 1.6–4.2%, 독일어 CVL 3.3–10.9%, 중국어 ICDAR-2013 6.8–11.2%, 아랍어 KHATT 8.9–16.3%, 작업 특화 엔진을 사용한 역사적 문서 3.6–6.2%, 범용 LLM을 사용한 역사적 문서 71–82%.

출처: Crosilla 외 (2025) — IAM/RIMES/READ-2016/Bentham 대상 LLM 벤치마크, 멀티모달 LLM 8종; CodeSOTA IAM 리더보드 (2024–2026) — 논문 출처가 포함된 모델별 CER/WER; Heyberger & Guyeux (2024) — 줄 단위 최고 수준(SOTA) 조사; Springer SNCS (2023) — CVL 교차 말뭉치 결과; IIETA (2024)MDPI (2024) — KHATT 결과; ICDAR 2013 중국어 대회PMC11951872 (2024) — 중국어 문자 정확률(CR); arXiv 2409.17095 (2024) — READ-2016 작업 특화 WER. 중국어 행은 CER이 아닌 문자 정확률(CR)을 사용합니다. 표 아래 참고 사항을 확인하세요.

문자 체계 / 말뭉치CERWER (최고–일반적)출처연도샘플
영어 — IAM1.2–5.5%3.3–16.3%CodeSOTA; Crosilla2024–2026필기자 657명, 13,353줄, 115,320단어
프랑스어 — RIMES1.6–4.2%2.0–7.7%Crosilla; Heyberger2024–2025프랑스어 비즈니스 서신; 1,500페이지, 12,723줄
독일어 — CVL3.3–10.9%10.4–26.2%Springer SNCS2023도메인 내 약 3.3% CER; IAM 학습 모델 교차 전이 10.89% CER / 26.24% WER
아랍어 — KHATT8.9–16.3%27.3–43.9%IIETA; MDPI2024필기자 1,000명, 문서 4,000건; 완전 연결형 오른쪽에서 왼쪽 문자 체계
중국어 — CASIA-HWDB / ICDAR-20136.8–11.2% 문자 오류ICDAR 2013; PMC119518722013–2024필기자 1,020명; ICDAR-2013 테스트 세트에서 오프라인 텍스트 인식 문자 정확률(CR) 88.76%(2013) → 93.18%(2024)
역사적 독일어 — READ-20163.6–6.2%4.1–5.5%Heyberger; arXiv 2409.170952016–202415~19세기 의회 회의록 30,000페이지; VAN 3.59% CER, DAN 4.10% WER
역사적 영어/독일어 — Bentham & READ71–82%95–100%Crosilla2025멀티모달 LLM 8개, 제로샷/미세 조정; 전사 결과는 사용 불가로 판정

위 표에 출처가 나열되어 있습니다. 두 가지 지표 관련 참고 사항: (1) 중국어 행은 문자 정확률(CR)을 보고하며, 이는 ICDAR 2013 대회와 이후 논문들에서 사용된 지표입니다. 올바르게 인식된 문자를 집계하지만 CER처럼 삽입 오류에 패널티를 부과하지 않으므로, 방향성은 유사하나 CER과 완전히 동일하지는 않습니다. (2) 역사적 문서 행은 의도적으로 모델 유형별로 구분했습니다. 작업 특화 엔진과 범용 LLM은 동일한 문서에서도 서로 다른 특성을 보입니다. 자세한 내용은 모델 아키텍처별 분석을 참조하세요.

필기 스타일은 실무자들이 가장 먼저 체감하는 요소이면서도 데이터가 가장 부족한 영역입니다. 주요 벤치마크 말뭉치 중 각 샘플을 활자체 또는 필기체로 분류한 경우가 없어, 활자체 대비 필기체의 성능 격차는 업계 벤치마크와 말뭉치 구성에 기반합니다.

필기 스타일별 분석

필기 스타일관측 정확도근거출처연도
활자체더 쉬운 기준선; 최고 시스템은 인쇄물 수준에 근접AIMultiple: "문자가 블록 형태로 개별 작성되어 원고 스타일 텍스트는 인식이 더 쉽다"; 통제된 학술 벤치마크는 없음AIMultiple2025
필기체100개 샘플 벤치마크: Gemini 3 Pro 100%, GPT-5 및 olmOCR-2-7B 최상위권10명의 작성자 × 10개의 필기체 문단, 자연스러운 연결과 기울기 유지; 14개 솔루션을 의미적 유사도로 순위 산정AIMultiple 필기체 벤치마크2025
필기체문자 오류율(CER) 1.6–3.7%RIMES(프랑스어 필기체 서신)와 CVL은 모델이 해당 데이터로 학습되면 IAM 수준의 CER에 도달 — 스타일 난이도는 학습 가능한 요소이지 본질적 특성이 아님Crosilla; Springer SNCS2023–2025
혼합최고 모델도 문서 수준 95% 미만활자체, 필기체, 혼합 스타일을 포함한 실제 필기 양식 10건: GPT-5 Mini와 Gemini 2.5 Flash Lite가 선두였지만 "최고 모델도 비즈니스 수준 정확도 95% 이상 달성에 어려움"BusinessWareTech2025

위 표에 출처가 나열되어 있습니다. 데이터 공백은 정직하게 명시합니다. 통제된 스타일 라벨 말뭉치에서 활자체와 필기체 정확도를 분리한 동료 검토 연구는 아직 없습니다. RIMES와 CVL은 우연히 필기체이고 IAM은 혼합되어 있지만, 각 샘플에 라벨을 붙인 벤치마크는 없습니다. 따라서 여기서의 스타일 차원은 AIMultiple 필기체 전용 벤치마크와 동료 검토 결과의 말뭉치 구성에 기반하며, 직접적인 학술적 스타일 비교는 아직 존재하지 않는다는 한계가 있습니다.

모델 아키텍처는 10년 만에 동일한 IAM 말뭉치에서 약 5배의 오류 감소를 이끌어 냈습니다. 아래 리더보드 진행 — CTC 기반 순환 신경망, 그다음 트랜스포머, 그다음 멀티모달 LLM — 은 필기 인식 정확도가 어떻게 향상되었는지에 대한 가장 명확하게 기록된 기록이며, "정확도"가 모델 훈련 방식에 가장 크게 의존하는 축이기도 합니다.

모델 아키텍처별 분석

아키텍처시대IAM 문자 오류율(CER) (최고)IAM 단어 오류율(WER) (최고)대표 모델출처
CNN-LSTM + CTC2016–2022~4.1–5.5%5.0–16.3%DAN 5.01 WER; Start-Follow-Read 6.4; PyLaia 7.5–8.4; VAN 16.3 / 4.45 CERarXiv 2409.17095; CodeSOTA
트랜스포머2021–20242.38–2.89%~2.4–2.9% (보고됨)TrOCR 2.89% CER (2021); DTrOCR 2.38% CER (WACV 2024); HTR-VT 14.9 WER (사전 훈련 없음)CodeSOTA; IIETA
멀티모달 LLM (VLM)2025–20261.22–1.75%3.34–3.59%GPT-5 ~1.22% CER (2026); GPT-4o-mini 1.71% CER / 3.34% WER (2025); Claude 3.5 Sonnet 1.75% CERCodeSOTA; Crosilla
범용 OCR 엔진2023–2026RIMES 말뭉치: 11–18% CER, 33–53% WERDOCSUMO 11% CER; Transkribus 18% CER; Ocelus 15% CERHeyberger

위 표에 출처가 나열되어 있습니다. 행은 동일한 IAM 말뭉치에 대한 최고의 발표 결과를 비교하며, 마지막 행은 RIMES에 대한 설문 조사의 별도 조정 없는 상용 평가를 보고합니다. 이는 익숙하지 않은 말뭉치에서 조정되지 않은 상용 엔진이 2026년 모델보다 2016년 연구 모델에 더 가깝게 동작함을 보여주기 위해 포함되었습니다. 동일한 분할에 대한 아키텍처 간 비교는 드뭅니다. IAM "Aachen 분할"과 표준 분할은 동일한 모델에 대해 다른 수치를 생성합니다.

문서 유형은 이론적 정확도가 실제 환경에서 얼마나 유지되는지를 결정합니다. 깨끗한 벤치마크 말뭉치는 줄 구분이 되어 있고 일반 종이에 작성되지만, 실제 문서는 필드가 겹치는 양식, 여백에 적힌 메모가 있는 편지, 약어와 희미한 잉크가 있는 필사본 형태로 제공됩니다. 각 문서 유형에 대해 발표된 범위가 계획의 기준이 되어야 합니다.

문서 유형별 분석

문서 유형정확도 범위맥락출처연도
표준 수기 양식최고 모델 <95% 문서 수준실제 양식 10개, 활자체/필기체/혼합; GPT-5 Mini와 Gemini 2.5 Flash Lite가 선두; 구조화 필드 추출은 판독 오류 외에 필드 수준 실패를 추가로 발생BusinessWareTech2025
자유 형식 편지문자 오류율(CER) 1.2–1.9%(최고 수준(SOTA)), 11–18%(별도 조정 없는 상용)IAM과 RIMES는 편지 데이터; 동일한 말뭉치에서 최고 수준(SOTA)과 조정되지 않은 상용 엔진 간의 격차는 한 자릿수 이상Crosilla; Heyberger2024–2025
역사적 문서문자 오류율(CER) 3.6–6.2%(작업 특화 엔진) / 71–82%(범용 LLM)READ-2016, Bentham, 글라골 문자; 약어, 고어 어휘, 문자 체계 복잡성으로 인해 가장 어려운 문자 체계에서 전용 엔진이 4.8–6.05% 문자 오류율(CER)에 도달arXiv 2409.17095; PMC12202554; Crosilla2024–2025
실제 메모 / 혼합 문서솔루션별 의미적 유사도 46–95%AIMultiple의 다양한 필기에 대한 12개 솔루션 OCR 벤치마크; LLM 기반 솔루션이 93–95%로 선두, 레거시 OCR 엔진은 범위 하단에 위치AIMultiple2026

출처는 위 표에 명시되어 있습니다. "자유 형식 편지" 행은 문자 오류율(CER)을 사용하는 반면 "실제 메모"는 의미적 유사도 점수를 사용합니다. 서로 다른 측정 척도이므로 혼합하지 않고 별도로 표시했습니다. 46–95% 범위는 현대와 역사적, 깨끗한 문서와 지저분한 문서를 하나의 측정으로 아우르는 유일한 수치입니다.

이 데이터를 사용하는 방법

벤더가 제공하는 "필기 인식 정확도" 수치를 자체 문서에 대한 합리적인 기대치로 전환하기 위해 벤치마크를 실행할 필요는 없습니다. 위 표를 활용한 4단계 간이 검증으로 충분하며, 일반적으로 헤드라인 수치가 실제 처리하는 문서 유형과 다른 문서에서 측정된 것임을 밝혀냅니다.

  1. 문서를 분류하세요. 네 가지 질문에 답하세요: 문자 체계, 필기 스타일, 문서 유형, 그리고 시스템이 훈련된 말뭉치가 이와 유사한지 여부입니다. 라틴 문자 현대 양식은 쉬운 범주에 속하며, 비라틴 문자로 작성된 19세기 역사적 문서는 어려운 범주에 속합니다 — 위 표는 각 범주에 고유한 범위를 제공합니다.
  2. 정직한 지표를 선택하세요. 다운스트림 프로세스가 백자당 몇 개의 오류 문자를 허용할 수 있다면 CER 범위를 사용하고, 전체 단어가 중요하다면 WER 범위를 사용하며, 한 필드의 오류가 레코드를 실패시키는 양식에는 문서 수준 정확도를 사용하세요. 동일한 시스템이 1.7% CER, 3.3% WER, 80% 필드 수준 정확도를 정당하게 보여줄 수 있습니다.
  3. 모델 특화 할인을 적용하세요. 엔진이 문서 유형에 대해 훈련되거나 미세 조정된 경우, 최고 발표 CER에 도달할 수 있습니다. 별도 조정 없는 범용 시스템이라면 익숙하지 않은 필기체에 대해 11–18% CER 계층(Heyberger 2024) 또는 역사적 문서에 대해 71–82% 계층(Crosilla 2025)을 예산에 반영하세요.
  4. 검토 대기열 규모를 산정하세요. 각각 50단어로 구성된 필기 페이지 200장에서 WER 3%라면, 수정 전에 배치당 약 300개의 오류 단어가 발생할 것으로 예상됩니다(200 × 50 × 3%). 아랍어 문서에서 CER 16%라면 동일한 배치에 수천 개의 의심 문자 가 있습니다 — 산술 계산을 통해 인간 검토, 신뢰도 임계값 또는 사전 기반 사후 수정 패스가 경제적으로 필요한지 결정됩니다.

이는 대략적인 추정 공식이며, 자체 문서에 대한 벤치마킹을 대체하지 않습니다. 이 페이지의 모든 발표 범위는 다른 사람의 말뭉치에서 측정된 것입니다 — 워크플로에 적용되는 유일한 정확도 수치는 직접 측정한 값입니다. 이 페이지의 가치는 측정 전에 기대치를 설정하는 데 있습니다.

자주 묻는 질문

2026년 필기 인식 정확도는 어느 정도인가요?

정확도는 거의 전적으로 문자 체계와 문서 유형에 따라 달라집니다. 현대 영어 필기의 경우 최고 수준(SOTA) 시스템이 1.22–1.71% 문자 오류율(CER)을 달성합니다(CodeSOTA 2026; Crosilla 2025). 프랑스어 필기체는 1.63–1.91%로 유사하며(Crosilla 2025; Heyberger 2024), 아랍어는 8.9–16.3% CER(IIETA 2024; MDPI 2024), 역사적 문서에 대한 범용 모델은 71–82% CER을 기록합니다(Crosilla 2025). 다양한 실제 필기 데이터에 대한 12개 상용 솔루션의 의미적 유사도 점수는 46–95% 범위입니다(AIMultiple 2026).

IAM 필기 데이터베이스에서 최고 수준(SOTA)은 무엇인가요?

2026년 기준, GPT-5는 IAM에서 ~1.22% CER을 보고했으며, GPT-4o-mini는 1.71% CER / 3.34% 단어 오류율(WER)(Crosilla 2025), 특화된 HTR-JAND는 어휘 보정을 통해 1.23% CER을 달성했습니다(CodeSOTA 2024). 동일한 말뭉치에서 트랜스포머 이전의 최고 수준(SOTA)은 약 8%의 문자 오류율에 머물렀으며(Chowdhury & Vig, 2018), 일반적인 CNN-LSTM 시스템은 7.5–8.4% WER을 기록했습니다(PyLaia — arXiv 2409.17095). 오류율은 몇 배나 감소했지만, IAM은 여전히 영어 필기의 기준 벤치마크로 남아 있습니다.

AI가 필기체를 읽을 수 있나요?

네 — 현재 최고 수준의 멀티모달 LLM은 필기체를 잘 처리합니다. AIMultiple의 2025년 벤치마크에서 의도적으로 지저분하게 작성된 필기체 샘플 100개를 대상으로, Gemini 3 Pro는 100% 의미적 유사도를 기록했으며 GPT-5와 olmOCR-2-7B가 최상위권에 올랐습니다(AIMultiple, 2025). 기존 OCR 엔진은 그룹에서 뒤처졌습니다. 필기체는 활자체보다 여전히 어렵습니다 — 문자가 연결되어 있어 분할이 모호하기 때문입니다 — 하지만 그 격차는 절대적 장벽이 아니라 모델 세대의 문제입니다.

필기 인식 정확도는 인쇄 텍스트 OCR과 어떻게 비교되나요?

인쇄 텍스트 OCR은 깨끗한 문서에서 98–99% 이상의 문자 정확도를 보여주며(참조: 문서 유형별 OCR 정확도), 최고 수준의 필기 시스템은 현대 영어에서 98.3–98.8%의 문자 정확도(1.2–1.7% CER)를 기록합니다 — 근접하지만 동일하지는 않으며, 아랍어와 중국어에서는 83–91%로 떨어지고, 역사적 문서에서는 일반 모델의 경우 30% 미만으로 떨어집니다(Crosilla 2025; IIETA 2024; PMC11951872 2024). 인쇄 텍스트와 필기 간의 격차는 모든 문자 체계에서 대략 한 자릿수입니다.

역사적 문서에서 필기 인식 정확도가 왜 이렇게 낮은가요?

역사적 문서는 오래된 문자 체계, 약어, 희미한 잉크, 그리고 현대 훈련 데이터에 없는 어휘를 결합합니다. 그 결과는 뚜렷한 모델 특화 효과입니다: 작업 특화 엔진은 READ-2016 말뭉치에서 3.6–6.2% CER에 도달하고, 글라골 문자와 같은 가장 어려운 문자 체계에서는 4.8–6.05%에 도달하는 반면(Heyberger 2024; PMC12202554 2025), 8개의 범용 LLM은 71–82% CER을 기록했습니다 — 사용할 수 없는 전사입니다(Crosilla 2025). 인식은 가능하지만, 특정 역사적 컬렉션에 대해 훈련된 모델로만 가능합니다.

필기 인식에서 좋은 CER은 얼마인가요?

HTR 문헌에서 채택된 이 분야의 실무 기준은 CER 5% 미만을 "매우 우수", 5–10%를 "우수", 2.5% 미만을 "탁월"로 정의합니다. 현대 라틴 문자 필기에서 최고 시스템은 "탁월" 범위에 있습니다. 아랍어, 중국어, 역사적 문서에서는 "매우 우수"(5–10%)가 현재 현실적인 생산 목표입니다.

필기 인식에서 CER과 WER의 차이는 무엇인가요?

문자 오류율(CER)은 개별적으로 잘못 읽은 문자를 계산하고, 단어 오류율(WER)은 전체 단어가 틀린 것을 계산하므로, 하나의 잘못 읽은 문자가 전체 단어를 실패하게 만듭니다. 필기에서 WER은 일반적으로 CER보다 2–4배 높게 나타납니다 — 아랍어 KHATT에서 8.9% CER은 37.6% WER과 공존합니다(IIETA 2024). 주장이 사용하는 지표를 항상 확인하세요: "95% 정확도"는 CER, WER 또는 문서 수준 정확도로서 매우 다른 의미를 갖습니다.

방법론 및 출처

이 페이지가 만들어진 방식

이 페이지는 2013~2026년에 걸친 15개 독립 출처의 데이터를 집계하며, 주로 동료 심사 논문, 학술 대회 보고서, 동료 심사 TPAMI 조사 논문으로 구성됩니다. 출처는 세 가지 기준으로 선정되었습니다: (1) 말뭉치 규모가 명시된 공개 문서화된 방법론, (2) 명명된 벤치마크 말뭉치(IAM, RIMES, CVL, KHATT, READ-2016, ICDAR-2013) 또는 투명한 업계 테스트 세트에 대한 결과 보고, (3) 마케팅 주장이 아닌 필기 인식과의 관련성. 여러 출처가 동일한 지표를 보고하는 경우 보수적 범위를 사용합니다 — 과소 주장을 선호합니다. 출처 간 유의미한 차이가 있는 경우, 해당 차이는 평균으로 희석하지 않고 지표 수준, 말뭉치 분할 또는 훈련 방식으로 설명합니다.

지표 구분은 이 페이지의 핵심입니다. 문자 오류율(CER), 단어 오류율(WER), 문자 정확률(CR)은 단일 숫자로 혼합되지 않으며, 작업 특화 모델과 범용 모델은 동일 문서에 대한 서로 다른 측정 체계이므로 별도 행으로 보고됩니다. 공급업체 자체 보고 수치는 완전히 제외됩니다 — 두 개의 독립 출처 검증을 통과한 공급업체 발행 필기 정확도 주장은 없었으며, 이는 그 자체로 하나의 발견입니다.

출처 목록

  1. Crosilla, G., Klic, L. & Colavizza, G. — "Benchmarking Large Language Models for Handwritten Text Recognition," Journal of Documentation 81(7) (2025). 동료 검토 논문; 8개 멀티모달 LLM × 7개 말뭉치(IAM, RIMES, READ-2016, Bentham, Leopardi, LAM, ICDAR-2017). IAM 1.71% CER/3.34% WER(GPT-4o-mini), RIMES 1.69% CER(GPT-4o), 역사적 문서 71–82% CER, <5%/<2.5% CER 품질 등급을 제공합니다.
  2. Heyberger, L. & Guyeux, C. — "Advancements and Challenges in Handwritten Text Recognition: A Comprehensive Survey," Journal of Imaging 10(1):18 (2024). 동료 검토 설문 조사; 250개 이상의 연구. 말뭉치 사양, 줄 단위 최고 수준(SOTA)(RIMES에서 VAN 1.91% CER), 별도 조정 없는 상용 결과를 제공합니다.
  3. Garrido-Muñoz, C., Ríos-Vila, A. & Calvo-Zaragoza, J. — "Handwritten Text Recognition: A Survey," IEEE TPAMI 48(4) (2026). 동료 검토 설문 조사. IAM에 대한 문단 단위 최고 수준(SOTA)(VAN 4.7%, OrigamiNet 4.6%), CTC 패러다임의 오류 58% 감소, 현재 벤치마크의 분포 외 일반화 비판을 제공합니다.
  4. CodeSOTA — "IAM Leaderboard" (2024–2026). 기술 벤치마크 집계 사이트; 각 항목은 원본 논문으로 연결됩니다. IAM에 대한 모델별 CER/WER 및 Tesseract급 OCR이 필기체 인식에 부적합하다는 점(~12.5% CER)을 제공합니다.
  5. "General Detection-based Text Line Recognition" (2024, arXiv 2409.17095). 모델 간 비교 표가 포함된 사전 인쇄본. IAM/READ/RIMES에 대한 WER 비교 및 IAM Aachen 분할 통계를 제공합니다.
  6. "Data Augmentation for Offline Handwritten Text Recognition: A Systematic Literature Review," SN Computer Science (2023). 동료 검토. 말뭉치 간 일반화 수치를 제공합니다: IAM에서 훈련된 모델이 CVL에서 10.89% CER / 26.24% WER을 기록한 반면 IAM 자체에서는 8.62% CER, CVL 말뭉치 설명을 제공합니다.
  7. "A Comparative Study of Four Handwritten Text Recognition Models," Ingénierie des Systèmes d'Information 29(6) (2024). 동료 검토; KHATT에 대한 DAN/VAN/FCN/GFCN. KHATT 최고 결과를 제공합니다: DAN 8.9% CER / 37.6% WER; VAN 10.7% CER / 43.9% WER; 아랍어 문자 체계의 과제 분석.
  8. "Machine Learning Approach for Arabic Handwritten Recognition," Applied Sciences 14(19):9020 (2024). 동료 검토; KHATT에 대한 BiLSTM-CTC. KHATT BiLSTM 결과(13.2–15.8% CER / 27.31–31.6% WER) 및 과거 기준선(MDLSTM 31.3% WER, 2015)을 제공합니다; KHATT의 1,000명 필기자 / 4,000개 문서를 기록합니다.
  9. Yin, F. 외 — "ICDAR 2013 중국어 필기 인식 대회" (2013). 학술 대회(IEEE). CASIA-HWDB 기반 테스트 세트에서 오프라인 텍스트 인식 결과 문자 정확률(CR) 88.76%를 제공합니다.
  10. "전력 산업을 위한 주의 기반 중국어 필기 인식" (2024). 동료 검토 완료. 2024년 ICDAR-2013 결과(AR 92.67% / CR 93.18%)와 HWDB 결과(AR 96.92% / CR 97.66%)를 제공하며, 중국어 오프라인 텍스트의 2013→2024년 개선 추이를 보여줍니다.
  11. "역사적 문서 디지털화를 위한 고급 필기 텍스트 인식 엔진 평가" (2025). 동료 검토 완료; 엔진 5종 × 문자 체계 4종. 문자 체계별 문자 오류율(CER)을 제공합니다: 로마자 활자체 1.74–2.78%, 크로아티아 공화국 3.54–6.32%, 글라골 문자 4.83–6.05%, 속기 9.53–11.9%.
  12. "게이트 메커니즘을 통한 필기 텍스트 인식 정확도 향상" (2024). 동료 검토 완료; GatedLexiconNet. 전용 모델의 두 번째 IAM 데이터 포인트(WER 5.73% / CER 2.27%)와 RIMES CER 0.9% / WER 2.76%를 제공합니다.
  13. AIMultiple — "필기 인식 벤치마크: LLM 대 OCR" (2025-11). 공급업체 중립 분석가 벤치마크; 필기자 10명의 필기체 샘플 100개; 코사인 유사도 파이프라인. 필기체 전용 벤치마크를 제공합니다: Gemini 3 Pro 100%, GPT-5 및 olmOCR-2-7B가 14개 솔루션 중 최상위권.
  14. AIMultiple — "OCR 벤치마크: 텍스트 추출/캡처 정확도" (2026). 공급업체 중립; 솔루션 12개 이상. 솔루션 간 필기 인식 범위 46–95%와 솔루션별 선두 주자(GPT-5 95%, olmOCR-2-7B 94%, Gemini 2.5 Pro 93%)를 제공합니다.
  15. BusinessWareTech — "필기 양식 인식 벤치마크" (2025). 독립 벤치마크, C등급; 실제 필기 양식 10개. 실제 양식에서 최고 수준의 모델도 95% 미만에 머문다는 문서 수준의 결과와 GPT-5 Mini / Gemini 2.5 Flash Lite가 선두를 차지했다는 결과를 제공합니다.

한계

  • 지리적 및 문자 체계 범위: 라틴 문자 말뭉치가 문헌을 지배합니다 — 영어(IAM), 프랑스어(RIMES), 독일어(CVL, READ). 아랍어(KHATT)와 중국어(CASIA-HWDB)는 견고하지만 범위가 더 얇습니다. 일본어, 한국어, 데바나가리 필기는 우리가 찾은 출처에서 표준화된 CER/WER 벤치마크가 전혀 없습니다. ICDAR 2023 인도어 경진대회는 유일한 집계 인도어 데이터 포인트이며, 다른 지표와 문자 세트를 사용하므로 위 표에 포함되지 않습니다.
  • 방법론 제약: 말뭉치 분할이 논문마다 다르며 동일 모델에 대해 실질적으로 다른 수치를 생성합니다 — 위 범위는 게시된 두 경우를 모두 포함합니다. 주요 말뭉치 중 샘플별 필기 스타일을 라벨링한 곳이 없어, 스타일 차원은 통제된 학술 데이터가 아닌 업계 벤치마크에 의존합니다. 클라우드 공급업체(Google, Microsoft, Amazon)는 필기 전용 정확도 측정치를 공개하지 않습니다. 이들의 "99%+" 수치는 인쇄 텍스트에 적용되며, 필기 정확도에 대한 독립적인 공급업체 측정치 두 건을 찾을 수 없었습니다 — 그래서 이 페이지에 D등급 공급업체 수치가 나타나지 않는 이유입니다.
  • 시간적 공백: ICDAR 2013 중국어 경진대회 수치(88.76% CR)는 13년 전 것으로, 동일 테스트 세트의 2024년 결과와 함께 역사적 기준점으로 사용됩니다. IAM 말뭉치는 1999년으로 거슬러 올라가지만 여전히 사실상의 영어 필기 벤치마크입니다. 2025–2026년 LLM 결과(GPT-4o-mini, GPT-5)는 가장 최신 데이터이며 변경될 것으로 예상해야 합니다.
  • 찾을 수 없었던 것: (1) 동일 말뭉치에서 활자체 대 필기체 정확도를 분리한 동료 검토 통제 연구; (2) Google Document AI, Azure Document Intelligence 또는 Amazon Textract에 대한 공급업체 공개, 방법론 투명 필기 정확도 벤치마크; (3) 혼합 인쇄+필기 문서에 대한 표준화된 벤치마크; (4) 작성자별 정확도 변동 집계; (5) IAM 기반 Crosilla 연구와 비교할 수 있는 중국어 또는 아랍어 필기에 대한 LLM 시대 벤치마크. 이러한 공백은 검증 불가능한 주장으로 채우지 않고 명시합니다.

관련 참고 자료: 문서 유형별 OCR 정확도 · 수동 데이터 입력 오류율 · 레코드당 문서 처리 비용 · 광학 문자 인식(OCR)이란 무엇인가요?

관련 읽을거리: 소규모 비즈니스를 위한 합리적인 가격의 AI 필기 추출 · AI 필기 추출 정확도가 어떻게 개선되었는가

📮 contact email: [email protected]