필기 인식 정확도:
문자 체계, 모델 및 문서 유형별 (2026)
최종 검토: 2026-08-10 · 데이터 범위: 부분 · 출처: 독립 연구 15건
이 페이지에서 다루지 않는 내용: 인쇄 텍스트 OCR 정확도(문서 유형별 OCR 성능 참조), OCR/HTR 자체의 메커니즘(OCR이란 무엇인가? 참조), 수동 데이터 입력 오류율(수동 키 입력 오류율 참조), 또는 아래에 인용된 독립적 측정을 넘어서는 특정 제품에 대한 공급업체별 성능 주장은 다루지 않습니다.
아래의 모든 수치는 방법론 섹션에 인용된 공개적으로 이용 가능한 제3자 연구 및 업계 벤치마크를 기반으로 합니다. 출처 간 불일치가 있는 경우 보수적인 범위를 사용합니다. 이 페이지는 필기 인식 연구 및 문서 디지털화 계획을 위한 방향성 벤치마크이며, 특정 엔진이나 말뭉치에 대한 정밀한 예측이 아닙니다.
2026년 최고 수준의 시스템은 IAM 벤치마크에서 현대 영어 필기를 1.22–1.71% 문자 오류율(CER)로 읽어내며, 이는 인쇄 텍스트 품질에 근접합니다. 동일한 세대의 모델을 15~19세기 문서에 적용하면 오류율은 71–82% CER로 급증합니다. 필기 인식은 단일 정확도 수치가 아니라, 문자 체계, 필기 스타일, 모델 아키텍처, 문서 유형 순으로 영향력이 정해지는 난이도 사다리입니다.
손글씨가 인쇄 텍스트보다 어려운 이유
인쇄 텍스트는 표준화된 글자 형태의 폐쇄 집합이지만, 손글씨는 개인별 특성이 반영된 개방 집합입니다. 이 페이지의 모든 모델은 동일한 세 가지 구조적 차이에 직면하며, 이것이 아래의 모든 문자 체계, 필기 스타일, 모델 아키텍처가 서로 다른 성능을 보이는 이유를 설명합니다.
첫째, 필기자 변이입니다. 같은 글자라도 사람마다 쓰는 방식이 다릅니다. IAM 말뭉치만 해도 13,353개 텍스트 줄에 걸쳐 657명의 서로 다른 필기자의 손글씨가 포함되어 있습니다(Heyberger & Guyeux, 2024) — 같은 글자가 수백 가지의 실질적으로 다른 형태로 나타나므로, 특정 필기자의 손글씨에 대한 정확도는 범용 인식에는 의미가 없습니다. 둘째, 연결된 문자입니다. 필기체 및 완전 연결 문자 체계에서는 글자가 합자로 합쳐져 명확한 분할 경계가 없습니다 — 인식 엔진은 한 문자가 끝나고 다음 문자가 시작되는 위치를 결정해야 하며, 인쇄 텍스트는 이러한 결정을 요구하지 않습니다. 아랍어가 가장 극단적인 사례입니다. 단어 내에서 완전히 연결되고 오른쪽에서 왼쪽으로 쓰이며, 단어 내 위치에 따라 글자 형태가 달라집니다. 이것이 아랍어 벤치마크가 라틴어 벤치마크보다 뒤처지는 주요 이유입니다. 셋째, 문맥 의존적이고 모호한 글자 형태입니다 — 흘려 쓴 "u"와 "n"은 세리프 방향만 다를 뿐이며, 주변 단어만이 이를 구분할 수 있습니다. 이것이 거의 모든 최신 시스템이 시각 모델과 언어 모델을 결합하는 이유입니다. IAM 말뭉치에서 어휘 또는 언어 모델을 추가하면 일반적으로 단어 오류가 3분의 1 이상 줄어듭니다.
실질적인 결과는 지속적인 지표 격차입니다. 문자 오류율(CER)은 백자당 잘못 인식된 문자 수를 나타냅니다 — 2% CER은 대략 백자당 두 개의 잘못된 문자를 의미합니다. 단어 오류율(WER)은 잘못 전사된 전체 단어 수를 나타냅니다. 단일 문자 오류가 전체 단어를 실패시키기 때문에, 손글씨의 WER은 일반적으로 CER보다 2–4배 높게 나타납니다 — 아랍어 KHATT 말뭉치에서는 CER 8.9%와 WER 37.6%가 공존합니다(IIETA, 2024). 어떤 지표와 어떤 말뭉치에 대한 것인지 명시하지 않고 하나의 숫자만 인용하는 정확도 주장은 기껏해야 불완전한 것입니다.
문자 체계는 손글씨 인식에서 모델 선택보다 더 큰 단일 정확도 결정 요인입니다. 아래 차트는 각 주요 벤치마크 말뭉치에 대해 발표된 CER 범위를 보여줍니다. 그 결과는 계단식입니다. 현대 라틴 문자 손글씨는 인쇄 품질에 가깝고, 아랍어와 중국어는 한 단계 더 어려우며, 역사적 문서는 절벽과 같습니다 — 모델이 이를 위해 훈련되지 않은 경우입니다.
문자 체계 및 언어별 분석
출처: Crosilla 외 (2025) — IAM/RIMES/READ-2016/Bentham 대상 LLM 벤치마크, 멀티모달 LLM 8종; CodeSOTA IAM 리더보드 (2024–2026) — 논문 출처 포함 모델별 CER/WER; Heyberger & Guyeux (2024) — 줄 단위 최고 수준(SOTA) 조사; Springer SNCS (2023) — CVL 교차 말뭉치 결과; IIETA (2024) 및 MDPI (2024) — KHATT 결과; ICDAR 2013 중국어 대회 및 PMC11951872 (2024) — 중국어 문자 정확률; arXiv 2409.17095 (2024) — READ-2016 작업 특화 WER. 중국어 행은 CER이 아닌 문자 정확률(CR)을 사용합니다 — 표 아래 참고 사항 확인.
| 문자 체계 / 말뭉치 | CER | WER (최고–일반적) | 출처 | 연도 | 샘플 |
|---|---|---|---|---|---|
| 영어 — IAM | 1.2–5.5% | 3.3–16.3% | CodeSOTA; Crosilla | 2024–2026 | 작성자 657명, 줄 13,353개, 단어 115,320개 |
| 프랑스어 — RIMES | 1.6–4.2% | 2.0–7.7% | Crosilla; Heyberger | 2024–2025 | 프랑스어 비즈니스 서한; 페이지 1,500장, 줄 12,723개 |
| 독일어 — CVL | 3.3–10.9% | 10.4–26.2% | Springer SNCS | 2023 | 도메인 내 약 3.3% CER; IAM 훈련 모델 교차 전이 10.89% CER / 26.24% WER |
| 아랍어 — KHATT | 8.9–16.3% | 27.3–43.9% | IIETA; MDPI | 2024 | 작성자 1,000명, 문서 4,000개; 완전 연결형 오른쪽-왼쪽 문자 체계 |
| 중국어 — CASIA-HWDB / ICDAR-2013 | 문자 오류 6.8–11.2% | — | ICDAR 2013; PMC11951872 | 2013–2024 | 작성자 1,020명; 오프라인 텍스트 인식 88.76% CR (2013) → 93.18% CR (2024) (ICDAR-2013 테스트 세트 기준) |
| 역사적 독일어 — READ-2016 | 3.6–6.2% | 4.1–5.5% | Heyberger; arXiv 2409.17095 | 2016–2024 | 15~19세기 시의회 회의록 30,000페이지; VAN 3.59% CER, DAN 4.10% WER |
| 역사적 영어/독일어 — Bentham & READ | 71–82% | 95–100% | Crosilla | 2025 | 멀티모달 LLM 8개, 제로샷/미세 조정; 전사 결과 사용 불가 판정 |
위 표에 명시된 출처. 두 가지 지표 관련 참고 사항: (1) 중국어 행은 문자 정확률(CR)을 보고하며, 이는 ICDAR 2013 대회와 이후 논문들에서 사용된 지표입니다. CR은 올바르게 인식된 문자를 집계하지만 CER처럼 삽입 오류에 패널티를 부과하지 않으므로, 방향성은 유사하나 CER과 완전히 동일하지는 않습니다. (2) 역사적 문서 행은 모델 유형별로 의도적으로 구분했습니다. 작업 특화 엔진과 범용 LLM은 동일한 문서에서도 서로 다른 성능 특성을 보입니다. 자세한 내용은 모델 아키텍처별 분석을 참조하십시오.
필기 스타일은 실무자가 가장 먼저 체감하는 차원이면서도 데이터가 가장 부족한 영역입니다. 주요 벤치마크 말뭉치 중 각 샘플을 활자체 또는 필기체로 분류한 경우는 없으므로, 활자체 대비 필기체의 성능 격차는 업계 벤치마크와 말뭉치 자체의 구성에 근거합니다.
필기 스타일별 분석
| 필기 스타일 | 관측 정확도 | 근거 | 출처 | 연도 |
|---|---|---|---|---|
| 활자체 | 더 쉬운 기준선; 최상위 시스템은 인쇄물 수준에 근접 | AIMultiple: "원고 스타일의 텍스트는 문자가 블록 형태로 분리되어 작성되므로 인식이 더 쉽습니다"; 통제된 학술 벤치마크는 없음 | AIMultiple | 2025 |
| 필기체 | 100개 샘플 벤치마크: Gemini 3 Pro 100%, GPT-5 및 olmOCR-2-7B 최상위권 | 작성자 10명 × 필기체 문단 10개, 자연스러운 연결과 기울기 유지; 의미적 유사도 기준 14개 솔루션 순위 평가 | AIMultiple 필기체 벤치마크 | 2025 |
| 필기체 | CER 1.6–3.7% | RIMES(프랑스어 필기체 서신)와 CVL은 해당 말뭉치로 모델을 학습시키면 IAM 수준의 CER에 도달합니다. 스타일 난이도는 학습 가능한 요소이지 본질적 특성이 아닙니다. | Crosilla; Springer SNCS | 2023–2025 |
| 혼합 | 최고 모델도 문서 수준 95% 미만 | 활자체, 필기체, 혼합 스타일을 포함한 실제 필기 양식 10개: GPT-5 Mini와 Gemini 2.5 Flash Lite가 선두였지만, "최고 모델조차 비즈니스 수준 정확도 95% 이상 달성에 어려움을 겪습니다" | BusinessWareTech | 2025 |
위 표에 출처를 정리했습니다. 데이터 공백도 정직하게 밝힙니다. 활자체 대비 필기체 정확도를 통제된 스타일 라벨 말뭉치로 분리해 검증한 동료 검토 연구는 아직 없습니다. RIMES와 CVL은 우연히 필기체이고 IAM은 혼합형이지만, 각 샘플에 스타일을 라벨링한 벤치마크는 없습니다. 따라서 이 문서의 스타일 차원은 AIMultiple 필기체 전용 벤치마크와 동료 검토 결과의 말뭉치 구성에 기반하며, 직접적인 학술적 스타일 비교는 아직 존재하지 않는다는 한계를 명시합니다.
모델 아키텍처는 10년 동안 동일한 IAM 말뭉치에서 오류율을 약 5배 줄였습니다. 아래 리더보드 추이는 필기 인식 정확도가 어떻게 개선되었는지 보여주는 가장 명확한 공개 기록이며, '정확도'가 모델 훈련 방식에 가장 크게 좌우되는 축이기도 합니다.
모델 아키텍처별 분석
| 아키텍처 | 시기 | IAM CER | IAM WER(최고) | 대표 모델 | 출처 |
|---|---|---|---|---|---|
| CNN-LSTM + CTC | 2016–2022 | ~4.1–5.5% | 5.0–16.3% | DAN 5.01 WER; Start-Follow-Read 6.4; PyLaia 7.5–8.4; VAN 16.3 / 4.45 CER | arXiv 2409.17095; CodeSOTA |
| 트랜스포머 | 2021–2024 | 2.38–2.89% | ~2.4–2.9%(보고 기준) | TrOCR 2.89% CER(2021); DTrOCR 2.38% CER(WACV 2024); HTR-VT 14.9 WER(사전 훈련 없음) | CodeSOTA; IIETA |
| 멀티모달 LLM(VLM) | 2025–2026 | 1.22–1.75% | 3.34–3.59% | GPT-5 ~1.22% CER(2026); GPT-4o-mini 1.71% CER / 3.34% WER(2025); Claude 3.5 Sonnet 1.75% CER | CodeSOTA; Crosilla |
| 범용 OCR 엔진 | 2023–2026 | RIMES 말뭉치: 11–18% CER, 33–53% WER | DOCSUMO 11% CER; Transkribus 18% CER; Ocelus 15% CER | Heyberger | |
위 표에 출처를 정리했습니다. 마지막 행을 제외한 모든 행은 동일한 IAM 말뭉치에서 발표된 최고 결과를 비교하며, 마지막 행은 설문 조사의 별도 조정 없는 상용 엔진 평가를 RIMES에서 보고한 것입니다. 이는 조정되지 않은 상용 엔진이 익숙하지 않은 말뭉치에서 2016년 연구 모델에 가깝게 작동한다는 점을 보여주기 위해 포함했습니다. 동일한 분할에서의 아키텍처 간 비교는 드물며, IAM 'Aachen 분할'과 표준 분할은 동일 모델에서도 다른 수치를 산출합니다.
문서 유형에 따라 이론적 정확도가 실제 환경에서 얼마나 유지되는지가 결정됩니다. 깨끗한 벤치마크 말뭉치는 줄 단위로 구분되고 평범한 종이에 작성되지만, 실제 문서는 겹치는 필드가 있는 양식, 여백에 메모가 있는 편지, 약어와 희미한 잉크가 있는 필사본으로 제공됩니다. 계획을 세울 때 기준이 되는 수치는 벤치마크 상한이 아니라 문서 유형별로 발표된 범위입니다.
문서 유형별 분석
| 문서 유형 | 정확도 범위 | 맥락 | 출처 | 연도 |
|---|---|---|---|---|
| 표준 수기 작성 양식 | 최고 모델 <95% 문서 수준 | 실제 양식 10개, 활자체/필기체/혼합; GPT-5 Mini와 Gemini 2.5 Flash Lite가 선두; 구조화 필드 추출은 판독 오류 위에 필드 수준 실패를 추가함 | BusinessWareTech | 2025 |
| 자유 형식 편지 | 문자 오류율(CER) 1.2–1.9%(최고 수준(SOTA)), 11–18%(별도 조정 없는 상용) | IAM과 RIMES는 편지 데이터셋; 동일 말뭉치에서 최고 수준(SOTA)과 조정되지 않은 상용 엔진 간 격차는 한 자릿수 이상임 | Crosilla; Heyberger | 2024–2025 |
| 역사적 문서 | 문자 오류율(CER) 3.6–6.2%(작업 특화 엔진) / 71–82%(범용 LLM) | READ-2016, Bentham, Glagolitic 문자 체계; 약어, 고어, 문자 체계 복잡성으로 인해 전용 엔진도 가장 어려운 문자 체계에서 4.8–6.05% 문자 오류율(CER)을 기록 | arXiv 2409.17095; PMC12202554; Crosilla | 2024–2025 |
| 실제 메모 / 혼합 문서 | 솔루션별 의미적 유사도 46–95% | AIMultiple의 다양한 필기에 대한 12개 솔루션 OCR 벤치마크; LLM 기반 솔루션이 93–95%로 선두, 기존 OCR 엔진은 범위 하단에 위치 | AIMultiple | 2026 |
출처는 위 표에 명시되어 있습니다. "자유 형식 편지" 행은 문자 오류율(CER)을, "실제 메모"는 의미적 유사도 점수를 사용합니다. 서로 다른 측정 척도이므로 혼합하지 않고 별도로 표시했습니다. 46–95% 범위는 현대와 역사적, 깨끗한 문서와 지저분한 문서를 하나의 측정으로 아우르는 유일한 수치입니다.
이 데이터 사용 방법
벤치마크를 실행하지 않아도 "필기 인식 정확도"라는 공급업체 수치를 자체 문서에 대한 합리적인 기대치로 전환할 수 있습니다. 위 표를 활용한 4단계 간이 검증만으로 충분하며, 일반적으로 핵심 수치는 자체 처리 문서와 다른 문서 유형에서 측정된 경우가 많다는 점이 드러납니다.
- 문서 유형을 분류하세요. 네 가지 질문에 답하세요: 문자 체계, 필기 스타일, 문서 유형, 그리고 시스템이 학습된 말뭉치가 이와 유사한지 여부입니다. 라틴 문자 기반 현대 양식은 쉬운 범주이고, 비라틴 문자 체계의 19세기 필사본은 어려운 범주입니다 — 위 표는 각 범주에 고유한 범위를 제공합니다.
- 정직한 지표를 선택하세요. 다운스트림 프로세스가 백자당 몇 개의 오류 문자를 허용할 수 있다면 CER 범위를 사용하고, 전체 단어가 중요하다면 WER 범위를 사용하며, 한 필드 오류가 레코드 전체를 실패시키는 양식에는 문서 수준 정확도를 사용하세요. 동일한 시스템이 1.7% CER, 3.3% WER, 80% 필드 수준 정확도를 동시에 보여줄 수 있습니다.
- 모델 특화 할인을 적용하세요. 엔진이 자체 문서 유형에 대해 학습 또는 미세 조정된 경우, 최고 수준의 CER이 도달 가능합니다. 별도 조정 없는 범용 시스템이라면, 익숙하지 않은 필기체에 대해 11–18% CER 범위(Heyberger 2024) 또는 역사적 문서에 대해 71–82% 범위(Crosilla 2025)를 예산에 반영하세요.
- 검토 대기열 규모를 산정하세요. 각각 50단어로 구성된 필기 페이지 200장에서 WER 3%라면, 수정 전 배치당 약 300개의 오류 단어가 예상됩니다(200 × 50 × 3%). 아랍어 문서에서 CER 16%라면 동일 배치에 수천 개의 의심 문자(character)가 있습니다 — 산술 계산에 따라 인간 검토, 신뢰도 임계값 또는 사전 기반 사후 수정 단계가 경제적으로 필요한지 결정됩니다.
이는 대략적인 추정 공식이며, 자체 문서에 대한 벤치마킹을 대체하지 않습니다. 이 페이지의 모든 게시된 범위는 다른 사람의 말뭉치에서 측정된 것입니다 — 워크플로우에 적용되는 유일한 정확도 수치는 자체 측정 결과입니다. 이 페이지의 가치는 측정 전에 기대치를 설정하는 데 있습니다.
자주 묻는 질문
2026년 필기 인식 정확도는 어느 정도인가요?
정확도는 문자 체계와 문서 유형에 거의 전적으로 달려 있습니다. 현대 영어 필기의 경우, 최고 성능 시스템이 1.22–1.71% CER을 달성합니다(CodeSOTA 2026; Crosilla 2025). 프랑스어 필기체는 1.63–1.91%로 유사하며(Crosilla 2025; Heyberger 2024), 아랍어는 8.9–16.3% CER(IIETA 2024; MDPI 2024), 역사적 문서를 대상으로 한 일반 모델은 71–82% CER을 기록합니다(Crosilla 2025). 다양한 실제 필기를 대상으로 한 12개 상용 솔루션 평가에서 의미적 유사도 점수는 46–95% 범위입니다(AIMultiple 2026).
IAM 필기 데이터베이스에서 최고 수준(SOTA)은 무엇인가요?
2026년 기준, GPT-5는 IAM에서 ~1.22% CER을 보고했으며, GPT-4o-mini는 1.71% CER / 3.34% WER(Crosilla 2025), 사전 훈련된 HTR-JAND는 사전 보정을 통해 1.23% CER을 달성했습니다(CodeSOTA 2024). 동일한 말뭉치에서 트랜스포머 이전 최고 수준은 약 8%의 문자 오류율에 머물렀으며(Chowdhury & Vig, 2018), 일반적인 CNN-LSTM 시스템은 7.5–8.4% WER을 기록했습니다(PyLaia — arXiv 2409.17095). 오류율은 몇 배나 감소했지만, IAM은 여전히 영어 필기의 기준 벤치마크로 남아 있습니다.
AI가 필기체를 읽을 수 있나요?
네 — 현재 최고 수준의 멀티모달 모델은 필기체를 잘 처리합니다. AIMultiple의 2025년 벤치마크에서 Gemini 3 Pro는 100% 의미적 유사도를 기록했으며, GPT-5와 olmOCR-2-7B가 최상위권에 올랐습니다(AIMultiple, 2025). 반면 기존 OCR 엔진은 그룹 내에서 뒤처졌습니다. 필기체는 활자체보다 여전히 어렵습니다. 문자가 연결되어 있어 분할이 모호하기 때문입니다. 그러나 그 격차는 모델 세대의 문제이지, 절대적인 한계는 아닙니다.
필기 인식 정확도는 인쇄 텍스트 OCR과 어떻게 비교되나요?
인쇄 텍스트 OCR은 깨끗한 문서에서 98–99%+ 문자 정확도를 보여주며, 최고 수준의 필기 시스템은 현대 영어에서 98.3–98.8% 문자 정확도(1.2–1.7% CER)에 도달합니다 — 근접하지만 동일하지는 않으며 — 아랍어와 중국어에서는 83–91%로 떨어지고, 역사적 문서에서는 일반 모델의 경우 30% 미만입니다(Crosilla 2025; IIETA 2024; PMC11951872 2024). 인쇄 텍스트와 필기 간의 격차는 모든 문자 체계에서 대략 한 자릿수입니다.
역사적 문서에서 필기 인식 정확도가 왜 이렇게 낮은가요?
역사적 문서는 오래된 문자 체계, 약어, 바랜 잉크, 그리고 현대 훈련 데이터에 없는 어휘를 결합합니다. 그 결과는 뚜렷한 모델 특화 효과입니다: 작업 특화 엔진은 READ-2016 말뭉치에서 3.6–6.2% CER에 도달하고, 글라골 문자와 같은 가장 어려운 문자 체계에서는 4.8–6.05%에 도달하는 반면(Heyberger 2024; PMC12202554 2025), 8개의 범용 LLM은 71–82% CER을 기록했습니다 — 사용할 수 없는 전사 결과입니다(Crosilla 2025). 인식은 가능하지만, 특정 역사적 컬렉션에 맞게 훈련된 모델이 있어야만 가능합니다.
필기 인식에서 좋은 CER은 얼마인가요?
HTR 문헌에서 채택된 이 분야의 실무 기준은 CER 5% 미만을 "매우 우수", 5–10%를 "우수", 2.5% 미만을 "탁월"로 정의합니다. 현대 라틴 문자 필기에서 최고 수준의 시스템은 "탁월" 범위에 있습니다. 아랍어, 중국어, 역사적 문서에서는 "매우 우수"(5–10%)가 현재 현실적인 생산 목표입니다.
필기 인식에서 CER과 WER의 차이는 무엇인가요?
문자 오류율(CER)은 개별적으로 잘못 읽은 문자를 집계하고, 단어 오류율(WER)은 전체 단어가 틀린 것으로 집계하므로, 문자 하나를 잘못 읽으면 전체 단어가 실패합니다. 필기에서 WER은 일반적으로 CER보다 2–4배 높게 나타납니다 — 아랍어 KHATT에서는 8.9% CER이 37.6% WER과 공존합니다(IIETA 2024). 주장이 어떤 지표를 사용하는지 항상 확인하세요: "95% 정확도"는 CER, WER 또는 문서 수준 정확도로서 매우 다른 의미를 갖습니다.
방법론 및 출처
이 페이지의 작성 방식
이 페이지는 2013~2026년에 걸친 15개의 독립적인 출처에서 데이터를 집계했으며, 동료 검토 논문, 학술 대회 보고서, 동료 검토 TPAMI 조사가 주를 이룹니다. 출처는 세 가지 기준에 따라 선정되었습니다: (1) 말뭉치 규모가 명시된 공개 문서화된 방법론, (2) 명명된 벤치마크 말뭉치(IAM, RIMES, CVL, KHATT, READ-2016, ICDAR-2013) 또는 투명한 업계 테스트 세트에 대해 보고된 결과, (3) 마케팅 주장이 아닌 필기 인식과의 관련성. 여러 출처가 동일한 측정 기준을 보고하는 경우, 보수적인 범위를 사용합니다 — 과소 주장을 선호합니다. 출처 간에 상당한 불일치가 있는 경우, 그 불일치는 평균으로 희석하지 않고 측정 기준 수준, 말뭉치 분할, 또는 훈련 방식으로 설명합니다.
측정 기준의 구분이 이 페이지의 핵심입니다: CER, WER, 문자 정확률(CR)은 단일 숫자로 혼합되지 않으며, 작업 특화 모델과 범용 모델은 동일한 문서에 대한 서로 다른 측정 체계이므로 별도의 행으로 보고됩니다. 공급업체 자체 보고 수치는 완전히 제외됩니다 — 두 개의 독립적인 출처 검증을 통과한 공급업체 게시 필기 인식 정확도 주장은 없었으며, 이는 그 자체로 하나의 발견입니다.
출처 목록
- Crosilla, G., Klic, L. & Colavizza, G. — "Benchmarking Large Language Models for Handwritten Text Recognition," Journal of Documentation 81(7) (2025). 동료 검토 완료; 8개 멀티모달 LLM × 7개 말뭉치(IAM, RIMES, READ-2016, Bentham, Leopardi, LAM, ICDAR-2017). IAM 1.71% CER/3.34% WER(GPT-4o-mini), RIMES 1.69% CER(GPT-4o), 역사적 문서 71–82% CER, <5%/<2.5% CER 품질 기준을 제공합니다.
- Heyberger, L. & Guyeux, C. — "Advancements and Challenges in Handwritten Text Recognition: A Comprehensive Survey," Journal of Imaging 10(1):18 (2024). 동료 검토 완료된 조사 논문; 250개 이상의 연구 포함. 말뭉치 사양, 줄 단위 최고 수준(SOTA)(RIMES에서 VAN 1.91% CER), 별도 조정 없는 상용 결과를 제공합니다.
- Garrido-Muñoz, C., Ríos-Vila, A. & Calvo-Zaragoza, J. — "Handwritten Text Recognition: A Survey," IEEE TPAMI 48(4) (2026). 동료 검토 완료된 조사 논문. IAM에 대한 문단 단위 최고 수준(SOTA)(VAN 4.7%, OrigamiNet 4.6%)과 CTC 패러다임의 오류 58% 감소, 그리고 현재 벤치마크에 대한 분포 외 일반화 비판을 제공합니다.
- CodeSOTA — "IAM Leaderboard" (2024–2026). 기술 벤치마크 집계 사이트; 각 항목은 원본 논문으로 연결됩니다. IAM에 대한 모델별 CER/WER과 Tesseract급 OCR이 필기체 인식에 부적합하다는 점(~12.5% CER)을 제공합니다.
- "General Detection-based Text Line Recognition" (2024, arXiv 2409.17095). 모델 간 비교 표가 포함된 사전 인쇄본. IAM/READ/RIMES에 대한 WER 비교와 IAM Aachen 분할 통계를 제공합니다.
- "Data Augmentation for Offline Handwritten Text Recognition: A Systematic Literature Review," SN Computer Science (2023). 동료 검토 완료. 말뭉치 간 일반화 수치를 제공합니다: IAM에서 훈련된 모델이 CVL에서 10.89% CER / 26.24% WER을 기록한 반면 IAM 자체에서는 8.62% CER을 기록했으며, CVL 말뭉치 설명도 포함합니다.
- "A Comparative Study of Four Handwritten Text Recognition Models," Ingénierie des Systèmes d'Information 29(6) (2024). 동료 검토 완료; KHATT에 대한 DAN/VAN/FCN/GFCN 비교. KHATT 최고 결과를 제공합니다: DAN 8.9% CER / 37.6% WER; VAN 10.7% CER / 43.9% WER; 아랍어 문자 체계의 과제 분석도 포함합니다.
- "Machine Learning Approach for Arabic Handwritten Recognition," Applied Sciences 14(19):9020 (2024). 동료 검토 완료; KHATT에 대한 BiLSTM-CTC. KHATT BiLSTM 결과(13.2–15.8% CER / 27.31–31.6% WER)와 과거 기준선(MDLSTM 31.3% WER, 2015)을 제공하며, KHATT의 필기자 1,000명 / 문서 4,000건을 기록합니다.
- Yin, F. 외 — "ICDAR 2013 중국어 필기 인식 대회" (2013). 학술 대회(IEEE). CASIA-HWDB 기반 테스트 세트에서 오프라인 텍스트 인식 결과 문자 정확률(CR) 88.76%를 제공합니다.
- "전력 산업을 위한 주의 기반 중국어 필기 인식" (2024). 동료 검토 완료. 2024년 ICDAR-2013 결과(AR 92.67% / CR 93.18%)와 HWDB 결과(AR 96.92% / CR 97.66%)를 제공하여 중국어 오프라인 텍스트의 2013→2024 개선 추이를 보여줍니다.
- "역사적 문서 디지털화를 위한 고급 필기 텍스트 인식 엔진 평가" (2025). 동료 검토 완료; 엔진 5종 × 문자 체계 4종. 문자 체계별 문자 오류율(CER)을 제공합니다: 로마자 활자체 1.74–2.78%, 크로아티아 공화국 3.54–6.32%, 글라골 문자 4.83–6.05%, 속기 9.53–11.9%.
- "게이트 메커니즘을 통한 필기 텍스트 인식 정확도 향상" (2024). 동료 검토 완료; GatedLexiconNet. 두 번째 IAM 데이터 포인트(WER 5.73% / CER 2.27%)와 전용 모델의 RIMES CER 0.9% / WER 2.76%를 제공합니다.
- AIMultiple — "필기 인식 벤치마크: LLM vs OCR" (2025-11). 공급업체 중립 분석가 벤치마크; 필기자 10명의 필기체 샘플 100개; 코사인 유사도 파이프라인. 필기체 전용 벤치마크를 제공합니다: Gemini 3 Pro 100%, GPT-5 및 olmOCR-2-7B가 14개 솔루션 중 최상위권.
- AIMultiple — "OCR 벤치마크: 텍스트 추출/캡처 정확도" (2026). 공급업체 중립; 솔루션 12개 이상. 솔루션 간 필기 인식 범위 46–95%와 솔루션별 선두 주자(GPT-5 95%, olmOCR-2-7B 94%, Gemini 2.5 Pro 93%)를 제공합니다.
- BusinessWareTech — "필기 양식 인식 벤치마크" (2025). 독립 벤치마크, C등급; 실제 필기 양식 10개. 실제 양식에서 최고 성능 모델도 95% 미만에 머문다는 문서 수준의 결과와 GPT-5 Mini / Gemini 2.5 Flash Lite가 선두를 차지했다는 결과를 제공합니다.
한계
- 지리적 및 문자 체계 범위: 라틴 문자 말뭉치가 문헌을 지배합니다 — 영어(IAM), 프랑스어(RIMES), 독일어(CVL, READ). 아랍어(KHATT)와 중국어(CASIA-HWDB)는 견고하지만 범위가 더 얇습니다. 일본어, 한국어, 데바나가리 필기체는 우리가 찾은 출처에서 표준화된 CER/WER 벤치마크가 전혀 없습니다. ICDAR 2023 인도 경진대회는 유일한 집계 인도 데이터 포인트이며, 다른 지표와 문자 체계 세트를 사용하기 때문에 위 표에 포함되지 않았습니다.
- 방법론 제약: 말뭉치 분할이 논문마다 다르며, 동일한 모델에 대해 실질적으로 다른 수치를 산출합니다 — 위 범위는 두 분할이 게시된 곳을 모두 포함합니다. 주요 말뭉치 중 샘플별 필기 스타일을 라벨링한 곳은 없으므로, 스타일 차원은 통제된 학술 데이터가 아닌 업계 벤치마크에 의존합니다. 클라우드 공급업체(Google, Microsoft, Amazon)는 필기체 전용 정확도 측정치를 공개하지 않습니다. 이들의 "99%+" 수치는 인쇄 텍스트에 적용되며, 필기체 정확도에 대한 독립적인 공급업체 측정치 두 건을 찾을 수 없었습니다 — 그래서 이 페이지에 D등급 공급업체 수치가 나타나지 않는 이유입니다.
- 시간적 공백: ICDAR 2013 중국어 경진대회 수치(88.76% CR)는 13년 전의 것으로, 동일한 테스트 세트의 2024년 결과와 함께 역사적 기준점으로 사용됩니다. IAM 말뭉치는 1999년으로 거슬러 올라가지만 여전히 사실상의 영어 필기체 벤치마크입니다. 2025–2026년 LLM 결과(GPT-4o-mini, GPT-5)는 가장 최신 데이터이며 변경될 것으로 예상해야 합니다.
- 찾을 수 없었던 것: (1) 동일한 말뭉치에서 활자체 vs 필기체 정확도를 분리한 동료 검토 통제 연구; (2) Google Document AI, Azure Document Intelligence 또는 Amazon Textract에 대한 공급업체 게시, 방법론 투명 필기체 정확도 벤치마크; (3) 혼합 인쇄+필기 문서에 대한 표준화된 벤치마크; (4) 작성자별 정확도 변동 집계; (5) IAM 기반 Crosilla 연구와 비교할 수 있는 중국어 또는 아랍어 필기체에 대한 LLM 시대 벤치마크. 이러한 공백은 검증 불가능한 주장으로 채우지 않고 명시합니다.
관련 참고 자료: 문서 유형 정확도 벤치마크 · 인간 전사 오류율 · 레코드당 문서 처리 비용 · 광학 문자 인식(OCR)이란 무엇인가요?
관련 읽을거리: 소규모 비즈니스를 위한 저렴한 AI 필기체 추출 · AI 필기체 추출 정확도가 어떻게 향상되었는가