문서 유형별 OCR 정확도: 디지털 PDF, 스캔,
필기 및 테이블 벤치마크(2026)
최종 검토: 2026-08-10 · 데이터 범위: 일부 · 출처: 독립 연구 16건
이 페이지에서 다루지 않는 내용: 수동 데이터 입력 오류율(수동 데이터 입력 오류율 참조), OCR 자체의 메커니즘(OCR이란 무엇인가? 참조), 또는 아래에 인용된 벤치마크 수치를 넘어서는 특정 제품에 대한 벤더별 주장입니다.
아래의 모든 수치는 방법론 섹션에 인용된 공개적으로 이용 가능한 제3자 연구 및 업계 보고서를 기반으로 합니다. 출처 간 불일치가 있는 경우 보수적인 범위를 사용합니다. 이 페이지는 방향성 벤치마크이며, 특정 엔진이나 조직에 대한 정밀한 예측이 아닙니다.
모든 OCR 벤더는 "99% 정확도"라는 표현을 인용합니다. 독립 연구 16건을 살펴보면, 이 수치는 정확히 하나의 문서 조건, 즉 모든 주요 엔진이 99.2% 이상을 기록하는 깨끗한 디지털 생성 텍스트에서만 사실이며, 그 외의 모든 경우에는 점점 더 사실에서 멀어집니다. 선명한 스캔은 98–99%로 떨어지고, 역사적·손상된 스캔본은 71–98%, 필기는 솔루션에 따라 46–95%의 분포를 보이며, 훼손된 원본은 72.7%까지 낮아집니다. 이 수치는 거짓말이 아닙니다. 보편적인 것처럼 제시된 문서 유형별 측정값일 뿐입니다.
"99%" 수치의 출처 — 그리고 왜 오해를 부르는가
99% 수치는 선명한 인쇄 텍스트에 대한 문자 수준 측정값이며, 문자 수준 정확도는 사용 가능한 지표 중 가장 유리한 기준입니다. 이를 이해하고 다른 세 가지 기준을 함께 살펴보면, 동일한 시스템에서 "OCR 정확도 99%"와 "필드 정확도 78%"가 동시에 성립할 수 있는 이유가 설명됩니다.
문자 오류율(CER)은 개별적으로 잘못 인식된 문자를 집계합니다. CER 1%는 대략 100자당 한 글자 오류를 의미합니다. 인쇄 텍스트에 대해 널리 채택된 벤치마크 기준은 우수한 OCR을 98–99% 정확도(1–2% CER), 평균을 90–98%(2–10% CER), 저조를 90% 미만으로 정의합니다(Holley, 2009). 유럽 데이터 보호 위원회의 OCR 지침은 일반적인 인쇄 문서 성능을 95–99% 문자 정확도로 독립적으로 제시하며, 98–99%를 생산 등급 보증 수준으로 간주합니다(EDPB, 2024).
문제는 문자 정확도가 사용되는 지표 중 가장 덜 까다로운 기준이라는 점입니다. 2,000자 문서의 문자 정확도가 99%라도 여전히 약 20자의 오류가 포함됩니다. 단어 수준에서는 한 글자의 오류가 전체 단어를 실패시키므로 동일한 출력이 96–98%로 평가될 수 있습니다. 필드 수준 — 인보이스 번호나 날짜 추출에 중요한 기준 — 에서는 한 자리 숫자 오류가 전체 필드를 실패시키므로, 문자 정확도 99% 시스템도 엔진에 따라 78–98%의 필드 정확도만 제공할 수 있습니다. 테이블에는 네 번째 지표가 적용됩니다: 트리 편집 거리 유사도(TEDS) — 추출된 테이블 구조와 셀 내용이 원본과 일치하는지 평가하며, 문자 정확도와는 완전히 다른 축입니다.
역사적 기록은 선명한 텍스트의 한계가 얼마나 높은지 보여줍니다. UNLV 정보과학연구소는 1992–1995년 기계 인쇄 영어 페이지에 대해 연례 OCR 정확도 테스트를 실시했습니다. 최고 상용 시스템은 약 94%에서 98% 이상의 문자 정확도로 상승한 후 대체로 정체되었습니다(Rice, Jenkins & Nartker, 1995). NIST도 1998년 평가에서 동일한 결론에 도달했습니다: 1% 문자 오류율은 원본이 선명하고 고정 형식의 타자 원본일 때만 달성 가능합니다(NIST IR 6101, 1998). 25년간의 딥러닝 발전이 그 한계를 끌어올렸지만, 가장 선명한 입력에 대해서만 그렇습니다.
문서 유형은 OCR 정확도의 가장 큰 단일 요인입니다 — 엔진 선택보다 더 큽니다. 아래 차트는 각 문서 클래스에 대해 발표된 범위를 표시합니다. 최저값과 최고값 사이의 폭이 정직한 답변이지, 단일 "평균"이 아닙니다. 손상되거나 필기된 문서는 범위가 너무 넓어서 단일 추정치는 적극적으로 오해를 불러일으킬 수 있습니다.
문서 유형별 분석
출처: IntuitionLabs (2025) — 모든 엔진이 쉬운 타이핑 텍스트에서 >99.2%; Holley (2009) — 선명한 인쇄물 98–99% "양호" 벤치마크; 손상된 호주 신문(1803–1954) 원시 문자 신뢰도 71–98.02%; AIMultiple (2026) — 12개 솔루션에서 필기 46–95%; GatedLexiconNet (2024) — IAM 단어 정확도 ~94.3%; IJSAT (2026) — 훼손된 원본 300 DPI에서 72.7–94.7%. 출처 간 차이가 있는 경우 보수적 범위를 사용했습니다.
| 문서 유형 / 상태 | 정확도 범위 | 중간값 | 출처 | 연도 | 샘플 |
|---|---|---|---|---|---|
| 디지털 생성 PDF | 99.2–99.8% | 99.5% | IntuitionLabs; ABBYY(벤더 주장) | 2025 | 쉬운 타자 텍스트에서 모든 엔진 >99.2% |
| 선명한 스캔 인쇄물(300 DPI) | 98–99% | 98.5% | Holley; EDPB | 2009 / 2024 | "우수 OCR" 벤치마크; NLA 디지털화 컬렉션 |
| 스캔 — 손상·오래된 스캔본 | 71–98% | ~85% | Holley | 2009 | 신문 30개 이상 제호, 1803–1954, 원시 문자 신뢰도 |
| 필기 — 최신 최고 시스템 | 단어 94–99% | 96% | GatedLexiconNet; LLM HTR 벤치마크 | 2024–2025 | IAM; RIMES(프랑스어 편지) |
| 필기 — 솔루션별 범위 | 46–95% | ~70% | AIMultiple | 2026 | 솔루션 12개, SBERT 유사도 점수 |
| 훼손된 원본 사진 | 72.7–94.7% | ~84% | IJSAT | 2026 | EasyOCR; 일반 vs 구겨짐/오염/젖음, 300 DPI |
| 표 — 구조 | TEDS 0.91–0.97 | 0.94 | PubTabNet 리더보드(MuTabNet 0.969); TrOCR-ctx (0.909) | 2024–2025 | PubTabNet 말뭉치, TEDS 구조 유사도 |
| 표 — 감지 | 가중 F1 0.49–0.53 | 0.51 | ICDAR 2019 cTDaR | 2019 | 아카이브 트랙, IoU 0.6–0.9에서 가중 F1 |
위 표에 나열된 출처를 기준으로 합니다. 문자/단어 수치는 동료 심사 완료 연구 및 정부 연구에서 비롯되었으며, 벤더가 주장한 수치는 별도로 표시했습니다. TEDS와 wF1은 구조 수준 지표로, 문자 정확도와 직접 비교할 수 없습니다. 자세한 내용은 정확도 범위가 넓은 이유를 참조하세요. 가장 심한 손상 행의 경우, 71% 하한선은 2009년에 가장 성능이 낮은 역사적 신문 타이틀을 대상으로 측정한 값입니다. 유사한 문서에 대한 최신 엔진의 성능은 이보다 훨씬 우수합니다.
해상도는 가장 통제하기 쉬운 정확도 변수이지만, 공개된 증거는 벤더 블로그가 시사하는 것보다 빈약합니다. 유일하게 엄격한 정부 연구인 미국 정부출판국(GPO)의 오래되고 변색된 문서 대상 테스트에서는 더 높은 DPI가 아니라 컬러(RGB) 캡처가 결정적 요인임을 발견했습니다. RGB 스캔은 GPO의 99% 문자 정확도 요건을 충족한 반면, 동일 문서의 비트맵 스캔은 ~77%에 그쳤고, 300 DPI에서 200 DPI로 다운샘플링해도 정확도 향상은 없었습니다.
DPI 및 스캔 품질별 분석
| 스캔 해상도/모드 | 관찰된 효과 | 출처 | 연도 |
|---|---|---|---|
| 300 DPI 이상 | 선명한 인쇄물에서 98–99% 문자 정확도 충족, 10pt 미만 글꼴은 400–600 DPI 권장 | 피츠버그대 OCR 가이드; 미국 GPO | 2024 / ~2022 |
| 200 DPI | 선명한 인쇄물에서 충분함, GPO 테스트에서 300 DPI에서 다운샘플링해도 인식 결과는 동일 | 미국 GPO | ~2022 |
| 150 DPI 미만 | 영향이 큰 열화 요인으로 분류, 작은 글꼴은 인식 실패, 정확도가 98–99% 선명도 구간 아래로 하락 | LlamaIndex 용어집, 열화 하한선은 IJSAT(2026) 기준 | 2026 |
| 72 DPI | 신뢰할 수 있는 문자 판별에 필요한 픽셀 밀도 부족, 정확도에 "영향이 큰" 요인으로 분류 | LlamaIndex 용어집 | 2026 |
| 노후 문서의 컬러(RGB) vs 비트맵 스캔 | 오래되고 변색된 원본에서 RGB는 99%, 비트맵은 ~77% 기록 | 미국 GPO | ~2022 |
위 표에 나열된 출처입니다. 솔직한 한계를 밝히자면, 다른 모든 요인을 통제한 채 DPI만 단독으로 분리한 동료 심사 완료 연구는 없습니다. 따라서 "150 DPI 미만" 행은 LlamaIndex 참조 용어집의 명시적 저해상도 지침과 IJSAT(2026)이 300 DPI에서 측정한 물리적 손상 정확도 하한을 결합한 것으로, 그 성격상 대리 지표임을 명시합니다.
필드 유형에 따라 판독 오류의 영향이 달라집니다. 문단에서 단어 하나를 잘못 읽어도 대부분의 워크플로에는 영향을 주지 않지만, 인보이스 번호의 숫자 하나를 잘못 읽으면 해당 필드 전체가 실패합니다. 여러 엔진을 대상으로 필드 유형을 분리한 유일한 공개 벤치마크는 2025년 인보이스 추출 연구이며, 그 편차는 필드 유형과 엔진에 따라 40–98%에 달합니다. 이는 "OCR 정확도"가 단일 수치가 아님을 보여주는 가장 명확한 증거입니다(BusinessWareTech, 2025).
필드 유형별 분석
| 필드 유형 | 정확도 범위 | 상세 | 출처 | 연도 |
|---|---|---|---|---|
| 키-값 텍스트 필드 | 엔진별 78–98% | GPT-4o + OCR 98%, Azure Document Intelligence 93%, Google Document AI 82%, AWS Textract 78% | BusinessWareTech | 2025 |
| 라인 항목 / 테이블 행 | 엔진별 40–82% | 라인 항목 감지: 동일 테스트에서 Textract 82% vs Google Document AI 40% | BusinessWareTech | 2025 |
| 숫자 필드 | 78–98%(필드 범위 내) | 제한된 형식이 도움이 되지만, 숫자 하나를 잘못 읽으면 필드 전체가 실패합니다 | BusinessWareTech; AIMultiple 인보이스 벤치마크 | 2025–2026 |
| 체크박스 / 마크 감지 | 신뢰할 수 있는 공개 벤치마크 없음 | 데이터 공백 — 한계에서 언급; 기존 마크 감지 문헌은 AI OCR 이전의 것입니다 | — | — |
| 서명 | 공개 정확도 벤치마크 없음 | 데이터 공백 — 벤더는 인식 정확도가 아닌 감지 여부만 보고합니다 | — | — |
위 표에 나열된 출처입니다. 78–98% 및 40–82% 수치는 단일 독립 벤치마크에서 비롯된 것으로, C등급 출처이며, AIMultiple의 인보이스 벤치마크가 방향성을 뒷받침합니다. 해당 벤치마크는 모든 도구에서 품질이 낮은 문서에 대해 정확도가 급격히 떨어지는 것을 확인했습니다(AIMultiple, 2026). "데이터 공백"으로 표시된 행은 인용 가능한 제3자 측정값이 없으며, 벤더 수치 대신 그 사실을 명시한 것입니다.
언어는 거의 모든 벤더가 언어별 벤치마크를 공개하지 않기 때문에 가장 덜 알려진 정확도 차원입니다. 동료 심사 완료된 유일한 다국어 비교 연구에 따르면, 동일한 엔진에서 영어 정확도가 아랍어보다 "상당히 높았으며", 기본 인식 기준 그 격차는 약 10~25퍼센트 포인트에 달했습니다(Hebert et al., 2021). 필기 벤치마크는 두 번째 데이터 포인트를 제공합니다. 프랑스어(RIMES)와 영어(IAM) 필기는 최고 시스템에서 이제 인쇄물에 가까운 품질에 도달했지만, 깨끗하고 표준화된 말뭉치 필기에 한해서입니다.
언어 및 문자 체계별 분석
| 언어 / 문자 체계 | 정확도 | 근거 | 출처 | 연도 |
|---|---|---|---|---|
| 영어 — 인쇄물 | 96–99.5% | 선명한 텍스트에 대한 모든 주요 엔진의 기준치 | Hebert et al.; EDPB | 2021 / 2024 |
| 아랍어 — 인쇄물 | 영어보다 약 10~25포인트 낮음 | 동일 엔진, 단일 공통 글꼴 말뭉치, 여전히 상당히 낮음 | Hebert et al. | 2021 |
| 영어 필기 | ~94.3% 단어 정확도 SOTA | 단어 오류율(WER) 5.73%(GatedLexiconNet), GPT-4o-mini 사용 시 3.34% | GatedLexiconNet; LLM HTR 벤치마크 | 2024–2025 |
| 프랑스어 필기 | ~97–99% 문자 정확도 | 비즈니스 서신 기준 문자 오류율(CER) 0.9–1.7% | GatedLexiconNet | 2024 |
| CJK, 데바나가리 및 기타 문자 | 비교 가능한 공개 벤치마크 없음 | 데이터 공백 — 동료 심사 완료된 엔진 간 비교를 찾을 수 없음 | — | — |
위 표에 나열된 출처. IAM과 RIMES는 표준화된 필기 말뭉치입니다. 실제 현장의 지저분한 필기, 특히 인쇄체와 필기체가 섞인 경우는 이러한 깨끗한 말뭉치 수치보다 낮은 점수를 받습니다. 아랍어 격차는 단일 공통 글꼴 말뭉치에 대한 발표된 연구 결과인 "영어 정확도가 아랍어보다 상당히 높았다"는 내용을 보수적으로 해석한 것입니다. 더 어려운 말뭉치에서는 그 격차가 더 벌어질 가능성이 높습니다.
OCR 정확도 범위가 이렇게 넓은 이유: 네 가지 지표, 하나의 단어
OCR 정확도 데이터에서 가장 큰 모순처럼 보이는 것은 측정 오류가 아니라 서로 다른 문서 조건에 적용된 서로 다른 지표입니다. "문자 정확도 99%"와 "필드 정확도 78%"는 동일한 시스템을 설명하며, "테이블 감지 wF1 0.49"와 "테이블 구조 TEDS 0.96"은 서로 다른 말뭉치에 대한 동일한 기술을 설명합니다.
사용되는 네 가지 지표는 엄격한 난이도 위계를 형성합니다. 문자 정확도(99%+)는 가장 부풀리기 쉽습니다. 단어 정확도는 한 글자만 틀려도 단어 전체가 실패하기 때문에 더 낮습니다. 호주 신문 교정 연구에서는 원시 역사적 출력에 대해 단어 정확도 81.7%를 측정했으며, 수동 교정 후 97.6%로 상승했습니다. 필드 정확도는 숫자 하나만 틀려도 필드 전체가 실패하기 때문에 더욱 낮습니다. 위의 엔진 범위 78–98%가 바로 그것입니다. 구조 지표는 완전히 별개의 축입니다. 테이블이 완벽한 문자로 읽혀도 행/열 구조가 잘못 재구성되면 점수가 낮을 수 있습니다. 이것이 아카이브 테이블 감지가 wF1 0.49–0.53에서 정체되는 반면, 현대 테이블 구조 인식은 TEDS 0.91–0.97에 도달하는 이유입니다.
노이즈는 이러한 분포를 더욱 넓힙니다. 동료 심사 완료된 Hebert 등의 연구에서 깨끗한 책 스캔본에 단일 인공 노이즈 레이어를 추가하자 최고 엔진의 단어 정확도가 약 96%에서 82.5%로 떨어졌고, 오픈소스 Tesseract는 58.4%까지 떨어졌습니다. 두 개의 노이즈 레이어를 추가하면 더욱 하락했습니다(Hebert et al., 2021). 이것이 "OCR 정확도는 얼마나 되나요?"라는 질문에 대한 정직한 답이 항상 문서 유형에 따라 달라지는 범위인 이유이며, 단일 숫자 주장은 보편적인 복장을 입은 깨끗한 텍스트 측정값으로 간주해야 하는 이유입니다.
이 데이터를 사용하는 방법
전체 감사 없이도 "OCR 정확도가 99%라는 이야기를 들었다" — 모든 벤더가 반복하는 주장이자 이 페이지가 검증하는 바로 그 주장 — 를 자체 문서에 대한 방어 가능한 기대치로 전환할 수 있습니다. 위의 범위를 사용한 세 단계의 간단한 계산으로 충분하며, 대개 헤드라인 수치가 실제 처리하는 문서에는 적용되지 않는다는 사실이 드러납니다.
- 문서 구성을 분류합니다. 볼륨을 위의 범위로 나눕니다. 예: 월 1,000건의 인보이스를 처리하는 일반적인 지급 계정 흐름의 경우 — 70% 디지털 생성 PDF(99.2–99.8%), 20% 선명한 스캔(98–99%), 10% 손상된 스캔 또는 필기 주석이 있는 파일.
- 문자 정확도를 필드 정확도로 변환합니다. 문자 수준 수치는 추출 워크플로를 과대평가합니다. 대신 엔진 등급에 맞는 측정된 필드 수준 범위를 사용하세요: 중급 클라우드 프로세서의 경우 93%, LLM 지원 파이프라인의 경우 98%, 하위 등급 엔진의 경우 78–82%(BusinessWareTech 2025).
- 월간 오류 수를 추정합니다. 필드 정확도 93%, 인보이스당 12개 필드 기준, 1,000건의 인보이스는 검토 전에 약 월 840개의 잘못된 필드를 생성합니다(1,000 × 12 × 7%). 볼륨의 10%가 손상되거나 필기된 경우, 해당 오류 수는 범위 차이만큼 증가합니다 — 일반적으로 필드 정확도의 15~30% 포인트.
- 그 수치가 수용 가능한지 결정합니다. 월 840개의 잘못된 필드가 다운스트림 시스템이 흡수할 수 있는 수준을 초과한다면, 공개된 해결책은 다음과 같습니다: 스캔 품질을 300-DPI/RGB 범위로 높이기, 낮은 신뢰도의 필드를 인간 검토로 라우팅, 또는 역사적 단어 정확도를 81.7%에서 97.6%로 끌어올린 보정 단계 적용(Cassidy, 2019).
이는 대략적인 추정 공식이며, 자체 문서에 대한 벤치마킹을 대체하지 않습니다. 이 페이지의 모든 게시된 범위는 다른 사람의 말뭉치에서 측정된 것입니다 — 워크플로에 적용되는 유일한 정확도 수치는 직접 측정한 값입니다. 이 페이지의 가치는 측정 전에 기대치를 설정하는 데 있습니다.
자주 묻는 질문
평균 OCR 정확도는 얼마인가요?
평균은 전적으로 문서 유형에 따라 달라집니다. 이 페이지의 출처에 따르면, 선명한 디지털 생성 텍스트는 평균 99.2–99.8%의 문자 정확도(IntuitionLabs 2025; ABBYY), 선명한 스캔본은 98–99%(Holley 2009; EDPB 2024), 손상·오래된 스캔본은 71–98%(Holley 2009), 필기는 솔루션에 따라 46–95%(AIMultiple 2026)를 기록합니다. 단일 "평균 OCR 정확도" 수치는 의미가 없습니다. 범위가 곧 답입니다.
좋은 OCR 정확도는 어느 정도인가요?
호주 국립도서관이 널리 채택한 기준에 따르면, 인쇄 텍스트의 우수한 OCR은 98–99%의 문자 정확도(1–2% CER), 보통은 90–98%, 낮음은 90% 미만으로 정의됩니다(Holley, 2009). 비즈니스 데이터에 중요한 지표인 필드 수준 추출의 경우, 보다 현실적인 "우수" 기준은 93–98%이며, 2025년 인보이스 벤치마크에서 최상위 엔진만이 이 수준에 도달했습니다.
스캔 문서와 디지털 PDF의 OCR 정확도는 어떻게 다른가요?
인쇄 텍스트의 선명한 스캔본은 98–99%의 문자 정확도를 보여 디지털 생성 텍스트의 99.2–99.8%에 근접하지만, 동일하지는 않습니다. 스캔 품질이 저하되면 격차는 급격히 벌어집니다. 역사적 신문 스캔본은 71–98%의 원시 정확도를 기록했고(Holley 2009), 훼손된 원본은 300 DPI에서도 72.7–94.7%로 떨어졌습니다(IJSAT 2026). 낮은 DPI, 비트맵 캡처, 노후화된 용지 모두 스캔 정확도를 낮추는 요인입니다.
필기 OCR의 정확도는 어느 정도인가요?
최신 시스템은 IAM 및 RIMES와 같은 선명한 벤치마크 말뭉치에서 약 94–99%의 단어 정확도에 도달하지만, 모든 솔루션을 통틀어 범위는 46–95%(AIMultiple 2026)입니다. 레거시 엔진은 하위권에 머물며, 지저분한 실제 필기, 인쇄체와 필기체의 혼합, 또는 역사적 필체는 선명한 말뭉치 수치보다 훨씬 낮은 점수를 기록합니다.
OCR 정확도를 위한 최적 DPI는 무엇인가요?
300 DPI가 표준 권장 사항입니다. 선명한 인쇄물에서 98~99%의 문자 정확도를 충족하며, 10pt 미만의 글꼴에는 400~600 DPI가 권장됩니다. 특히 GPO 연구에 따르면 오래된 문서에서는 해상도보다 스캔 색상 모드가 더 중요했습니다. RGB 캡처는 99%에 도달한 반면 비트맵은 약 77%에 그쳤으며, 300에서 200 DPI로 다운샘플링해도 결과는 달라지지 않았습니다.
테이블에서 OCR 정확도가 낮은 이유는 무엇인가요?
테이블은 문자 인식 위에 구조 인식 단계가 추가됩니다. 엔진은 콘텐츠를 사용하기 전에 행, 열, 병합된 셀을 재구성해야 합니다. 최신 시스템은 디지털 생성 테이블 말뭉치에서 TEDS 0.91–0.97을 기록하지만, 아카이브 또는 수기 테이블은 wF1 0.49–0.53 감지율(ICDAR 2019 cTDaR)로 떨어지며, 실제 인보이스 테스트에서 라인 항목 추출은 엔진별로 40–82% 범위를 보였습니다(BusinessWareTech 2025).
OCR 정확도는 언어에 따라 다른가요?
네, 상당히 다릅니다. 동료 심사 완료된 유일한 교차 언어 비교 연구에 따르면 동일한 엔진과 말뭉치에서 영어 정확도가 아랍어보다 10~25% 포인트 높습니다(Hebert et al. 2021). 필기 벤치마크에서는 프랑스어와 영어 말뭉치가 최상위 시스템에서 인쇄물 수준에 근접했지만, CJK, 데바나가리 또는 기타 문자에 대한 공개 벤치마크는 존재하지 않습니다. 이는 명백한 데이터 공백입니다.
방법론 및 출처
이 페이지가 만들어진 방식
이 페이지는 1995~2026년에 걸친 16개의 독립적인 연구 데이터를 종합합니다. 출처는 세 가지 기준으로 선정했습니다: (1) 표본 크기가 명시된 공개된 방법론, (2) 가능한 경우 최근 3년 이내에 수집된 데이터, (3) 마케팅 주장이 아닌 문서 처리와의 관련성. 여러 출처가 동일한 지표를 보고하는 경우 보수적인 범위를 사용합니다 — 과장을 피하는 것을 선호합니다. 출처 간에 상당한 차이가 있는 경우, 그 차이는 평균으로 희석하지 않고 지표 수준이나 말뭉치로 설명합니다.
지표 구분은 이 페이지의 핵심입니다: 문자 수준, 단어 수준, 필드 수준, 구조 수준(TEDS/wF1) 수치는 절대 단일 숫자로 혼합하지 않습니다. 벤더 자체 보고 수치는 벤더 주장으로 표시하고 상한 참고값으로만 사용하며, D등급 인용 규칙에 따라 교차 검증을 요구합니다 — 이 경우 IntuitionLabs의 독립 측정 결과 모든 엔진이 쉬운 타이핑 텍스트에서 99.2%를 초과한다는 사실이 이를 뒷받침합니다.
출처 목록
- Holley, R. — "How Good Can It Get?" D-Lib Magazine 15(3/4) (2009). 호주 국립도서관 신문 디지털화 프로그램; 1803~1954년에 걸친 30개 이상의 역사적 신문 제호의 원시 문자 신뢰도 측정 결과. 손상·오래된 스캔본 범위 71~98.02%, 우수/보통/불량 척도 98~99%/90~98%/<90%, 그리고 CER 1~2%의 "우수" 벤치마크를 제공합니다.
- Hebert, J. 외 — "OCR with Tesseract, Amazon Textract, and Google Document AI: a benchmarking experiment," Journal of Computational Social Science (2021). 동료 심사 완료; 영어 도서 스캔 322건 + 아랍어 기사 스캔 100건 × 노이즈 유형 43종 = 문서 18,568건, 요청 51,304건. 선명한 스캔에서 노이즈가 있는 스캔으로 갈수록 떨어지는 단어 정확도(~96%→82.5%→58.4%), 영어 대비 아랍어의 격차, 서버형 대비 오픈소스 비교를 제공합니다.
- Rice, S.V., Jenkins, F.R. & Nartker, T.A. — "The Fourth Annual Test of OCR Accuracy," UNLV ISRI (1995). 상용 OCR에 대한 연례 독립 평가, DOE 표본 460페이지 + 잡지 표본 200페이지 대상. 선명한 텍스트 상한선의 근거가 되는 1992~1995년 문자 정확도 향상(~94%→98%+)을 제공합니다.
- NIST IR 6101 — "Impact of image quality on machine print optical character recognition" (1998). 미국 국립표준기술연구소(NIST)가 연방관보 페이지를 대상으로 상용 OCR 제품 3종을 평가한 결과. "오류율 1%를 달성하려면 고정 형식의 선명한 원본이 필요하다"는 제약 조건을 제공합니다.
- 유럽 데이터 보호 위원회(European Data Protection Board) — "AI Possible Risks & Mitigations: OCR" (2024). EU 규제 기관의 기술 지침. 일반 인쇄 문서의 95~99% 범위와 생산 보장 수준 98~99%를 제공합니다.
- 미국 정부출판국(GPO) — "Optimizing OCR Accuracy on Older Documents" 백서. 노후·변색 문서에 대한 스캔 모드 및 보정 기능의 공식 테스트, GPO의 99% 정확도 요건 기준. RGB 99% 대비 비트맵 약 77%의 결과와 300→200 DPI 다운샘플링 결과를 제공합니다.
- "Optical Character Recognition Accuracy on Degraded Documents," IJSAT (2026). 동료 심사 완료; 300 DPI에서 네 가지 물리적 상태에 대한 EasyOCR 평가. 정상 94.7% / 구겨짐 86.9% / 오염 80.9% / 젖음 72.7%의 정확도 단계를 제공합니다.
- AIMultiple — "OCR Benchmark: Text Extraction / Capture Accuracy" (2026). Sentence-BERT 코사인 유사도를 사용한 벤더 중립 분석가 벤치마크; 12개 이상의 솔루션. 필기 인식률 46~95% 범위와 솔루션별 선두 주자(GPT-5 95%, olmOCR-2-7B 94%, Gemini 2.5 Pro 93%)를 제공합니다.
- AIMultiple — "Invoice OCR Benchmark: Extraction Accuracy of LLMs vs OCRs" (2026). 벤더 중립 벤치마크, 공개 인보이스 20개에서 추출한 키-값 쌍 400개 이상. 저품질 대비 고품질 문서의 정확도 하락 결과를 제공합니다.
- Gao, L. 외 — "ICDAR 2019 Competition on Table Detection and Recognition (cTDaR)," ICDAR (2019). 학술 대회, 11개 팀, 손으로 그린 표와 필기 표가 포함된 현대 및 아카이브 데이터셋. 아카이브 트랙 wF1 0.49의 표 감지 하한선을 제공합니다.
- OpenCodePapers — "Table Recognition on PubTabNet" 리더보드 (2024). PubTabNet 말뭉치에 대한 공개 TEDS 결과를 추적하는 기술 벤치마크 집계 사이트입니다. TEDS 상한선을 제공합니다: MuTabNet 0.9687 (2024), TableMaster 0.9676, SLANet 0.963.
- "Tabular context-aware OCR and tabular data reconstruction for historical records" (2025). 동료 심사 완료; PubTabNet, SROIE, CORD, 역사적 말뭉치에 대한 TrOCR-ctx. 표 구조 점수 TEDS 0.909(PubTabNet), 0.967(SROIE), 0.986(CORD)을 제공합니다.
- "Enhancing handwritten text recognition accuracy with gated mechanisms" (2024). 동료 심사 완료; IAM, RIMES, READ-2016에 대한 GatedLexiconNet. IAM WER 5.73%/CER 2.27% 및 RIMES CER 0.9%의 최신 필기 인식 수치를 제공합니다.
- "Benchmarking Large Language Models for Handwritten Text Recognition" (2025, Journal of Documentation). 동료 심사 완료; 7개 말뭉치에 걸친 독점 및 오픈 LLM 대 Transkribus 비교. GPT-4o-mini IAM CER 1.71%/WER 3.34%, GPT-4o RIMES CER 1.69%/WER 3.66%, 그리고 현대 CER<5% 품질 기준 프레임을 제공합니다.
- BusinessWareTech — "AWS Textract vs Google, Azure, and GPT-4o: Invoice Extraction Benchmark" (2025). 실제 인보이스에 대한 독립 벤치마크; C등급. 엔진별 필드 정확도 78–98% 및 엔진별 라인 항목 감지 40–82%를 제공합니다.
- IntuitionLabs — "Pharma Document AI & OCR Accuracy: A Benchmark Report" (2025-04). 혼합 문서 벤치마크를 요약한 업계 연구; C등급. 모든 엔진이 쉬운 인쇄 텍스트에서 >99.2% 정확도를 보인다는 결과와 Google Cloud Vision의 전체 약 98% 정확도를 제공합니다.
- ABBYY FineReader. D등급 자체 보고 수치로, 깨끗한 텍스트 상한선으로만 사용되며 그렇게 표시됩니다. "선명한 스캔에서 최대 99.8% 정확도"를 주장하며, 팩스/저해상도 개선 주장도 문서화합니다.
- LlamaIndex — "What is OCR Accuracy Rate?" 용어집 (2026). 요인 영향 표가 포함된 참조 용어집. DPI 표에 사용된 DPI 단계(72 vs 300 vs 600 DPI)와 300 DPI 최소 권장 사항을 제공합니다.
- 피츠버그 대학교 — "Best Practices: OCR" 도서관 가이드. 대학 디지털화 지침. 300 DPI 표준과 <10pt 글꼴에 대한 400–600 DPI 권장 사항을 제공합니다.
- Cassidy, S. — "OCR 품질이 디지털화된 역사 텍스트 사용에 미치는 영향" (Macquarie University). 역사 신문에 대한 사후 OCR 교정에 대한 동료 심사 완료 연구. 81.7%→97.6%의 단어 정확도 교정 효과를 제공합니다.
한계
- 지리적 범위: 출처는 북미, EU, 호주, 그리고 유럽 말뭉치에 집중되어 있습니다. 라틴 아메리카나 아프리카에 대한 신뢰할 수 있는 1차 데이터는 찾을 수 없었습니다. CJK/데바나가리 비교는 저희가 찾은 동료 심사 완료 문헌에 없습니다.
- 방법론 제약: 클라우드 벤더(Google, Azure, Amazon)는 문서 유형별로 방법론이 투명한 정확도 벤치마크를 공개하지 않습니다 — 이들의 "99%+" 수치는 측정값이 아닌 마케팅 자료이며, 독립 연구에서 측정한 경우를 제외하고 여기서 제외합니다. 여러 핵심 수치는 단일 연구 데이터 포인트에 의존하며 등급이 표시됩니다. ABBYY의 99.8%는 교차 검증된 상한값으로만 사용되는 벤더 주장입니다.
- 시간적 공백: UNLV ISRI(1995) 및 NIST(1998) 데이터는 27년 이상 된 것이지만, 깨끗한 텍스트 정확도 상한선에 대한 유일한 공개 종단 기록으로 남아 있습니다. 연도로 표시하고 역사적 맥락으로 사용합니다. Holley(2009)의 손상 스캔 하한값은 역사적 신문에 대해 공개된 가장 최근의 원시 수치입니다 — 현대 엔진은 이러한 문서에서 더 나은 성능을 보이며(Hebert et al. 2021), 따라서 표에 둘 다 표시합니다.
- 찾을 수 없었던 것: (1) 현대 AI OCR의 체크박스/마크 감지 인식에 대한 신뢰할 수 있는 공개 벤치마크 — 기존 문헌은 레거시 OMR입니다; (2) 서명 인식 정확도 — 벤더는 인식 정확도가 아닌 감지만 보고합니다; (3) 다른 요인을 일정하게 유지하면서 DPI만 분리한 동료 심사 완료 통제 연구; (4) 화면 캡처 OCR에 대한 표준화된 벤치마크; (5) 라인 항목 수치를 넘어선 혼합 레이아웃 문서. 이러한 공백은 검증 불가능한 벤더 수치로 채우지 않고 명시적으로 밝힙니다.
관련 참고 자료: 수동 데이터 입력 오류율: 유형, 산업 및 역할별 1-4% · 광학 문자 인식(OCR)이란 무엇인가요?
관련 자료: OCR 정확도 향상 방법: 실용 팁 10가지 · AI 문서 추출의 정확도는 실제로 어느 정도일까? · ABBYY FineReader vs 최신 AI OCR