필드 단위 정확도와 문자 단위 정확도: 차이점은 무엇인가?
최종 검토: 2026-08-13 · 적용 대상: 문서 데이터 추출 / OCR 평가 / AP 및 데이터 입력 워크플로
다른 이름: 필드 단위 정확도는 "필드 정확도", "필드 추출 정확도" 또는 "필드 단위 추출 정확도"라고도 합니다. 문자 단위 정확도는 일반적으로 그 역수인 문자 오류율(CER)로 표현됩니다.
필드 단위 정확도는 각 추출 필드가 완전히 올바른지 여부를 측정하고, 문자 단위 정확도는 개별 문자가 올바르게 읽혔는지 여부를 측정합니다. 한 글자만 잘못 읽어도 전체 필드가 손상되므로, 두 지표는 완전히 다른 것을 설명합니다.
두 정확도 지표의 작동 방식
두 지표 모두 비율이지만, 계산 대상이 다릅니다. 문자 단위 정확도는 "이 문서의 문자가 몇 개나 올바르게 읽혔는가?"를 묻고, 필드 단위 정확도는 "실제로 필요한 데이터 필드 중 단 하나의 오류 없이 추출된 것이 몇 개인가?"를 묻습니다.
문자 단위 정확도 = 올바르게 인식된 문자 수 ÷ 전체 문자 수. 표준 공식 정의는 OCR 평가 커뮤니티에서 비롯되었습니다. 문자 오류율(CER)은 인식된 텍스트와 정답 데이터 사이의 Levenshtein 편집 거리, 즉 하나를 다른 것으로 바꾸는 데 필요한 최소한의 대체, 삭제, 삽입 횟수를 전체 문자 수로 나눈 값입니다. 문자 정확도는 단순히 100% − CER입니다. NIST 자체 평가 프레임워크(TRAIT)도 문자 정확도를 모든 주석에 대한 100 ×로 동일하게 정의합니다(NISTIR 8199, 2017).
필드 단위 정확도 = 올바르게 추출된 필드 수 ÷ 전체 필드 수. 필드는 이진 단위로 평가됩니다. 정답 데이터와 정확히 일치하거나 실패하거나 둘 중 하나입니다. 학술 벤치마크에서 사용되는 공식 버전은 필드 단위 F1으로, 정밀도와 재현율의 조화 평균입니다: F1 = 2 × / (정밀도 + 재현율). 여기서 정밀도는 추출된 필드 중 올바른 필드의 비율이고, 재현율은 기대되는 필드 중 발견된 필드의 비율입니다. 송장 번호의 숫자 하나만 틀려도 해당 필드는 오류로 처리됩니다. 부분 점수는 적용되지 않습니다.
이 지점에서 두 지표는 갈라집니다. N개의 문자로 구성된 필드가 C%의 문자 정확도를 가질 때, 완전히 올바를 확률은 대략 C^N입니다. 이 복리 효과 때문에 문자 정확도는 필드 정확도를 예측하는 데 쓸모가 없습니다. 9자리 송장 번호가 99%의 문자 정확도를 가질 때: 해당 필드의 필드 정확도는 0.99^9 ≈ 91.3%입니다. 동일한 번호가 99.9%의 문자 정확도를 가지면 99.1%로 상승합니다. 20자리 필드가 95%의 문자 정확도를 가지면 필드 정확도는 35.9%까지 떨어집니다. 이는 오류가 독립적이고 균등하게 분포한다고 가정하는 근사치입니다. 실제 시스템은 오류가 중요한 필드에 집중되므로 실제 필드 정확도는 모델이 예측하는 것보다 대개 더 낮습니다. NIST의 자체 OCR 연구에서도 이를 직접 관찰했습니다. 페이지 번호를 인식할 때 전체 문자 인식이 그럴듯해 보였음에도 12%의 필드 오류율이 발생했습니다(NISTIR 6101).
이 격차는 이론적인 문제가 아닙니다. ICDAR 2019 SROIE 벤치마크 — 동일한 이미지에서 단어 단위 OCR과 필드 단위 핵심 정보 추출 모두에 대해 점수를 매긴 1,000개의 스캔 영수증 — 에서 제출된 24개 중 7개의 방법이 90% 이상의 단어 단위 Hmean을 달성했지만, 필드 단위 F1에서 90%(90.49%)를 초과한 것은 18개 중 1개에 불과했으며, 필드 단위 제출물의 절반 이상이 80% 미만의 점수를 기록했습니다(Huang et al., ICDAR 2019). 작업 2에서 최고의 OCR 방법조차도 영수증 애플리케이션이 요구하는 엄격한 99% 정확도를 충족하지 못했으며, 필드 단위 추출은 더욱 어려웠습니다. CORD 영수증 벤치마크에서 최신 모델의 필드 단위 F1은 모델에 따라 78%~97% 사이입니다. 원본 모델 논문 기준입니다(Kim et al., Donut, 2022).
이 구분이 중요한 이유
공급업체는 가장 높고 산출하기 쉬운 수치인 문자 정확도를 인용하는 반면, 비즈니스 의사결정은 항상 더 낮은 필드 정확도에 의존합니다.
마케팅과 현실 사이의 격차는 체계적입니다. 깨끗한 인쇄 문서의 경우 98–99.5%의 문자 단위 정확도 주장은 일반적이며, ICDAR 2019 SROIE 벤치마크에 제출된 최고의 OCR 방법조차도 영수증 애플리케이션이 요구하는 99% 정확도에 미치지 못했습니다(Huang et al., ICDAR 2019). 그러나 동일한 이미지에서 측정된 필드 단위 정확도는 훨씬 낮습니다. SROIE에서 필드 단위 방법 18개 중 1개만이 90% F1을 초과한 반면, 단어 단위 OCR 방법 24개 중 7개는 90%를 넘었습니다 — 동일한 문서인데 두 점수는 매우 다릅니다(Huang et al., ICDAR 2019). 위의 C^N 모델이 이 격차를 설명합니다. 95%의 문자 정확도에서 20자 필드가 완전히 올바를 확률은 35.9%에 불과합니다. 동일한 영수증에서 두 수치 모두 사실일 수 있습니다 — 높은 문자 정확도와 훨씬 낮은 필드 정확도 — 서로 다른 질문에 답하기 때문입니다.
필드 정확도가 중요한 수치인 이유는 다운스트림 시스템이 문자가 아닌 필드를 소비하기 때문입니다. 송장 합계의 잘못된 숫자는 지불을 오류로 만들고, 잘못된 계좌 번호는 전표 입력을 오류로 만듭니다 — 다른 문자가 얼마나 정확히 읽혔는지와 무관합니다. NIST 자체 OCR 기술은 문서 변환 연구에서 이 점을 입증했습니다. 연방 관보 페이지 번호를 인식하는 데 있어 전반적인 문자 인식이 그럴듯해 보였음에도 12%의 필드 오류율이 발생했습니다(NISTIR 6101).
운영상의 결과는 검토 대기열 규모 산정입니다. 모든 필드 단위 오류는 발견되고 수정되어야 하는 문서입니다. 최신 모델은 벤치마크 영수증에서 90% 중반대의 필드 단위 F1에 도달합니다 — LayoutLMv3는 CORD에서 약 96.6%를 기록하며, 초기 모델의 78–84%와 대조됩니다(Kim et al., Donut, 2022) — 그러나 실제 정확도는 문서 유형, 이미지 품질, 필드 설계에 따라 달라지며, 100% 필드 정확도 미만의 모든 문서는 누군가를 검토 대기열로 보냅니다. 문자 정확도만으로 도구를 평가하는 팀은 검토 없이 통과할 수 있는 문서 수를 지속적으로 과대평가하게 됩니다 — 이것이 바로 조달 및 AP 팀이 파이프라인을 도입하기 전에 자체 문서 유형에 대한 필드 단위 정확도를 요청해야 하는 이유입니다.
흔한 오해
- 오해: "정확도 99%는 내 데이터의 99%가 정확하다는 뜻이다."
- 현실: 무엇을 측정했는지에 따라 전적으로 달라진다. 문자 단위 정확도 99%가 필드 단위 정확도 99%를 의미하지는 않는다. 한 글자만 잘못 읽어도 필드 전체가 손상되기 때문이다. 문자 단위 정확도 99%에서 9자리 송장 번호가 완전히 정확할 확률은 91.3%에 불과하며(0.99^9), 20자리 필드가 완전히 정확할 확률은 81.8%에 그친다. 동일한 문서라도 문자 단위에서는 높은 점수를 받으면서 상당한 비율의 필드가 틀릴 수 있다. SROIE 벤치마크는 단어 단위 방법 24개 중 7개가 90%를 넘은 반면, 필드 단위 방법은 18개 중 1개만 90%를 넘는 것으로 기록했다(Huang et al., ICDAR 2019).
- 오해: "문자 단위 정확도와 필드 단위 정확도는 상호 변환이 가능하다. 고정된 비율을 빼면 된다."
- 현실: 변환은 필드 길이와 오류 분포에 따라 달라지므로 고정된 매핑은 존재하지 않는다. C^N 모델은 필드 길이가 길수록 손실이 커진다는 것을 보여준다. 문자 단위 정확도 99%에서 9자리 필드는 필드 단위 정확도 91.3%를 유지하지만, 동일한 문자 단위 정확도에서 20자리 필드는 81.8%로 떨어지고, 문자 단위 정확도 95%에서는 20자리 필드가 35.9%까지 하락한다. 동일한 문서의 서로 다른 필드는 길이와 오류율이 각각 다르므로 단일 변환 계수는 존재하지 않는다.
- 오해: "문자 단위 정확도가 높을수록 더 좋은 도구다."
- 현실: 필드 단위 성능은 단순한 문자 판독 이상의 요소에 달려 있다. 문맥, 구조 이해, 검증을 통해 필드 정확도가 문자 단위 정확도의 예측보다 높아질 수도 있고 낮아질 수도 있다. 시스템이 거의 모든 문자를 정확히 읽으면서도 값을 잘못된 필드에 할당할 수 있는데, 이는 구조적 오류로 문자 단위 정확도로는 측정조차 불가능하다. 올바른 값이 올바른 위치에 들어갔는지 묻지 않기 때문이다. 필드 단위 F1은 이러한 문제를 포착한다. 잘못된 값과 추출은 되었지만 라벨이 잘못된 값 모두에 패널티를 부여하므로, 벤치마크가 원시 문자 단위 정확도 대신 F1을 채점하는 이유다. 필드 정확도는 자체 문서에서 직접 평가해야 한다.
자주 묻는 질문
필드 단위 정확도와 문자 단위 정확도의 차이는 무엇인가요?
문자 단위 정확도는 개별 문자가 올바르게 읽히는 빈도를 측정합니다. 필드 단위 정확도는 송장 번호, 날짜, 합계, 공급업체명 등 완전한 데이터 필드가 하나의 단위로 올바르게 추출되는 빈도를 측정합니다. 필드 내 문자가 하나라도 틀리면 해당 필드는 오류로 간주되므로, 동일한 문서에서 필드 단위 정확도는 항상 문자 단위 정확도보다 낮습니다. 실제 업무 흐름에서 중요한 지표는 필드 단위 정확도입니다.
99% 정확도는 데이터의 99%가 정확하다는 의미인가요?
99%가 필드 단위로 측정된 경우에만 그렇습니다. 공급업체 마케팅에서 말하는 "99% 정확도"는 대개 문자 단위 정확도입니다. 이는 가장 높고 산출하기 쉬운 수치이기 때문이며, 필드 정확도로 환산할 수 없습니다. 문자 정확도 99%에서 9자리 송장 번호가 완전히 올바를 확률은 약 91.3%(0.99^9)에 불과하며, 필드별 오류 위험은 각 문서의 모든 필드에 걸쳐 누적됩니다.
문서 추출 도구를 평가할 때 어떤 정확도 지표를 사용해야 하나요?
자체 문서 유형을 기준으로 측정된 필드 단위 정확도를 요청하세요. 문자 정확도는 OCR 엔진이 텍스트를 얼마나 잘 읽는지를 알려줄 뿐, 올바른 값이 올바른 필드에 들어갔는지에 대해서는 아무것도 알려주지 않습니다. 후자는 다운스트림 시스템이 실제로 사용하는 부분입니다. 눈에 띄는 정확도 주장을 볼 때는 무엇이, 어떤 문서에서, 어떤 필드를 기준으로 측정되었는지 물어보세요. 필드 단위 F1은 추출되었지만 잘못된 라벨이 할당된 필드도 포착하므로 표준적인 공식 지표입니다.
필드 단위 정확도는 어떻게 계산하나요?
필드 단위 정확도 = 올바르게 추출된 필드 ÷ 전체 예상 필드 × 100%. 필드는 정답 데이터와 정확히 일치할 때만 일치하는 것으로 간주되며, 한 글자라도 틀리면 해당 필드는 실패합니다. 학계 표준은 필드 단위 F1입니다: F1 = 2 × / (정밀도 + 재현율). 여기서 정밀도는 추출된 필드 중 올바른 필드의 비율이고, 재현율은 예상 필드 중 발견된 필드의 비율입니다. 이는 SROIE 및 CORD 벤치마크에서 사용하는 것과 동일한 평가 방식입니다.
필드 단위 정확도가 항상 문자 단위 정확도보다 낮은 이유는 무엇인가요?
필드는 구성 문자 중 하나라도 실패하면 실패하며, 긴 필드는 빠르게 실패합니다. 복합 모델 C^N에 따르면, 문자 정확도 99%에서 9자 필드의 필드 정확도는 91.3%에 불과하며, 필드 길이가 길어질수록 감점은 커집니다(0.99^20 ≈ 81.8%). 실제 시스템은 또한 숫자 필드에 오류가 집중되는데, 숫자 필드에서는 한 자리 숫자 오류만으로도 치명적입니다. NIST는 자체 OCR 작업에서 이를 관찰했으며, 문자 인식 성능이 양호함에도 불구하고 페이지 번호에서 12%의 필드 오류율이 발생했습니다(NISTIR 6101).
일반적인 필드 단위 정확도 벤치마크는 무엇인가요?
학술 벤치마크에서 필드 단위 F1은 모델에 따라 78%에서 97% 범위입니다. ICDAR 2019 SROIE 대회에서는 18개 제출물 중 단 1개만이 90%를 초과하는 필드 단위 F1을 기록했으며, CORD 벤치마크의 최고 모델은 약 96~97%에 도달합니다(Huang et al., 2019; Kim et al., 2022). 실제 문서는 벤치마크보다 복잡하기 때문에 생산 환경의 수치는 벤치마크보다 더 큰 편차를 보입니다. 따라서 단일 수치는 문서 및 필드에 따라 달라지는 것으로 간주하고, 자체 문서로 테스트해야 합니다.
출처
- Huang, Z. 외 — "ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction" (IEEE ICDAR, 2019). 스캔 영수증 1,000건 기준 벤치마크로, OCR 제출 24건과 필드 단위 추출 제출 18건을 포함합니다. OCR 방식 24건 중 7건이 Hmean 90%를 초과한 반면, 필드 단위 방식 18건 중 1건만이 90%를 초과했으며(90.49%), 절반 이상이 80% 미만이었습니다. 동일 문서에서 문자 단위와 필드 단위 성능 격차를 보여주는 주요 출처입니다.
- Kim, G. 외 — "OCR-free Document Understanding Transformer" (ECCV, 2022). CORD 영수증 벤치마크의 모델별 필드 단위 F1: LayoutLM 78.4, LayoutLMv2 78.9, Donut 84.1, LayoutLMv3 ~96.6. 필드 단위 F1 범위 78~97%의 출처입니다.
- NIST — "The Text Recognition Algorithm Independent Evaluation (TRAIT)" (NISTIR 8199, 2017). NIST 공식 정의에 따르면 문자 정확도 = 100/주석 수입니다. 공식 문자 정확도 정의의 출처입니다.
- NIST — "Impact of Image Quality on Machine Print OCR" (NISTIR 6101, 2001). NIST 자체 OCR은 문자 단위 인식 성능이 양호했음에도 불구하고 Federal Register 페이지 번호에서 12%의 필드 오류율을 기록했습니다. 필드 오류율 사례의 출처입니다.
- OCR-D 프로젝트 — 품질 보증 사양. 공식 CER = / 전체 문자 수 및 이에 대응하는 WER 공식을 정의합니다. CER 공식의 출처입니다.
- LlamaIndex — "What is F1 Score for Document Extraction?". F1 = 2·(P·R)/(P+R)이며, 10개 필드 송장 예시를 통해 필드 단위와 문서 단위 점수 산정의 차이를 설명합니다. F1 공식 및 계산 예시의 출처입니다.
관련 용어
- 광학 문자 인식(OCR)이란?: 혼란의 원인이 되는 문자 단위 정확도의 판독 기술 — OCR은 픽셀을 문자로 변환하며, 그 자체로 올바른 필드를 생성하지 않습니다.
- 문서 유형별 문자 정확도: 문서 유형별로 세분화된 문자 단위 정확도 벤치마크 — 필드 단위 정확도의 기반이 되는 계층으로, 필드 단위 정확도와 동일하지 않습니다.
- 무중단 처리(STP)율이란?: 필드 단위 정확도에 의존하는 종단 간 지표 — 문서가 사람의 개입 없이 처리되려면 시스템의 필드 정확도가 100%에 가까워야 합니다.
관련 자료: 4단계 정확도 가이드: 문자, 필드, 문서, STP · "99% 정확도"가 거의 항상 문자 단위인 이유 · 실무에서 필드 단위 정확도를 측정하는 방법