키 정보 추출(KIE)이란 무엇인가?
최종 검토: 2026-08-31 · 적용 대상: 문서 AI / 데이터 추출 / OCR 평가
다른 이름: "문서 정보 추출", "양식 이해", 또는 "키-값 쌍 추출"이라고도 합니다. 클라우드 제공업체 환경에서는 Document AI 서비스의 추출 단계로 설명됩니다.
키 정보 추출(KIE)은 OCR도 아니고 문서 분류도 아닙니다. OCR은 "페이지에 어떤 문자가 있는가"에 답하고, 분류는 "이 문서가 어떤 종류인가"에 답하며, KIE는 그 사이의 질문에 답합니다: 이 문서에 어떤 특정 정보가 포함되어 있으며, 그것들은 무엇인가?
키 정보 추출(KIE)은 문서 이미지와 PDF에서 인보이스 번호, 날짜, 합계와 같은 특정 데이터 필드를 자동으로 식별하고 추출하여 구조화된 기계 판독 가능 레코드로 변환하는 프로세스입니다.
키 정보 추출 작동 방식
KIE는 입력/출력 계약에 따라 작동합니다: 비구조화 또는 반구조화 문서 이미지가 들어가면 구조화된 키-값 쌍과 엔터티가 나옵니다. 인보이스, 영수증, 구매 주문서, 청구서와 같은 수취 문서는 예측 불가능한 레이아웃에 콘텐츠가 흩어져 있지만, 다운스트림 시스템이 필요로 하는 정보는 인보이스 번호, 날짜, 벤더 ID, 금액, 명세행 집합과 같은 유한한 필드 집합입니다. KIE는 시각적 페이지를 정확히 그러한 필드로 변환하는 계층입니다(Rombach & Fettke, 2025).
고전적 파이프라인에서는 이 과정이 네 단계로 이루어집니다. 첫째, 문자 인식은 콘텐츠를 기계 판독 가능하게 만듭니다 — OCR이 스캔된 픽셀을 텍스트로 변환하거나, 디지털 PDF에서 직접 텍스트에 접근합니다. 둘째, 레이아웃 이해는 읽기 순서와 영역 구조를 재구성하여 엔진이 "합계: $1,249.99"가 바닥글에 있고 "인보이스 #1234"가 머리글에 있음을 알게 합니다. 셋째, 의미론적 필드 분류는 각 텍스트 영역을 위치가 아닌 의미로 읽어 "1234"를 인보이스 번호로, "$1,249.99"를 합계로 인식합니다 — 두 필드가 벤더마다 다른 레이아웃에서 이동하더라도 말입니다. 마지막으로, 그룹화 및 키-값 조립은 관련 값을 구조화된 단위로 연결합니다 — CORD와 같은 벤치마크의 전형적인 예로, 명세행이 세 개의 고립된 문자열이 아닌 하나의 레코드로 이해되는 경우입니다. 이 마지막 단계가 추출을 단순 인식과 구분 짓는 요소입니다: 엔터티를 식별하지만 그룹화하지 않는 모델은 사용 가능한 레코드 없는 키만 생성합니다(Khang et al., 2025).
OCR과의 결정적 차이는 의미론적 수준입니다. OCR은 모든 문자가 정확할 때 올바릅니다. KIE는 모든 필드가 정확할 때 올바릅니다 — 그리고 9자리 인보이스 번호의 단 한 글자가 틀려도 전체 필드가 틀리게 됩니다. 이것이 KIE 정확도가 문자 수준이 아닌 필드 수준에서 측정되는 이유이며, 이 차이는 필드 대 문자 정확도 참조 자료에서 자세히 다룹니다.
현대 시스템은 점점 더 OCR 단계를 완전히 건너뜁니다. 독자는 고정 템플릿의 쇠퇴에서 이미 이 흐름을 본 적이 있습니다. 필드를 좌표에 매핑하는 규칙은 벤더가 레이아웃을 바꾸는 순간 깨집니다. 오늘날의 비전 기반 모델은 레이아웃과 의미를 함께 읽어, 한 번도 본 적 없는 문서 유형에서 필드를 추출합니다 — AI가 문서를 읽는 방법 가이드에서 설명한 의미론적 접근 방식입니다. 그러나 참조 작업 정의는 메커니즘과 관계없이 동일합니다: 중요한 필드를 식별하고 구조화된 형태로 재현하는 것입니다. 해당 작업의 표준 학술적 정의는 ICDAR 2019 SROIE 대회로, 영수증당 정확히 네 개의 필드 — 회사, 날짜, 주소, 합계 — 에 대해 KIE를 평가했습니다 (Huang et al., 2019).
키 정보 추출(KIE)이 중요한 이유
KIE가 중요한 이유는 KIE가 생성하는 데이터가 다운스트림 시스템 — ERP 전기, 지급 실행, 보험금 심사 — 이 실제로 소비하는 것이며, 대안은 인간이 필드를 수작업으로 입력하는 것이기 때문입니다. 해당 수작업 단계의 오류율은 무시할 수 없습니다: 독립적인 인간 요소 연구에 따르면 훈련된 직원도 전사 중 1–4%의 필드 오류를 범합니다 (Panko, 2008–2015), 미지급금 벤치마크는 약 2%에 근접합니다 (IOFM, 수동 데이터 입력 오류율 참조 자료 경유).
이 1–4% 수치는 오류가 필드 간에 누적되기 때문에 실제 문제를 과소평가합니다. 필드당 1%의 비율에서도 20개 필드로 구성된 단일 인보이스는 여전히 ~18%의 확률로 하나 이상의 잘못된 값을 포함합니다 — 이것이 AP 부서가 수동 처리된 인보이스의 약 3분의 1에서 오류를 보고하는 이유입니다. 이러한 오류 각각은 다운스트림 마찰입니다: 잘못 전기된 지급, 거부된 청구, 일치하지만 잘못된 계약 날짜. KIE는 입력 단계를 추출로 대체하므로 수동 프로세스가 오류를 누적시키는 지점에서 필드 오류율이 낮아집니다 — 이것이 바로 게시된 오류율 벤치마크에서 정량화된 워크플로우입니다.
KIE는 또한 취약한 추출을 드러내는 수치를 생성합니다. SROIE 벤치마크에서 24개 중 7개의 단어 수준 OCR 방법이 90% Hmean을 초과했지만, 필드 수준 KIE 방법은 18개 중 1개만이 그렇게 했습니다 (90.49%), 절반 이상이 80% 미만을 기록했습니다 (Huang et al., 2019). 동일한 문서, 두 가지 매우 다른 점수: 텍스트를 인식하는 것이 올바른 필드를 추출하는 것보다 훨씬 쉽습니다. 벤더가 "99% 정확도"를 인용할 때, KIE가 요구하는 질문은 어떤 수준이 측정되었는가입니다 — 필드 수준 정확도 페이지의 반복되는 평가 주제입니다. 이 분야에 처음 접하는 독자는 문서 추출 초보자 가이드로 시작할 수 있습니다; KIE는 해당 가이드가 계속해서 돌아오는 핵심 기능입니다.
키 정보 추출(KIE)이 사용되는 분야
KIE는 문서가 대량으로 유입되고, 캡처할 가치가 있는 안정적이고 반복적인 필드 집합이 있는 모든 곳에 배포됩니다. 가장 영향력이 큰 다섯 가지 적용 분야는 다음과 같습니다:
- 미지급금/금융: 공급업체 인보이스에서 벤더, 인보이스 번호, 인보이스 날짜, 마감일, 명세행 합계를 추출하여 구매 주문서와 대조 검증한 후 ERP에 게시합니다. 이는 이 분야를 선도하는 인보이스 처리 벤치마크 내의 추출 단계입니다(Rombach & Fettke, 2025).
- 의료: 보험 청구 양식 첨부 파일, EOB, 접수 양식에서 보험 청구 필드를 추출합니다. 이러한 문서는 종종 손으로 작성되어 KIE 상류의 ICR급 인식 작업으로 연결됩니다.
- 은행: 은행 및 신용카드 명세서, 대출 신청서, 계좌 개설 양식에서 고객 온보딩 및 조정 워크플로우로 추출합니다. 여기에는 추출 외에도 수집 복잡성을 더하는 암호로 보호된 PDF 및 다중 페이지 명세서가 포함됩니다.
- 법률: 계약 조건을 계약서 및 임대차 계약서에서 의무 추적 시스템으로 추출하여, 조항이 문장 속에 묻히지 않고 쿼리 가능한 기록이 되도록 합니다.
- 화물 및 물류: 운송장, 포장 명세서, 통관 신고서에는 추적 및 인보이스 발행 시스템에 공급되는 선적, 수하인, 신고 가액 필드가 포함됩니다.
다섯 분야 모두에서 패턴은 동일합니다. 변동성이 레이아웃에 있지 필드 집합에 있지 않은 거의 동일한 문서의 흐름이며, 레이아웃 변동을 처리하는 도구가 워크플로우를 무인으로 실행할지 아니면 모든 것을 검토 대기열로 보낼지를 결정합니다. 이것이 더 광범위한 질문인 "데이터 추출 소프트웨어"가 무엇인지와 KIE가 서로 다른 추상화 수준에서 동일한 질문인 이유입니다.
흔한 오해
- 오해: "KIE는 더 발전된 OCR일 뿐이다."
- 사실: OCR은 KIE의 입력 계층일 뿐, KIE 자체가 아닙니다. OCR은 픽셀을 문자로 변환하고, KIE는 해당 문자 중 어떤 것이 특정 필드를 구성하는지 식별하여 구조화된 데이터로 재현합니다. 클라우드 제공업체들도 정확히 이 경계를 긋습니다. AWS는 KIE를 "IDP의 기본 구성 요소"로 설명하며, 인식 계층 위에서 핵심 데이터 포인트를 식별하고 추출하는 역할을 한다고 말합니다 (AWS, 2025). 시스템이 모든 문자를 완벽하게 읽어도 올바른 값을 잘못된 필드에 넣으면 KIE에서 실패할 수 있습니다. 이는 문자 정확도로는 측정조차 할 수 없는 구조적 오류입니다.
- 오해: "KIE와 개체명 인식(NER)은 같은 것이다."
- 사실: NER은 텍스트 수준의 NLP 기법으로, 토큰 범위를 사람, 조직, 위치, 날짜, 금액 등 사전 정의된 범주로 분류합니다 (IBM). KIE는 문서 수준의 작업으로, 입력은 이미지이고 출력은 레코드로 그룹화될 수 있는 구조화된 키-값 쌍입니다. 학계의 정의는 명확합니다. KIE는 "문서 이미지의 정보를 구조화된 데이터로 변환"하며, 레이아웃 이해 + 개체 분류 + 그룹 조립이 필요합니다. NER은 개체 라벨링 부분만 처리하며 시각적 페이지가 아닌 일반 텍스트에서 작동합니다 (Khang et al., 2025). NER은 KIE 파이프라인의 구성 요소가 될 수 있지만, KIE 자체는 아닙니다.
- 오해: "KIE는 문서 유형별 템플릿 또는 고정 레이아웃이 필요하다."
- 사실: 템플릿 기반 캡처는 2020년 이전의 방식이며, 벤더가 레이아웃을 변경하면 작동이 중단됩니다. SROIE 데이터는 그 심각성을 정량화합니다. 단일 영수증 레이아웃군에서도 전체 필드 수준 제출의 절반 이상이 F1 80% 미만을 기록했습니다 (Huang et al., 2019). 최신 비전 기반 KIE는 위치가 아닌 의미론에 따라 추출하므로 본 적 없는 레이아웃에도 일반화됩니다. 위치 기반에서 의미 기반 추출로의 전환은 AI가 문서를 읽는 방법 가이드의 핵심 주제입니다.
- 오해: "KIE와 IDP는 같은 것이다."
- 사실: KIE는 더 넓은 IDP 범주 내의 추출 하위 작업입니다. IDP는 플랫폼의 포괄적 개념입니다. 수집, 분류, 추출, 검증, 다운스트림 시스템 통합을 포함하며, KIE는 구체적으로 식별 및 추출 단계입니다. 시스템이 우수한 KIE를 실행해도 결과를 검증하거나 예외를 담당자에게 라우팅하지 않으면 IDP로서는 실패할 수 있습니다. 클라우드 제공업체도 동일한 중첩 구조를 명시합니다. "IDP 환경 내에서 KIE는 기본 구성 요소 역할을 한다" (AWS, 2025).
자주 묻는 질문
키 정보 추출(KIE)이란 무엇인가요?
키 정보 추출(KIE)은 문서 이미지와 PDF에서 인보이스 번호, 날짜, 합계와 같은 특정 데이터 필드를 식별하고 추출하여 구조화된 기계 판독 가능 레코드로 변환하는 자동화된 프로세스입니다. 비구조화 또는 반구조화 문서를 키-값 쌍과 엔티티로 변환하며, 다운스트림 시스템에서 직접 사용할 수 있습니다. 클라우드 공급업체 분류 체계에서 KIE는 더 넓은 IDP 스택 내 Document AI 서비스의 추출 구성 요소입니다(AWS, 2025).
KIE와 OCR의 차이점은 무엇인가요?
OCR은 문자를 읽고, KIE는 정보를 추출합니다. OCR은 텍스트 이미지를 의미를 이해하지 않고 기계 판독 가능한 문자로 변환합니다. 즉, "페이지에 무엇이 적혀 있는가?"에 답합니다. KIE는 더 나아가 특정 필드를 구성하는 텍스트가 무엇인지 식별하고 구조화하여 "이 문서에 어떤 정보가 포함되어 있으며, 어디에 속하는가?"에 답합니다. OCR은 일반적으로 KIE 파이프라인의 선행 단계이지 대체물이 아닙니다(Rombach & Fettke, 2025).
KIE와 개체명 인식의 차이점은 무엇인가요?
NER은 텍스트 수준의 레이블링 기법이고, KIE는 문서 이미지 수준의 추출 작업입니다. NER은 텍스트 범위를 사전 정의된 범주로 태깅하며 일반 텍스트에서 작동합니다(IBM). KIE는 문서 이미지에서 작동하며 출력은 구조화된 키-값 쌍입니다. 명세행과 같은 레코드로 그룹화되는 경우도 있으며, 텍스트만 처리하는 NER에는 없는 레이아웃 이해가 필요합니다. NER은 KIE 파이프라인 내부의 한 구성 요소로 나타날 수 있지만, 둘은 상호 교환 가능하지 않습니다(Khang et al., 2025).
KIE는 지능형 문서 처리(IDP)와 같은 것인가요?
아닙니다 — KIE는 추출 하위 작업이고, IDP는 전체 플랫폼입니다. IDP는 문서 수집, 분류, 추출, 비즈니스 규칙 검증, ERP 또는 청구 시스템과의 통합을 포괄합니다. KIE는 그 체인의 식별 및 추출 중간 단계를 담당합니다. 배포 환경에 강력한 KIE가 있더라도 IDP로 기능하려면 분류, 검증, 라우팅이 여전히 필요합니다. 그렇기 때문에 직통 처리와 같은 자동화 지표는 추출만이 아니라 전체 스택을 측정합니다(AWS, 2025).
KIE 정확도는 어떻게 측정하나요?
필드 수준에서 측정합니다 — 필드는 올바르게 추출되거나 실패하며, 한 글자만 틀려도 전체 필드가 실패합니다. 표준 지표는 대상 필드에 대한 필드 수준 F1입니다. 표준 SROIE 벤치마크에서 필드 수준 방법 18개 중 단 1개만 90% F1을 초과했고, 절반 이상이 80% 미만을 기록했습니다. 이는 추출이 텍스트 인식보다 어렵다는 것을 보여줍니다. 따라서 KIE를 평가할 때는 문자 또는 단어 정확도 수치가 아니라 자체 문서에 대한 필드 수준 정확도를 요청해야 합니다.
KIE는 어떤 유형의 문서를 처리하나요?
반구조화 및 비구조화 문서 — 영수증, 인보이스, 구매 주문서, 계약서, 은행 명세서, 보험 청구 양식 — 스캔, 촬영, 또는 디지털 PDF 형태로 처리합니다. 반구조화 문서는 다양한 레이아웃에서도 인식 가능한 필드 집합을 공유합니다. 비구조화 문서는 고정 레이아웃이 전혀 없습니다. KIE는 둘 다 처리합니다. 레이아웃 변동이 클수록 추출은 위치보다 의미적 이해에 더 의존해야 합니다(Ding & Han, 2025).
출처
- Rombach, A.M. & Fettke, P. — "Deep Learning Based Key Information Extraction from Business Documents: A Systematic Literature Review," ACM Computing Surveys 58(2) (2025). KIE 분야의 동료 검토를 거친 체계적 문헌 고찰: 정의, 방법군, 인보이스/영수증 비즈니스 문서 맥락을 다룹니다. 정의와 비즈니스 워크로드 내 KIE 관련 주장의 주요 출처.
- Huang, Z., et al. — "ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction," IEEE ICDAR (2019). SROIE 벤치마크: 작업 3은 4개의 대상 필드로 KIE를 정의하며, 필드 수준 정확도 평가에서 24개 OCR 방법 중 7개가 Hmean >90%를 달성한 반면 18개 KIE 방법 중 1개만 F1 >90%를 기록했습니다. 필드 수준 정확도 증거와 표준 KIE 작업 정의의 주요 출처.
- Khang, D., et al. — "KIEval: Evaluation Metric for Document Key Information Extraction" (2025). 문서 이해(Document Understanding) 분야 내에서 문서 KIE를 문서 이미지에서 구조화된 키-값 쌍을 추출하는 것으로 공식적으로 정의합니다. 그룹화/엔터티 계약 및 이미지 입력 정의의 주요 출처.
- AWS — "Document intelligence evolved: Building and evaluating KIE solutions that scale" (2025). 금융, 의료, 법률, 공급망 전반의 IDP 환경에서 KIE를 추출 구성 요소로 위치시키는 클라우드 제공업체의 기술 문서. IDP 내 KIE 프레임워킹의 주요 출처.
- IBM — "What is named entity recognition?". NER에 대한 독립적인 업계 정의: MUC-6 이후 텍스트에서 사전 정의된 엔터티 범주를 라벨링하는 NLP 기법. KIE와 NER의 경계에 대한 출처.
- ABBYY — Document AI Glossary ("Key-value pair extraction"). 키와 해당 값을 인식하는 것으로 키-값 쌍 추출을 정의하는 업계 용어집. 입출력 계약을 뒷받침합니다.
- Panko, R.R. — Human Error Research, University of Hawaii (2008–2015). 인간 전사 오류율에 대한 동료 검토를 거친 편집: 단순 인지 작업의 경우 1~5%, 기계적 정확도 99.5~99.8% 대 복잡한 전사의 95~98%. 수동 필드 오류 기준선 및 복리 계산의 출처.
- Ding, Y. & Han, S.C. — "Deep Learning Based Visually Rich Document Content Understanding: A Survey," Artificial Intelligence Review (2025). KIE 접근 방식과 벤치마크 발전을 다루는 시각적 풍부 문서 이해에 대한 동료 검토를 거친 조사. 문서 유형 범위 주장의 출처.
관련 용어
- 지능형 문서 처리(IDP)란?: KIE가 속한 플랫폼의 상위 개념 — KIE는 캡처, 분류, 추출, 검증, 통합으로 구성된 광범위한 IDP 범주 내의 추출 하위 작업입니다.
- 광학 문자 인식(OCR)이란?: KIE 아래에 있는 문자 판독 입력 계층 — OCR은 문자를 인식하고, KIE는 의미론적 수준에서 정보를 추출합니다.
- 지능형 문자 인식(ICR)이란?: OCR의 필기 인식 대응 기술 — OCR과 마찬가지로 문자를 인식할 뿐 정보를 인식하지 않으므로, 필기는 인식이 성공한 후에만 KIE에 입력됩니다.
- 문자별이 아닌 필드별 추출 점수 산정: KIE 정확도 측정 방식을 정의하는 지표 체계 — 추출은 문자별이 아닌 필드별로 점수가 산정됩니다.
- Regex vs LLM 필드 추출: 실제 현장에서 필드 추출 성능을 입증하는 메커니즘 근거 — 규칙 기반 KIE가 복구하는 양과 LLM 기반 추출을 정량적으로 비교합니다.
관련 자료: AI 문서 추출: 초보자 가이드 · 템플릿 없이 AI가 문서를 읽는 방법 · 데이터 추출 소프트웨어란?