영수증 OCR 정확도: 감열지, 구겨짐, 바램,및 다중 통화 벤치마크 (2026)

최종 검토: 2026-08-10 · 데이터 범위: 부분 · 출처: 독립 연구 14건

이 페이지에서 다루는 내용: 영수증 특화 OCR 및 핵심 정보 추출 정확도 벤치마크를 동료 검토 논문 및 대회(ICDAR SROIE, CORD, KORIE, ReceiptSense, IJSAT), 실제 환경 공급업체 엔진 연구, 방법론이 투명한 업계 벤치마크(BusinessWareTech, Google Developer Forum, Doubleword)에서 집계했습니다. 물리적 영수증 상태, 필드 유형, 엔진 티어, 언어별로 세분화했으며, 모든 수치에 문자/단어/필드 지표 구분을 명시했습니다. 모든 출처는 제3자이며 독립적으로 검증 가능합니다.
이 페이지에서 다루지 않는 내용: 문서 유형별 일반 OCR 정확도(문서 유형별 세부 분석 참조), 필기 인식 정확도(필기 인식 정확도 참조), 또는 아래 인용된 벤치마크 수치를 넘어서는 공급업체별 주장.

아래 모든 수치는 방법론 섹션에 인용된 공개적으로 이용 가능한 제3자 연구 및 업계 보고서를 기반으로 합니다. 출처 간 불일치가 있는 경우 보수적 범위를 사용합니다. 지표 수준은 각 수치에 명시되며 단일 숫자로 혼합되지 않습니다. 이 페이지는 방향성 벤치마크이며, 특정 엔진이나 조직에 대한 정밀한 예측이 아닙니다.

영수증 OCR 이야기는 기준선이 아닌 상한선에서 시작합니다. 유일한 표준화된 영수증 벤치마크인 ICDAR 2019의 SROIE에서 최고 성능의 핵심 정보 추출 시스템은 깨끗한 스캔 영수증에서 90.49% F1을 기록했으며, 18개 참가 팀 중 절반 이상이 80% 미만을 기록했습니다(Huang et al., 2019). 실제 비용 처리 워크플로우는 그 상한선에서 물리적 성능 저하 단계를 따라 내려갑니다. 바랜 감열지는 오픈소스 단어 정확도를 55~73%로 낮추고(KORIE, 2026), 휴대폰으로 촬영한 실제 영수증은 66.7~68.7%의 판매자명 정확도를 보여줍니다. 공급업체가 주장하는 "99% 영수증 정확도"는 영수증이 좀처럼 유지하지 못하는 상태를 설명하는 것입니다.

90.49%
ICDAR 2019 SROIE 영수증 벤치마크에서 최고 필드 수준 F1 — 18개 팀 중 90%를 넘은 유일한 팀 (Huang et al., 2019)
55–73%
실제 바래고 구겨진 감열지 영수증에 대한 오픈소스 엔진의 단어 정확도 — PaddleOCR이 73.3%로 최고, Tesseract 64.7%
66.7–68.7%
실제 영수증 118건에서 판매자명 정확히 일치 정확도, 약 65%는 휴대폰 촬영, 약 50%는 접히거나 구겨짐

영수증 상태별 분석: 성능 저하 단계

영수증 OCR 정확도는 엔진보다 종이의 물리적 상태와 촬영 방식에 더 크게 좌우됩니다. 동일한 영수증도 새것처럼 평평한 상태에서 바랜 상태, 구겨진 상태, 휴대폰 촬영 상태로 단계를 내려갈 때마다 정확도가 5~30포인트씩 떨어집니다.

영수증이 인보이스와 다른 점은 레이아웃보다 더 중요한 부분, 바로 매체 자체가 불안정하다는 것입니다. 대부분의 영수증은 감열지에 인쇄되는데, 이 열에 민감한 코팅은 빛, 열, 시간에 노출되면 점진적으로 바랍니다. 구매 당일에는 또렷하게 읽히던 영수증도 몇 주 후에는 세금 금액, 날짜, 품목이 부분적으로 읽히지 않을 수 있으며, 어떤 OCR 엔진도 종이에서 물리적으로 사라진 텍스트는 복구할 수 없습니다. SROIE 조직위원회는 벤치마크의 핵심 과제로 "낮은 종이 품질, 낮은 잉크 및 인쇄 품질, 저해상도 스캐너와 스캔 왜곡, 접힌 인보이스"를 명시적으로 꼽았습니다 (Huang et al., 2019). 아래 차트는 단계별로 발표된 정확도 범위를 보여줍니다. 각 연구에서 사용된 지표는 행에 표시되어 있는데, 문자, 단어, 필드 수준의 수치는 서로 직접 비교할 수 없기 때문입니다. SROIE 수치는 F1 점수, 즉 정밀도와 재현율의 조화 평균(Hmean)으로, 감지된 대부분의 단어가 정확해야 하고 대부분의 실제 정답 단어도 찾아야 합니다.

상태별 영수증 OCR 정확도: 평평한 깨끗한 원본 94.7% 문자 정확도, 구겨진 원본 86.9%, 바랜 감열지 영수증 64.7–73.3% 오픈소스 엔진별 단어 정확도, 실제 휴대폰 촬영 영수증 66.7–68.7% 필드 수준 판매자명 정확도.

출처: IJSAT (2026) — 인쇄 문서 300 DPI에서 EasyOCR 문자 정확도; KORIE (2026) — 퇴화된 한국어 감열지 영수증 748장, 17,587개 크롭, 오픈소스 엔진 단어 정확도(Tesseract 64.7%, EasyOCR 68.6%, PaddleOCR 73.3%); RMIT Textract 연구 (2025) — 실제 영수증 118장 대상 판매자명 필드 정확히 일치. 문자 수준 수치는 단어 또는 필드 수준 수치와 직접 비교할 수 없습니다. 자세한 내용은 지표가 중요한 이유를 참조하세요.

영수증 상태정확도 범위지표출처연도표본
깨끗한 스캔 영수증>90% (24개 팀 중 7개 팀); 최고 <99%단어 수준 F1 (Hmean)SROIE / Huang et al.2019스캔 영수증 1,000장, 24개 팀
평평하고 깨끗한 원본94.7%문자 정확도IJSAT2026EasyOCR, 300 DPI
구겨진 원본86.9%문자 정확도IJSAT2026EasyOCR, 300 DPI
바래거나 접힌 감열지 영수증55–73%단어 정확도KORIE2026한국 감열지 영수증 748장, 17,587개 이미지 조각, 4개 엔진
실사 휴대폰 촬영66.7–68.7%필드 수준 정확히 일치RMIT Textract 연구2025호주 영수증 118장, 약 65% 휴대폰 사진

출처는 위 표에 명시되어 있습니다. KORIE 행은 합성적 성능 저하가 아닌 실제 감열지의 물리적 손상을 보존한 유일한 공개 벤치마크입니다. 이 벤치마크의 300-DPI 평판 스캔은 "스캔" 최상의 경우에도 용지 자체의 노화가 반영되어 있음을 의미합니다. SROIE 상한 행은 2019년 당시 기술 기준이며, 동일 데이터셋에서 최신 LLM 엔진은 전체 필드 정확도 84.3–93.0%에 도달합니다.

필드 유형별 분석: 총액은 쉽고, 판매자명은 어렵습니다

필드 유형은 두 번째로 큰 영향 요인이며, 이를 보고한 모든 연구에서 놀랍도록 일관된 결과를 보여줍니다. 숫자 요약 필드는 판매자명이나 업체명 같은 텍스트 식별 필드보다 훨씬 안정적으로 추출됩니다. 아래 차트는 626개 영수증으로 구성된 전체 SROIE 테스트 세트에서 5개 최신 LLM 엔진의 성능을 동일한 필드 수준 정확히 일치 프로토콜로 측정한 결과입니다(Doubleword, 2026).

SROIE 테스트 세트에서 5개 LLM 엔진의 필드 수준 정확히 일치 정확도: 총액 94.9–98.9%, 날짜 84.3–92.5%, 판매자명 73.1–87.7%.

출처: Doubleword (2026) — SROIE 테스트 영수증 626건, 필드 수준 정확히 일치, 엔진 5개(Qwen3-VL-235B/30B, GPT-5-mini/5.2/5-nano). 방법론을 완전히 공개한 D등급 벤더 벤치마크이며, 방향성은 ReceiptSense (2024)가 뒷받침합니다. 해당 연구는 아랍어–영어 영수증에서 숫자 #Units 필드가 F1 93.42에 도달한 반면, 텍스트 Brand 필드는 F1 62.30으로 떨어지는 것을 확인했습니다.

이러한 패턴은 매우 다른 조건과 언어에서도 유지됩니다. RMIT Textract 연구는 총액이 "일관되게 감지"된 반면 판매자명은 오작동하는 것을 발견했으며, 이는 Doubleword 순위와 정확히 일치합니다(2025). 실무적으로 중요한 점은 "영수증 OCR 정확도"라는 헤드라인 수치가 가장 쉬운 필드와 가장 어려운 필드를 하나의 숫자로 평균화한다는 것입니다. 총액만 필요한 지출 워크플로는 판매자명과 품목까지 필요한 워크플로보다 근본적으로 더 쉬운 작업을 기준으로 수치를 제시하는 셈입니다.

엔진 등급별 분석

엔진 선택은 문서 상태와 필드 유형보다 영향이 작지만, 각 상태가 도달할 수 있는 상한선을 결정합니다. 아래 표는 측정 맥락이 서로 다른 네 가지 등급을 구분합니다: 영수증 말뭉치로 미세 조정된 연구 모델, 미세 조정 없이 사용되는 범용 LLM, 실제 문서를 처리하는 클라우드 API, 그리고 레거시/전통 엔진입니다.

엔진 등급정확도지표 / 맥락출처연도
미세 조정된 문서 AI (CORD SOTA)필드 F1 91.3–97.5%Donut 91.3%, LayoutLMv2 96.0%, LayoutLMv3 97.5% — 깨끗한 인도네시아 영수증, 태스크에 학습됨Donut; LayoutLMv2; MDPI 조사2021–2022
미세 조정된 문서 AI (SROIE)필드 F1 97.8% (LayoutLMv2); 논문 평균 약 0.95깨끗한 스캔 영어 영수증; 체계적 문헌고찰 평균 F1 0.95LayoutLMv2; KIE SLR2021 / 2024
일반 LLM, 미세 조정 없음CORD 80.9% / SROIE 필드 F1 83.9%인컨텍스트 학습만, 태스크 학습 없음 — 솔직한 "설정 불필요" 기준선LLM-TKIE2025
SROIE의 최신 LLM 엔진 (2026)전체 필드 정확도 84.3–93.0%Qwen3-VL-235B 93.0%, GPT-5-mini 87.7%, GPT-5-nano 84.3% — 전체 테스트 세트 626건Doubleword2026
다양한 실제 문서 대상 클라우드 APIF1 0.75–0.85Google Invoice/Expense Parser, 약 1,500개 다양한 레이아웃Google Developer Forum2024
실제 휴대폰 촬영 영수증 대상 클라우드 API판매자명 필드 66.7–68.7%호주 실제 영수증 118건 대상 AWS Textract AnalyzeExpenseRMIT Textract 연구2025
클라우드 API — 인보이스 맥락필드 정확도 78–98%GPT-4o+OCR 98%, Azure 93%, Google 82%, Textract 78% — 영수증이 아닌 인보이스; 더 쉬운 상한선으로 제시BusinessWareTech2025
영수증 대상 레거시/전통 OCR약 64%벤더 백서 등급 주장; D등급 하한선 참고로만 사용DATABASICS2024

위 표에 나열된 출처 기준입니다. CORD 및 SROIE 수치는 모델이 해당 작업에 미세 조정된 깨끗한 벤치마크 말뭉치에서의 필드 수준 F1으로, 낙관적 상한선이지 실제 환경 기대치가 아닙니다. 실제 환경 행은 서로 다른 문서 모집단을 측정하므로 직접 비교할 수 없으며, 두 행 모두 해당 조건이 표시되어 있습니다. DATABASICS 수치는 단일 공급업체의 등급 주장으로, 하한 참고용으로만 제시됩니다.

다중 통화 및 다중 언어 영수증

글로벌 비용 처리 워크플로에는 세 번째 차원이 추가됩니다. 이 페이지의 모든 벤치마크 데이터셋은 단일 언어 또는 이중 언어이며, 필드별 수치가 게시된 유일한 다국어 연구에서도 총액 대비 텍스트 격차에 추가 스크립트 페널티가 더해진 동일한 패턴이 나타납니다. 아랍어-영어 영수증 20,000건에서 미세 조정 없이 일반 LLM은 제로샷으로 F1 32.07~42.98에 그쳤고, 필드당 3개의 예시를 제공하자 F1 60.60~80.26으로 상승했습니다. 반면 숫자 #Units 필드는 F1 93.42를 기록한 반면 텍스트 Brand 필드는 F1 62.30에 머물렀습니다(ReceiptSense, 2024). RMIT 연구는 생산 환경에서 동일한 스크립트 효과를 관찰했습니다. 비영어 제품명이 포함된 영수증은 "부분적으로만 파싱"되어 품목 데이터가 조용히 누락되었습니다(2025).

언어 / 말뭉치정확도지표출처연도
영어최고 KIE F1 90.49%(2019); LLM 전체 84.3~93.0%(2026)필드 수준 F1 / 정확히 일치SROIE; Doubleword2019 / 2026
인도네시아어(CORD)필드 F1 91.3~97.5%필드 수준 F1Donut; LayoutLMv22021~2022
한국어단어 정확도 55~73%단어 정확도KORIE2026
아랍어-영어 혼합(ReceiptSense)제로샷 F1 32~43%; 3샷 61~80%; 숫자 필드 93.4 대 텍스트 필드 62.3필드 수준 F1ReceiptSense2024
비영어 제품명품목이 부분 또는 전체 누락됨정성적RMIT Textract 연구2025

위 표에 출처가 나열되어 있습니다. 통화 효과를 스크립트를 고정한 채 분리한 동료 검토 연구는 없습니다. 실제 워크플로에서의 "다중 통화" 격차는 주로 스크립트와 레이아웃 변형에 의해 발생하며, 숫자 값 자체는 인식되면 잘 추출됩니다. 이는 제한 사항에서 데이터 격차로 표시되며, 공급업체 수치로 대체되지 않습니다.

측정 항목이 중요한 이유: 문자, 단어, 필드는 서로 다른 세 가지 답변입니다

이 페이지의 넓은 범위는 측정 오류가 아닙니다. "정확도"라는 같은 단어를 쓰는 서로 다른 세 가지 질문입니다. 영수증 하나가 동시에 문자 정확도 98%, 단어 정확도 약 85%, 필드 정확도 약 75%를 기록할 수 있으며, 세 숫자 모두 사실입니다.

문자 정확도는 개별 문자를 셉니다. 오류율 1%는 100자당 한 글자 오류를 의미합니다. 단어 정확도는 한 글자만 잘못 읽어도 전체 단어가 실패합니다. WER로 측정되며, 이것이 KORIE의 최고 엔진이 문자 오류율(CER) 15.84%에 불과하지만 WER 26.73%를 기록하는 이유입니다. 단어 수준에서 오류가 거의 두 배입니다(KORIE, 2026). 필드 정확도는 판매자명, 날짜, 총액 등 필드 전체가 한 글자나 토큰 오류로 실패합니다. 이것이 SROIE 주최측이 "영수증 OCR은 일반 OCR 작업보다 훨씬 높은 정확도 요구 사항을 가진다"고 결론 내린 이유이며, 필드 수준 F1이 비용 워크플로가 실제로 소비하는 지표인 이유입니다(Huang et al., 2019). 이 페이지의 모든 수치는 해당 수준으로 표시됩니다. 이를 하나의 "영수증 OCR 정확도" 숫자로 혼합하는 것이 바로 99% 주장이 만들어지는 방식입니다.

이 데이터를 사용하는 방법

영수증 OCR이 비용 처리 프로세스에서 어떤 성과를 낼지 예측하기 위해 파일럿 프로젝트가 필요하지 않습니다. 위의 범위를 사용한 4단계 간단 계산으로 "벤더가 말하는 99%"를 방어 가능한 예상 오류 수로 바꿀 수 있습니다. 그리고 이 계산은 엔진이 아니라 영수증의 상태가 결과를 결정한다는 것을 보여주는 경우가 많습니다.

  1. 영수증 구성을 상태별로 분류합니다. 월간 영수증 볼륨을 위의 성능 저하 단계에 따라 분류합니다. 일반적인 필드 영업 비용 흐름은 다음과 같습니다: 40% 새 휴대폰 촬영, 30% 접힘/구겨짐, 20% 바랜 감열지, 10% 다국어 또는 손글씨 주석.
  2. 실제로 필요한 필드를 선택합니다. 워크플로에 총액과 날짜만 필요하다면 94.9–98.9% 및 84.3–92.5% 범위를 사용합니다 (Doubleword 2026). 정책 확인이나 벤더 분석을 위해 판매자명이 필요하다면 73.1–87.7% 범위를 사용하고, 실제 최저치는 67% 근처가 될 것으로 예상합니다.
  3. 월간 예상 오류 수를 계산합니다. 영수증당 6개 필드에 대해 평균 필드 정확도 80%, 월 1,000장의 영수증을 가정하면 검토 전에 월간 약 1,200개의 잘못된 필드가 발생합니다 (1,000 × 6 × 20%). 전체 영수증을 검토하는 대신 신뢰도가 낮은 필드만 사람이 검토하도록 지정합니다. 대부분의 엔진이 제공하는 필드별 신뢰도 점수는 전체 재입력 워크플로를 소규모 예외 큐로 전환합니다.
  4. 구매 전에 기대치를 설정합니다. 해당 오류 수를 현재 수동 입력 오류율(일반적으로 필드의 1–4%) 및 잘못된 필드 각각의 검토 비용과 비교합니다. 특정 상태 구성을 기준으로 이 페이지의 범위를 초과하는 벤더 견적은 자체 영수증에 대한 필드 수준 벤치마크가 함께 제공되어야 합니다.

이는 대략적인 추정 공식이며, 자체 문서에 대한 벤치마킹을 대체하지 않습니다. 이 페이지의 모든 게시된 범위는 다른 사람의 말뭉치에서 측정된 것입니다. 영수증 흐름에 적용되는 유일한 정확도 수치는 직접 측정한 값입니다. 이 페이지의 가치는 측정 전에 기대치를 설정하고, 어떤 지표를 요청해야 하는지 아는 데 있습니다.

자주 묻는 질문

영수증 OCR의 정확도는 어느 정도인가요?

솔직한 답변은 숫자 하나가 아니라 단계로 설명됩니다: 깨끗하게 스캔된 영수증의 단어 수준 정확도는 90% 이상, 실제 바랜 감열지 영수증의 단어 정확도는 55~73%(KORIE 2026), 실제 휴대폰으로 촬영한 영수증의 판매자명 필드 정확도는 66.7~68.7%입니다. 업체가 주장하는 97~99%는 새롭고 평평하며 조명이 잘 잡힌 촬영에서 쉬운 필드를 추출한 경우, 즉 사다리의 맨 꼭대기에 해당하며 중간 단계가 아닙니다.

OCR이 바랜 감열지 영수증을 읽을 수 있나요?

부분적으로 가능합니다. 그리고 손실은 물리적입니다: 바랜 감열지 텍스트는 종이에서 영구히 사라지므로 어떤 엔진도 복구할 수 없습니다. 실제 바램과 구김 흔적이 남은 한국어 감열지 영수증에서 오픈소스 엔진은 단어 정확도 55~73%에 그쳤습니다(KORIE 2026). 최고 성능(PaddleOCR, 73.3%)도 여전히 네 단어 중 약 한 단어는 틀립니다. 유일한 확실한 해결책은 영수증이 바래기 전에 촬영하는 것입니다.

영수증을 구기면 OCR 정확도에 영향을 미치나요?

네, 측정 가능할 정도로 영향을 미칩니다. 통제된 300-DPI 테스트에서 구김은 문자 정확도를 94.7%에서 86.9%로 약 8%포인트 떨어뜨렸으며, 오염과 물 손상은 각각 80.9%와 72.7%까지 더 떨어뜨렸습니다(IJSAT 2026). RMIT 연구의 실제 영수증 중 약 50%가 접히거나 구겨진 상태였으며, 이는 약 67%의 판매자명 필드 결과와 일치합니다.

OCR이 추출하기 가장 어려운 영수증 필드는 무엇인가요?

판매자 이름이 일관되게 가장 어려우며, 다섯 개 LLM 엔진에서 필드 정확도 73.1~87.7%를 기록했습니다. 반면 총액은 94.9~98.9%로 가장 쉬웠고, 날짜는 84.3~92.5%로 그 사이에 있습니다. 동일한 순위가 실제 휴대폰 촬영 영수증(RMIT 2025)과 아랍어-영어 영수증에서도 나타납니다.

영수증 OCR이 인보이스 OCR보다 정확도가 낮나요?

네, 실제로 그렇습니다. 인보이스는 표준화된 레이아웃의 PDF나 평판 스캔으로 제공되는 반면, 영수증은 감열지에 휴대폰 촬영, 구겨짐, 레이아웃 없음 등의 특성을 가집니다. 이러한 차이는 유사한 클라우드 엔진에서 확인됩니다. 인보이스의 경우 엔진별 필드 정확도가 78~98%(BusinessWareTech 2025)인 반면, 동일한 엔진 클래스를 실제 휴대폰 촬영 영수증에 적용한 결과 판매자명 필드에서 66.7~68.7%의 정확도를 보였습니다.

휴대폰 촬영이 스캔에 비해 영수증 OCR 정확도를 얼마나 떨어뜨리나요?

동일한 영수증에 대한 동료 검토를 거친 통제 비교 연구는 없습니다. 이는 실제 데이터 공백입니다. 존재하는 증거는 다음과 같습니다. RMIT 연구의 영수증 중 약 65%가 휴대폰 사진이었고, 44%가 기울어져 있었으며 12.7%가 흐릿했고, 판매자명 필드 정확도는 66.7~68.7%였습니다. 반면 더 높은 점수를 기록한 SROIE 및 KORIE 벤치마크는 평판 스캔을 사용했습니다. 방향적으로 볼 때 휴대폰 촬영은 기울어짐, 그림자, 흐릿함을 추가하여 각각 정확도를 성능 저하 단계에서 끌어내리지만, 정확한 감소 폭은 발표된 문헌에서 측정되지 않았습니다.

SROIE란 무엇이며 왜 중요한가요?

SROIE(Scanned Receipt OCR and Information Extraction)는 ICDAR 2019 대회로, 최초의 표준화된 영수증 OCR 벤치마크를 만든 대회입니다. 실제 스캔 영수증 1,000장을 대상으로 텍스트 위치 파악, OCR, 핵심 필드 추출 작업을 포함합니다(Huang et al., 2019). 이 벤치마크가 중요한 이유는 게시된 팀 간 결과가 있는 유일한 영수증 벤치마크이기 때문입니다. 2019년 최고의 방법조차 영수증 애플리케이션이 요구하는 99% 정확도에 미치지 못했습니다. 동일한 데이터셋에 대한 최신 LLM의 전체 정확도는 84.3~93.0%입니다(Doubleword 2026).

방법론 및 출처

이 페이지가 만들어진 방식

이 페이지는 2019~2026년에 걸친 14개의 독립적인 연구 데이터를 종합합니다. 출처는 세 가지 기준으로 선정되었습니다: (1) 표본 크기가 명시된 공개된 방법론, (2) 가능한 경우 최근 3년 이내에 수집된 데이터, (3) 일반적인 문서 주장이 아닌 영수증 특화 OCR 및 추출과의 관련성. 여러 출처가 동일한 지표를 보고하는 경우, 보수적인 범위를 사용합니다 — 과소 주장을 선호합니다. 출처 간에 상당한 불일치가 있는 경우, 그 불일치는 평균으로 희석하지 않고 지표 수준, 문서 상태 또는 말뭉치로 설명합니다.

지표 구분이 이 페이지의 핵심입니다: 문자 수준, 단어 수준, 필드 수준 수치는 단일 숫자로 혼합되지 않으며, 각 차트와 표 행은 자체 지표를 명시합니다. 공급업체 자체 보고 수치는 D등급으로 표시되며 확인된 참고 자료로만 사용됩니다. SROIE 벤치마크 결과는 2019년 기술이며 연도로 표시됩니다; 동일 데이터셋의 현대 LLM 결과(Doubleword 2026)는 최신성을 위해 함께 표시됩니다.

출처 목록

  1. Huang, Z. 외 — "ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction" (2019). 동료 검토를 거친 대회 보고서; 스캔 영수증 1,000장, 세 가지 과제에 걸쳐 29/24/18개의 유효 제출. Task-3 최고 F1 90.49%, "18개 팀 중 90%를 넘은 팀은 단 하나뿐"/"절반 이상이 80% 미만"이라는 결과, 그리고 Task-2에서 "최고 성능의 방법조차 99% 요구 기준에 도달하지 못함"이라는 진술을 제공합니다.
  2. Park, S. 외 — "CORD: A Consolidated Receipt Dataset for Post-OCR Parsing" (2019). 학술 데이터셋 논문; 인도네시아 영수증 11,000장 이상, 4개 상위 클래스 아래 30개 필드; 공개 하위 집합 800/100/100. 연구 모델 행에서 사용된 말뭉치 정의와 필드 수준 F1 평가 프로토콜을 제공합니다.
  3. Xu, Y. 외 — "LayoutLMv2" (ACL 2021). 동료 검토 논문. CORD 필드 F1 96.01%와 SROIE 필드 F1 97.81%를 제공합니다.
  4. Kim, G. 외 — "Donut: OCR-free Document Understanding Transformer" (ECCV 2022). 동료 검토 논문 및 공식 모델 저장소. CORD 필드 F1 91.3%(donut-base-finetuned-cord-v2)를 제공합니다.
  5. "KORIE: A Multi-Task Benchmark for Detection, OCR, and Information Extraction on Korean Retail Receipts" — MDPI Mathematics (2026). 동료 검토 저널; 실제 바램/줄무늬/구김 아티팩트가 있는 한국 감열지 영수증 748장, OCR 크롭 17,587개. 실제 열화 환경에서의 유일한 단어 수치를 제공합니다: PaddleOCR WER 26.73%, EasyOCR 31.43%, Tesseract 35.26%, BiGRU 44.47%.
  6. "Towards Analysing Invoices and Receipts with Amazon Textract" (RMIT, 2025). 학술 사례 연구; 호주 영수증 118장, 약 65%가 휴대폰 촬영, 약 50%가 접힘/구겨짐, 44%가 기울어짐. 판매자명 정확히 일치 68.7%/66.7%(로고 레이아웃), "총액이 일관되게 감지됨"이라는 결과, 그리고 언어 제한 관찰을 제공합니다.
  7. Abdallah, A. 외 — "ReceiptSense: Beyond Traditional OCR" (2024). 학술 사전 인쇄본; 아랍어–영어 영수증 20,000장, OCR 이미지 30,000개. 제로샷 F1 32.07–42.98%, 3샷 F1 60.60–80.26%, 숫자 필드와 텍스트 필드 간 격차를 제공합니다.
  8. "Optical Character Recognition Accuracy on Degraded Documents" — IJSAT 17(2) (2026). 동료 검토; 네 가지 물리적 조건에서 300 DPI의 EasyOCR. 물리적 손상 행에 사용된 평판 94.7% / 구겨짐 86.9% / 오염 80.9% / 젖음 72.7% 문자 정확도 성능 저하 단계를 제공합니다.
  9. "Deep Learning based Key Information Extraction from Business Documents: Systematic Literature Review" (2024). 학술 체계적 문헌 검토. 발표된 논문들의 평균 필드 F1을 제공합니다: CORD 0.94, SROIE 0.95.
  10. "Large language model driven transferable key information extraction mechanism for nonstandardized tables" (2025). 동료 검토; LLM-TKIE, 미세 조정 없음, 3샷. 설정 없는 LLM 기준으로 CORD F1 80.9 / SROIE F1 83.9를 제공합니다.
  11. Doubleword — "Structured Data Extraction" SROIE 벤치마크 (2026). 방법론을 완전히 공개한 벤더 벤치마크로, 전체 626건 영수증 SROIE 테스트 세트, 필드 수준 정확히 일치, 5개 LLM 엔진을 사용합니다. 전체 84.3~93.0%와 필드별 범위를 제공합니다.
  12. Google Developer Forum — "Low F1 Score with Document AI on Diverse Invoice and Expense Layouts" (2024). Google 공식 포럼의 사용자 경험 기반 측정으로, 약 1,500건의 다양한 문서를 대상으로 합니다. 클라우드 API 실제 환경에서 F1 0.75~0.85 범위를 제공합니다.
  13. BusinessWareTech — "AWS Textract vs Google, Azure, and GPT-4o: Invoice Extraction Benchmark" (2025). 독립적인 제3자 벤치마크입니다. 인보이스 환경 엔진 계층을 제공합니다: GPT-4o+OCR 98%, Azure 93%, Google 82%, Textract 78% — 영수증의 더 쉬운 상한선입니다.
  14. DATABASICS — "Receipt Capture & OCR for Expense Reports" 백서. 벤더 백서로, 하한 참고용으로만 사용합니다. 전통적 OCR 약 64% / AI 개선 85~95% / LLM 97~99% 계층 구조를 제공하며, 정확도는 이미지 품질, 레이아웃, 필기체에 따라 달라질 수 있음을 명시합니다.

한계

  • 지리적 범위: 출처는 아시아-태평양 및 중동에 집중되어 있습니다. 북미, 라틴 아메리카 또는 아프리카에 대한 영수증 특화 학술 벤치마크는 발견되지 않았습니다 — 미국/영국 영수증 OCR 정확도는 현재 동료 검토 연구가 아닌 공급업체 주장과 일화적 포럼 보고를 통해서만 문서화되어 있습니다.
  • 방법론 제약: 지표 수준은 연구마다 다르며 혼합하지 않고 행별로 표시됩니다; 여러 핵심 수치는 단일 연구에 의존합니다. Doubleword 및 Google-Forum 수치는 등급이 공개된 상태로 사용되는 D/C등급입니다. IJSAT 구겨짐/바램 수치는 영수증이 아닌 인쇄 문서에서 비롯된 것입니다 — 감열지 영수증은 더 심하게 성능이 저하될 것으로 예상되지만, 이는 추론이며 그렇게 명시되어 있습니다.
  • 시간적 공백: SROIE 대회 데이터는 2019년 것입니다; 절대 수치는 2019년 시대 방법을 반영하며 연도로 표시되고, 동일 데이터셋의 현대 LLM 결과(Doubleword 2026)가 함께 제공됩니다. SROIE 2019 이후 게시된 교차 팀 결과가 있는 새로운 표준화된 영수증 대회는 발견되지 않았습니다.
  • 찾을 수 없었던 것: (1) 동일한 영수증에 대한 휴대폰 촬영과 평판 스캔을 비교하는 동료 검토 통제 연구 — 공급업체 마케팅에서 가장 많이 인용되는 변수; (2) 영수증 특화 품목 추출 벤치마크; (3) 스크립트를 고정한 상태에서 통화 효과를 분리한 연구; (4) 손으로 쓴 영수증 추가 사항에 대한 벤치마크; (5) 전자 영수증/스크린샷과 촬영된 종이에 대한 공개 벤치마크. 이러한 공백은 검증되지 않은 공급업체 수치로 채우지 않고 명시합니다.

관련 참고 자료: 문서 유형별 OCR 정확도 · 필기 인식 정확도 · 문서 처리 비용 분석 · 수동 데이터 입력 오류율

관련 읽을거리: 수기 영수증 데이터 수동 입력의 비용 · AI 필기 추출 정확도가 계속 향상되는 방법

📮 contact email: [email protected]