OCR 정확도 주장 읽는 법:구매 전 꼭 물어봐야 할 5가지 질문

문서 추출 도구를 평가하는 사람이라면 누구나 한 번쯤 벤더의 "99% 정확도" 주장을 보고 가입한 뒤, 실제 문서 첫 배치를 업로드하고 실제 정확도가 85%에 가깝다는 사실을 발견하게 됩니다. 그들은 거짓말에 속은 것이 아닙니다. 그들이 실제로 던지고 있던 질문, 즉 "이 도구가 내 문서에서도 작동할까?"라는 질문에 답하도록 설계된 적이 없는 숫자에 속은 것입니다. 벤더가 보고하는 정확도와 실제 성능 사이의 격차는 우연이 아닙니다. 이는 정확도 주장이 구성되는 방식의 예측 가능한 결과입니다. 그리고 무엇을 물어봐야 하는지 알게 되면, 그 격차는 구매 전에 보이게 됩니다.

수작업 입력은 그만 — AI가 대신 읽어드립니다
이미지나 PDF를 업로드하세요 — 10초 만에 정형 데이터로
지금 체험하기 →
Title 'How to Read an OCR Accuracy Claim: 5 Questions to Ask Before You Buy' with three icons below: Test Set, Field-Level, Your Docs, on a light gradient background with hand-drawn data decorations.

핵심 요점

  1. 99% 정확도 주장은 어려운 사례를 모두 먼저 제거한 깨끗하고 완벽한 스캔에서 측정되기 때문에, 실제로 처리하는 지저분한 문서는 제외됩니다.
  2. 문자 수준 정확도는 실제 현장 열 추출에서 도구의 성능이 헤드라인 수치보다 10~15포인트 낮을 수 있다는 사실을 숨깁니다.
  3. 오늘 밤 모든 후보 도구에 자신의 문서 20개를 테스트해 보세요. 결정의 근거가 될 만한 유일한 정확도 수치는 직접 측정한 수치이기 때문입니다.

99%가 생각보다 의미가 적은 이유

두 개의 게이지가 나란히: 왼쪽 게이지는 바늘이 녹색 영역에 있고 '깨끗한 인쇄 텍스트'와 '99% 이상'으로 표시, 오른쪽 게이지는 바늘이 빨간색 영역에 있고 '손글씨 텍스트'와 '70–95%'로 표시, 상단에 제목.

문서 추출 도구의 일반적인 랜딩 페이지에는 "송장 OCR 정확도 99.9%"라고 적혀 있을 수 있습니다. 그 숫자는 체크마크 아이콘 옆에 표시됩니다. 증거처럼 보이고, 엔지니어링 수준처럼 보입니다. 하지만 이 숫자가 알려주지 않는 것이 있습니다: 그 99.9%가 단일 템플릿의 완벽한 품질 스캔에서 측정된 것인지, 문자를 기준으로 한 것인지 필드를 기준으로 한 것인지, 그리고 테스트 세트에 실제로 처리하는 문서 유형이 제외되었는지 여부입니다.

AIMultiple의 2026 OCR 벤치마크의 독립적인 평가는 그 격차를 보여줍니다: 주요 API 서비스는 깨끗한 인쇄 텍스트에서 99% 이상을 달성하지만 엔진에 따라 손글씨에서는 약 70–95%로 떨어집니다 — 이 범위는 두 도구가 전체적으로 99%를 주장하더라도 실제 문서에서 25퍼센트 포인트 차이가 날 수 있을 만큼 넓습니다. 헤드라인 숫자는 벤더가 어느 쪽에 속하는지 알려주지 않습니다. 헤드라인 숫자는 원래 그렇게 의도된 것이 아니기 때문입니다.

아래의 다섯 가지 질문은 모호한 정확도 주장을 구체적인 평가로 바꿔줍니다. 평가하기 전에 이 질문들을 던지면, 어떤 벤더가 실제 테스트를 수행했는지 — 그리고 어떤 벤더가 당신이 묻지 않기를 바라는지 — 알 수 있습니다.

Q1: 어떤 문서로 테스트했나요?

정확도는 도구의 속성이 아닙니다. 특정 문서 세트에 대한 도구의 속성입니다. 세트를 바꾸면 숫자도 바뀝니다 — 때로는 극적으로 바뀝니다. 균일하고 고해상도의 단일 언어 송장으로 테스트하는 벤더는 손글씨 양식, 바랜 복사본, 폰 카메라 영수증이 섞인 혼합 코퍼스로 테스트하는 벤더보다 높은 정확도를 보고할 것입니다. 두 숫자 모두 사실일 수 있습니다. 오직 하나만이 당신이 경험할 결과를 예측합니다.

테스트 세트의 정확한 구성을 요청하세요: 문서 수, 출처 수, 언어 수, 해상도 범위. 벤더가 이 내역을 제시할 수 없다면 정확도 수치는 기준점이 없는 것입니다. 알 수 없는 데이터 세트에 대한 주장을 알 수 없는 문서에 적용한 것 — 즉, 유용하지 않다는 뜻입니다.

이 시점은 또한 도구가 템플릿 매칭이나 구역 OCR에 의존하는지 확인하기 좋은时机입니다. 레이아웃이 다양해지면 이러한 방식은 작동하지 않습니다. OCR 정확도가 실제로 의미하는 바에서 다루듯이, 템플릿 기반 시스템은 훈련된 형식 내에서는 잘 작동하지만 그 외부에서는 완전히 실패할 수 있습니다 — 단일 "99%" 숫자로는 절대 드러나지 않는 사실입니다.

Q2: 어느 수준에서 측정하나요 — 문자, 단어, 아니면 필드?

문자 수준, 단어 수준, 필드 수준의 세 가지 정확도 지표를 비교한 그림, 제목 '정확도 지표: 문자 vs 단어 vs 필드'.

정확도는 세 가지 수준에서 측정할 수 있으며, 공급업체는 보통 가장 높은 수치가 나오는 기준을 보고하는 경향이 있습니다.

문자 수준 정확도(CER)는 엔진이 개별 문자를 몇 개나 올바르게 읽는지 집계합니다. 문서에 1,000개의 문자가 있고 990개가 맞다면 CER 99%입니다. 인상적으로 들리지만 실제 업무에서는 가장 덜 유용한 지표입니다. 문자가 하나만 틀려도 전체 필드의 가치가 무너질 수 있기 때문입니다. $1,429.50의 인보이스 합계를 OCR이 $1,429.50으로 읽었다면 8자 중 7자가 맞아 문자 정확도는 87.5%지만, 필드는 완전히 틀린 것입니다. 그 합계가 AP 시스템이 지급하는 금액이라면 나머지 문자가 아무리 깨끗해도 오류는 비용으로 이어집니다.

필드 수준 정확도는 인보이스 번호, 납기일, 품목 금액 등 각 완전한 데이터 포인트가 완벽하게 추출되는지 측정합니다. 필드는 맞거나 틀리거나 둘 중 하나입니다. 숫자 하나만 잘못 읽어도 해당 필드 전체가 실패합니다. 이것이 실제 비즈니스 성과와 직결되는 지표입니다. LlamaIndex의 OCR 정확도 분석에 따르면 2026년 벤치마크는 완전 자동 처리를 위한 필드 수준 정확도 기준을 99.9% — 즉 필드 1,000개당 오류 1개 — 로 설정합니다. 이 기준 미만이면 수동 검토가 불가피합니다.

문자 수준 정확도와 필드 수준 정확도의 차이는 학문적인 문제가 아닙니다. 문자 정확도 99%를 보고하는 도구가 같은 문서에서 필드 정확도 90% 미만을 기록할 수도 있습니다. 문서 유형별 OCR 정확도가 떨어지는 이유에서 살펴보듯이, 복잡한 레이아웃에서는 표 경계를 하나만 잘못 해석해도 행의 모든 필드가 뒤섞이면서 그 격차는 더 벌어집니다.

공급업체가 정확도 수치를 제시하면 가장 먼저 이렇게 물어보세요. "그것은 문자 수준, 단어 수준, 아니면 필드 수준인가요? 그리고 문서 유형별로 세분화된 필드 수준 결과를 공유해 주실 수 있나요?"

Q3: 테스트 세트에서 제외된 것은 무엇인가요?

공급업체의 테스트 방법론 문서 — 블로그에 게시하거나 백서에 포함하는 문서 — 는 정확도 수치보다 제외 기준에 더 유용한 정보를 담고 있는 경우가 많습니다. 그들은 의도적으로 무엇을 제외했을까요?

일반적인 제외 항목으로는 필기 텍스트, 데이터 필드와 겹치는 스탬프나 로고가 있는 문서, 다중 페이지 PDF, 저해상도 모바일폰 사진, 비영어권 언어, 여백에 주석이나 수정 사항이 있는 문서 등이 있습니다. 각 제외 항목은 보고된 정확도의 적용 범위를 좁힙니다. 필기를 제외한 99% 수치가 필기 배송 메모가 워크플로에 포함된 경우에는 무의미합니다 — OCR 필기 정확도 현실에서 자세히 설명하듯이, 동일한 엔진에서 인쇄 텍스트와 필기 정확도 간의 격차는 20퍼센트 포인트 이상일 수 있습니다. 다중 언어 문서를 제외한 벤치마크는 이중 언어 인보이스를 도구가 어떻게 처리할지에 대해 아무것도 알려주지 않습니다.

특히 중요한 제외 항목은 회전, 기울어짐, 또는 저대비 이미지의 처리입니다. 전통적인 OCR 엔진은 이러한 입력에 취약합니다. 2026년 OCR 소프트웨어 비교에서 언급했듯이, 일부 도구는 인식 전에 이미지 품질을 정규화하는 전처리 파이프라인을 적용하지만, 많은 도구는 그렇지 않으며 정확도 주장은 입력이 이미 깨끗하다는 것을 암묵적으로 가정합니다.

직접 물어보세요: "어떤 문서 유형, 품질 수준, 조건을 제외했으며, 제외한 문서 유형에 대한 정확도 결과를 구체적으로 공유해 주실 수 있나요?" 그 답변은 헤드라인 수치보다 더 많은 정보를 알려줄 것입니다.

Q4: 어떤 오류 허용 범위가 적용되었나요?

필드 수준에서도 덜 명확한 변수가 있습니다: 값이 "정확"하다고 간주되려면 얼마나 근접해야 할까요? 일부 공급업체는 추출된 값이 사소한 형식 정규화 — 구두점 제거, 날짜 형식 표준화, 앞자리 0 무시 — 후 일치하면 필드를 정확한 것으로 간주합니다. 이는 합리적입니다. 그러나 다른 업체는 더 나아가 숫자 필드가 실제 값의 일정 비율 이내이면 정확한 것으로 간주하거나, 하위 문자열이 일치하면 수용하거나, 철자로 표기된 숫자를 숫자 형태와 동등하게 취급합니다.

이러한 허용 범위가 반드시 잘못된 것은 아닙니다. 일부 애플리케이션은 날짜가 MM/DD/YYYY 또는 YYYY-MM-DD 형식인지 실제로 신경 쓰지 않습니다. 문제는 허용 범위가 정확도 수치와 함께 거의 공개되지 않는다는 것입니다. 달러 금액에 5% 변동을 허용하는 98% 필드 수준 수치는 모든 필드에서 문자별 정확 일치를 요구하는 98% 수치와 매우 다른 의미입니다.

이는 합계, 수량, 세액과 같은 숫자 필드에서 특히 관련이 있습니다 — 정확도가 가장 중요하고 단 하나의 잘못된 숫자도 조정 곤란을 초래하는 필드입니다. 도구가 인보이스 합계에서 99% 필드 정확도를 보고하지만 $1,429.50과 $1,429.00을 1% 허용 범위 내의 차이로 일치로 간주한다면, 실제 정확 일치 정확도는 광고된 것보다 낮습니다.

물어보세요: "정확한 추출로 간주되는 기준은 정확히 무엇인가요? 근사 일치가 정확한 것으로 계산되나요? 어떤 임계값에서 그런가요?"

Q5: 내 문서와 비슷한 문서에서의 정확도는 얼마인가요?

두 개의 열: 왼쪽은 '공급업체 테스트 세트'라고 표시된 문서 스택 아이콘과 빨간 X, 오른쪽은 '내 문서'라고 표시된 단일 문서 아이콘과 녹색 체크표시, 제목 '공급업체 테스트 세트 vs 내 문서'.

이것이 궁극적으로 가장 중요한 유일한 질문이며, 대부분의 구매자가 건너뛰는 질문이기도 합니다. 공급업체의 테스트 세트에는 그들의 문서가 포함되어 있습니다 — 그들이 선택하고, 선별하고, 최적화한 문서들입니다. 내 문서에는 내 공급업체, 내 고객, 내 형식, 내 이미지 품질, 내 필드 유형이 포함되어 있습니다. 이 둘은 서로 다른 것입니다.

실용적인 테스트 방법은 다음과 같습니다: 팀이 실제로 접하는 품질과 다양성의 범위를 대표하는 샘플 20~50개를 준비하세요. 동일한 세트를 평가 중인 모든 공급업체에 보내세요. 워크플로에 관련 없는 텍스트가 아닌, 실제로 중요하게 여기는 특정 필드 — 송장 합계, 구매 주문 번호, 라인 항목 설명 — 에 대한 필드 수준 정확도를 측정하세요. 결과를 나란히 비교하세요.

내 문서에 대한 블라인드 평가를 거부하거나, 자체 샘플만 사용한 선별된 데모만 제공하는 공급업체는 감동을 주기 위해 만들어진 숫자 — 내 결과를 예측하기 위해 만들어진 숫자가 아닌 — 를 제공하는 것입니다. 내 테스트 세트를 환영하고 도구가 잘하는 부분과 어려워하는 부분을 공유하는 공급업체는 진실을 말하는 것입니다.

이것이 바로 기본 추출 패러다임이 중요한 이유이기도 합니다. 기존 OCR 도구와 템플릿 기반 시스템은 각각의 새 형식에 대해 학습하거나 구성해야 합니다. ImageToTable.ai와 같은 비전-언어-모델 기반 도구는 템플릿 불필요 및 형식 독립적입니다: 페이지에서의 위치가 아닌 필드의 의미를 이해하여 문서를 읽으므로, 단일 구성으로 다양한 레이아웃에서 작동합니다. 테스트 샘플에서 측정한 정확도가 실제 운영에서 얻는 정확도입니다 — 형식별 튜닝이 필요 없습니다.

FAQ

좋은 OCR 정확도 수치는 얼마인가요?

좋은 수치는 무엇을 추출하는지, 무엇을 오류로 간주하는지에 따라 다릅니다. 깨끗한 인쇄 텍스트의 경우 대부분의 최신 도구로 필드 수준 정확도 97% 이상을 달성할 수 있습니다. 필기 문서의 경우 최상위 엔진으로 필드 수준 정확도 90–95%가 현실적입니다. 가장 솔직한 답변: 자신의 문서로 테스트하고 자체 기준을 설정하세요. 보편적인 "좋은" 수치는 없습니다.

공급업체는 오해의 소지가 있는 문자 수준 정확도를 왜 사용하나요?

그것이 그들이 만들 수 있는 가장 높은 수치이기 때문입니다. 문자 수준 정확도는 평균화의 이점을 누립니다. 8자 합계에서 숫자 하나가 틀리고 4자 통화 코드에서 문자 하나가 틀리면 이 두 필드에서 문자 정확도 84%가 산출됩니다. 하지만 합계와 통화 코드가 정확한지가 중요하다면 두 필드 모두 100% 틀린 것입니다. 공급업체는 제품이 가장 좋아 보이는 지표를 보고하며, 구매자의 압력이 아직 필드 수준 보고를 표준화하도록 강제하지 않았습니다.

독립적인 OCR 벤치마크를 신뢰할 수 있나요?

네, 단 한 가지 주의사항이 있습니다: 벤치마크가 내 문서 유형과 유사한 문서로 테스트했는지 확인하세요. AIMultiple의 DeltOCR Bench나 오픈소스 OCRBench 같은 독립 벤치마크는 중립적인 비교를 제공하지만, 문서 구성이 내 워크플로우와 일치하지 않을 수 있습니다. 벤치마크를 후보 선별 필터로 사용한 다음, 최종 후보를 자신의 문서로 테스트하세요.

정확도가 높을수록 항상 더 나은 도구인가요?

아니요. 정확도는 한 가지 차원일 뿐입니다. 송장에서 필드 정확도 99.5%를 달성하지만 템플릿당 학습 샘플 10개가 필요하고, 공급업체가 레이아웃을 변경하면 중단되며, 통합 엔지니어의 지속적인 유지보수가 필요한 도구는 설정 없이 모든 형식에서 첫날부터 97% 정확도를 제공하는 도구보다 실질적으로 덜 가치 있을 수 있습니다. 설정 노력, 유지보수 비용, 문서 지원 범위가 마지막 두 퍼센트 포인트의 정확도보다 더 중요한 경우가 많습니다.

다음 단계

정확도 주장은 쓸모없는 것이 아닙니다 — 단지 불완전할 뿐입니다. 다섯 가지 질문에 모두 명확히 답하고, 문서 유형별 필드 수준 결과를 공유하며, 제외 사항과 허용 오차를 공개하고, 자신의 문서로 테스트하도록 초대하는 공급업체는 진지하게 고려할 가치가 있습니다. 회피하거나 사례 연구로 돌리거나 선별된 데모만 제공하는 공급업체도 무언가를 말하고 있는 것입니다 — 그 말을 들어보세요.

다음 한 시간 동안 팀이 가장 자주 처리하는 문서 샘플 세트를 모으세요. 후보 목록의 도구로 실행해 보세요. 워크플로우에 중요한 필드에서 필드 수준 정확도를 측정하세요 — 페이지의 모든 문자가 아니라. 돌아온 수치는 마케팅 주장보다 낮을 것입니다. 하지만 그것은 당신의 수치이며, 결정을 내릴 가치가 있는 유일한 수치입니다.

📮 contact email: [email protected]