광학 문자 인식(OCR)이란 무엇인가요?

최종 검토: 2026-08-08 · 적용 대상: 문서 자동화 / 데이터 추출 / 컴퓨터 비전

범위: 본 정의는 문서 데이터 추출에 사용되는 광학 문자 인식(OCR)을 다룹니다. 즉, 스캔한 문서, 사진, 이미지 전용 PDF를 다운스트림 시스템에서 검색, 편집, 처리할 수 있는 기계 판독 가능 텍스트로 변환하는 것입니다. 지능형 문서 처리(IDP) 플랫폼, 컴퓨터 비전의 전체 분야, 또는 문서 워크플로우가 아닌 일반 이미지 처리에서의 OCR 사용과 같은 관련되지만 다른 개념은 포함하지 않습니다.
다른 명칭: "텍스트 인식" 또는 "문서 디지털화"라고도 합니다.

광학 문자 인식(OCR)은 인쇄, 필기 또는 타자된 텍스트의 이미지를 기계가 읽을 수 있는 텍스트로 변환하는 기술입니다 — 스캔한 문서, 사진, PDF의 내용을 수동으로 다시 입력하지 않고도 컴퓨터가 검색, 편집, 처리할 수 있게 해줍니다.

OCR 작동 방식

OCR은 네 단계로 작동합니다. 첫째, 스캐너나 카메라가 문서를 이미지로 캡처합니다. 둘째, 전처리 단계에서 해당 이미지를 정리합니다: 기울기 보정, 잡음과 노이즈 제거, 대비 보정, 그리고 텍스트가 배경과 깨끗하게 분리되도록 흑백으로 변환합니다. 셋째, 인식 엔진이 각 형태를 알려진 문자 패턴 또는 특징 규칙과 비교 분석합니다. 마지막으로, 후처리 단계에서 사전과 문맥을 사용하여 명백한 오류를 수정합니다 — 사전에 0으로 시작하는 단어가 없기 때문에 원시 매칭 결과 "cl0ud"를 다시 "cloud"로 바꿉니다.

인식 단계 내부에는 두 가지 고전적인 알고리즘이 있습니다(IBM Think). 패턴 인식은 스캔된 각 문자를 알려진 모든 글리프의 저장된 템플릿과 비교하여 가장 가까운 일치 항목을 반환합니다. 학습된 글꼴에서는 빠르고 정확하지만, 익숙하지 않은 글꼴에서는 실패합니다. 특징 인식은 대신 문자의 구조에 대한 규칙을 적용하여 한 번도 본 적 없는 글꼴도 인식할 수 있습니다. 현대 시스템은 두 가지를 결합한 다음, 문법과 단어 빈도 문맥을 사용하여 잔여 오류를 수정하는 언어 모델에 텍스트를 전달합니다.

핵심 구분: OCR은 의미 없는 텍스트를 생성합니다. 페이지에 어떤 문자가 있는지는 알려주지만, 문서가 무엇을 의미하는지는 알려주지 않습니다. 전통적인 OCR 엔진은 "INVOICE TOTAL: $1,250.00"을 문자 문자열 "INVOICE TOTAL: $1,250.00"로 변환하지만, 이것이 인보이스라는 것 또는 $1,250.00이 합계라는 것을 이해하지 못합니다. 인식된 텍스트를 구조화된 필드로 바꾸는 이러한 이해 계층은 AI 시대에 와서야 실용화된 별도의 기술입니다.

OCR이 중요한 이유

OCR은 사실상 모든 문서 자동화 워크플로의 입력 계층이며, 시장도 이를 반영합니다. 글로벌 OCR 시장은 2025년 158억 달러로 평가되었으며, 2034년까지 481억 달러에 이를 것으로 전망됩니다(IMARC Group, 2025). OCR 이전에는 모든 스캔된 인보이스, 양식, 계약서가 단순한 이미지에 불과했습니다. 검색도, 편집도 불가능하고 사람만이 읽을 수 있었습니다. 미국 의회도서관의 Chronicling America 프로그램은 OCR이 구현하는 규모를 보여줍니다. 1,600만 페이지 이상의 미국 역사 신문(1789~1963)이 기계 판독 가능한 OCR 텍스트 레이어로 디지털화되어, 2세기에 걸친 신문을 누구나 키워드로 검색할 수 있게 되었습니다.

OCR이 중요한 두 번째 이유는 정확도 주장이 모호해지는 지점이 바로 여기이며, 공급업체들이 일상적으로 그 모호함을 이용하기 때문입니다. 유럽 데이터 보호 위원회(EDPB)의 기술 지침에 따르면, 깨끗한 인쇄 문서의 경우 95~99%의 OCR 정확도가 일반적으로 달성 가능하며, 100% 정확도를 제공하는 시스템은 없다고 명시되어 있습니다. 정확성을 보장하는 유일한 방법은 사람의 검토입니다(EDPB, 2024). "99% 정확도"라는 주장은 무엇을 측정했는지 알 때만 의미가 있습니다. 깨끗한 인쇄물의 문자인지, 지저분한 실제 문서의 필드인지에 따라 전혀 다른 수치입니다.

OCR의 역사와 진화

OCR의 기원은 1914년으로 거슬러 올라갑니다. 물리학자 에마누엘 골드버그가 문자를 읽어 표준 전신 부호로 변환하는 기계를 만들었는데, 이는 가장 초기에 기록된 텍스트 판독 장치 중 하나입니다. 1920년대 후반과 1930년대에 그는 이를 마이크로필름 아카이브 검색용 "통계 기계(Statistical Machine)"로 개량했고, 1931년 미국 특허 제1,838,389호를 취득했으며, 이후 IBM이 이 특허를 인수했습니다(Wikipedia). IBM은 1959년에 이 용어를 공식화했고, 1966년에는 손으로 쓴 숫자를 읽을 수 있는 최초의 상업용 스캐너인 IBM 1287을 출시했습니다(RPA Technologies).

전환점은 1974년에 찾아왔습니다. 레이 커즈와일이 Kurzweil Computer Products를 설립하고 사실상 모든 글꼴로 인쇄된 텍스트를 인식할 수 있는 최초의 전체 글꼴 OCR(omni-font OCR) 시스템을 구축했습니다. 1976년에는 이를 시각 장애인용 독서 기계로 제작하여 전미 시각 장애인 연합회와 함께 공개했고, 1978년에 상용 버전이 출시되었으며, 1980년에 제록스가 이 회사를 인수했습니다(Veriff). 1990년대와 2000년대에 OCR은 대규모 디지털화의 엔진이 되었습니다. 전미 디지털 신문 프로그램과 미국 의회도서관은 OCR을 기반으로 Chronicling America를 구축하여 수천만 페이지의 검색 가능한 신문을 제공했고, 미국 국립표준기술연구소(NIST)는 1989년부터 1998년까지 미국 국세청(IRS) 및 미국 인구조사국과 협력하여 자체 OCR 연구 프로그램을 운영하며 1990년과 2000년 10년 단위 인구조사를 직접 지원했습니다(NIST).

2010년대에는 딥러닝이 등장했습니다. 신경망이 수작업으로 만든 특징 규칙을 대체하면서 인쇄 텍스트 인식 정확도는 90%대 후반까지 올라갔고, 필기 인식도 실용화되었습니다. 2020년대에는 비전-언어 모델(VLM)이 등장했습니다. 시각적 이해와 언어 이해를 결합한 멀티모달 AI 시스템으로, 단일 모델이 텍스트를 읽는 동시에 문서의 구조와 의미를 파악할 수 있습니다. GPT-4V에 대한 학계 평가는 라틴 문자 텍스트 인식과 표 구조 이해에서 뛰어난 성능을 보여주는 한편, 다국어 및 복잡한 레이아웃에서는 한계를 드러냈습니다. 이는 VLM이 OCR을 단순히 대체하는 것이 아니라 그 역할을 재편하고 있음을 시사합니다(SCUT-DLVCLab, 2023).

OCR의 유형

OCR은 단일 기술이 아니라 네 가지 인식 접근법의 집합이며, 가장 단순한 방식에서 가장 정교한 방식 순으로 나열됩니다. IBM과 Coursera는 모두 동일한 4분류를 설명합니다(IBM Think; Coursera):

단순 OCR

저장된 글꼴 템플릿에 대해 문자 단위로 패턴 매칭을 수행합니다. 깨끗하고 잘 알려진 글꼴과 표준 인쇄 문서에서는 빠르고 안정적이지만, 훈련되지 않은 흔치 않은 글꼴, 손상된 스캔, 필기에는 취약합니다.

광학 마크 인식(OMR)

문자가 아닌 마크를 감지합니다. 양식의 채워진 동그라미, 체크박스, 확인 표시 및 기타 미리 정의된 마크를 인식합니다. 표준화 시험, 설문조사, 투표 집계에 활용되며, 여기서 중요한 것은 영역이 채워졌는지 여부이지 그 내용이 무엇인지가 아닙니다.

지능형 문자 인식(ICR)

고정된 템플릿이 아닌 예제를 학습하여 필기체 인쇄 문자를 글리프 단위로 읽어내는 OCR의 머신러닝 변형입니다. 인간 필기의 자연스러운 변형을 처리하지만, 문자 경계가 흐려지는 필기체는 여전히 어려운 과제입니다.

지능형 단어 인식(IWR)

개별 문자가 아닌 전체 단어나 구를 하나의 단위로 읽고 문맥을 활용합니다. 개별 문자 경계가 모호하지만 전체 단어는 인식 가능한 필기체에서 특히 유용합니다. 네 가지 접근법 중 가장 정교합니다.

대부분의 실제 문서 처리 시스템은 하이브리드 방식입니다. OMR은 체크박스를, 단순 OCR은 깨끗한 인쇄물을, ICR/IWR은 필기 입력란을 처리합니다. 흔히 동일한 양식 내에서 말이죠.

OCR이 사용되는 분야

OCR은 다른 어떤 인식 기술보다도 더 많은 산업 분야에 걸쳐 사용됩니다. 가장 중요한 다섯 가지 적용 영역은 다음과 같습니다:

  • 매입채무/재무: OCR은 공급업체 송장, 구매 주문서, 비용 영수증을 디지털화하여 자동 추출을 가능하게 하며, 송장당 수 시간의 수작업 입력을 몇 초로 단축하고 재입력 오류를 줄입니다.
  • 의료: 환자 접수 양식, 의료 기록, 처방전, 보험 청구서가 OCR로 스캔 및 판독되어 재입력 없이 전자 건강 기록과 청구 시스템으로 정보가 흘러 들어갑니다.
  • 법률: 계약 검토와 eDiscovery는 스캔된 증거 문서를 검색 가능하게 만들기 위해 OCR에 의존합니다. 수백만 페이지에 걸친 키워드 검색은 모든 페이지에 기계 판독 가능한 텍스트 레이어가 있어야만 가능합니다.
  • 물류: 운송 라벨, 추적 번호, 번호판, 컨테이너 코드는 운송 중에 OCR로 판독되어, 인간이 따라잡을 수 없는 벨트 속도로 패키지를 처리하는 패키지 분류 및 추적 시스템에 데이터를 공급합니다.
  • 은행: 모바일로 입금되는 수표는 계좌 번호, 라우팅 번호, 금액까지 OCR로 처음부터 끝까지 판독됩니다. 이것이 원격 수표 입금이 작동하는 방식이며, KYC 문서 검증에도 동일한 기술이 사용됩니다.
  • 정부 기록 보관소: 인구 조사 기록, 부동산 문서, 신문이 대규모로 디지털화됩니다. Chronicling America만 해도 1,600만 페이지 이상의 OCR 처리된 신문 페이지를 보유하며, 수백 년의 역사를 온라인에서 검색 가능하게 만듭니다.
  • 접근성: OCR은 시각 장애인과 저시력 사용자를 위한 텍스트 음성 변환의 판독 레이어입니다. 커즈와일이 1976년에 최초의 판독기를 만드는 데 사용한 바로 그 기술이 오늘날에도 화면 판독기와 읽기 앱의 기반이 되고 있습니다.

흔한 오해

  • 오해: "OCR은 AI라서 문서를 이해한다."
  • 사실: OCR은 문자를 인식할 뿐 의미를 이해하지 못합니다. 기존 OCR 출력은 맥락이 없는 텍스트입니다. 페이지에 "$1,250.00"이라고 적혀 있다는 것은 알 수 있지만, 그것이 청구서 합계라는 것은 알 수 없습니다. 읽기와 이해는 별개의 기능이며, 현대 AI 시스템이 OCR 위에 추가하는 것은 바로 이해 계층입니다(IBM Think).
  • 오해: "99% 정확도는 문서의 99%가 완벽하게 처리된다는 뜻이다."
  • 사실: "99%"라는 수치는 일반적으로 깨끗한 인쇄 텍스트에 대한 문자 단위 정확도를 의미합니다. 문서에는 많은 문자가 포함되어 있어 99.9%의 문자 정확도에서도 빽빽한 페이지에는 여러 오류가 발생할 수 있습니다. 문서 추출에서 청구서 번호나 금액의 한 글자만 틀려도 전체 필드가 무효화됩니다. 유럽 데이터 보호 위원회(EDPB)의 지침은 단호합니다. 어떤 OCR 시스템도 100% 정확도를 달성하지 못하며, 유일한 보장은 사람의 검토입니다(EDPB, 2024).
  • 오해: "OCR은 인쇄물만큼 필기체도 잘 읽는다."
  • 사실: 기존 OCR은 인쇄 및 타자 텍스트를 대상으로 합니다. 필기체는 별도의 문제 유형으로, ICR 또는 IWR이 필요하며, 이들조차 인쇄 텍스트 정확도에는 미치지 못합니다. 공급업체의 인쇄 문서 정확도 수치는 필기 양식을 처리하는 능력에 대해 아무것도 알려주지 않습니다.
  • 오해: "OCR은 최근에 나온 AI 발명품이다."
  • 사실: OCR은 100년 이상의 역사를 가지고 있습니다. 에마누엘 골드버그의 텍스트 판독기는 1914년으로 거슬러 올라가며, 상업용 OCR 시스템은 1950년대에 이미 존재했습니다. 새로운 것은 딥러닝 덕분에 실제 업무 흐름을 자동화할 수 있을 만큼 정확해졌다는 점이며, 기술 자체는 현대 컴퓨팅보다 앞섰습니다(Wikipedia).

자주 묻는 질문

OCR은 무엇의 약자인가요?

OCR은 광학 문자 인식(Optical Character Recognition)의 약자로, 인쇄물, 필기, 또는 타자된 텍스트의 이미지를 기계가 읽을 수 있는 텍스트로 변환하는 기술입니다. "텍스트 인식"이라고도 불립니다.

OCR과 ICR의 차이점은 무엇인가요?

OCR은 인쇄 및 타자된 텍스트를 읽고, ICR은 필기를 읽습니다. OCR은 저장된 글꼴 템플릿과 문자를 매칭하는 반면, ICR은 머신러닝을 사용하여 사람 필기의 자연스러운 변형을 해석합니다. 다만 ICR은 분리된 손으로 쓴 인쇄체 문자에만 적용되며, 필기체에는 적용되지 않습니다. 필기체의 경우 관련 기술인 IWR 방식이 문맥 속에서 전체 단어를 읽습니다.

OCR의 정확도는 어느 정도인가요?

깨끗한 인쇄 문서의 경우, EDPB 기술 지침에 따르면 OCR 정확도 95–99%가 일반적으로 달성 가능하며, 어떤 시스템도 100%에 도달하지 못합니다. 유일한 보장은 사람의 검토입니다(EDPB, 2024). 정확도는 스캔 품질, 비정형 글꼴, 필기, 복잡한 레이아웃에 따라 급격히 떨어집니다. 깨끗한 인쇄물에서의 문자 단위 정확도는 실제 문서에서의 필드 단위 정확도와 다릅니다. 송장 합계에서 한 글자만 잘못 읽어도 문자의 99%가 정확하더라도 전체 필드가 틀리게 됩니다.

OCR 정확도 주장은 어떻게 평가하나요?

정확도 수치를 신뢰하기 전에 세 가지 질문을 하세요: (1) 어떤 수준이 측정되었나요? 문자 단위, 단어 단위, 또는 필드 단위 — 99% 문자 정확도 주장은 80%의 필드 추출률을 숨길 수 있습니다. 오류는 가장 중요한 숫자와 코드에 집중되기 때문입니다. (2) 어떤 문서가 테스트되었나요? 깨끗한 디지털 PDF와 구겨진 감열지 영수증은 완전히 다른 수치를 산출합니다. 주장은 사용자의 문서 유형에 맞춰져야 합니다. (3) 어떤 조건인가요? EDPB는 해상도, 기울기, 대비, 노이즈를 정확도 결정 요인으로 제시합니다(EDPB, 2024). 또한 공급업체가 신뢰도 점수를 공개하는지, 낮은 신뢰도 결과를 어떻게 처리하는지 확인하세요. 검토 대상으로 표시된 출력이 조용히 틀린 출력보다 더 신뢰할 수 있기 때문입니다.

OCR과 AI는 같은 것인가요?

아닙니다. 전통적인 OCR은 인식 기술, 즉 패턴 인식과 특징 규칙에 기반한 기술로, 현대 AI보다 수십 년 앞서 존재했습니다. AI 시대에 달라진 점은 머신러닝(그리고 최근에는 비전-언어 모델(VLM))이 필기체와 복잡한 레이아웃 같은 어려운 입력에 대해 OCR의 정확도를 획기적으로 높이고, 인식된 텍스트를 구조화된 데이터로 변환하는 이해 계층을 추가했다는 것입니다. OCR은 구성 요소이며, AI 기반 문서 이해는 이를 기반으로 구축됩니다.

오늘날 OCR은 어떤 용도로 사용되나요?

OCR은 문서 자동화의 입력 계층으로, 송장, 영수증, 양식, 계약서를 이미지에서 검색·편집·기계 판독이 가능한 텍스트로 변환합니다. 실제로는 은행의 모바일 수표 입금, 법률 분야의 eDiscovery 검색, 의료 및 정부 부문의 기록 디지털화, 물류의 운송장 라벨 판독, 접근성을 위한 텍스트 음성 변환 읽기 등에 사용됩니다.

출처

  1. IBM Think — "광학 문자 인식(OCR)이란 무엇인가?". IBM의 공식 설명 자료: 정의, 패턴 인식 대 특징 인식 알고리즘, 전처리 파이프라인, 네 가지 OCR 유형. 정의 및 작동 원리 분석의 주요 출처.
  2. Wikipedia — "광학 문자 인식". OCR 정의, 역사 및 네 가지 유형 분류에 대한 인용된 개요. 역사 연대표 및 유형 분류의 주요 출처.
  3. 유럽 데이터 보호 위원회 — "AI 잠재적 위험 및 완화: 광학 문자 인식"(2024). 공식 EU 기술 지침: 인쇄 문서에서 일반적으로 달성 가능한 95~99% 정확도, 100%를 달성하는 시스템 없음, 신뢰도 점수 메커니즘, 정확도에 영향을 미치는 요인. 모든 정확도 주장의 주요 출처.
  4. 미국 의회도서관 — Chronicling America 컬렉션. 전미 디지털 신문 프로그램 아카이브: 기계 판독 가능한 OCR 텍스트 레이어가 포함된 1,600만 개 이상의 디지털화된 신문 페이지. 디지털화 규모 주장의 주요 출처.
  5. 미국 국립표준기술연구소(NIST) — 광학 문자 인식(OCR) 연구 프로그램. 미국 정부 연구 역사: 미국 국세청(IRS) 및 미국 인구조사국과 함께한 1989~1998년 NIST의 OCR 및 필기 인식 작업. NIST의 OCR 참여에 대한 주요 출처.
  6. SCUT-DLVCLab — "대규모 다중 모달 모델에서 OCR의 숨겨진 신비"(2023). 장면 텍스트, 필기, 표 구조 및 문서 추출에 걸친 GPT-4V의 OCR 성능에 대한 동료 검토 평가. 비전-언어 모델 시대 주장의 주요 출처.
  7. IMARC Group — 광학 문자 인식 시장 보고서(2025). 시장 조사: 2025년 158억 달러 시장, 2034년까지 481억 달러로 전망. 시장 규모 주장의 주요 출처.
  8. Veriff — "광학 문자 인식(OCR)이란 무엇인가?". 골드버그 1914, 1931년 특허, 커즈와일 1974, 1976년 판독 기계를 다루는 역사 서술. Wikipedia 역사 연대표를 뒷받침.
  9. Coursera — "광학 문자 인식이란 무엇인가?". 네 가지 유형 분류를 확인하는 교육용 설명 자료. IBM 유형 분류를 뒷받침.
  10. RPA Technologies — "OCR 기술: 전신 코드에서 AI 지능까지". IBM이 1959년 OCR을 명명했고 IBM 1287(1966)이 필기 숫자를 읽은 최초의 상업용 스캐너임을 확인하는 역사 서술. 초기 IBM 역사 주장을 뒷받침.

관련 자료: ABBYY 전통 OCR과 현대 AI OCR 비교 · AI가 필기체를 처리하는 방식과 템플릿 기반 OCR 비교 · 필기 문서용 AI OCR

📮 contact email: [email protected]