광학 문자 인식(OCR)이란 무엇인가요?

최종 검토: 2026-08-08 · 적용 대상: 문서 자동화 / 데이터 추출 / 컴퓨터 비전

범위: 이 정의는 문서 데이터 추출에 사용되는 광학 문자 인식(OCR)을 다룹니다. 즉, 스캔된 문서, 사진, 이미지 전용 PDF를 다운스트림 시스템에서 검색, 편집, 처리할 수 있는 기계 판독 가능 텍스트로 변환하는 것입니다. 지능형 문서 처리(IDP) 플랫폼, 컴퓨터 비전의 전체 분야, 또는 문서 워크플로우가 아닌 일반 이미지 처리에서의 OCR 사용과 같은 관련되지만 다른 개념은 포함하지 않습니다.
다른 이름: "텍스트 인식" 또는 "문서 디지털화"라고도 합니다.

광학 문자 인식(OCR)은 인쇄물, 필기체, 또는 타자된 텍스트의 이미지를 기계가 읽을 수 있는 텍스트로 변환하는 기술입니다 — 스캔한 문서, 사진, PDF의 내용을 수동으로 다시 입력하지 않고도 컴퓨터가 검색, 편집, 처리할 수 있게 해줍니다.

OCR 작동 방식

OCR은 네 단계로 작동합니다. 첫째, 스캐너나 카메라가 문서를 이미지로 캡처합니다. 둘째, 전처리 단계에서 해당 이미지를 정리합니다: 기울기 보정, 잡티와 노이즈 제거, 대비 보정, 그리고 텍스트가 배경과 명확히 분리되도록 흑백으로 변환합니다. 셋째, 인식 엔진이 각 형태를 알려진 문자 패턴이나 특징 규칙과 대조하여 분석합니다. 마지막으로, 후처리 단계에서 사전과 문맥을 사용하여 명백한 오류를 수정합니다 — 원시 매칭 결과 "cl0ud"를 사전에 0으로 시작하는 단어가 없으므로 "cloud"로 되돌리는 식입니다.

인식 단계 내부에는 두 가지 고전적인 알고리즘이 있습니다(IBM Think). 패턴 인식은 각 스캔된 문자를 저장된 모든 알려진 글리프의 템플릿과 비교합니다 — "글리프"란 문자의 고유한 모양/크기/글꼴 조합 하나를 의미합니다 — 그리고 가장 가까운 일치 항목을 반환합니다. 훈련된 글꼴에 대해서는 빠르고 정확하지만, 익숙하지 않은 글꼴에서는 실패합니다. 특징 인식은 대신 문자의 구조에 대한 규칙을 적용합니다 — 기울어진 선, 교차점, 고리, 곡선의 개수 등, 예를 들어 "A"는 가로 막대로 연결된 두 개의 대각선이라는 규칙 — 이를 통해 한 번도 본 적 없는 글꼴도 인식할 수 있습니다. 현대 시스템은 두 가지를 결합한 후, 문법과 단어 빈도 문맥을 사용하여 잔여 오류를 수정하는 언어 모델에 텍스트를 전달합니다.

핵심 차이점: OCR은 의미 없는 텍스트를 생성합니다. 페이지에 어떤 문자가 있는지는 알려주지만, 문서가 무엇을 의미하는지는 알려주지 않습니다. 전통적인 OCR 엔진은 "INVOICE TOTAL: $1,250.00"을 문자 문자열 "INVOICE TOTAL: $1,250.00"로 변환하지만, 이것이 청구서이며 $1,250.00이 합계라는 것을 이해하지는 못합니다. 인식된 텍스트를 구조화된 필드로 바꾸는 이러한 이해 계층은 별도의 기술로, AI 시대에 와서야 실용화되었습니다.

OCR이 중요한 이유

OCR은 사실상 모든 문서 자동화 워크플로우의 입력 계층이며, 시장도 이를 반영합니다. 글로벌 OCR 시장은 2025년 158억 달러로 평가되었으며, 2034년까지 481억 달러에 이를 것으로 전망됩니다(IMARC Group, 2025). OCR이 등장하기 전에는 스캔된 모든 송장, 양식, 계약서가 단순한 이미지에 불과했습니다. 검색도, 편집도 불가능했고 오직 사람만이 읽을 수 있었습니다. 미국 의회도서관의 Chronicling America 프로그램은 OCR이 구현하는 규모를 보여줍니다. 1,600만 페이지 이상의 역사적인 미국 신문(1789~1963)이 기계 판독 가능한 OCR 텍스트 레이어로 디지털화되어, 200년치 신문을 누구나 키워드로 검색할 수 있게 되었습니다.

OCR이 중요한 두 번째 이유는 정확도 주장이 모호해지는 지점이 바로 여기이며, 공급업체들이 일상적으로 그 모호함을 이용하기 때문입니다. 유럽 데이터 보호 위원회(EDPB)의 기술 지침에 따르면, 깨끗한 인쇄 문서의 경우 95~99%의 OCR 정확도가 일반적으로 달성 가능하며, 100% 정확도를 제공하는 시스템은 없다는 점을 명시하고 있습니다. 정확성을 보장하는 유일한 방법은 사람의 검토입니다(EDPB, 2024). "99% 정확도"라는 주장은 무엇을 측정했는지 알 때만 의미가 있습니다. 깨끗한 인쇄물의 문자인지, 지저분한 실제 문서의 필드인지에 따라 완전히 다른 수치이기 때문입니다.

OCR의 역사와 진화

OCR의 기원은 1914년으로 거슬러 올라갑니다. 물리학자 에마누엘 골드버그가 문자를 읽어 표준 전신 부호로 변환하는 기계를 만들었는데, 이는 가장 초기의 문서화된 문자 판독 장치 중 하나입니다. 1920년대 후반과 1930년대에 그는 이를 마이크로필름 아카이브 검색용 "통계 기계(Statistical Machine)"로 개량했고, 1931년 미국 특허 제1,838,389호를 취득했으며, 이후 IBM이 이 특허를 인수했습니다(Wikipedia). IBM은 1959년에 이 용어를 공식화했고, 1966년에는 손으로 쓴 숫자를 읽을 수 있는 최초의 상업용 스캐너인 IBM 1287을 출시했습니다(RPA Technologies).

전환점은 1974년이었습니다. 레이 커즈와일이 Kurzweil Computer Products를 설립하고 최초의 옴니폰트 OCR(omni-font OCR)을 구축했습니다. 이는 사실상 모든 글꼴로 인쇄된 텍스트를 인식할 수 있는 시스템이었습니다. 1976년에는 이를 시각 장애인용 독서 기계로 상용화하여 전미 시각 장애인 연합회와 함께 공개했고, 1978년에는 상업용 버전이 출시되었으며, 1980년에는 제록스가 이 회사를 인수했습니다(Veriff). 1990년대와 2000년대에 걸쳐 OCR은 대규모 디지털화의 엔진이 되었습니다. 전미 디지털 신문 프로그램과 미국 의회도서관은 OCR을 기반으로 Chronicling America를 구축하여 수천만 페이지의 검색 가능한 신문을 확보했으며, 미국 국립표준기술연구소(NIST)는 1989년부터 1998년까지 미국 국세청(IRS) 및 미국 인구조사국과 협력하여 자체 OCR 연구 프로그램을 운영하며 1990년과 2000년 인구총조사를 직접 지원했습니다(NIST).

2010년대에는 딥러닝이 등장했습니다. 신경망이 수작업으로 만든 특징 규칙을 대체하면서 인쇄 텍스트 인식 정확도는 90% 후반대에 이르렀고, 필기 인식도 실용화되었습니다. 2020년대에는 비전-언어 모델(VLM)이 등장했습니다. VLM은 시각적 이해와 언어 이해를 결합한 멀티모달 AI 시스템으로, 하나의 모델이 텍스트를 읽는 동시에 문서의 구조와 의미를 파악할 수 있습니다. GPT-4V에 대한 학술 평가에서는 라틴 문자 텍스트 인식과 표 구조 이해에서 뛰어난 성능을 보였지만, 다국어 및 복잡한 레이아웃에서는 한계도 드러났습니다. 이는 VLM이 OCR을 단순히 대체하는 것이 아니라 그 역할을 재편하고 있음을 시사합니다(SCUT-DLVCLab, 2023).

OCR의 유형

OCR은 단일 기술이 아니라 가장 단순한 방식부터 가장 정교한 방식까지 네 가지 인식 접근법으로 구성된 기술군입니다. IBM과 Coursera 모두 동일한 네 가지 분류를 설명합니다(IBM Think; Coursera):

단순 OCR

저장된 글꼴 템플릿에 대해 문자 단위로 패턴 매칭을 수행합니다. 깨끗하고 잘 알려진 글꼴과 표준 인쇄 문서에서는 빠르고 정확하지만, 학습되지 않은 흔하지 않은 글꼴, 손상된 스캔, 필기체에는 취약합니다.

광학 마크 인식(OMR)

문자가 아닌 마크를 감지합니다. 채워진 동그라미, 체크박스, 선택 표시 등 양식에 미리 정의된 마크를 인식합니다. 표준화 시험, 설문조사, 투표 집계에 활용되며, 중요한 것은 영역이 채워졌는지 여부이지 내용이 무엇인지가 아닙니다.

지능형 문자 인식(ICR)

고정된 템플릿 대신 예제를 학습하는 머신러닝 기반 OCR 변형으로, 필기체 인쇄 문자를 글리프 단위로 하나씩 읽습니다. 인간 필기의 자연스러운 변형을 처리할 수 있지만, 문자 경계가 흐려지는 필기체는 여전히 어려운 과제입니다.

지능형 단어 인식(IWR)

개별 문자가 아닌 전체 단어나 구를 단위로 읽고 문맥을 활용합니다. 개별 문자 경계가 모호하지만 전체 단어는 인식 가능한 필기체에서 특히 유용합니다. 네 가지 접근법 중 가장 정교합니다.

실제 문서 처리 시스템은 대부분 하이브리드 방식입니다. OMR은 체크박스를, 단순 OCR은 깨끗한 인쇄물을, ICR/IWR은 필기 입력란을 처리합니다. 이 모든 것이 종종 동일한 양식에서 함께 작동합니다.

OCR이 사용되는 분야

OCR은 거의 다른 어떤 인식 기술보다도 더 많은 산업 분야에 걸쳐 사용됩니다. 가장 중요한 다섯 가지 적용 분야는 다음과 같습니다:

  • 매입채무/재무: OCR은 공급업체 청구서, 구매 주문서, 비용 영수증을 디지털화하여 자동 추출을 지원하므로, 건당 수 시간이 걸리던 수동 입력 작업을 수 초로 단축하고 재입력 오류를 줄입니다.
  • 의료: 환자 접수 양식, 의료 기록, 처방전, 보험 청구서를 OCR로 스캔하고 판독하여, 재입력 없이 전자 건강 기록과 청구 시스템으로 정보가 흘러 들어갈 수 있게 합니다.
  • 법률: 계약 검토와 eDiscovery는 스캔된 증거 문서를 검색 가능하게 만드는 OCR에 의존합니다. 수백만 페이지에 대한 키워드 검색은 모든 페이지에 기계 판독 가능한 텍스트 레이어가 있어야만 가능합니다.
  • 물류: 운송 라벨, 추적 번호, 자동차 번호판, 컨테이너 코드는 운송 중에 OCR로 판독되어, 사람이 따라잡을 수 없는 벨트 속도로 패키지를 처리하는 분류 및 추적 시스템에 데이터를 공급합니다.
  • 은행: 모바일로 입금되는 수표는 계좌 번호, 라우팅 번호, 금액까지 OCR로 처음부터 끝까지 판독되며, 이것이 원격 수표 입금이 작동하는 방식입니다. KYC 문서 검증에도 동일한 기술이 사용됩니다.
  • 정부 기록 보관소: 인구 조사 기록, 부동산 문서, 신문은 대규모로 디지털화됩니다. Chronicling America만 해도 1,600만 페이지가 넘는 OCR 처리 신문을 보유하여 수백 년의 역사를 온라인에서 검색 가능하게 만들었습니다.
  • 접근성: OCR은 시각 장애인과 저시력 사용자를 위한 텍스트 음성 변환의 판독 레이어입니다. 커즈와일이 1976년에 최초의 독서 기계를 만드는 데 사용한 바로 그 기술이 오늘날에도 화면 판독기와 독서 앱의 기반이 되고 있습니다.

흔한 오해

  • 오해: "OCR은 AI다 — 문서를 이해한다."
  • 사실: OCR은 문자를 인식할 뿐 의미를 이해하지 못합니다. 전통적인 OCR 출력은 맥락이 없는 텍스트입니다. 페이지에 "$1,250.00"이라고 적혀 있다는 것은 알 수 있지만, 그것이 송장 합계라는 것은 알지 못합니다. 읽기와 이해는 별개의 능력이며, 이해 계층이 바로 현대 AI 시스템이 OCR 위에 추가하는 부분입니다 (IBM Think).
  • 오해: "99% 정확도는 문서의 99%가 완벽하게 처리된다는 뜻이다."
  • 사실: "99%"라는 수치는 일반적으로 깨끗한 인쇄 텍스트에 대한 문자 단위 정확도를 의미합니다. 문서에는 많은 문자가 포함되어 있어 99.9%의 문자 정확도에서도 빽빽한 페이지에는 여러 오류가 발생할 수 있습니다. 문서 추출에서 송장 번호나 금액의 한 글자 오류는 전체 필드를 무효화합니다. EDPB 지침은 단호합니다: 어떤 OCR 시스템도 100% 정확도를 달성하지 못합니다, 유일한 보장은 사람의 검토입니다 (EDPB, 2024).
  • 오해: "OCR은 인쇄물만큼 필기체도 잘 읽을 수 있다."
  • 사실: 전통적인 OCR은 인쇄 및 타자 텍스트를 대상으로 합니다. 필기체는 별도의 문제 영역으로 ICR 또는 IWR이 필요하며, 이들조차 인쇄 텍스트 정확도에는 미치지 못합니다. 공급업체의 인쇄 문서 정확도 수치는 필기 양식을 처리하는 방식에 대해 아무것도 알려주지 않습니다.
  • 오해: "OCR은 최근에 나온 AI 발명품이다."
  • 사실: OCR은 100년 이상의 역사를 가지고 있습니다 — 에마누엘 골드버그의 텍스트 판독 기계는 1914년으로 거슬러 올라가며, 상업용 OCR 시스템은 1950년대에 이미 존재했습니다. 새로운 것은 딥러닝이 실제 워크플로우를 자동화할 수 있을 만큼 정확하게 만든 것이며, 기술 자체는 현대 컴퓨팅보다 앞섰습니다 (Wikipedia).

자주 묻는 질문

OCR은 무엇의 약자인가요?

OCR은 광학 문자 인식(Optical Character Recognition)의 약자로, 인쇄물, 필기체 또는 타자된 텍스트의 이미지를 기계가 읽을 수 있는 텍스트로 변환하는 기술입니다. "텍스트 인식"이라고도 불립니다.

OCR과 ICR의 차이점은 무엇인가요?

OCR은 인쇄 및 타자된 텍스트를 읽고, ICR은 필기체를 읽습니다. OCR은 저장된 글꼴 템플릿과 문자를 대조하는 반면, ICR은 머신러닝을 사용하여 사람 필기의 자연스러운 변형을 해석합니다. 다만 ICR은 분리된 손으로 쓴 활자체에 적용되며, 필기체에는 적용되지 않습니다. 필기체의 경우 관련 기술인 IWR 방식이 문맥 속에서 전체 단어를 읽습니다.

OCR의 정확도는 어느 정도인가요?

깨끗한 인쇄 문서의 경우, EDPB 기술 지침에 따르면 OCR 정확도 95–99%가 일반적으로 달성 가능하며, 100%에 도달하는 시스템은 없습니다. 유일한 보장은 사람의 검토뿐입니다(EDPB, 2024). 정확도는 스캔 품질, 특이한 글꼴, 필기체, 복잡한 레이아웃에 따라 급격히 떨어집니다. 깨끗한 인쇄물에 대한 문자 수준 정확도는 실제 문서에 대한 필드 수준 정확도와 다릅니다. 인보이스 합계에서 단 하나의 문자가 잘못 읽히면 문자의 99%가 정확하더라도 전체 필드가 틀리게 됩니다.

OCR 정확도 주장은 어떻게 평가하나요?

정확도 수치를 신뢰하기 전에 세 가지 질문을 해야 합니다: (1) 어떤 수준이 측정되었나요? 문자 수준, 단어 수준 또는 필드 수준 — 99%의 문자 정확도 주장은 80%의 필드 추출률을 숨길 수 있습니다. 오류는 가장 중요한 숫자와 코드에 집중되기 때문입니다. (2) 어떤 문서가 테스트되었나요? 깨끗한 디지털 PDF와 구겨진 열전사 영수증은 완전히 다른 수치를 생성합니다. 정확도 주장은 사용자의 문서 유형에 맞춰져야 합니다. (3) 어떤 조건인가요? EDPB는 해상도, 기울기, 대비, 노이즈를 정확도 결정 요인으로 제시합니다(EDPB, 2024). 또한 공급업체가 신뢰도 점수를 공개하는지, 낮은 신뢰도 결과에 대해 어떻게 처리하는지 확인해야 합니다. 검토 대상으로 표시된 출력은 조용히 잘못된 출력보다 더 신뢰할 수 있기 때문입니다.

OCR과 AI는 같은 것인가요?

아닙니다. 전통적인 OCR은 패턴 매칭과 특징 규칙에 기반한 인식 기술로, 현대 AI보다 수십 년 앞서 존재했습니다. AI 시대에 달라진 점은 머신러닝(그리고 최근에는 비전-언어 모델(VLM))이 필기나 복잡한 레이아웃 같은 어려운 입력에 대해 OCR의 정확도를 비약적으로 높이고, 인식된 텍스트를 구조화된 데이터로 변환하는 이해 계층을 추가했다는 것입니다. OCR은 하나의 구성 요소이며, AI 기반 문서 이해는 이를 기반으로 구축됩니다.

오늘날 OCR은 어디에 사용되나요?

OCR은 문서 자동화의 입력 계층으로, 송장, 영수증, 양식, 계약서를 이미지에서 검색·편집·기계 판독이 가능한 텍스트로 변환합니다. 실제로는 은행의 모바일 수표 입금, 법률 분야의 eDiscovery 검색, 의료 및 정부 부문의 기록 디지털화, 물류의 운송 라벨 판독, 접근성을 위한 텍스트 음성 변환 읽기에 사용됩니다.

출처

  1. IBM Think — "광학 문자 인식(OCR)이란 무엇인가?". IBM 공식 설명 자료: 정의, 패턴 인식 대 특징 인식 알고리즘, 전처리 파이프라인, 네 가지 OCR 유형을 다룹니다. 정의 및 작동 원리 분석의 주요 출처.
  2. Wikipedia — "광학 문자 인식". OCR 정의, 역사, 네 가지 유형 분류에 대한 인용된 개요. 역사 연대표 및 유형 분류의 주요 출처.
  3. 유럽 데이터 보호 위원회 — "AI 잠재적 위험 및 완화: 광학 문자 인식"(2024). 공식 EU 기술 지침: 인쇄 문서에서 일반적으로 달성 가능한 95–99% 정확도, 100%를 달성하는 시스템 없음, 신뢰도 점수 메커니즘, 정확도에 영향을 미치는 요인. 모든 정확도 주장의 주요 출처.
  4. 미국 의회도서관 — Chronicling America 컬렉션. 전미 디지털 신문 프로그램 아카이브: 기계 판독 가능한 OCR 텍스트 레이어가 포함된 1,600만 개 이상의 디지털화된 신문 페이지. 디지털화 규모 주장의 주요 출처.
  5. 미국 국립표준기술연구소(NIST) — 광학 문자 인식(OCR) 연구 프로그램. 미국 정부 연구 역사: 미국 국세청(IRS) 및 미국 인구조사국과 함께한 1989–1998년 NIST의 OCR 및 필기 인식 작업. NIST의 OCR 참여에 대한 주요 출처.
  6. SCUT-DLVCLab — "대규모 멀티모달 모델에서 OCR의 숨겨진 신비"(2023). 장면 텍스트, 필기, 표 구조, 문서 추출 전반에 걸친 GPT-4V의 OCR 성능에 대한 동료 검토 평가. 비전-언어 모델 시대 주장의 주요 출처.
  7. IMARC Group — 광학 문자 인식 시장 보고서(2025). 시장 조사: 2025년 158억 달러 시장, 2034년까지 481억 달러로 전망. 시장 규모 주장의 주요 출처.
  8. Veriff — "광학 문자 인식(OCR)이란 무엇인가?". 골드버그 1914, 1931년 특허, 커즈와일 1974, 1976년 독서 기계를 다루는 역사 서술. Wikipedia 역사 연대표를 뒷받침합니다.
  9. Coursera — "광학 문자 인식이란 무엇인가?". 네 가지 유형 분류를 확인하는 교육용 설명 자료. IBM 유형 분류를 뒷받침합니다.
  10. RPA Technologies — "OCR 기술: 전신 코드에서 AI 지능까지". IBM이 1959년 OCR을 명명했고 IBM 1287(1966)이 필기 숫자를 읽은 최초의 상업용 스캐너였다는 역사 서술을 확인합니다. 초기 IBM 역사 주장을 뒷받침합니다.

관련 자료: ABBYY 전통 OCR과 현대 AI OCR 비교 · AI가 필기체를 처리하는 방식과 템플릿 기반 OCR 비교 · 필기 문서용 AI OCR

📮 contact email: [email protected]