작은 글꼴이 OCR 정확도를
떨어뜨리는 이유 — 4가지 근본 원인과 해결책
계약서를 스캔하고, 작은 글씨 약관이 있는 은행 명세서에서 추출을 실행하고, 빽빽하게 서식이 지정된 표의 스크린샷에서 라인 항목 데이터를 가져오려고 시도한 적이 있을 것입니다. 10pt와 12pt 필드는 문제없이 추출되었습니다. 그러나 작은 텍스트는 엉터리 결과를 생성하거나 아무것도 생성하지 못했습니다. 문제는 AI가 작은 글꼴을 읽는 데 서툴다는 것이 아닙니다. 문제는 물리입니다. 150 DPI에서 6pt 문자는 대략 12픽셀 높이입니다. 12픽셀로는 어떤 시스템도 "8"과 "6" 또는 "rn"과 "m"을 구분할 수 있는 충분한 정보가 아닙니다.

핵심 요약
- 150 DPI로 스캔한 6pt 문자는 높이가 12픽셀입니다. 불과 12픽셀입니다. "8"과 "6"을 구분하는 특징은 이 12픽셀 중 2픽셀을 차지하며, 스캐너 노이즈 1픽셀이 그 차이를 지워버립니다. 이는 AI 문제가 아니라 시중의 모든 추출 도구가 공유하는 물리 문제입니다.
- 20픽셀 규칙: 문자의 높이가 20~25픽셀 미만이면 "rn"과 "m" 또는 "5"와 "S" 사이의 간격이 1픽셀의 모호함으로 붕괴됩니다. 대부분의 사무용 MFP 스캐너는 기본적으로 200 DPI로 설정되어 있어 10pt 미만의 모든 것을 위험 구역으로 밀어 넣습니다. 본문 텍스트는 잘 추출되는 반면 표 값은 노이즈로 변합니다.
- 캡처되지 않은 픽셀을 추가할 수는 없지만 물리와 싸우는 것은 멈출 수 있습니다. 작은 글꼴 문서를 400+ DPI로 스캔하고, 워크플로우에 실제로 필요한 데이터에 대해서만 추출 열을 정의하고, 7pt 미만 텍스트를 고쳐야 할 실패가 아닌 하드 한계로 취급하십시오.
문제는 AI가 아닌 물리입니다
OCR 엔진이나 비전 AI 모델이 작은 텍스트에서 실패할 때, 가장 먼저 드는 생각은 소프트웨어를 탓하는 것입니다. 하지만 진짜 병목 현상은 AI 처리가 시작되기 전에 발생합니다. 이는 글자당 사용 가능한 픽셀 수에 의해 결정됩니다.
수학을 살펴보겠습니다. 타이포그래피에서 '포인트'는 1/72인치입니다. 150 DPI에서 문자의 픽셀 높이는 다음과 같습니다:
픽셀 높이 = 글꼴 크기(pt) × DPI / 72
150 DPI에서 6pt 문자의 경우:
6 × 150 / 72 = 12.5 픽셀
12픽셀은 운영 체제의 터미널 창에서 허용하는 가장 작은 글꼴 크기의 한 글자 높이와 거의 같습니다. 이제 그 크기에서 문자 내부에서 어떤 일이 발생하는지 생각해 보십시오. '8'과 '6'을 구분하는 특징은 기껏해야 2~3픽셀에 불과합니다. 스캐너 센서의 단일 픽셀 노이즈, 약간의 페이지 기울어짐, 또는 휴대폰 사진의 JPEG 압축 블록이 그 구분을 완전히 없앨 수 있습니다. 작은 크기에서 문자 'm'과 문자 쌍 'rn'은 동일한 2~3픽셀 열 너비를 차지하여 구조적으로 동일해집니다.
이것은 더 나은 AI 학습이나 더 정교한 OCR 후처리로 해결할 수 있는 문제가 아닙니다. 입력 신호에 어떤 인식 시스템이든 올바른 출력을 생성하는 데 필요한 정보가 누락되어 있습니다. 이 글의 모든 후속 수정은 이 제약을 우회하거나 줄이는 방법이지만, 제약 자체는 피할 수 없습니다.
문자에 실제로 필요한 픽셀 수는?
작은 글꼴이 실질적인 문제가 되는 시점을 이해하려면 글꼴 크기와 스캔 해상도를 픽셀 높이로 매핑해야 합니다. 문자 인식의 임계 기준은 유사한 문자를 안정적으로 구별하기 위해 대략 20-25픽셀의 문자 높이입니다:
| 글꼴 크기 | 150 DPI | 200 DPI | 300 DPI | 400 DPI | 600 DPI |
|---|---|---|---|---|---|
| 6 pt | 12 px ✗ | 17 px ✗ | 25 px ⚠ | 33 px ✓ | 50 px ✓ |
| 7 pt | 15 px ✗ | 19 px ⚠ | 29 px ✓ | 39 px ✓ | 58 px ✓ |
| 8 pt | 17 px ✗ | 22 px ⚠ | 33 px ✓ | 44 px ✓ | 67 px ✓ |
| 10 pt | 21 px ⚠ | 28 px ✓ | 42 px ✓ | 56 px ✓ | 83 px ✓ |
| 12 pt | 25 px ✓ | 33 px ✓ | 50 px ✓ | 67 px ✓ | 100 px ✓ |

✗ = 신뢰할 수 없음 ⚠ = 경계 ✓ = 인쇄 텍스트에 일반적으로 신뢰할 수 있음. 이는 문자 높이 추정치이며, 인식은 획 두께, 대비, 글꼴 디자인에도 의존합니다.
표를 보면 패턴이 분명합니다: 표준 300 DPI에서 6pt 텍스트는 경계선에 위치합니다. 많은 사무용 복합기와 대부분의 팩스 문서의 해상도인 200 DPI에서는 10pt 미만의 모든 텍스트가 경계 또는 신뢰할 수 없음으로 표시됩니다. 150 DPI로 낮추면 12pt 이상만 신뢰할 수 있습니다.
원인 1: 스캔 해상도가 200 DPI 미만
작은 글씨 추출 실패의 가장 흔한 단일 원인은 대상 텍스트에 비해 스캔 해상도가 너무 낮은 경우입니다. 문제는 스캐너 하드웨어 자체가 부족하다는 것이 아니라, 스캔 워크플로가 읽을 수 있는 텍스트를 기준으로 설계되었고 각주, 표 셀, 법적 고지, 양식 지침에 등장하는 더 작은 문자에 맞게 조정된 사람이 없었다는 점입니다.
200 DPI가 위험 기준인 이유: 200 DPI에서 8pt 문자는 높이가 22픽셀에 불과합니다. "e"와 "c" 같은 문자는 열린 카운터가 1픽셀로 줄어들면서 거의 구분이 불가능해집니다. "8"의 고리와 "6"의 둥근 부분은 동일한 2픽셀 세로 공간을 차지합니다. 이것이 팩스로 받은 인보이스와 스캔한 계약서에서 본문은 정상으로 보이면서 작은 글씨 부분에서 추출 오류가 일상적으로 발생하는 이유입니다.
확인할 사항: 스캔한 PDF가 기본 "표준 품질" 모드로 설정된 사무용 MFP로 생성된 경우 거의 확실히 200 DPI입니다. 팩스로 받은 문서는 발신자의 장비에 따라 100~200 DPI로 도착합니다. 추출 도구를 탓하기 전에 입력 이미지의 실제 DPI를 확인하세요. 이미지 뷰어에서 파일 속성을 열고 픽셀 너비를 물리적 페이지 너비로 나누세요. 결과가 250 DPI 미만이고 문서에 10pt 미만의 텍스트가 포함된 경우 해상도가 근본 원인일 가능성이 높습니다.
이미지 품질이 다양한 문서 유형의 추출 정확도와 어떻게 상호작용하는지 자세히 알아보려면 스캔 문서의 OCR 정확도 저하에 대한 가이드를 참조하세요.
원인 2: 글꼴 선택이 해상도 문제를 증폭
모든 8pt 문자가 동일하게 생성되는 것은 아닙니다. 글꼴 디자인은 사용 가능한 픽셀 예산 중 실제로 인식에 사용할 수 있는 부분을 결정합니다.
작은 크기에서의 산세리프 대 세리프. Times New Roman과 같은 세리프 글꼴은 문자 줄기 끝에 장식적인 획을 추가합니다. 10pt 이상에서는 이러한 세리프가 가독성을 돕습니다. 200 DPI 스캔에서 6~8pt에서는 세리프가 주요 획과 합쳐져 문자가 예측 불가능하게 두꺼워지고 인접 문자를 분리하기 어려워집니다. 산세리프 글꼴(Arial, Helvetica, Calibri)에는 이러한 추가 획이 없어 단순한 형태가 저해상도 스캔에서 더 잘 견딥니다. Tesseract의 자체 문서와 여러 라이브러리 지침은 OCR 친화적인 문서에 산세리프 글꼴을 구체적으로 권장합니다.
가는/얇은 글꼴 두께. 현대 브랜드 디자인, 재무 보고서 헤더, 미니멀 UI에서 인기 있는 글꼴 패밀리의 "Light" 또는 "Thin" 두께는 일반적인 스캔 해상도에서 너비가 1픽셀에 불과한 획을 사용합니다. 획 너비가 1픽셀이면 노이즈, 압축 아티팩트 또는 스캐너 센서 변동이 획을 끊거나 비대칭적으로 두껍게 만들어 결과적으로 문제가 발생합니다. 동일한 해상도에서 2~3픽셀 획 너비를 가진 Bold 및 Regular 두께는 이러한 아티팩트에 대한 내성이 훨씬 높습니다.
모호한 글리프가 있는 글꼴. 특정 글꼴 디자인은 OCR이 이미 어려워하는 문자를 더욱 어렵게 만듭니다. 예를 들어 Arial은 소문자 "l"(L)과 대문자 "I"(i)를 동일하게 렌더링합니다. 유일한 구분 신호는 문맥이며, 전통적인 OCR에는 이것이 없습니다. 작은 크기에서는 나머지 시각적 차이가 완전히 사라지기 때문에 이러한 모호성이 더욱 악화됩니다.
실용적인 패턴: 문서의 작은 텍스트가 현대적인 가벼운 산세리프 글꼴을 사용하는 경우, 더 굵거나 세리프가 강한 글꼴이라면 여전히 읽을 수 있는 출력을 생성할 수 있는 크기에서 추출 오류가 발생합니다. 글꼴 선택이 문제를 일으키는 것은 아니지만, 문제가 보이기 시작하는 픽셀 높이를 결정합니다.
원인 3: 우선순위를 두지 않고 모든 것을 추출하려는 시도
이것은 기술적 문제라기보다는 워크플로 설계 문제에 가깝지만, 작은 글꼴 추출에서 가장 흔한 불만의 원인 중 하나입니다.
많은 사용자가 페이지의 모든 내용이 추출되어야 한다는 마음가짐으로 접근합니다: 모든 라인 항목, 모든 면책 조항, 모든 각주, 모든 여백 표기. 은행 명세서 하단의 6pt 법적 면책 조항이 왜곡된 출력을 생성하면 전체 추출이 실패한 것처럼 느껴집니다. 실제로 본문 텍스트와 주요 재무 수치는 완벽하게 추출되었을 수 있으며, 실패는 실제 워크플로에서 필요하지 않은 텍스트 섹션에 국한되었습니다.
필드 우선순위 전략: 추출 전에 문서의 내용을 세 가지 범주로 분리하세요:
- 중요 필드 — 인보이스 번호, 합계, 날짜, 공급업체 이름, 계좌 번호, 정책 번호. 이러한 항목은 거의 항상 읽을 수 있는 글꼴 크기로 설정되며 재무 또는 운영상의 중요성을 지닙니다. 높은 신뢰도로 추출하세요.
- 보조 필드(8-10pt) — 참조 코드, 부서 이름, 세금 내역, 수량 필드. 일반적으로 300 DPI에서 추출 가능하며, 낮은 해상도에서는 경계적일 수 있습니다. 이 항목들은 무작위 검사를 위해 표시하세요.
- 부수적 텍스트 — 법적 면책 조항, 저작권 고지, 이용 약관, 페이지 바닥글, 작은 글씨 지침. 구조화된 데이터 워크플로에서 거의 필요하지 않습니다. 이러한 필드의 오류가 전체 결과에 대한 신뢰도를 떨어뜨리기보다는 추출에서 완전히 제외하는 것을 고려하세요.

맞춤 열 추출 기능을 사용하는 AI 추출 도구를 사용할 때, 이 우선순위는 설계상 워크플로에 내장되어 있습니다: 실제로 필요한 데이터에 대해서만 열을 정의합니다. AI는 요청하지 않은 문서 섹션에 처리 용량을 낭비하지 않습니다. 열에 작은 글꼴 영역의 값이 포함된 경우, 신뢰도 점수가 수동 검토를 위한 자연스러운 표시가 됩니다.
동일한 원칙이 일괄 처리에도 적용됩니다: 50개의 공급업체 견적을 추출하고 있고 작은 글씨의 약관이 혼합된 정확도로 모든 행에 포함된다면, 스프레드시트에 그 약관이 실제로 필요한지 물어보세요. 종종 대답은 '아니요'이며, 이를 제외하면 추출 속도와 출력의 인지된 품질이 모두 향상됩니다.
원인 4: 스크린샷의 서브픽셀 렌더링 아티팩트
이 원인은 사람의 눈에는 거의 보이지 않지만 가장 혼란스러운 추출 실패를 초래합니다. 스크린샷에만 영향을 미치지만 — 대시보드 내보내기, 웹 포털 인보이스, 모바일 앱 스크린샷 등 문서 처리의 상당 부분이 화면 캡처로 시작되므로 대부분이 생각하는 것보다 더 많은 워크플로우에 영향을 줍니다.
최신 운영 체제는 LCD 화면에서 텍스트 선명도를 높이기 위해 서브픽셀 렌더링을 사용합니다. 이 기술은 각 화면 픽셀 내의 개별 빨간색, 녹색, 파란색 서브픽셀을 처리하여 텍스트 렌더링의 수평 해상도를 사실상 3배로 높입니다. 눈에는 작은 화면 텍스트가 선명하고 또렷하게 보입니다. 그러나 스크린샷을 평면 이미지로 처리하는 OCR 엔진에는 동일한 텍스트가 컬러 프린지로 나타나며, 이는 가장자리 감지, 이진화, 문자 분할을 혼란스럽게 만듭니다.
임계값 처리에 의존하는 기존 OCR 엔진은 이 아티팩트에 특히 민감합니다. 이진화 단계에서 빨간색 서브픽셀 프린지가 있는 문자 가장자리를 만나면 프린지를 문자의 일부 또는 별도의 객체로 해석할 수 있으며, 어느 쪽이든 문자 경계가 예측할 수 없게 이동합니다. 일반적인 문서 크기(10-12pt)에서는 아티팩트가 문자에 비해 작아 OCR 엔진이 여전히 올바르게 추측할 수 있습니다. 6-8pt에서는 서브픽셀 프린지가 문자 획 자체만큼 넓어져 텍스트 대신 컬러 노이즈를 "읽는" 것처럼 보이는 출력이 생성될 수 있습니다.
테스트 방법: 스크린샷에서 결과가 좋지 않지만 동일한 문서를 300 DPI로 스캔한 경우는 정상적으로 작동하고 — 텍스트가 충분히 작아 사람의 눈으로 화면에서 읽기 어려운 경우 — 서브픽셀 렌더링이 원인일 가능성이 높습니다. 스크린샷을 찍기 전에 브라우저 또는 애플리케이션을 150%로 확대해 보세요. 문자당 픽셀 예산이 늘어나고 서브픽셀 프린지가 비례적으로 작아집니다.
색상, 대비, 배율 문제를 포함한 스크린샷 특유의 추출 문제를 더 자세히 알아보려면 컬러 배경과 워터마크에서 OCR 추출이 실패하는 이유를 참조하세요 — 작은 텍스트가 있는 스크린샷에도 동일한 이미지 품질 원칙이 많이 적용됩니다.
실제로 효과 있는 방법: 실용적인 해결 우선순위
아래 해결책은 효과가 크고 노력이 적은 순서에서 효과가 작고 노력이 많이 드는 순서로 정렬되어 있습니다. 위에서부터 시작하여 워크플로에 허용 가능한 정확도에 도달하면 중단하세요.
해결책 1: 작은 글씨 문서는 300+ DPI 목표
스캔 단계를 제어할 수 있다면, 이것이 가장 효과적인 조치입니다. 10pt 미만의 텍스트가 포함된 문서의 경우 표준 300 DPI 대신 400-600 DPI로 스캔하세요. 피츠버그 대학교의 OCR 모범 사례 가이드에 따르면 작은 글씨 문서에는 400-600 DPI가 권장됩니다. 단점은 파일 크기가 커지고 처리 속도가 느려진다는 점이지만, 작은 글씨 정확도가 중요한 페이지에서는 그만한 가치가 있습니다. 팩스나 이메일로 받은 문서처럼 출처를 제어할 수 없는 경우, 워크플로에서 해상도 한계를 알려진 제약 조건으로 기록하세요. 모든 문서를 동일한 정확도로 추출할 수는 없으며, 기대치를 적절히 설정하기만 하면 괜찮습니다.
해결책 2: 추출 설계에 필드 우선순위 적용
열 정의를 검토하고 작은 글씨의 부수적인 텍스트를 대상으로 하는 필드는 제거하세요. 6pt 바닥글에 있는 공급업체 등록 번호를 실제로 조정에 사용한 적이 없다면 해당 열을 삭제하세요. 제거하는 모든 열은 더 이상 검증이 필요 없는 낮은 신뢰도 출력의 원천입니다. 사용자 정의 열 추출을 사용할 때는 도구의 신뢰도 신호를 살펴보세요. 필드가 지속적으로 낮은 신뢰도 값을 반환한다면, AI가 실제로 추측하고 있을 정도로 원본 텍스트가 작은지 확인하세요. 그렇다면 수동 검증을 통해 필드를 유지할 가치가 있는지, 아니면 다른 방식으로 데이터를 가져올 수 있는지 결정하세요.
수정 3: 초해상도 업스케일링 — 주의해서 사용
AI 기반 업스케일링은 150 DPI 스캔을 보간법으로 새 픽셀을 생성해 겉보기 300 DPI로 확대할 수 있습니다. 작은 글꼴 텍스트에 대한 결과는 엇갈립니다. 단순한 최근접 이웃 또는 양선형 업스케일링은 새로운 정보를 추가하지 않습니다. 단지 동일한 12픽셀을 더 넓은 공간에 펼칠 뿐입니다. 문서 이미지로 학습된 AI 초해상도 모델(SRGAN, ESRGAN, Real-ESRGAN)은 중간 정도 품질 저하가 있는 텍스트, 특히 인쇄된 고대비 문자에서 일부 획 세부 정보를 복구할 수 있습니다. 그러나 구별 가능한 픽셀 특징이 이미 부족한 작은 글꼴 텍스트의 경우, SR은 캡처되지 않은 특징을 만들어낼 수 없습니다. 시각적으로 더 부드러운 출력을 생성할 수는 있지만 문자 수준 정확도를 실제로 향상시키지는 못할 수 있습니다. SR의 가장 안정적인 사용 사례는 이미 한계 해상도인 스캔의 텍스트를 추출 도구에 전달하기 전에 확대하는 것입니다. 팩스 수준 해상도로 캡처된 텍스트를 SR이 구제해 주리라 기대하지 마십시오.
업스케일링, 이진화, 기울기 보정을 포함한 추출 전 전처리 기법에 대해서는 OCR 이미지 전처리 가이드를 참조하십시오.
수정 4: 가능하면 더 나은 원본 문서 재요청
지급 계정, 계약 관리, 세금 문서 처리 등 많은 전문 워크플로우에서는 더 나은 원본을 요청할 수 있는 옵션이 있습니다. 공급업체가 150 DPI로 팩스로 보낸 인보이스에서 7pt 줄 항목 설명이 지속적으로 읽을 수 없는 경우, 공급업체에 디지털 PDF를 이메일로 보내 달라고 요청하십시오. 하청업체가 서명된 양식의 복사본의 복사본을 제출하는 경우, 원본이나 깨끗한 사진을 요청하십시오. 이 수정 사항이 항상 가능한 것은 아니지만, 팀이 생각하는 것보다 더 자주 가능합니다. 이메일 요청 한 번의 비용은 배치 전체에서 50개의 추출 오류를 수동으로 수정하는 비용보다 낮습니다.
솔직한 한계: 7pt 미만은 모든 시스템에서 신뢰할 수 없음

정확도 개선, 워크플로 조정, 또는 도구 업그레이드로도 200 DPI 스캔에서 6pt 텍스트를 안정적으로 추출할 수 없습니다. 픽셀 예산이 애초에 부족합니다. 7pt 미만 인쇄 텍스트의 인식 정확도는 문자 단위로 약 60-80%에서 정체됩니다. 즉, 문자의 20-40%가 오인식된다는 뜻이며, 이는 엔진이 기존 OCR이든 최신 비전-언어 모델이든 동일합니다. 청구서에 있는 6pt 숫자의 여백은 99% 필드 단위 정확도로 추출할 수 없으며, 책임 있는 답변은 디지털화의 물리적 한계가 지원할 수 없는 입력값을 중심으로 워크플로를 최적화하는 데 시간을 쓰기보다 수동 검증 또는 생략을 계획하는 것입니다.
이 한계는 현재 운영 중인 모든 시스템에 적용됩니다. Tesseract뿐만 아니라 기존 OCR도 마찬가지이며, Google Cloud Vision, Amazon Textract, 비전-언어 모델 기반 도구에도 동일하게 적용됩니다. 작은 글꼴 텍스트에서 이 도구들 간의 차이는 수 배가 아니라 몇 퍼센트 포인트에 불과합니다. 비전 AI 모델은 주변 문맥을 활용해 누락된 문자를 추정할 수 있기 때문에 7pt 미만 텍스트에서 이점이 있습니다. AI가 익숙한 청구서 헤더에서 "Inv_ice N_mber"를 보면 올바른 값을 추론할 수 있지만, 이러한 문맥 기반 추정에도 한계가 있습니다. 특정 픽셀 임계값 이하의 문자가 진정으로 모호할 때, 추론은 기껏해야 합리적 추측에 불과합니다.
다양한 문서 유형과 조건에서의 정확도 기대치에 대한 더 넓은 관점은 OCR 정확도 개선을 위한 실용 가이드를 참조하세요.
자주 묻는 질문
더 비싸거나 특화된 AI 도구가 작은 글꼴 추출 문제를 해결할 수 있나요?
부분적으로는 가능하지만 완전히 해결하지는 못합니다. 문맥 속에서 텍스트를 처리하는 비전-언어 모델은 주변 데이터를 통해 일부 작은 글꼴 문자를 추론하여 복원할 수 있습니다. 예를 들어 "Invoic_ N_mber: INV-2026-0_4_"를 읽고 예상되는 송장 번호 형식에 따라 누락된 문자를 채워 넣는 방식입니다. 이러한 문맥 기반 보정은 동일한 작은 글꼴 입력에서 기존 OCR보다 필드 수준 정확도를 5~15% 포인트 향상시킬 수 있습니다. 그러나 근본적인 픽셀 예산을 바꾸지는 않습니다. 입력 해상도가 AI가 픽셀 수준에서 "5"와 "S"를 구분하기에 너무 낮다면, 어떤 문맥 추론도 정확한 답을 보장할 수 없습니다. 확실한 해결책은 여전히 더 나은 원본 해상도입니다.
작은 글꼴 추출을 더 잘 하기 위해 스캔 대신 휴대폰으로 문서를 촬영해도 되나요?
안정적이지 않습니다. 일반적인 거리(30~40cm)에서 12MP 해상도로 촬영한 휴대폰 사진은 문서 기준 약 150~200 유효 DPI를 제공합니다. 팩스보다는 낫지만 300 DPI 평판 스캔만큼 좋지는 않습니다. 더 중요한 것은 휴대폰 사진은 원근 왜곡, 고르지 못한 조명, 모션 블러를 유발한다는 점입니다. 이 모든 요소가 작은 글꼴 문자를 더욱 저하시킵니다. 휴대폰을 사용해야 한다면 문서를 평평한 표면에 놓고 균일한 조명에서 휴대폰을 평행하게 유지한 뒤 약간 확대하여 프레임을 문서로 채우세요. 이렇게 하면 나중에 크롭하는 광각 촬영보다 더 나은 결과를 얻을 수 있습니다.
작은 글꼴의 경우 AI 추출이 기존 OCR보다 훨씬 더 나은가요?
한계 해상도의 작은 글꼴 텍스트의 경우 AI 추출은 일반적으로 기존 OCR보다 10~25% 포인트 더 우수합니다. 문맥 이해 덕분에 AI가 문자 단위로 판독하는 OCR 엔진이 해결하지 못하는 모호성을 처리할 수 있기 때문입니다. 매우 작은 텍스트나 매우 낮은 해상도에서는 두 시스템 모두 동일한 근본적인 픽셀 부족 문제에 직면하므로 격차가 좁아집니다. 도구 선택은 문맥 추론과 의미 이해가 여전히 작동할 수 있는 한계 상황에서 가장 중요합니다. 이러한 접근 방식의 상세한 필드 수준 비교는 AI OCR과 기존 OCR 정확도 비교를 참조하세요.
저해상도 이미지를 업스케일링하면 작은 글꼴의 OCR 정확도가 향상되나요?
예, 아니요. 단순한 이미지 크기 조정은 이미지를 더 크게 만들 뿐 정보를 추가하지 않습니다. 문자의 픽셀 수준 모호성은 그대로이며, 단지 더 많은 픽셀에 걸쳐 퍼져 있을 뿐입니다. 문서 이미지로 학습된 AI 기반 초해상도 모델은 손실된 가장자리 정보 중 일부를 복구할 수 있지만, 작은 글꼴 텍스트의 개선 효과는 제한적이며 원본 이미지 품질에 크게 의존합니다. 업스케일링은 전처리 단계로 시도해 볼 가치가 있지만, 충분한 소스 해상도를 대체하지는 못합니다. 더 높은 DPI의 원본에서 시작하는 것이 항상 더 안정적인 방법이며, 이미지 전처리 가이드에서 설명한 대로입니다.
언어 또는 문자 체계가 작은 글꼴 추출을 더 어렵게 만드나요?
그렇습니다. 문자당 획 복잡도가 높은 문자 체계는 신뢰할 수 있는 인식을 위해 문자당 더 많은 픽셀이 필요합니다. 구별되는 특징이 더 많고 더 미세하기 때문입니다. 200 DPI에서 7pt 데바나가리 문자는 OCR로 사실상 읽을 수 없을 수 있지만, 같은 해상도의 7pt 라틴 문자는 간신히 읽을 수 있을 수 있습니다. 문서에 비라틴 문자가 포함된 경우 최소 DPI 권장 사항을 그에 따라 높이십시오. 작은 텍스트가 있는 혼합 문자 문서의 경우 400 DPI가 상한선이 아니라 하한선으로 간주해야 합니다.
작은 글꼴 추출에는 물리적 한계가 있지만, 그 한계 내에서 올바른 워크플로우 선택이 신뢰할 수 있는 배치와 다시 실행해야 하는 배치의 차이를 만듭니다. 자신의 작은 글꼴 문서로 테스트하여 실제 정확도 상한선이 어디에 있는지 확인하십시오.
내 문서로 추출 테스트하기