검색 가능한 PDF란 무엇인가요?
최종 검토: 2026-08-31 · 적용 대상: 문서 자동화 / OCR / 기록 보존
다른 이름: "검색 가능한 스캔", "OCR 처리 PDF", "텍스트 레이어 PDF", "검색 가능한 이미지 PDF"라고도 합니다. Adobe Acrobat 및 미국 국립문서기록관리청(NARA)의 기록 이관 용어에서는 충실도 보존 형식을 "Searchable Image (Exact)"라고 합니다.
검색 가능 vs. 스캔 vs. 네이티브: 중요한 차이점
검색 가능한 PDF는 네이티브 PDF도 아니고, 단순 스캔본도 아닙니다. 스캔 이미지 아래에 숨겨진 텍스트 레이어가 있는 것입니다. 이 하나의 기계적 차이가 파일로 할 수 있는 모든 것을 결정합니다. Ctrl+F가 아무것도 찾을 수 있는지, 문장을 복사해 이메일에 붙여넣을 수 있는지, 아카이브 시스템이 기록을 색인할 수 있는지 여부가 모두 여기에 달려 있습니다. 세 가지 PDF 유형은 스펙트럼상에 있습니다:
| PDF 유형 | 파일에 포함된 내용 | 단어 검색 / 선택 / 복사 가능? | 보이는 텍스트 편집 가능? |
|---|---|---|---|
| 이미지 전용 PDF | 페이지의 단순 이미지 | 아니요 — 텍스트가 픽셀이지 문자가 아님 | 아니요 |
| 검색 가능한 PDF | 페이지 이미지 + 보이지 않는 OCR 텍스트 레이어 | 예 — 숨겨진 레이어를 통해 | 아니요 — 보이는 페이지는 여전히 스캔본 |
| 네이티브 PDF | 실제 인코딩된 문자가 보이게 렌더링됨 | 예 — 실제 텍스트를 통해 | 예 |
분류 기준: ABBYY의 PDF 유형 및 PowerPDF 용어집. 여기서 검색 가능한 PDF를 "문서의 비트맵 이미지와 숨겨진 텍스트로 저장된 텍스트 콘텐츠를 포함하는 PDF의 한 형태"로 정의합니다. 편집 가능 열은 evermap Acrobat 튜토리얼에 설명된 Adobe Acrobat의 OCR 출력 모드를 요약한 것입니다.
검색 가능한 PDF는 스캔하거나 촬영한 페이지에 OCR로 생성된 보이지 않는 텍스트가 페이지 이미지 아래에 저장된 것입니다. — 따라서 보이는 페이지가 여전히 스캔본이어도 사용자는 단어를 선택, 복사, 검색할 수 있습니다.
검색 가능한 PDF의 작동 방식
검색 가능한 PDF는 OCR 기술로 생성됩니다. OCR은 이미지에서 문자를 읽어 기계가 읽을 수 있는 텍스트로 변환하는 기술입니다. OCR 엔진은 스캔된 페이지를 분석하고 문자 모양을 식별하여 세 가지 결과물을 생성합니다: 인식된 텍스트, 페이지 내 각 단어의 위치, 그리고 이 둘을 결합한 PDF입니다. Adobe Acrobat의 "텍스트 인식" 기능은 그 결과를 정확히 설명합니다. "페이지 이미지 뒤에 추가되어 페이지의 시각적 모양이 변경되지 않으면서" "검색하거나 복사할 수 있는 보이지 않는 텍스트 레이어를 생성"합니다.
보이지 않는 레이어는 PDF 내부에서 표준 메커니즘으로 구현됩니다. 텍스트는 PDF의 "텍스트 렌더링 모드 3"을 사용하여 페이지에 그려지는데, 이 모드는 뷰어가 문자를 배치하되 아무것도 표시하지 않도록 지시합니다. PDFlib 기술 쿡북은 바로 이 방식을 보여줍니다. OCR 결과를 명시적인 x/y 좌표의 "이미지 위에" 보이지 않게 배치하여 검색 텍스트가 아래의 스캔과 정렬되도록 합니다(PDFlib Cookbook). 오픈소스 도구도 동일한 기법을 사용합니다. OCRmyPDF는 "텍스트 전용 레이어를 렌더링하여 원본 페이지에 샌드위치처럼 끼워 넣어" 스캔을 그대로 유지하면서 보이지 않는 텍스트가 검색 가능한 콘텐츠를 담당하게 합니다. 텍스트가 일치하는 문자 좌표에 위치하므로 PDF 뷰어는 숨겨진 텍스트에 걸친 단어를 스캔에 표시된 정확한 위치에서 강조 표시할 수 있습니다.
그 결과는 두 개의 레이어로 구성된 문서입니다. 눈에 보이는 것과 키보드로 접근할 수 있는 것입니다. 단어를 선택하면 숨겨진 레이어의 문자가 선택되고, 복사하면 페이지의 픽셀이 아닌 OCR 엔진이 읽은 페이지 내용이 제공됩니다. 그리고 바로 이 차이점에서 정확성 문제가 시작됩니다.
검색 가능한 PDF와 검색 불가능한 PDF의 충돌
스캔 아카이브, 법률 문서, 도서 디지털화 프로젝트가 검색 가능 여부로 평가되는 순간, 이러한 대비는 더 이상 학문적 논의에 그치지 않습니다. 미국 국립문서관리국(NARA)은 이전 요건에서 이러한 충돌을 명확히 설명합니다. NARA는 OCR로 생성된 검색 가능 텍스트가 "기록에 대한 접근성을 향상시키는" PDF 기록을 수락하지만, OCR 프로세스가 가시적 콘텐츠를 변경하거나 원본 비트맵 이미지를 손상시키지 않은 경우에만 수락합니다. 또한 생성된 텍스트를 스캔 이미지 대신 대체하는 OCR 출력물은 거부합니다 (NARA, PDF 기록 이전 지침; NARA, 이전 지침 표). 즉, 보존하려는 스캔 이미지를 손상시키는 검색 가능한 PDF는 이미지 전용 PDF보다 아카이브에 더 나쁩니다.
소송에서도 동일한 충돌이 문서 생산 형식을 둘러싼 분쟁으로 나타납니다. 전자 증거 개시(e-discovery) 실무 가이드에서는 당사자가 "적절한 경우, 상대방이 생산한 ESI가 전문(full text) 또는 날짜, 작성자, 수신자와 같은 특정 범주에 대해 검색 가능해야 한다고 요구할 수 있다"고 명시하며, 실패 상황을 강조합니다. "백만 페이지 분량의 문서를 전자적으로 받았는데 생산된 문서가 전자적으로 검색 불가능한 상황을 상상해 보십시오" (뉴욕주 변호사 협회, 전자 증거 개시 모범 사례 (2013)). 여기서 보이지 않는 텍스트 레이어는 단순한 개선 사항이 아니라, 검토 가능한 문서 생산과 사용할 수 없는 이미지 더미를 구분 짓는 요소입니다.
검색 가능한 PDF가 중요한 이유
이 중요성은 보유 자료를 검색해야 하는 기관에서 가장 분명하게 드러납니다. 미국 국립문서기록관리청(NARA)의 국가 기록 카탈로그는 디지털화된 기록에 OCR을 적용합니다 — 9,200만 페이지 이상이며 계속 늘어나고 있고, 2019년 6월 이후 추가된 PDF 및 이미지 기록에는 OCR 검색이 적용됩니다 — 그 이유는 텍스트가 기계 판독 가능해야만 기록을 검색할 수 있기 때문입니다(NARA, 새 검색 기능: OCR (2019)). 도서 디지털화도 같은 전제로 운영됩니다: Internet Archive는 Tesseract OCR로 도서를 처리하여 "각 페이지 텍스트를 검색 가능하게" 만들고, OCR 데이터에는 검색 가능한 PDF를 구축하는 데 사용되는 단어 좌표가 포함되어 있습니다. OCR로 변환된 전문(full text)을 기반으로 구축된 Google Books도 가장 큰 규모에서 같은 개념입니다(Wikipedia, Google Books).
그러나 검색 가능한 PDF는 스캔 기록의 기본 상태가 아니라 생성된 상태입니다. AIIM의 2015 Industry Watch 설문 조사에 따르면 조직의 41%만이 어떤 형태로든 OCR을 사용하며, 34%는 평면 이미지만 스캔하고 18%는 보관용으로 스캔합니다(AIIM, Paper-Free Progress (2015)). 이러한 불일치 — NARA와 Internet Archive 같은 거대한 검색 가능 저장소와, 여전히 검색 불가능한 이미지로 남아 있는 대부분의 스캔 기록 사이의 격차 — 가 바로 "검색 가능한 PDF"라는 용어가 지칭하는 것입니다. 화면 판독기는 스캔을 읽을 수 없고, 검색 엔진은 스캔을 색인할 수 없으며, 기록 보관소는 스캔으로 검색 요청을 충족할 수 없습니다. 보이지 않는 텍스트 레이어가 이 세 가지 문제를 모두 해결하는 메커니즘입니다.
검색 가능한 PDF의 유형과 변형
"검색 가능한 PDF"라는 명칭 안에는 두 가지 별개의 변형 축이 있습니다: OCR 출력이 생성된 방식과 파일이 준수하는 아카이브 표준입니다.
| 출력 모드(Acrobat) | 스캔에 적용되는 작업 | 장단점 |
|---|---|---|
| Searchable Image | 원본 이미지를 유지하고 필요한 경우 기울기를 보정하며 보이지 않는 텍스트를 위에 추가합니다. | 빠름; 이미지를 다시 인코딩하고 다운샘플링할 수 있음 |
| Searchable Image (Exact) | 원본 이미지를 그대로 유지하고 보이지 않는 레이어만 추가합니다. | 최대 충실도 — NARA 스타일 아카이브 승인에서 기대하는 모드 |
| Editable Text & Images | 스캔을 합성 글꼴과 저해상도 배경으로 대체합니다. | 텍스트를 시각적으로 편집 가능하게 만들지만 원본 이미지는 더 이상 표시되지 않습니다. |
출력 모드 및 장단점은 evermap의 Adobe Acrobat OCR 튜토리얼 기준; 아카이브 승인 관련성은 NARA의 PDF 전송 지침 기준.
아카이브 축은 PDF/A입니다 — 장기 보존을 위해 설계된 ISO 표준(ISO 19005) PDF 버전으로, 글꼴 연결, 암호화, 외부 종속성 등의 기능을 제한하여 수십 년 후에도 문서를 동일하게 렌더링할 수 있도록 합니다(Wikipedia, PDF/A). 아카이브와 기관은 일반적으로 두 가지 개념을 결합합니다: 원본 스캔을 유지하고, OCR을 적용하여 보이지 않는 텍스트 레이어를 추가한 다음, 결과를 PDF/A로 저장하여 파일이 검색 가능하면서도 보관 가능하도록 합니다. 검색 가능 레이어와 PDF/A 준수는 상호 추가적입니다 — PDF/A만으로는 스캔을 검색 가능하게 만들지 않으며, 검색 가능한 PDF만으로는 반드시 PDF/A를 준수하는 것은 아닙니다.
검색 가능한 PDF가 사용되는 분야
스캔은 수십 년 동안 이루어져 왔습니다. 검색 가능한 레이어가 스캔 아카이브를 실용적인 아카이브로 바꿔줍니다. 가장 중요한 적용 분야는 다음과 같습니다:
- 정부 아카이브 및 기록 관리: NARA로 이관되는 연방 기록은 위의 충실도 규칙을 준수하는 검색 가능한 OCR 텍스트가 포함된 상태로 접수되며, NARA 자체도 카탈로그 기록에 OCR을 적용하여 9,200만 개 이상의 페이지를 검색 가능하게 만듭니다.
- 법률 증거개시 및 규제 제출: 소송 당사자와 기관은 검토 플랫폼이 전체 제출물을 색인하고 키워드 검색할 수 있도록 스캔 기록을 검색 가능한 PDF로 제출합니다.
- 도서관 및 도서 디지털화: Internet Archive와 Google Books는 OCR 텍스트를 활용하여 스캔된 도서를 전체 텍스트 검색 가능하게 만듭니다 (Internet Archive; Wikipedia).
- 기업 콘텐츠 및 기록 보존: 스캔된 송장, 계약서, 양식에는 OCR 텍스트 레이어가 추가되어 기록 관리자, 감사자, 다운스트림 자동화 시스템이 이를 찾고 처리할 수 있습니다. 이 레이어는 "디지털 메일룸" 또는 문서 관리 검색이 색인하는 대상입니다 (AIIM 2015).
- 접근성: 화면 판독기와 텍스트 음성 변환 도구는 OCR 텍스트 레이어가 단어를 제공할 때만 스캔된 PDF를 읽을 수 있습니다. 이는 모든 검색 가능한 PDF가 포함하는 동일한 보이지 않는 레이어입니다.
일반적인 오해
- 오해: "스캔한 PDF는 자동으로 검색 가능하다."
- 현실: 스캔은 픽셀일 뿐이며, OCR이 없으면 Ctrl+F로 아무것도 찾을 수 없고 단어 하나를 선택할 수도 없습니다. 검색 가능성은 OCR 텍스트 레이어가 있어야만 제공됩니다. 즉, "검색 가능"은 스캔의 본질적 속성이 아니라 생성된 속성입니다.
- 오해: "텍스트를 선택할 수 있다면 PDF를 편집할 수 있거나 실제 텍스트가 있는 것이다."
- 현실: 검색 가능한 PDF에서 텍스트를 선택하면 보이지 않는 OCR 레이어가 선택됩니다. 보이는 페이지는 여전히 스캔입니다. 검색과 복사는 가능하지만, 네이티브 PDF에서처럼 단어를 그 자리에서 편집할 수는 없습니다. Acrobat의 "Editable Text & Images" 출력은 스캔을 합성 텍스트로 대체하는 별도 모드로, 원본 이미지를 희생합니다(evermap). 복사하는 내용도 OCR 엔진의 추측일 뿐 인쇄된 문자와 다를 수 있습니다.
- 오해: "텍스트 레이어는 페이지 내용의 완벽한 복사본이다."
- 현실: 레이어에는 OCR 엔진이 인식한 내용이 포함되며, 인식 오류는 품질이 낮은 스캔, 특이한 글꼴, 손글씨, 복잡한 레이아웃에서 발생할 수 있습니다. 텍스트 레이어 품질은 페이지마다 다릅니다(Hypothesis, How to OCR PDFs). 다단 페이지는 문서화된 실패 사례입니다. 페이지를 왼쪽에서 오른쪽으로 평면화하는 추출기는 인접한 단을 서로 섞어 레이어에 비문을 생성합니다(LlamaIndex, Reading Order Detection). "검색 가능"은 정확성에 대해 아무것도 말하지 않습니다.
- 오해: "검색 가능한 PDF와 네이티브 PDF는 같은 것이다."
- 현실: 구조적으로 서로 다른 산출물입니다. 검색 가능한 PDF는 숨겨진 텍스트가 있는 이미지이고, 네이티브 PDF는 실제 문자로 렌더링됩니다. 편집, 추출 충실도, 접근성, 아카이브 수용에 있어 결과가 다르며, 제자리에서 편집할 수 있는 것은 네이티브 PDF뿐입니다.
- 오해: "OCR된 PDF는 모두 아카이브 품질/PDF/A를 준수한다."
- 현실: NARA는 원본 이미지를 변경하거나 저하시키지 않는 OCR만 허용합니다. 손실이 있는 "Searchable Image – Compact" 및 텍스트 대체 출력은 거부됩니다. PDF/A(ISO 19005)는 보존을 위한 별도의 적합성 표준입니다. 스캔은 검색 가능하고 아카이브 가능하려면 OCR 처리와 적합성 준수가 모두 필요합니다(NARA; Wikipedia, PDF/A).
자주 묻는 질문
검색 가능한 PDF란 무엇인가요?
검색 가능한 PDF는 스캔하거나 촬영한 페이지에 보이지 않는 OCR 생성 텍스트가 페이지 이미지 아래에 저장된 파일로, 사용자가 보이는 페이지가 여전히 스캔본임에도 단어를 선택, 복사, 검색할 수 있게 해줍니다. 이는 이미지 전용 스캔과 네이티브 PDF 사이의 중간 유형이며, 이미지 전용 PDF에 OCR을 적용하여 생성됩니다 (ABBYY).
PDF가 검색 가능한지 어떻게 알 수 있나요?
Ctrl+F를 누르고 페이지에서 보이는 단어를 입력하세요. 단어가 강조 표시되면 검색 가능한 PDF이고, 아무 일도 일어나지 않으면 OCR이 필요할 가능성이 높습니다. 더 빠른 시각적 확인 방법: 텍스트 줄을 선택해 보세요. 커서가 페이지 전체를 하나의 블록으로 잡으면 아직 텍스트 레이어가 없는 것입니다. 검색을 가능하게 하는 동일한 레이어가 단어별 선택도 가능하게 하므로, 두 테스트는 동일하게 작동합니다 (Hypothesis, How to OCR PDFs).
스캔한 PDF를 검색 가능하게 하려면 어떻게 해야 하나요?
원본 이미지를 유지하면서 텍스트 레이어를 추가하는 도구로 이미지 전용 PDF에 OCR을 실행하세요. Adobe Acrobat에서는 "텍스트 인식" 기능과 "검색 가능한 이미지" 출력 스타일을 사용합니다. Tesseract/OCRmyPDF와 같은 오픈소스 옵션도 원본 페이지에 보이지 않는 텍스트를 겹쳐 넣는 방식으로 동일한 작업을 수행합니다 (evermap; OCRmyPDF). 아카이브로 보낼 기록의 경우, 스캔 품질이 저하되지 않도록 충실도 보존 출력("Searchable Image – Exact")을 선택하세요.
검색 가능한 PDF는 편집할 수 있나요?
아니요 — 검색 가능과 선택 가능은 편집 가능과 같지 않습니다. 검색 가능한 PDF에서는 숨겨진 레이어에서 텍스트를 선택하고 복사할 수 있지만, 표시되는 콘텐츠는 여전히 이미지이므로 단어를 제자리에서 편집할 수 없습니다. 자유롭게 편집하려면 Acrobat의 "Editable Text & Images" 출력 또는 네이티브 PDF가 필요합니다 — 원본 스캔의 충실도를 희생하면서 말입니다(evermap).
검색 가능한 PDF와 네이티브 PDF의 차이점은 무엇인가요?
검색 가능한 PDF는 보이지 않는 텍스트 레이어가 있는 이미지이고, 네이티브 PDF는 처음부터 디지털로 생성된 렌더링 텍스트입니다. 둘 다 검색이 가능하지만, 제자리 편집과 직접 텍스트 추출을 지원하는 것은 네이티브 PDF뿐입니다. 검색 가능한 PDF의 표시 페이지는 절대 편집할 수 없으며, 보이지 않는 레이어에는 OCR 오류가 포함될 수 있습니다(ABBYY).
검색 가능한 PDF가 기록 보존에 적합한 형식인가요?
네, 올바르게 수행된다면 그렇습니다 — 기록 보존소는 원본 이미지를 변경하지 않고 텍스트 레이어를 추가해야 합니다. NARA는 OCR 프로세스가 비트맵 이미지를 변경하거나 저하시키지 않는 경우에만 검색 가능한 OCR 처리된 PDF를 수용하며, 이러한 기록을 PDF/A(ISO 19005)로 보존하여 장기간 렌더링 및 검색이 가능하도록 유지합니다(NARA; Wikipedia, PDF/A).
출처
- National Archives — "Transfer Instructions for Permanent Electronic Records in PDF format". NARA의 PDF 기록 이전 공식 요구사항으로, 검색 가능한 텍스트가 원본 비트맵 이미지를 변경하거나 저하시키지 않을 때만 허용하는 OCR 섹션을 포함하며, 허용되는 출력("Searchable Image – Exact")과 금지되는 출력("Searchable Image – Compact," "Formatted Text and Graphics," "PDF Normal")을 명시합니다. 아카이브 수용 규칙의 1차 출처.
- National Archives — "Appendix A: Tables of File Formats". NARA의 형식 표로, 광학 문자 인식(OCR) 섹션에서 허용 및 금지되는 OCR 출력 용어를 나열합니다. OCR 수용 용어를 뒷받침합니다.
- NARA (NARAtions) — "New Search Feature: Optical Character Recognition (OCR)" (2019). National Archives Catalog에서의 OCR 검색 발표: 2019년 6월 이후 추가된 PDF/이미지 기록에 OCR을 적용한 9,200만 페이지 이상의 디지털화 페이지, 그리고 OCR이 "완벽하지 않다"는 NARA 자체의 경고를 포함합니다. 아카이브 규모 주장의 1차 출처.
- New York State Bar Association — "Best Practices in E-Discovery in New York State and Federal Court" (2013). 주 변호사 협회의 e-discovery 실무 지침으로, 생성된 ESI가 검색 가능해야 한다고 요구하며 "수백만 페이지 ... 검색 불가" 실패 시나리오를 설명합니다. 법률 조사 사용 사례의 1차 출처.
- Wikipedia — "PDF/A". 아카이빙 및 장기 보존을 위한 PDF 변형으로서 PDF/A(ISO 19005)의 개요와 기능 제한 사항을 설명합니다. PDF/A 정의의 1차 3차 출처.
- Wikipedia — "Google Books". Google Books가 도서를 스캔하고 OCR을 통해 텍스트로 변환하여 전체 텍스트 검색을 제공한다는 내용을 문서화합니다. 도서 디지털화 규모 맥락의 출처.
- Internet Archive — Digitization Services. IA가 자체 디지털화 파이프라인을 설명: Tesseract OCR로 이미지를 처리하여 각 페이지를 텍스트 검색 가능하게 만들고, 항목당 여러 형식을 제공합니다. Internet Archive OCR 주장의 1차 출처.
- Open Library (Internet Archive) — OCR posts. 아카이브의 OCR 문서로, 매일 1,000권 이상의 도서가 디지털화되며 검색 가능한 PDF를 구축하는 데 사용되는 단어 좌표 OCR 데이터를 기록합니다. 아카이브의 검색 가능한 PDF 워크플로를 뒷받침합니다.
- AIIM — "Paper-Free Progress: Measuring Up" (2015 Industry Watch). 정보 전문가 대상 독립 업계 설문조사: 41%가 어떤 형태로든 OCR을 사용하고, 34%가 평면 이미지만 스캔하며, 18%가 아카이브용으로 스캔합니다. OCR 도입 데이터의 1차 출처.
- ABBYY — "PDF 유형: 검색 가능한 PDF, 이미지 전용, True PDF". 검색 가능한 PDF는 OCR이 이미지 레이어에 텍스트 레이어를 추가하여 생성되며, 이미지 전용/검색 가능/디지털 생성 분류 체계를 설명합니다. 3가지 유형 프레임워크의 출처.
- PDFlib — Cookbook: "Invisible text". 공급업체 기술 문서(PDFlib)로, 텍스트 렌더링 모드 3을 사용하여 명시적 좌표에 스캔 이미지 위에 보이지 않는 OCR 텍스트를 배치하는 방법을 보여줍니다. 보이지 않는 레이어 메커니즘의 주요 기술 출처.
- OCRmyPDF — "고급 기능". 오픈소스 OCR 도구의 문서로, 보이지 않는 텍스트 레이어가 렌더링되어 원본 PDF 페이지에 샌드위치되는 방식을 설명합니다. 보이지 않는 레이어 메커니즘을 뒷받침합니다.
- Hypothesis — "PDF OCR 방법". 검색 가능 vs 편집 가능 vs 이미지 형태를 구분하고 실제 예시로 텍스트 레이어의 인식 오류를 문서화합니다. 검색 가능/편집 가능 구분 및 OCR 오류 주의 사항의 출처.
- evermap — "스캔된 PDF 문서에서 텍스트 인식". Acrobat의 세 가지 OCR 출력 모드 — Searchable Image, Searchable Image (Exact), Editable Text & Images — 및 페이지 이미지 뒤에 숨겨진 텍스트가 추가되는 방식을 문서화합니다. 출력 모드 분류 및 편집 가능성 대비의 출처.
- Tungsten Automation — PowerPDF 용어집: "Searchable PDF". 용어집 정의: "문서의 비트맵 이미지와 숨겨진 텍스트로 저장된 텍스트 콘텐츠를 포함하는 PDF의 한 형태." 독립적인 공급업체 용어집 정의.
- LlamaIndex — "읽기 순서 감지란 무엇인가?". 다중 열 문서의 인접 열을 평면 왼쪽에서 오른쪽 텍스트 추출이 섞는 방식을 문서화한 기술 용어집. 다중 열 읽기 순서 실패 모드의 출처.
- docsie — "텍스트 레이어" 용어집. PDF의 보이지 않는 선택적 텍스트 오버레이와 화면 판독기 접근성 지원을 설명하는 용어집. 접근성 사용 사례를 뒷받침합니다.
관련 용어
- 광학 문자 인식(OCR)이란?: 스캔에서 문자를 읽고 검색 가능한 텍스트 레이어를 생성하는 기술 — OCR은 모든 검색 가능한 PDF의 핵심 메커니즘입니다.
- 데이터 캡처: 검색 가능한 텍스트 레이어가 인덱싱, 검색 및 다운스트림 추출에 공급되는 파이프라인 — 검색 가능한 PDF가 단순한 아카이브가 아닌 재사용 가능한 데이터가 되는 지점입니다.
- 지능형 문자 인식(ICR)이란?: OCR의 필기 인식 자매 기술 — 손글씨 스캔에 대한 OCR 패스가 텍스트 레이어를 구축할 때 사용할 수 있는 엔진 클래스입니다.
- 문서 유형별 OCR 정확도: 다양한 스캔 품질과 레이아웃에서 검색 가능한 PDF의 텍스트 레이어 신뢰성을 뒷받침하는 벤치마크 데이터입니다.
관련 읽을거리: 스캔된 PDF가 OCR 처리 전까지 편집하거나 검색할 수 없는 이유 · 스캔된 PDF를 Excel로 OCR하는 단계별 방법 · AI가 스캔된 PDF에서 데이터를 추출할 수 있나요? · 초보자를 위한 AI 문서 추출