스캔된 PDF · 텍스트 레이어 불필요

AI PDF OCR — 스캔된 PDF의 구조를 검색 가능하고 편집 가능한 구조화된 데이터로 재구축하는 비전 인식

스캐너 출력을 수동으로 다시 입력하는 데 페이지당 3분이 걸립니다 — 이 기능은 픽셀을 읽고 구조를 5~10초 안에 재구축합니다.

페이지당 5~10초 · 인쇄 텍스트 기준 최대 99% 필드 수준 정확도 · 표, 열 및 읽기 순서 보존 · XLSX / CSV / JSON

스캔된 PDF
행으로 변환된 표
읽기 순서
손으로 쓴 메모

스캔 페이지에서 명명된 열까지: 이 도구가 복원하는 것

스캔된 PDF에는 텍스트 레이어가 없으므로 모든 값은 픽셀로만 존재합니다. 그래서 PDF OCR이 필수이며 이 도구가 각 페이지를 이미지로 읽는 이유입니다. 원하는 열 이름을 입력하면 AI가 값이 위치한 곳이 아니라 의미하는 바를 기준으로 각 값을 찾아내며, 페이지 구조를 유지합니다. 표 행은 정렬을 유지하고, 열은 읽는 순서대로 유지되며, 머리글, 바닥글, 페이지 번호는 데이터에서 제외됩니다.

송장 / 참조 번호
문서 날짜
공급업체 / 고객 이름
품목 설명
수량
단가
품목 합계
합계 / 총합계
표 셀 — 정렬된 행으로 유지
다단 텍스트 — 읽기 순서 유지
페이지 / 폴리오 번호
손글씨 여백 메모

다음은 예시 열 이름입니다. 한 번 정의하면 동일한 스키마가 스캔된 PDF 폴더 전체를 읽어 각 페이지가 하나의 행이 됩니다.

일반 PDF OCR은 단어를 반환합니다. AI PDF OCR은 그 주변의 구조를 재구축합니다.

스캔된 PDF는 텍스트 레이어가 없는 페이지 이미지 더미입니다. 따라서 OCR은 선택적 개선이 아니라 파일에서 데이터를 얻을 수 있는 유일한 방법입니다. 문제는 이 OCR 단계가 결과를 어떻게 처리하느냐입니다. 무료 온라인 PDF OCR 도구는 문자를 인식하고 평면 텍스트 덩어리를 전달합니다. 표는 연결되지 않은 줄이 되고, 2단 페이지는 왼쪽과 오른쪽이 서로 섞이며, 머리글, 바닥글, 페이지 번호가 데이터 중간에 들어갑니다. 비전 AI는 사람이 읽는 것처럼 전체 페이지를 읽고 문자가 놓여 있던 구조를 재구축합니다. 이것이 이 페이지가 PDF에만 초점을 맞추는 이유이며(우리의 모든 문서 유형 AI OCR 페이지와 같은 플랫폼 리뷰가 아닌), 출력이 PDF-텍스트 변환기의 일반 텍스트 출력이 아닌 구조화된 행인 이유이기도 합니다.

무료 PDF OCR이 실제로 반환하는 것

01

문자 인식 — 그 다음은 평평한 텍스트 덩어리입니다. 기존 엔진은 문자를 인식하고 읽는 순서대로 단어를 출력하지만, 표가 많은 스캔에서는 행의 구성 요소가 더 이상 서로 연결되지 않습니다. 한 Tesseract 기술 가이드가 인정하듯이, "tesseract는 종종 표의 행을 분리합니다 — 종종 텍스트 줄이 완벽하게 수평이 아니기 때문입니다." 수량과 단가는 분리된 레이블 없는 조각으로 남게 됩니다.

02

2단 스캔은 지그재그로 반환됩니다. 엔진은 텍스트 상자를 세로 위치별로 정렬하므로, 스캔된 저널이나 보고서 페이지에서 왼쪽 1행, 오른쪽 1행, 왼쪽 2행, 오른쪽 2행 순서로 읽습니다. 2단 문제는 OCR 프로젝트에서 공개 이슈로 유지될 만큼 유명합니다 — ocrmypdf의 이슈는 말 그대로 "2단은 가끔만 인식됨"이라는 제목입니다.

03

머리글, 바닥글, 페이지 번호가 모두 결과를 오염시킵니다. 본문이 아닌 것도 텍스트로 계산됩니다: "4/12페이지" 같은 반복 바닥글과 회사 레터헤드가 모든 페이지에 반복됩니다. 무료 및 온라인 등급은 더 많은 제한을 추가합니다 — 한 번에 한 페이지 처리, 파일 크기 제한, 또는 워터마크가 있는 검색 가능한 출력 — 따라서 일괄 작업은 각 파일을 개별적으로 돌봐야 함을 의미합니다.

열 이름 추출이 이를 재구성하는 방법

01

맞춤 열 추출: 필드를 지정하면 AI가 의미를 기반으로 찾아냅니다. 원하는 열을 입력하면 — Vendor, Document Date, Total Amount — 비전 모델이 좌표를 매칭하는 대신 각 값이 무엇인지 이해하여 페이지 어디서든 찾아냅니다. 사각형 그리기, 공급업체별 템플릿, 학습 실행이 필요 없습니다.

02

구조는 페이지를 읽는 동안 보존되며, 나중에 추측하지 않습니다. 모델이 레이아웃 전체를 읽기 때문에 표는 선택한 열 이름 아래 정렬된 셀이 있는 행이 되고, 2열 페이지는 올바른 순서로 열별로 읽힙니다. 반복 머리글, 바닥글, 페이지 번호는 페이지 장식으로 인식되어 기본적으로 데이터에서 제외됩니다.

03

손글씨와 일괄 스캔 포함. 깔끔한 손글씨 항목 — 여백 메모, 이니셜, "승인" 도장 영역 — 은 모델이 전체 페이지를 보기 때문에 인쇄된 텍스트와 함께 읽힙니다. 또한 모든 페이지가 동일한 시각적 파이프라인을 거치므로, 스캔된 PDF 100개가 들어 있는 폴더는 페이지당 5~10초로 하나의 배치로 처리되어 단일 스프레드시트로 병합됩니다.

"OCRmyPDF+Tesseract를 사용해 봤지만 줄을 놓치고 수량 등을 엉망으로 만듭니다..." — r/Python의 개발자가 스캔된 PDF에 문자 인식기 이상이 필요한 이유를 설명하며 한 말입니다. OCR은 단어를 제공하지만, 데이터 문제는 단어가 더 이상 해당 레이블과 정렬되지 않는다는 것입니다.

스캔한 PDF 더미가 세 단계로 하나의 구조화된 스프레드시트가 됩니다

1

스캔한 PDF를 그대로 업로드하세요

평판 스캔, 팩스로 받은 페이지, 온라인 뱅킹에서 저장한 은행 거래 내역 PDF, 촬영 후 PDF로 내보낸 계약서 — 모두 한 폴더에 넣으면 됩니다. 스캔한 페이지에는 텍스트 레이어가 없어 어떤 텍스트 추출기로도 읽을 수 없고 선택할 수도 없습니다. 비전 AI가 페이지 이미지를 직접 읽기 때문에 사전에 OCR, 변환, 분류 작업을 할 필요가 없습니다. 텍스트 레이어가 있는 페이지도 같은 배치에 포함할 수 있습니다.

2

필요한 열을 입력하세요

Invoice Date, Line Item Description, Quantity, Unit Price, Line Total, Total Amount를 입력하세요. 이 값들이 출력 파일의 정확한 헤더가 됩니다. AI는 각 페이지에서 값의 의미를 기준으로 찾아냅니다. 예를 들어 "Quantity"는 "Unit Price" 옆에 있으면 표 중간의 조각이 아닌 숫자로 인식됩니다. 페이지에 없는 필드는 추측하지 않고 비워 두므로, 레이아웃이 일정하지 않아도 배치 처리가 실패하지 않습니다.

3

텍스트 덤프가 아닌 구조화된 행을 다운로드하세요

스캔한 각 페이지는 하나의 행이 됩니다. 스캔에서 추출한 표는 입력한 헤더 아래 정렬된 열로 유지되며, 2단 페이지도 올바른 순서로 읽힙니다. 머리글, 바닥글, 페이지 번호는 데이터에서 제외됩니다. "승인" 같은 깔끔한 손글씨 메모나 이니셜도 별도의 열로 추출할 수 있습니다. XLSX, CSV, JSON 형식으로 내보낼 수 있으며, 분당 약 4페이지 속도로 처리되고 이후 정리 작업이 필요 없습니다.

구조 인식 PDF OCR이 신뢰할 수 있는 경우 — 그리고 수동 확인이 필요한 경우

스캔한 PDF의 정확도는 문서 자체, 즉 생성 방식, 스캔 품질, 레이아웃에 따라 달라집니다. 그 경계를 알면 출력을 신뢰할 때와 검토해야 할 때를 구분할 수 있습니다.

가장 적합한 경우

150+ DPI의 인쇄된 텍스트가 있는 깨끗한 평판 스캔. 읽기 쉬운 활자가 있는 정면 스캔은 날짜, 금액, 공급업체 이름, 참조 번호 등 표준 비즈니스 필드에서 최대 99%의 필드 수준 정확도를 달성합니다.

구조가 보이는 표. 스캔한 표에 테두리, 격자선 또는 열 사이에 일관된 정렬과 공백이 있으면 행과 열이 지정한 헤더에 깔끔하게 매핑됩니다.

한 배치에서 혼합된 PDF 생성. 스캔본, 디지털, 하이브리드 페이지가 동일한 패스로 처리됩니다 — 어떤 페이지에도 텍스트 레이어가 필요 없으며, 별도의 OCR 단계가 먼저 실행되지 않습니다.

주의가 필요한 경우

심하게 손상된 스캔은 정확도를 떨어뜨립니다. 복사본의 복사본, 약 100 DPI 미만의 팩스 출력, 심한 잉크 번짐 또는 페이지에 포함된 워터마크는 인식률을 신뢰할 수 있는 임계값 아래로 떨어뜨립니다 — 원본이 존재한다면 OCR로 보완하려 하지 말고 다시 스캔하세요.

빽빽한 필기체와 겹치는 손글씨는 정확도를 떨어뜨립니다. 깨끗한 양식의 또박또박한 인쇄체 손글씨는 90–95%로 잘 읽히지만, 심한 필기체와 낙서 같은 여백 메모는 필드 수준 정확도가 75–85%로 떨어집니다. 손글씨 필드에는 검토 과정을 계획하세요.

콘텐츠를 구조화할 뿐, 페이지를 재현하거나 워크플로우를 실행하지 않습니다. PDF 내부의 내용을 읽고 데이터로 정리합니다 — 원본 페이지의 픽셀 단위 완벽한 시각적 복제본을 재구성하지 않으며, 결제를 처리하거나 회계 및 문서 관리 시스템을 통해 문서를 전달하지 않습니다. 입력을 구조화된 데이터(Excel, CSV, JSON)로 변환하며, 그 이후의 단계는 사용자의 몫입니다.

자주 묻는 질문

스캔한 PDF에는 선택 가능한 텍스트가 전혀 없습니다 — 별도로 OCR 단계를 먼저 실행해야 하나요?

아니요 — 이것이 바로 이 도구의 핵심입니다. 스캔한 PDF는 텍스트 레이어가 없는 페이지 이미지 묶음이므로 문자 인식(OCR)은 선택이 아니라 파일에서 데이터를 얻을 수 있는 유일한 방법입니다. 이 도구는 페이지 이미지를 읽고 구조를 재구성하는 비전 AI 모델로 해당 단계를 내부적으로 수행합니다. 업로드하고 열 이름을 입력하면 OCR 처리가 내부에서 진행됩니다 — 사전에 설치하거나, 구성하거나, 실행할 것이 없습니다. 평판 스캔, 팩스, 또는 기본 디지털 PDF든 동일한 페이지가 시각적으로 읽힙니다.

스캔한 PDF에서 행이 텍스트 덩어리로 평평해지지 않고 테이블을 추출할 수 있나요?

네 — 테이블 구조를 보존하는 것은 기존 OCR 엔진보다 AI PDF OCR을 사용하는 주요 이유 중 하나입니다. Tesseract와 같은 엔진은 인쇄된 선이 완벽하게 수평이 아닐 때 테이블 행을 분리하는 경우가 많아, 스캔한 인보이스의 수량 / 단가 / 라인 합계 행이 분리된 텍스트 조각으로 반환됩니다. 여기서는 해당 열의 이름을 지정하면 AI가 각 셀의 값을 읽고 행-열 관계를 유지하므로 스프레드시트에 텍스트 덩어리 대신 정렬된 행이 생성됩니다. 셀-헤더 대응이 진정으로 모호할 정도로 열화된 스캔의 경우, 영향을 받는 행을 육안으로 확인하는 것이 정직한 기대치입니다.

다른 도구에서는 2열 스캔 페이지가 서로 섞여 나옵니다 — 여기서는 읽기 순서가 보존되나요?

네. 오픈소스 OCR 이슈 트래커에도 문서화된 전형적인 실패 — ocrmypdf 자체 이슈 제목이 "2 columns only sometimes recognized"입니다 — 는 엔진이 텍스트 상자를 세로 위치로 정렬하여 2열 페이지에서 왼쪽-1행, 오른쪽-1행, 왼쪽-2행, 오른쪽-2행 순으로 읽는 것입니다. 비전 모델은 각 열을 공간적 영역으로 취급하고 다음 열로 이동하기 전에 열 내부에서 위에서 아래로 읽습니다. 이는 사람이 페이지를 읽는 방식과 동일하므로 스캔한 학술지 기사와 보고서는 출력에서 논리적 읽기 순서를 유지합니다.

무료 온라인 PDF OCR 도구나 ocrmypdf, Adobe 등으로 스캔을 '검색 가능'하게 만드는 것과 이것의 실제 차이점은 무엇인가요?

무료 또는 "검색 가능하게 만들기" 도구는 인식된 텍스트를 파일에 다시 추가합니다 — Ctrl+F와 복사-붙여넣기가 가능해지지만, 복사하는 내용은 OCR이 생성한 동일한 평면 텍스트이며 테이블과 열은 여전히 원시 라인으로 남아 있습니다. 이 도구는 스캔한 PDF를 데이터 소스로 취급합니다: 원하는 필드의 이름을 지정하면 테이블이 정렬되고 읽기 순서가 재구성된 행을 Excel 또는 CSV 파일로 얻을 수 있습니다. 목표가 파일 내 키워드 찾기뿐이라면 검색 가능한 텍스트 레이어가 더 가볍고 저렴한 도구이며 충분할 수 있습니다; 필터링, 합계, 재입력을 위해 스프레드시트의 숫자가 필요하다면 그것이 구조화된 출력의 용도입니다.

열 이름 추출이 인쇄된 텍스트뿐 아니라 손으로 쓴 여백 메모에서도 값을 추출할 수 있나요?

네, 모델이 읽을 수 있는 필체라면 가능합니다. 깨끗한 스캔본의 또박또박 쓴 손글씨는 안정적으로 추출됩니다. 비전 AI가 키보드 글꼴 인식이 아닌 페이지 전체를 읽기 때문입니다. 밀집된 필기체와 겹쳐진 낙서는 약점입니다. 필기체가 심한 경우 필드 수준 정확도가 75~85% 범위로 떨어지므로 해당 값을 육안으로 확인하는 절차를 계획하세요. 문서 전체가 인쇄본이 아닌 손글씨라면, 검토 단계가 내장된 손글씨 인식 작업으로 취급하세요.

📮 contact email: [email protected]