배치 데이터 추출

배치 데이터 추출: 여러 문서를 하나의 구조화된 스프레드시트로 처리 — 형식별 설정 불필요

문서 더미에서 수동으로 데이터를 추출하는 데는 페이지당 약 3분이 소요됩니다. 배치 추출은 모든 형식의 각 페이지를 5~10초 안에 처리하여 단일 스프레드시트로 만듭니다. 템플릿도, 사전 분류도 필요 없습니다.

페이지당 5~10초 · 모든 형식(PDF/JPG/PNG) · 혼합 배치 · 인쇄 텍스트 최대 99% 정확도

배치 처리
PDF / JPG / PNG
하나의 스프레드시트
명명된 열

문서 배치에서 추출할 수 있는 항목

필요한 열 이름을 한 번만 지정하면 AI가 형식이나 레이아웃에 관계없이 각 문서의 의미를 이해하여 해당 값을 추출합니다. 각 문서는 하나의 스프레드시트에서 한 행이 됩니다.

문서 날짜
문서 번호 / ID
공급업체 / 발신자 이름
총 금액
세액
통화
라인 항목 설명
수량
단가
라인 합계
마감일
카테고리

이 열 이름을 한 번만 입력하면 AI가 배치 내 모든 문서에 자동으로 적용합니다.

배치 데이터 추출은 간단해 보이지만, 실제로 설정하려고 하면 어렵습니다

모든 도구가 "여러 파일을 업로드하면 하나의 스프레드시트를 얻을 수 있습니다"라고 약속합니다. 하지만 대부분은 모든 문서가 동일한 템플릿과 레이아웃을 공유할 때만 그렇게 작동합니다. 공급업체가 다르고, 형식이 혼합되며, 소스 품질이 다양한 실제 환경에서는 설정 비용이 드러납니다.

기존 배치 도구가 숨은 설정 비용을 발생시키는 이유

01

문서 레이아웃마다 템플릿이 필요하므로, 공급업체마다 템플릿이 필요합니다. 템플릿 기반 도구는 레이아웃별로 파서가 필요합니다. 모든 공급업체의 송장 위치가 다르기 때문에 각각에 대해 별도의 구성을 만들고 유지 관리해야 합니다. Nanonets나 Rossum 같은 AI 기반 도구도 배치를 처리하기 전에 문서 유형별 학습이나 필드 매핑이 필요합니다. Reddit의 한 사용자는 상황을 직설적으로 설명했습니다: "매주 PDF에서 Excel로 데이터를 수동으로 복사하고 있는데 시간이 너무 많이 걸립니다." 템플릿 솔루션은 작업을 없애지 않고 복사에서 설정으로 옮길 뿐입니다.

02

대부분의 도구에서는 혼합 형식을 함께 배치 처리할 수 없습니다. 기존 OCR 도구에서는 네이티브 PDF, 스캔 이미지, 모바일 사진에 각각 다른 처리 파이프라인이 필요합니다. 사용자는 결국 형식별로 별도의 배치를 실행한 후 출력을 수동으로 병합해야 합니다. Reddit의 한 개발자는 단호하게 말했습니다: "PDF는 사람이 읽을 수 있는 출력 형식입니다. 컴퓨터가 읽을 수 있는 입력 형식이 아닙니다." 형식별 파이프라인은 혼합 배치에서 항상 어려움을 겪을 것입니다.

03

배치 크기와 진행 상황 가시성은 부차적인 고려 사항입니다. 많은 도구가 단일 진행률 표시줄 뒤에서 파일을 하나씩 처리합니다. 하나의 문서가 실패하면 어떤 문서인지, 왜 실패했는지 알 수 있는 방법이 없습니다. 실제 병목 현상은 AI 속도가 아니라 문서별 상태 정보 부족으로 인해 전체 배치를 수동으로 다시 확인해야 한다는 점입니다.

열 이름 추출이 첫 번째 배치 전 설정을 없애는 방법

01

입력 규칙이 아닌 출력을 정의합니다. 각 레이아웃에 대한 파서를 만드는 대신, 필요한 열 이름을 입력하기만 하면 됩니다 — 문서 날짜, 공급업체, 총 금액, 세금, 납기일 — AI는 각 문서에서 해당 값의 의미를 이해하여 찾아냅니다. 한 공급업체 PDF의 "송장 날짜"와 다른 업체의 스캔된 영수증에 있는 "거래 날짜"는 모두 "문서 날짜" 열로 해석됩니다. 열 이름 자체가 유일한 설정이며, 공급업체, 형식 또는 레이아웃에 관계없이 배치의 모든 문서에 적용됩니다. 이것이 바로 맞춤 열 추출입니다: AI가 위치 기반 규칙을 적용하는 대신 의미적 의미를 읽어냅니다.

02

모든 형식이 하나의 파이프라인을 공유합니다 — 사전 분류가 필요 없습니다. PDF 송장, 스캔된 JPG 영수증, 모바일 PNG 사진이 담긴 폴더를 동일한 업로드에 드롭하세요. 시각 언어 모델은 모든 파일을 동일한 방식으로 읽습니다: 픽셀을 보고 명명된 열을 추출합니다. "PDF 파이프라인"과 "이미지 파이프라인"이 따로 없습니다 — 하나의 배치, 하나의 열 정의, 하나의 출력 스프레드시트만 있으면 됩니다.

03

문서별 진행 상황 및 독립적 처리 — 하나의 잘못된 파일이 배치 전체를 망치지 않습니다. 각 문서는 독립적으로 처리되며 실시간으로 자체 상태가 추적됩니다. 배치 보기에는 어떤 문서가 완료되었고, 처리 중이며, 문제가 발생했는지 정확히 표시됩니다 — 단일 진행률 표시줄이 개별 실패를 숨기지 않습니다. 처리 시간은 페이지당 5-10초 이며, 출력은 사용자가 정의한 열이 포함된 하나의 통합 XLSX 또는 CSV 파일입니다.

배치 데이터 추출 실제 적용: 혼합 파일 폴더에서 하나의 깔끔한 스프레드시트로

형식별 설정을 건너뛰고 출력 정의로 바로 이동할 때의 워크플로우입니다.

1

전체 배치 업로드 — 형식은 중요하지 않습니다

월말 폴더에 30개의 파일이 있습니다: 10개 다른 ERP 시스템의 PDF 송장 18개, 현장 사무소에서 스캔한 JPG 영수증 7개, 수기 배송 메모 사진 5개. 30개 파일을 모두 업로드 영역으로 드래그하세요. PDF, JPG, PNG, WebP — 사전 분류나 "문서 유형 선택" 단계가 필요 없습니다. 배치 업로드는 한 번에 약 30개 파일을 처리합니다.

2

열 이름을 한 번만 지정하면 모든 문서에 적용됩니다

문서 날짜, 공급업체, 송장 번호, 총 금액, 세액, 납기일을 입력하세요. 이 값들이 출력 스프레드시트의 정확한 헤더가 됩니다. AI는 디지털 PDF의 "Invoice Date", 스캔 영수증의 "Transaction Date", 수기 메모의 "Date"를 모두 사용자의 "문서 날짜" 열에 매핑합니다 — 문서 유형 템플릿을 일치시키는 것이 아니라 각 필드의 의미를 이해하기 때문입니다. 필요에 따라 라인 합계와 같은 계산 열을 추가하면 AI가 추출 중에 산술을 수행합니다.

3

하나의 스프레드시트 출력 — 모든 문서가 하나의 행입니다

처리 시간은 페이지당 5~10초입니다. 출력은 단일 XLSX 파일입니다: 30개 행과 사용자가 정의한 열로 구성됩니다. 공급업체 송장에 세액이 표시되지 않으면 해당 셀은 비어 있습니다 — 조작된 0도, 배치 실패도 아닙니다. 각 행은 독립적으로 추출되므로 품질이 낮은 스캔 하나가 나머지 29개에 영향을 미치지 않습니다. AI는 추론 열도 지원합니다. "송장 / 영수증 / 배송 메모 / 구매 주문서"와 같은 옵션이 있는 "카테고리" 열을 정의하면 AI가 각 문서를 추출하면서 분류하여 데이터와 문서 유형 레이블을 한 번에 생성합니다.

배치 추출이 가장 효과적인 경우와 주의해야 할 경우

대상 필드에 레이블이 지정되어 있으면 배치 추출은 혼합 형식과 다양한 레이아웃을 안정적으로 처리합니다. 경계를 이해하면 배치가 원활하게 실행됩니다.

가장 적합한 경우

공통 필드 개념을 공유하는 혼합 형식 배치. 모든 문서가 서로 다른 위치에 날짜, 합계, 공급업체명을 포함하는 경우, AI는 문서별 설정 없이 이를 사용자가 지정한 열에 매핑합니다.

값 근처의 명확한 인쇄 레이블. "송장 날짜:" 및 "합계:"와 같은 레이블이 페이지 어느 위치에 있든 최대 99% 정확도를 제공합니다.

배치당 약 30개 문서, 파일별 상태 확인 가능. 각 문서의 상태를 실시간으로 확인할 수 있습니다. 더 많은 양은 여러 배치로 나뉘며, 각 배치는 독립적인 스프레드시트를 생성합니다.

주의가 필요한 경우

원본 품질이 심각하게 저하된 경우. 바랜 감열지 영수증, 200 DPI 미만 스캔본, 또는 아티팩트가 있는 압축 이미지. AI는 기존 OCR보다 맥락을 활용하여 보정하지만, 문서 유형과 관계없이 원본 품질 저하가 정확도의 가장 큰 병목입니다.

공유 의미 앵커가 없는 문서별 고유 필드. 한 문서에 "컨테이너 봉인 번호"가 있고 배치 내 다른 문서에 유사한 내용이 없는 경우, AI가 앵커로 삼을 교차 문서 신호가 없습니다. 유형별 필드는 유사한 문서와 함께 배치될 때 더 잘 추출됩니다.

근처 필드명이 없는 레이블 없는 숫자 값. "합계" 또는 "금액" 없이 문단에 단독으로 있는 달러 금액은 AI가 매칭할 레이블을 제공하지 않습니다. 레이블-값 쌍은 안정적으로 추출되지만, 서술형 텍스트 내의 고립된 숫자는 그렇지 않을 수 있습니다.

자주 묻는 질문

PDF, 스캔 이미지, 휴대폰 사진을 같은 업로드에 섞어서 배치 추출할 수 있나요? 아니면 형식별로 분리해야 하나요?

모든 형식을 동일한 배치에 넣을 수 있습니다. PDF, JPG, PNG, WebP, AVIF 파일을 함께 업로드하세요. 시각 언어 모델이 모든 파일을 하나의 파이프라인으로 처리합니다. 픽셀을 읽고, 내용을 이해하며, 사용자가 지정한 열을 추출합니다. 네이티브 PDF에서 찾은 문서 날짜는 스캔된 JPG나 모바일 사진에서도 동일한 방식, 즉 파일 형식 감지가 아닌 의미 인식을 통해 찾아집니다. 형식별로 배치를 나누거나 수동으로 형식을 미리 분류할 필요가 없습니다.

제가 정의한 필드가 배치 내 일부 문서에 존재하지 않으면 어떻게 되나요?

AI는 값을 조작하거나 배치를 중단하는 대신, 해당 문서의 셀을 비워둡니다. 세금 항목이 없는 구매 주문서는 세금 금액 열에 빈 셀이 표시되지만, 동일 배치 내 세금이 있는 송장에는 값이 채워집니다. 오류가 배치를 중단시키거나, 조작된 값이 스프레드시트에 조용히 입력되지 않습니다. 이 기능은 배치에 서로 다른 문서 유형이나 공급업체 형식이 섞여 있어 필드가 일부 겹치지만 완전히 동일하지는 않은 경우에 특히 유용합니다. 각 문서는 동일한 열 프레임워크 내에서 독립적으로 처리됩니다.

각 문서의 행 수가 다른 경우 배치 모드에서 라인 항목을 추출할 수 있나요?

네, 가능합니다. AI는 각 문서의 구조를 독립적으로 읽고 해당 문서가 포함하는 만큼의 출력 행을 생성합니다. 한 줄짜리 송장은 헤더 필드가 포함된 하나의 행과 하나의 라인 항목 행을 생성합니다. 50줄짜리 구매 주문서는 동일한 열 헤더 아래에 50개의 행을 생성합니다. 행 수를 미리 정의할 필요가 없으며, 가변 길이 콘텐츠로 인해 테이블이 깨지지 않습니다. "라인 합계"와 같은 계산 열도 가변 길이 배치에서 정상 작동합니다.

배치 추출에 계산 열을 추가할 수 있나요? 예를 들어, 배치 실행 중에 라인 합계를 수량 × 단가로 계산하는 경우입니다.

네, 가능합니다. 계산 열을 사용하면 별도의 Excel 수식 단계 없이 AI가 추출 중에 수행할 계산을 정의할 수 있습니다. 열 이름으로 "라인 합계"를 입력하면 AI가 배치 내 각 문서에서 찾은 수량과 단가 값을 곱하여 결과를 직접 출력합니다. 이는 각 문서의 라인 항목 수에 관계없이 모든 문서에서 작동합니다. 로그인한 사용자의 경우, 규칙 형식에서 교차 행 집계 및 조건부 로직을 포함한 더 복잡한 다단계 계산을 지원합니다.

배치 내 한 문서의 품질이 낮으면 다른 문서에도 영향을 미치나요?

아니요. 각 문서는 독립적으로 처리되며, 배치 보기에서 각각의 상태가 추적됩니다. 30개 파일 배치 중 하나가 흐릿한 스캔본인 경우, 해당 문서의 추출 정확도는 낮아지지만 나머지 29개 파일에는 영향을 주지 않습니다. 품질이 낮은 문서도 AI가 추출할 수 있는 값과 함께 출력에 표시되며, 해당 행은 검토가 필요함을 명확히 식별할 수 있습니다. 최상의 결과를 얻으려면 300 DPI 이상으로 스캔하고, 배치 보기에서 문서별 상태를 활용하여 전체 배치를 다시 실행하지 않고도 주의가 필요한 파일을 식별하십시오.

📮 contact email: [email protected]