일괄 문서 처리는 어떻게 작동하나요?업로드부터 병합된 Excel까지

일괄 문서 처리를 우체국의 우편물 분류 작업이라고 생각해 보세요. 하나씩 분류한다는 것은 각 봉투를 열고, 주소를 읽고, 수작업으로 경로를 지정하는 것을 의미합니다. 일괄 분류는 전체 자루를 기계에 쏟아 넣으면 기계가 모든 주소를 동시에 읽고 한 번에 올바른 칸으로 분류하는 것입니다. 50장의 인보이스를 한 번에 업로드할 때 일어나는 일이 바로 이것입니다. AI가 각 문서를 읽고, 데이터를 추출하고, 모든 것을 하나의 테이블로 병합합니다.

수작업 입력은 그만 — AI가 대신 읽어드립니다
이미지나 PDF를 업로드하세요 — 10초 만에 정형 데이터로
지금 체험하기 →
일괄 문서 처리: AI가 여러 문서를 처리하고 추출된 데이터를 하나의 스프레드시트로 병합하는 방법

주요 요점

  1. 50개의 문서를 하나씩 처리하는 데는 150분이 소요되며, 추출 자체는 그중 20분에 불과합니다. 나머지는 개별 파일을 열고, 결과를 마스터 시트에 복사-붙여넣기하고, 별도 출력물 간의 열을 다시 정렬하는 데 사용됩니다.
  2. 실제 병목 현상은 추출 속도가 아니라 추출 후의 보이지 않는 조립 작업이었습니다. 수동으로 병합된 모든 스프레드시트에는 열 정렬 오류와 붙여넣기 오류가 있으며, 파일을 결합할 때마다 이러한 오류가 누적됩니다.
  3. 일괄 처리는 모든 것을 하나의 스프레드시트로 자동 병합합니다. 모든 문서는 행이 되고, 모든 필드는 열이 되며, 추출 후 조립 단계는 완전히 사라집니다.

일괄 처리가 실제로 하는 일

일괄 처리를 다르게 만드는 핵심은 속도가 아니라 아키텍처입니다. 문서를 하나씩 처리할 때 시스템은 선형 경로를 따릅니다. 파일 업로드, 완료 대기, 결과 다운로드, 다음 파일 업로드. 각 문서는 앞선 문서를 기다려야 합니다. 일괄 처리할 때 시스템은 동시에 여러 레인을 엽니다. 50개 파일이 모두 함께 업로드됩니다. 병렬로 파싱됩니다. 그리고 출력은 수동으로 이어 붙여야 할 50개의 개별 스프레드시트가 아니라 하나의 통합된 결과로 도착합니다.

이 차이가 중요한 이유는 문서마다 처리 시간이 다르기 때문입니다. 한 페이지짜리 PDF 인보이스는 8초 만에 처리될 수 있습니다. 손글씨가 있는 30페이지 스캔 계약서는 25초가 걸릴 수 있습니다. 하나씩 처리하는 워크플로에서는 모든 문서가 앞에 있는 가장 느린 문서를 기다려야 합니다. 일괄 처리 워크플로에서는 3단계 큐 시스템이 이를 처리합니다. 업로드, 큐, 병합입니다. 12번 위치의 느린 문서가 13번이 먼저 완료되는 것을 막지 않습니다.

출력 측면에서 일괄 처리라는 이름이 빛을 발합니다. 문서당 하나씩 별도의 Excel 파일을 받는 대신, 각 행이 한 문서의 추출된 데이터이고 각 열이 요청한 필드인 단일 스프레드시트를 받습니다. 구매 주문서 40개를 업로드하고 "PO 번호", "공급업체", "라인 합계", "납품 날짜" 같은 열을 지정하면 출력은 40개 행이 있는 하나의 테이블이 되고 모든 필드가 열에 맞춰 정렬됩니다. 파일 간 복사-붙여넣기 없음. 수동 병합 없음.

단계별: 일괄 처리 중 발생하는 일

30개 파일을 업로드 영역으로 끌어다 놓는 순간부터 병합된 스프레드시트를 다운로드하는 순간까지 어떤 일이 일어나는지 설명합니다.

1
업로드 및 큐

선택한 모든 파일이 한 번에 업로드됩니다. 시스템은 각 파일을 등록하고 유형(PDF, JPG, PNG), 파일 크기, 페이지 수를 기록한 후 처리 큐에 배치합니다. 200페이지 PDF는 큐에 들어가기 전에 개별 페이지 이미지로 분할되므로 페이지 50이 아직 업로드되는 동안 페이지 1이 처리될 수 있습니다. 이 사전 큐 파일 분석 덕분에 시스템이 작은 문서를 굶기는 거대한 문서를 처리하는 대신 리소스를 지능적으로 할당할 수 있습니다.

2
병렬 처리

여기서 일괄 처리의 이점이 실제로 드러납니다. 한 번에 하나의 파일이 아니라 여러 문서가 동시에 처리되며 각각 사용 가능한 처리 슬롯에 배정됩니다. AI는 필드가 어디에 위치하는지가 아니라 문서가 무엇을 말하는지 이해하여 각 문서를 읽습니다. "인보이스 번호"와 "합계"를 요청하면 AI는 한 공급업체의 PDF 상단에 나타나든 다른 공급업체의 테이블에 포함되어 있든 의미를 기준으로 해당 필드를 찾습니다. 기존 도구와의 핵심 차이점: 추출이 템플릿 불필요 방식이므로 시스템에 파일별 구성이 필요 없습니다. 동일한 추출 로직이 문서별 설정 없이 배치의 모든 문서에 적용됩니다.

3
결과 수집 및 병합

각 문서 처리가 완료되면 추출된 데이터가 수집됩니다. 문서마다 완료 순서가 달라도 병합 단계에서 모든 데이터를 올바른 순서로 정렬합니다. 결과는 행 단위로 조합됩니다. 각 문서는 하나의 행이 되고, 각 데이터 필드는 하나의 열이 됩니다. 열을 세 개 지정했다면 모든 행에 해당 세 개의 열이 채워지며, 특정 문서에 해당 필드가 정말로 없는 경우에는 비어 있는 상태로 남습니다.

4
내보내기

병합된 결과는 단일 Excel(XLSX) 파일로 작성되며, 배치마다 하나의 워크시트에 모든 문서의 데이터가 동일한 열로 정렬됩니다. CSV 또는 JSON으로도 내보낼 수 있습니다. 출력 결과는 재구성 없이 회계 소프트웨어나 ERP에 바로 가져올 수 있을 만큼 깔끔합니다. Google Sheets 애드온을 사용하면 병합된 데이터가 다운로드 및 가져오기 단계 없이 스프레드시트에 바로 입력됩니다.

기존 방식과 배치 방식의 비교

문서를 하나씩 처리하는 방식과 배치 처리 방식의 차이는 단지 속도만이 아닙니다. 업로드 사이에 어떤 작업을 수행하느냐의 차이이기도 합니다. 실제 문서를 다룰 때 중요한 기준으로 두 방식을 비교하면 다음과 같습니다.

기준하나씩 처리배치 처리
업로드파일 하나 선택, 업로드, 결과 대기, N회 반복N개 파일을 한 번에 모두 선택, 동시 업로드
동시 처리처리 슬롯 1개, 모든 파일이 이전 파일 완료를 대기여러 병렬 슬롯, 빠른 파일이 먼저 완료되어 다음 파일에 슬롯을 넘김
형식 변동공급업체 형식이 다르면 파일별로 다른 설정 필요하나의 열 정의가 모든 파일에 적용, 형식 독립적
출력N개의 개별 파일, 수동 병합 필요병합된 단일 파일: 각 문서는 행, 각 필드는 열
일관성개별 실행 간 필드 누락 위험동일한 추출 로직이 모든 문서에 균일하게 적용

형식 변형 행은 특별히 주의를 기울일 필요가 있습니다. 템플릿에 의존하는 기존 OCR 도구에서는 배치 처리가 템플릿 적용 범위에 의해서만 성공 여부가 결정됩니다. 공급업체 7이 공급업체 1~6과 다른 인보이스 레이아웃을 사용한다면, 공급업체 7용 새 템플릿을 만들거나 배치에서 필드를 놓치는 것을 감수해야 합니다. 위치가 아닌 의미로 추출하는 AI를 사용하면 단일 열 정의가 모든 공급업체 레이아웃에서 작동합니다. AI가 한 인보이스의 "Our Ref:"와 다른 인보이스의 "Invoice #"가 동일한 대상을 가리킨다는 것을 이해하기 때문입니다. 이것이 AI 기반 추출이 기존 템플릿 기반 방식보다 배치 워크플로에 근본적으로 더 적합한 이유입니다.

배치 처리가 중요한 이유

시간 절약은 명백한 이점이지만 가장 중요한 것은 아닙니다. 덜 명확한 세 가지 결과로 인해 배치 처리가 실제 워크플로에서 혁신적입니다.

문서 간 일관성. 문서를 하나씩 처리하면 각 실행이 독립적인 추출입니다. 파일 3과 파일 4 사이에 열 이름을 수정하는 경우 결과에 두 개의 서로 다른 열 스키마가 생깁니다. 배치 처리는 단일 실행에서 모든 파일에 동일한 추출 로직을 적용하여 열 수준 일관성을 보장합니다. 모든 행은 동일한 추출 규칙으로 채워진 동일한 순서의 동일한 열을 갖습니다. 이는 월말 정산이나 감사를 위한 데이터를 준비할 때 매우 중요합니다. 일관되지 않은 열은 다운스트림 가져오기를 깨뜨리는 첫 번째 요인이기 때문입니다.

병합된 출력이 실제 병목 현상을 제거합니다. 대부분의 사람들은 문서 데이터 입력의 병목 현상이 추출 자체라고 생각합니다. 하지만 그렇지 않습니다. 실제 병목 현상은 추출 후에 발생합니다. 즉, 개별 파일을 열고, 데이터를 마스터 스프레드시트에 복사하고, 열을 정렬하고, 복사-붙여넣기 중 발생한 오류를 확인하는 과정입니다. 배치 처리는 출력 자체가 마스터 스프레드시트이므로 이 전체 사후 추출 계층을 제거합니다. 조립이 필요 없습니다.

시간은 선형적으로 증가하지 않습니다. 문서 하나를 처리하는 데 10초가 걸린다면 문서 50개를 처리하는 데 500초가 걸리지 않습니다. 90초가 걸릴 수 있습니다. 동시 처리 아키텍처 덕분에 대부분의 문서는 순차적이 아닌 병렬로 완료됩니다. 총 배치 시간은 모든 처리 시간의 합이 아니라 배치에서 가장 느린 문서에 의해 결정됩니다. 월 200개의 인보이스를 처리하는 팀에게 이는 30분이 걸리는 작업과 커피를 마시는 동안 완료되는 작업의 차이입니다.

첫 배치 전에 알아야 할 사항

배치 처리는 간단하지만, 몇 가지 실용적인 팁이 첫 실행을 순조롭게 할지, 아니면 답답하게 할지를 결정합니다.

파일 수와 크기가 함께 중요합니다. 파일 수보다 파일 크기의 분포가 더 중요합니다. 100개의 1페이지 PDF 배치와 10개의 1페이지 PDF 및 1개의 200페이지 PDF가 섞인 배치는 처리 방식이 다릅니다. 병합 단계는 가장 느린 파일까지 모두 완료되어야 완전히 종료될 수 있으므로, 큰 파일 하나가 전체 배치 시간을 좌우할 수 있습니다. 크기가 섞여 있다면 대략적인 페이지 수로 배치를 나누어 처리 시간을 예측 가능하게 유지하세요.

긴 문서 하나는 여러 개의 개별 페이지로 도착합니다. 큰 PDF는 대기열에 들어가기 전에 페이지 이미지로 분할되므로, 200페이지 명세서는 200개의 개별 단위로 처리되어 병합된 스프레드시트에 200개의 행으로 표시됩니다. 템플릿 설정에서 Multi-Page Merge를 켜고 페이지가 어떻게 연결되는지 지정하면, 동일한 문서의 페이지가 자동으로 하나의 행으로 접히고 계좌 번호와 같은 반복 필드가 모든 라인 항목에 전달됩니다. 긴 명세서의 경우 이는 하나로 정리된 레코드와 수작업으로 이어 붙여야 하는 200개의 조각 사이의 차이를 의미합니다. 다중 페이지 PDF 추출에 대한 가이드에서 AI가 페이지 나누기를 넘어 어떻게 읽는지 설명합니다.

열 이름은 AI와의 인터페이스입니다. 열에 지정하는 이름은 AI가 따르는 지침입니다. 대부분의 인보이스에는 "Total"이 적합하지만, 라인 항목 합계와 주문 합계가 모두 있는 구매 주문서에서 추출하는 경우 모호함을 피하기 위해 "Order Total"과 "Line Total"을 별도의 열로 지정하는 것이 좋습니다. AI는 마음을 읽을 수 없지만 정확한 열 이름은 읽을 수 있습니다. 추출 중에 AI가 수량과 단가에서 라인 합계를 계산하는 것과 같은 계산을 수행하길 원한다면 계산 열을 사용하여 원시 데이터가 아닌 결과를 얻을 수 있습니다.

혼합 형식도 문제없습니다. 배치에는 PDF, JPG, PNG, 스크린샷이 모두 섞여 있을 수 있습니다. AI는 고정 레이아웃을 파싱하는 대신 콘텐츠를 이해하여 읽기 때문에 형식이 다양해도 문제가 되지 않습니다. 휴대폰으로 찍은 영수증 사진과 공급업체 ERP 시스템의 선명한 디지털 PDF 인보이스가 동일한 배치에서 동일한 구조화된 출력으로 생성되어 동일한 병합 스프레드시트에 들어갑니다.

문서에 필드가 정말 없는 경우 셀은 비어 있습니다. 모든 문서에 요청한 모든 필드가 있는 것은 아닙니다. PO 번호가 없는 인보이스는 해당 행의 PO 번호 열에 빈 셀로 표시되며 배치가 중단되거나 오류가 발생하지 않습니다. 이는 의도된 설계입니다. AI는 존재하는 것을 추출하고 존재하지 않는 곳은 공백으로 남겨두므로 스프레드시트를 살펴보고 빈 셀이 예상된 것인지 후속 조치가 필요한지 결정할 수 있습니다.

대규모 배치를 검증할 때 모든 원본을 다시 열 필요는 없습니다. 병합된 스프레드시트는 작업의 절반에 불과합니다. AI가 각 값을 올바르게 읽었는지도 확인해야 합니다. 행과 소스 파일 폴더 사이를 오가며 확인하는 대신 검토 모드를 켜고 추출된 셀을 클릭하면 해당 값이 원본 문서에서 강조 표시된 위치를 정확히 볼 수 있습니다. 처리 전에 자동 주석을 켜면 각 문서가 완료될 때 시각적 확인이 이미 생성되어 대기합니다. 대규모 배치의 경우 "모든 문서 다시 읽기"가 "확실하지 않은 셀 클릭"으로 바뀝니다. 배치 출력에 대한 샘플링 검사 루틴을 구축 중이라면 추출 결과를 검증하는 방법에 대한 가이드에서 이와 잘 어울리는 샘플링 방법을 안내합니다.

자주 묻는 질문

한 번에 몇 개의 문서를 배치 처리할 수 있나요?

도구에 따라 다르지만, 잘 설계된 배치 시스템은 한 번의 실행으로 50-100개의 문서를 무리 없이 처리할 수 있습니다. 실제 제한은 보통 처리 엔진이 아니라 결과를 검증하는 실질적인 제약입니다. 200개의 행을 훑어보며 정확성을 확인하는 것이 500개를 스크롤하는 것보다 더 효과적입니다. 규모를 늘리기 전에 작은 배치로 시작하여 정확성을 파악하는 것이 좋습니다.

배치 처리가 손글씨 문서에서도 작동하나요?

네. 최신 AI는 인쇄된 문자를 매칭하는 대신 시각적 장면을 이해하여 문서를 읽으므로, 손글씨도 또 다른 시각적 패턴일 뿐입니다. 깔끔한 손글씨는 인쇄된 텍스트와 비슷한 정확도로 추출됩니다. 매우 지저분한 필기체는 정확도가 낮아질 수 있습니다. 배치에 인쇄 문서와 손글씨 문서가 섞여 있어도 모두 동일한 배치에서 처리되며, 손글씨 문서에 대한 특별한 설정이 필요하지 않습니다.

배치에서 하나의 파일이 실패하면 어떻게 되나요?

제대로 설계된 배치 시스템은 하나의 실패한 파일이 전체 배치를 중단시키지 않습니다. 성공적으로 처리된 파일은 결과를 생성합니다. 오류가 발생한 파일은 오류 상태로 표시되고 나머지 배치는 계속 진행됩니다. 실패한 파일은 전체 배치를 다시 실행하지 않고 개별적으로 재시도할 수 있습니다.

서로 다른 출처의 문서를 같은 실행에서 배치 처리할 수 있나요?

네. 단일 배치에 PDF, JPG 사진, PNG 스크린샷, WebP 이미지를 모두 섞어서 포함할 수 있습니다. AI는 각 파일을 시각적 콘텐츠로 독립적으로 읽으므로 형식이 다양해도 추출에 영향을 미치지 않습니다. 이는 비용 보고와 같은 실제 업무 워크플로우에서 특히 유용합니다. 공급업체의 PDF 인보이스, 종이 영수증 사진, 디지털 결제 확인 스크린샷을 모두 동일한 월간 보고서에 포함할 수 있기 때문입니다.

일괄 처리는 파일을 하나씩 업로드하는 것과 어떻게 다른가요?

파일을 하나씩 업로드하면 한 번에 하나의 결과만 얻을 수 있으며, 각각의 출력물을 수동으로 결합해야 합니다. 시스템이 순차적으로 처리하므로 각 파일은 이전 파일이 완료될 때까지 대기합니다. 일괄 처리는 모든 파일을 함께 업로드하고 병렬로 처리한 후 하나의 출력으로 병합합니다. 출력 차이만으로도, 병합된 스프레드시트 하나와 N개의 개별 파일은 사후 처리 워크플로우 전체를 바꿉니다.

일괄 처리가 개별 처리보다 비용이 더 많이 드나요?

대부분의 도구에서 일괄 처리는 개별 처리와 동일한 파일당 가격 또는 크레딧 소비를 사용하므로 일괄 처리에 대한 추가 비용이 없습니다. 파일당 비용은 동일하며, 시간 절약은 병렬 처리와 병합된 출력에서 비롯됩니다. 일부 도구는 볼륨 할인 또는 전용 일괄 처리 가격 티어를 제공합니다. 특정 도구의 가격 페이지를 확인하여 확인하세요.

일괄 처리 중에 규칙이나 계산을 적용할 수 있나요?

네. 도구가 계산 열 또는 추론 열을 지원하는 경우 열 정의에 계산 로직을 직접 포함할 수 있으며 일괄 추출 중에 실행됩니다. 예를 들어 "라인 합계"라는 열은 배치의 모든 문서에 대해 값을 즉시 계산하므로 병합된 출력에는 원시 추출 숫자뿐만 아니라 계산된 결과도 포함됩니다. 즉, 단일 일괄 실행으로 추출, 계산, 분류를 한 번에 처리할 수 있습니다.

하나씩에서 한 번에 모두로

일괄 처리는 하나씩 처리하는 더 빠른 버전이 아닙니다. 문서 모음을 단일 작업으로 취급하고 병렬로 처리하며 통합된 결과를 제공하는 다른 아키텍처입니다. 차이는 세 가지에서 나타납니다: 대기 시간, 추출 후 수행하지 않는 작업, 모든 행에서 얻는 일관성입니다.

5년 전에는 취약하거나 불가능했던 이 아키텍처가 오늘날 실용적인 이유는 템플릿 기반 추출에서 의미 기반 추출로의 전환 때문입니다. 추출이 문서별 템플릿에 의존할 때 일괄 처리는 템플릿 설정만큼만 빠릅니다. 추출이 레이아웃과 관계없이 각 필드의 의미를 이해하여 작동할 때 동일한 열 정의가 문서별 구성 없이 배치의 모든 파일에 적용됩니다. 이것이 일괄 처리를 "모든 문서가 동일하게 보이는 경우에만 더 빠름"에서 "실제로 받는 모든 문서 혼합에서 작동"으로 바꾸는 요소입니다.

AI가 문서 콘텐츠를 이해하는 방법, 템플릿 불필요 일괄 추출을 가능하게 하는 SEE → UNDERSTAND → FETCH 프로세스에 대해 더 자세히 알아보려면 AI가 문서를 읽는 방법을 읽어보세요. 송장 일괄 처리에 대한 구체적인 단계별 지침을 찾고 있다면 송장 데이터를 Excel로 일괄 추출하는 방법 가이드에서 전체 예제를 안내합니다.

자신의 문서에서 일괄 처리를 사용해 보세요. 송장 10개를 업로드하고 열 3개를 지정하면 템플릿, 파일별 설정, 사후 수동 조립 없이 모두 하나의 스프레드시트로 병합되는 것을 확인할 수 있습니다.

📮 contact email: [email protected]