PDF 가져오기로 Excel이 시트로 분할됩니다.하나의 테이블로 만드는 방법

Excel의 PDF 가져오기는 큰 오류를 내지 않습니다. 파일을 파싱된 것처럼 보이지만 실제로는 그렇지 않은 형태로 바꿔 놓을 뿐입니다. r/excel 스레드에서 사용자들이 Excel에 추가하고 싶은 기능을 묻는 질문에, 최상위 댓글은 정확한 증상을 지목합니다: PDF에서 데이터를 가져올 때 "각 페이지를 별도의 워크시트로 분리하지 않고" 가져오는 기능이라고요. 다중 페이지 명세서에 데이터 > 데이터 가져오기 > 파일에서 > PDF에서를 실행하면 페이지마다 쿼리 하나씩, 첫 페이지 이후에는 새로운 Column1 및 Column2 머리글, 페이지 나누기 지점에서 잘린 행이 생성됩니다. 여러분은 스프레드시트를 요청했지만, Excel은 조각 더미를 반환했습니다.

수작업 입력은 그만 — AI가 대신 읽어드립니다
이미지나 PDF를 업로드하세요 — 10초 만에 정형 데이터로
지금 체험하기 →
문서 위에 놓인 돋보기 아이콘이 중앙에 있고, 다중 페이지 PDF, 하나의 연속 테이블, 페이지 수준 읽기라는 세 개의 노드가 방사형으로 연결된 구조. 깔끔한 그라데이션 배경에 손으로 그린 선 장식이 포함되어 있습니다.

핵심 요점

  1. 5페이지짜리 명세서가 손상된 것이 아닙니다. PDF에는 애초에 단일 테이블이 없었기 때문에 Power Query가 페이지당 하나의 테이블로 보고하는 것입니다.
  2. 첫 번째 조각만 실제 제목을 유지하므로 2페이지와 3페이지는 Column1, Column2, Column3으로 대체되고 Append Queries는 이를 정렬하지 못합니다.
  3. 페이지별로 읽는 것을 멈추고 원하는 열 이름을 지정하면 ImageToTable.ai가 문서를 하나의 레코드로 읽고 명세서 40개가 40개 행으로 변환됩니다.

다중 페이지 PDF 가져오기에서 실제로 얻는 결과

A two-column comparison: left side shows a stack of documents labeled 'What You Get' with 'Multiple sheets, one per page' in red, right side shows a clean table labeled 'What You Want' with 'One continuous table' in green, on a gradient background with line decorations.

가져오기가 거의 오류를 내지 않습니다. 대신 잘못된 형태를 반환하며, 이후의 모든 증상은 그 형태에서 비롯됩니다. Power Query가 파일에 연결하면 Navigator 창에 두 종류의 개체가 표시됩니다. 위쪽에는 개별 테이블, 아래쪽에는 전체 페이지가 나열됩니다. 둘 이상을 선택하면 Power Query는 각 항목에 대해 별도의 쿼리를 만듭니다. Load를 선택하면 Excel은 각 쿼리를 자체 시트에 기록하므로 5페이지 분량의 명세서가 여러 워크시트로 나뉘고 원하는 테이블이 모든 시트에 흩어지게 됩니다.

이것이 "PDF 하나가 여러 시트가 된" 이유입니다. 파일이 손상된 것이 아닙니다. 커넥터가 페이지별로 발견한 내용을 그대로 보고한 것입니다. 이후 행과 열이 깨져 보이는 것은 각 페이지별 워크시트가 개별적으로 읽히고 각각 고유한 열 이름이 할당되었기 때문입니다.

다중 페이지 PDF는 손상된 테이블 하나로 도착하지 않습니다. 결코 결합되지 않은 여러 개의 작은 테이블로 도착하며, 그래서 아무리 다시 포맷해도 해결되지 않는 것입니다.

Power Query가 페이지당 하나의 테이블로 보는 이유

A central gear icon representing Pdf.Tables, with three radiating nodes: Fixed-Layout Format, MultiPageTables Default: True, and Layout Shift Detected (amber), on a gradient background with line decorations.

Power Query가 PDF를 잘못 읽는 것이 아닙니다. PDF 형식에는 읽을 테이블이 없습니다. PDF는 고정 레이아웃 형식으로 명시되었으며 ISO 32000으로 표준화되었습니다. 각 페이지는 좌표에 고정된 텍스트와 그래픽의 캔버스입니다. 해당 좌표가 머리글 행이 있는 3열 테이블을 형성한다는 것은 해석일 뿐이며, 파일이 논리 구조를 가진 태그가 지정된 PDF(ISO 32000 14.8절)인 경우에만 형식이 그 해석을 담습니다. 회계 및 은행 시스템에서 내보낸 대부분의 PDF는 태그가 지정되지 않습니다.

따라서 Microsoft의 커넥터는 추측해야 하며, 그 추측은 단일 함수에 노출됩니다. Pdf.Tables는 데이터 가져오기 > PDF에서 뒤에 있는 엔진입니다. Name, Kind, Data라는 세 개의 열이 있는 테이블을 반환하며, Kind는 Table 또는 Page입니다. 그 옵션 중 하나가 추측의 강도를 결정합니다: MultiPageTables는 Microsoft의 Pdf.Tables 참조에서 "연속된 페이지의 유사한 테이블이 단일 테이블로 자동 결합되는지 여부"를 제어한다고 설명합니다. 기본값은 true입니다.

이 기본 동작이 분할 방식을 정확히 설명합니다. 연속된 페이지가 동일한 구조를 공유하면 감지기가 이를 하나의 표로 간주하고 결합합니다. 페이지마다 레이아웃이 바뀌거나, 머리글 행이 반복되거나, 열 수가 다르거나, 특정 페이지에만 요약 블록이 나타나면 감지기는 서로 다른 표로 인식하여 페이지마다 하나씩 보고합니다. 문서의 페이지별 구성 요소가 강할수록 조각으로 분할될 가능성이 높아집니다.

대부분의 튜토리얼이 건너뛰는 부분이 바로 여기입니다. Append를 클릭하고 넘어가라고만 안내할 뿐, 파일 자체에 단일 표가 없었으므로 커넥터가 유지할 대상이 없었다는 점은 설명하지 않습니다. 내보내기를 탓하기 전에 PDF가 담을 수 있는 것과 담을 수 없는 것에 대한 전체적인 이해가 필요합니다. 더 자세한 내용은 PDF가 구조화 데이터가 되는 과정을 참조하세요.

2페이지의 머리글이 데이터 행이 되는 이유

두 열 비교 이미지: 왼쪽은 '페이지 1' 위쪽 화살표와 초록색 '머리글: 날짜, 설명, 금액'이 표시된 문서, 오른쪽은 '페이지 2' 물음표와 빨간색 '머리글: Column1, Column2, Column3'이 표시된 문서, 그라데이션 배경과 선 장식 포함.

열 제목은 첫 번째 조각에만 한 번 존재합니다. 그 페이지 이후에는 동일한 단어가 단순한 셀 값일 뿐입니다. Microsoft Q&A의 한 사용자가 이로 인해 발생하는 정확한 오류를 설명합니다: 세 페이지에 걸친 PDF 표가 "세 개의 별도 표로 식별"되며, "첫 번째 표에만 원래 열 제목이 있고 나머지 두 표에는 Column1, Column2 등이 표시"됩니다. 열 이름이 더 이상 일치하지 않으므로 편집 없이는 표를 추가할 수 없습니다. 전체 스레드는 Microsoft Q&A 게시물에서 확인할 수 있습니다.

출력 구조를 보면 메커니즘은 간단합니다. 각 페이지별 표는 독립적으로 감지되므로 각각 자체 머리글 승격 단계를 거칩니다. 1페이지에서는 "첫 행을 머리글로 사용"이 날짜, 설명, 금액을 올바르게 열 이름으로 변환합니다. 2페이지에는 승격할 머리글 행이 없습니다. 반복된 제목이 단순히 데이터의 첫 행이기 때문입니다. Power Query는 Column1, Column2, Column3으로 대체합니다. 열 이름을 기준으로 표를 쌓는 Append Queries는 정렬을 거부합니다.

페이지 나눔에서 행이 절반으로 잘리는 위치

페이지 나눔은 종이가 끝나는 위치에 따라 결정되므로, 줄바꿈된 설명이나 여러 줄로 된 셀이 두 개의 행으로 나뉘어 도착할 수 있습니다. Microsoft의 PDF 커넥터 문서에는 "여러 줄 행 처리" 항목에서 이 문제가 알려진 제한 사항으로 명시되어 있으며, 정렬이 어긋난 값을 위 행에 복사하려면 Table.FillDown을, 인접한 행을 결합하려면 Table.Group을 사용하라고 안내합니다. 둘 다 자동으로 실행되지는 않습니다. 같은 문서에는 EnforceBorderLines가 "테두리 선이 항상 셀 경계로 적용되는지 여부"를 제어하며 기본값이 false라고 설명되어 있어, 완전한 테두리 없이 그려진 표는 잘못된 셀 경계로 파싱될 수 있습니다.

이제 두 가지 실패 모드가 겹칩니다. 페이지 나눔을 넘어가는 레코드는 두 개의 행이 되고, 이전 섹션의 머리글 문제로 인해 이를 인지하지 못할 수도 있습니다. 두 번째 행은 종종 이를 식별해 줄 레이블을 잃기 때문입니다. 병합되거나 느슨한 셀 테두리는 열 매핑을 더 악화시키며, 이는 병합된 셀이 표 추출을 깨뜨리는 이유에서 다루는 별도의 추출 문제입니다.

Excel에서 수정하기: 쿼리 추가와 머리글 조정

수정은 Excel 내에서 이루어지며, 레이아웃이 다른 모든 파일에 대해 반복해야 하는 네 단계로 구성됩니다. 작동은 하지만 수동입니다. 핵심은 조각들을 쌓기 전에 모든 조각이 동일하게 보이도록 만든 다음, 마지막에 실제 머리글을 한 번에 복원하는 것입니다.

1

조각 선택

Navigator에서 여러 항목 선택을 체크하고 필요한 테이블을 선택합니다. 목록이 복잡하다면 전체 파일을 로드하고 Kind 기준으로 쿼리를 필터링하여 Table 행만 유지할 수 있습니다.

2

첫 번째 테이블의 머리글을 일반 행으로 변환

첫 번째 조각에서 변환 > 머리글을 첫 행으로 사용을 사용합니다. 실제 열 제목이 데이터로 내려가고, 테이블은 이후 페이지와 마찬가지로 Column1, Column2, Column3을 사용하게 됩니다.

3

나머지 조각 추가

홈 > 쿼리 추가 > 새 쿼리로 추가를 사용하고 나머지 모든 조각을 추가합니다. 이제 모든 조각이 동일한 자리 표시자 이름을 공유하므로 각 열을 수동으로 이름을 바꾸지 않아도 열이 정렬됩니다.

4

머리글 복원

결합된 쿼리에서 첫 행을 머리글로 사용을 클릭합니다. 원래 제목이 맨 위 행으로 돌아오고, 쌓인 페이지가 하나의 연속된 테이블이 됩니다.

두 가지 주의 사항이 있습니다. 단계는 쿼리에 저장되므로 같은 파일을 새로 고치는 것은 간단하지만, 다음 달에 레이아웃이 변경되는 명세서는 감지를 다시 깨뜨려 머리글 승격을 다시 수행해야 할 수 있습니다. 또한 PDF가 텍스트 레이어가 없는 스캔본이라면 커넥터가 OCR을 실행하지 않으므로 구조화할 내용이 전혀 없습니다. 그런 경우는 스캔된 PDF를 Excel로 OCR 변환에 해당합니다.

수작업 입력은 그만 — AI가 대신 읽어드립니다
이미지나 PDF를 업로드하세요 — 10초 만에 정형 데이터로
지금 체험하기 →

PDF를 페이지로 모델링하지 않는 방법

시트별 페이지 결과는 페이지 단위 읽기의 증상이므로, 대안은 페이지별로 읽는 것을 중단하는 것입니다. 목표가 페이지의 복사본이 아니라 표라면, 출력을 먼저 정의하고 문서를 작업 단위로 삼을 수 있습니다. 이것이 페이지 수준 읽기와 문서 수준 이해의 차이이며, 추출 도구가 페이지 가져오기 도구와 달라지기 시작하는 지점입니다.

맞춤 열 추출을 사용하면 Invoice Number, Statement Date, Amount와 같은 열 이름을 입력하고, 그 이름이 완성된 표의 머리글이 됩니다. 도구는 고정된 위치를 읽는 대신 문서를 읽고 각 값을 찾으므로, 모든 페이지 상단에 반복되는 머리글 밴드는 데이터 행이 아닌 페이지 장식으로 처리됩니다. 출력은 페이지당 워크시트가 아니라 레코드당 한 행입니다. 단위가 문서이므로 열 이름이 첫 페이지와 어긋날 수 있는 두 번째 페이지가 없습니다.

단일 파일이 아닌 폴더의 경우에도 동일한 설계가 배치로 적용됩니다. 일괄 우선 처리는 여러 PDF를 한 번에 놓으면 동일한 머리글로 단일 스프레드시트에 병합되므로, 40개의 월별 명세서가 수동으로 조립해야 하는 40개의 시트가 아니라 하나의 표에 40개의 행이 됩니다. 쿼리 편집기 없이 이를 수행하는 방법은 코드 없이 문서 일괄 처리에서 다룹니다. 커밋하기 전에 자신의 파일에서 출력 형태를 확인하려면 아래의 임베디드 데모가 샘플에서 실행됩니다.

PDF/JPG/PNG AI 추출

파일은 안전하게 처리되며 저장되지 않습니다.

각 페이지가 실제로 별개의 문서인 경우

연속된 하나의 표는 페이지들이 동일한 레코드에 속할 때만 올바른 답입니다. 때로는 그렇지 않습니다. PDF는 서로 관련 없는 단일 페이지 문서들의 연속일 수 있고, 페이지마다 다른 고객 명세서일 수 있으며, 수십 장의 개별 인보이스를 스캔한 것일 수도 있습니다. 이런 경우 하나의 통합 표로 강제로 합치면 분리되어야 할 레코드들이 병합됩니다. 올바른 방법은 더 나은 가져오기가 아니라 그룹화 규칙입니다.

이것이 바로 다중 페이지 병합의 용도입니다. 추출된 결과 중 어떤 것이 동일한 논리 문서에 속하는지 결정하는 템플릿 설정이며, 그룹화 방식을 구성할 수 있습니다: 추적 중인 열의 값이 변경될 때마다 새 그룹을 시작하거나, 전체 배치에서 참조 번호를 공유하는 행을 일치시키거나, 고정된 업로드 수마다 그룹화합니다. 그룹의 여러 페이지에 동일한 필드가 나타나면 첫 번째 값 유지, 마지막 값 유지, 연결, 또는 별도의 행으로 분할 중에서 중복 처리 방식을 선택합니다. 중요한 것은 제어의 방향입니다. 도구는 어떤 페이지가 서로 속하는지 조용히 추측하지 않으며, 여러분이 규칙을 제공하면 그 규칙을 일관되게 적용합니다.

실제로 함께 속하는 페이지의 정확성도 여전히 확인할 가치가 있으며, 이것이 Bbox 지원 검증이 포함된 검토 모드가 제공하는 기능입니다. 추출된 셀 위에 마우스를 올리거나 클릭하면 원본 이미지에서 해당 값이 나온 위치가 강조 표시되며, 반대 방향도 작동합니다: 문서의 영역을 클릭하면 해당 셀로 이동합니다. 단일 파일에 대해 필요할 때 강조 표시를 트리거하거나 처리 후 자동으로 실행되도록 설정할 수 있습니다. 한 자리 숫자의 오독이 중요한 명세서의 경우, 이 시각적 교차 확인이 페이지를 다시 읽는 것보다 빠릅니다.

FAQ

Excel의 PDF에서 가져오기가 다중 페이지 표를 한 시트에 자동으로 배치하는 경우가 있나요?

때때로 그렇습니다. 연속된 페이지가 동일한 표 구조를 공유하면 기본값이 true인 MultiPageTables 옵션이 이를 단일 표로 결합합니다. 페이지마다 레이아웃이 변경되면 별도의 표로 감지되어 별도의 워크시트에 배치됩니다. 임의의 페이지를 하나의 표로 강제하는 설정은 없습니다.

2페이지와 3페이지에 머리글 대신 Column1과 Column2가 표시되는 이유는 무엇인가요?

각 페이지의 표는 개별적으로 감지되므로 1페이지에 적용한 머리글 승격이 이후 페이지에는 적용되지 않습니다. 첫 번째 조각에만 실제 머리글 행이 있고, 이후 조각은 자리 표시자 이름을 사용합니다. 이것이 이름이 일치할 때까지 Append Queries가 실패하는 이유이기도 합니다.

Google Sheets에서 다중 페이지 PDF를 하나의 표로 가져올 수 있나요?

Google Sheets에는 Power Query처럼 PDF 내부의 표를 감지하는 기본 커넥터가 없습니다. 일반적인 해결 방법은 PDF를 중간 형식으로 변환한 후 가져오거나, 스프레드시트를 직접 반환하는 전용 추출 도구를 사용하는 것입니다. 두 방법 모두 페이지별 시트를 피할 수 있지만, 정리 작업을 피하려면 추출 방식을 사용해야 합니다.

PDF가 텍스트 레이어 없는 스캔 문서라면 어떻게 하나요?

Power Query의 PDF 커넥터는 OCR을 실행하지 않으므로 순수 이미지 스캔에는 구조화할 텍스트가 없습니다. 먼저 OCR 단계를 거치거나 이미지를 직접 읽는 도구가 필요합니다. 이러한 장단점은 스캔 PDF를 Excel로 변환하는 가이드에 설명되어 있습니다.

시트 분할을 중지하는 원클릭 설정이 있나요?

없습니다. 이 동작은 체크박스가 아니라 PDF가 콘텐츠를 저장하는 방식에서 비롯됩니다. 가장 가까운 기본 제공 수단은 구조가 일치하는 경우의 MultiPageTables와 그 외 모든 경우의 Append Queries 및 머리글 단계입니다. 파일이 매우 큰 경우 대용량 PDF는 페이지 분할보다 먼저 자체적인 문제를 일으킵니다. Copilot이 정리 작업을 대신 처리해 주기를 기대했다면, 그 기대가 충족되지 않는 이유는 Copilot이 PDF를 Excel로 변환하는 데 어려움을 겪는 이유에서 확인할 수 있습니다.

가져오기 대신 PDF를 Excel로 바로 변환해도 되나요?

가능합니다. 문서가 단일하고 깔끔한 표이고 숫자가 한 번만 필요하다면 합리적인 선택입니다. 입력이 서로 다른 형식의 문서 폴더이고 출력에서 일관된 열을 유지해야 하는 경우에는 열 기반 PDF를 Excel로 변환이 더 안정적인 경로입니다. 머리글이 페이지별로 감지되는 것이 아니라 사용자가 직접 정의하기 때문입니다.

페이지당 하나의 시트가 생성되는 결과는 파일의 결함이 아닙니다. 페이지 중심의 판독기가 레코드 중심의 표를 재구성하도록 요청받을 때 발생하는 현상이며, 해결 방법은 조각을 의도적으로 결합하거나 아무것도 읽기 전에 표를 정의하는 것입니다.

분할을 손상이 아닌 모델링 선택으로 보면 결정이 더 쉬워집니다. 파일이 몇 개 없고 쿼리를 유지 관리할 시간이 있다면 Excel의 추가 및 승격 시퀀스로 충분합니다. 표가 핵심이고 페이지는 단지 포장일 뿐이라면 필요한 열 이름을 지정하고 문서를 작업 단위로 삼으세요. 별도 설정 없이 자신의 명세서로 테스트하여 다음 다중 페이지 PDF가 하나의 표로 처리되는지 아니면 시트 더미로 처리되는지 확인할 수 있습니다.

수작업 입력은 그만 — AI가 대신 읽어드립니다
이미지나 PDF를 업로드하세요 — 10초 만에 정형 데이터로
지금 체험하기 →
📮 contact email: [email protected]