비밀번호로 보호된 PDF 잠금 해제
그런 다음 테이블 추출
잠긴 PDF에 대한 도움말을 포럼에서 검색하면 항상 비슷한 형태의 답변이 돌아옵니다. 여러 도구 목록이 나오는데, 그중 상당수는 광고처럼 읽힙니다. r/pdf의 한 스레드에서는 비밀번호로 보호된 PDF의 잠금을 해제하여 테이블을 Excel에서 편집하는 방법을 묻습니다. 댓글에는 제품 이름이 하나둘씩 나열되어 있고, 가장 유용한 댓글은 이 작업이 목록이 시사하는 것보다 더 어렵다고 말하는 댓글입니다. 그 댓글은 맞지만, 제시된 이유 때문은 아닙니다.
"잠금 해제"라는 단어는 한 음절 아래에 세 가지 문제가 쌓여 있습니다. 첫 번째는 접근입니다. 파일을 아예 열 수 있는지의 문제입니다. 두 번째는 사용입니다. 내부 내용을 복사하거나 편집할 수 있는지의 문제입니다. 세 번째는 형태입니다. 일단 읽을 수 있게 되면 행이 스프레드시트로 이동하는 과정에서 살아남을 수 있는지의 문제입니다. PDF 잠금 해제 도구로 판매되는 대부분의 제품은 처음 두 가지를 해결하고 세 번째는 조용히 남겨두므로, 잠긴 파일이 결국 열렸지만 여전히 사용할 수 없는 상태로 끝나는 경우가 많습니다.

핵심 요점
- 비밀번호는 쉬운 부분입니다. "잠금 해제"에는 세 가지 별개의 문제가 숨어 있으며, 대부분의 도구는 테이블을 얻을 수 있는지 여부를 결정하는 문제 앞에서 멈춥니다.
- 파일을 여는 것만으로는 테이블을 얻을 수 없습니다. 복호화된 PDF는 고정된 좌표에 고정된 텍스트일 뿐이므로, 하나의 거래가 두 개의 Excel 행으로 나뉘어 도착할 수 있습니다.
- 해결책은 잠금 해제를 건너뛰는 것입니다. ImageToTable.ai는 비밀번호를 문 앞에서 받아 정의한 열을 반환하므로, 명세서의 보호되지 않은 사본이 디스크에 남지 않습니다.
"PDF 잠금 해제"는 서로 다른 두 가지 잠금이며, 그중 하나만 암호화입니다

잠긴 PDF를 열 수 있는지 여부는 발신자가 설정한 두 잠금 중 어느 것에 해당하는지에 따라 달라지며, PDF 사양은 이를 별개의 메커니즘으로 취급합니다. 문서 형식 표준인 ISO 32000-1:2008은 표준 보안 핸들러를 정의하여 문서에 소유자 비밀번호와 사용자 비밀번호를 모두 담을 수 있도록 하며, 이는 사양의 7.6.3절에 명시되어 있습니다. 사람들은 이 두 용어를 혼용하지만, 두 잠금의 작동 방식은 전혀 다릅니다.
| 잠금 유형 | 실제 기능 | 차단되는 작업 | 적용 주체 |
|---|---|---|---|
| 사용자 비밀번호 (열기 비밀번호) | 문서 콘텐츠를 복호화하는 키를 생성 | 비밀번호 없이는 한 페이지도 읽을 수 없음 | 수학. 콘텐츠가 암호화되어 있음 |
| 소유자 비밀번호 (권한 비밀번호) | 인쇄, 복사, 편집 등 허용되어야 하는 작업을 기록 | 파일이 열리면 아무것도 차단하지 않음 | 협조하기로 선택한 뷰어 소프트웨어 |
이 구분은 단순한 기술적 세부 사항이 아닙니다. qpdf 문서는 이를 명확히 설명합니다: 비밀번호 보호는 암호화와 별개이며, PDF는 비밀번호 보호 없이도 암호화될 수 있습니다. qpdf는 소유자 비밀번호가 비어 있으면 제한 사항이 사실상 무용지물이 된다고 지적합니다. pikepdf 문서는 더 나아가 권한을 "협조하는 뷰어만 존중하는 권고 플래그"라고 부릅니다. 복사와 붙여넣기를 차단하지만 프롬프트 없이 열리는 파일은 벽이 아니라 요청을 담고 있는 것입니다.
1초 테스트가 있습니다. 파일이 아무것도 묻지 않고 브라우저에서 열린다면 이는 열기 비밀번호가 아닌 권한 플래그이며, 차단은 비밀이 아니라 설정일 뿐입니다.
실제 잠금의 강도도 사람들이 생각하는 것보다 더 다양합니다. PDF는 수년에 걸쳐 40비트 RC4 키, 128비트 RC4, AES-128, AES-256을 사용해 왔습니다. 동일한 qpdf 문서에 따르면 40비트 키는 5바이트 길이로 비밀번호가 아무리 강력해도 무차별 대입이 가능하며, RC4를 사용하는 128비트 기본값도 취약한 것으로 알려져 있습니다. AES-256만이 현대적이고 방어 가능한 옵션입니다. 이러한 역사가 여기서 중요한 이유는 "PDF 비밀번호 제거"가 단일 기술 수준이 아니며, 오래된 시스템의 파일은 지난달에 발급된 파일과 매우 다르게 작동할 수 있기 때문입니다.
대부분이 선택하는 경로와 각 경로가 멈추는 지점
잠긴 PDF에서 Excel로 가는 모든 일반적인 경로는 세 가지 문제 중 최대 한 가지만 처리하며, 각 경로는 예측 가능한 지점에서 멈춥니다. 멈추는 지점을 아는 것이 시간을 가장 많이 절약해 주는데, 오후 내내 낭비하기 전에 실패 원인을 설명해 주기 때문입니다.
| 방법 | 처리하는 작업 | 멈추는 지점 |
|---|---|---|
| Excel Power Query (데이터 → 데이터 가져오기 → PDF에서) | 비밀번호를 요청하고 감지한 테이블을 읽습니다 | 가져오기마다 파일 하나만 처리하며, 매번 테이블을 수동으로 선택해야 합니다 |
| Adobe Acrobat PDF 내보내기 | 읽을 수 있는 파일을 스프레드시트로 내보냅니다 | 보안을 제거하려면 소유자 비밀번호가 필요하며, Acrobat은 권한이 있는 사람만 제한을 해제할 수 있다고 안내합니다 |
| 온라인 잠금 해제 도구 (Smallpdf, iLovePDF, CanaryPDF 등) | 비밀번호를 받아 복호화된 PDF를 반환합니다 | 파일을 한 번에 하나씩만 처리하며, 대부분의 경우 파일이 해당 서버에 업로드되고, 출력 결과물은 테이블이 아닌 PDF입니다 |
| qpdf 또는 기타 명령줄 도구 | 비밀번호 없이 이미 열 수 있는 파일의 권한 플래그를 제거합니다 | 열기 비밀번호가 있는 파일은 여전히 비밀번호가 필요하며, 출력 결과물 역시 PDF입니다 |
| macOS Preview | 새 PDF로 내보내면 권한 제한이 해제됩니다 | 권한 잠금에만 유용하며, 스프레드시트를 생성하지 않습니다 |
Excel 경로는 대부분의 사람이 가장 먼저 시도하고 실제로 유용한 기능을 제공하기 때문에 이해할 가치가 있습니다. 비밀번호를 요청한 다음 문서에서 찾은 테이블을 표시하므로, 상자를 선택하고 하나를 불러올 수 있습니다. 단일하고 깔끔한 명세서에는 효과가 있습니다. 그러나 아무것도 기억하지 못합니다. 다음 파일도 동일한 절차를 시작하며, 비밀번호가 다르면 그 비밀번호도 입력해야 합니다.
지원 포럼에서 반복적으로 등장하는 PDF로 인쇄하기 트릭도 언급할 가치가 있습니다. 이 방법은 Chase 명세서에 관한 Adobe 커뮤니티 스레드에서 반복적으로 나타나며, 사용자들은 "Microsoft Print to PDF"를 통해 파일을 다시 인쇄하면 작업할 수 있는 복사본이 생성된다고 보고합니다. 이 방법은 권한 플래그를 해제할 수 있지만, 많은 환경에서 페이지를 래스터화하여 선택 가능한 텍스트를 이미지로 바꾸므로 이후 추출 작업이 더 쉬워지는 대신 더 어려워집니다. 같은 스레드에서 커뮤니티 전문가는 아무도 듣고 싶어 하지 않는 답변을 제공합니다. "이 모든 것에 대한 진정한 해결책은 은행에 PDF 파일이 아닌 스프레드시트 형태로 데이터를 제공해 달라고 요청하는 것입니다."
잠금 해제로 얻는 것은 PDF이지 테이블이 아닙니다

파일을 여는 것과 사용 가능한 테이블을 얻는 것은 다릅니다. 테이블 구조는 데이터가 아니라 페이지 레이아웃에 있기 때문입니다. 복호화된 PDF는 여전히 좌표에 배치된 텍스트로 가득 찬 페이지일 뿐입니다. 열도, 행도 없으며, 오른쪽 여백의 숫자가 왼쪽 설명 옆에 속한다는 것도 알지 못합니다.
이러한 차이는 데이터가 스프레드시트에 들어가는 순간 드러납니다. 두 줄로 된 거래 설명이 두 개의 행으로 나뉘어 들어옵니다. 소계 행이 거래로 처리됩니다. 2페이지 상단에 반복되는 열 머리글이 데이터 행으로 읽힙니다. 4페이지에 걸쳐 있는 하나의 논리적 명령문이 서로 관련 없는 4개의 블록으로 들어오는데, 이는 병합된 셀과 분할된 행이 어떤 변환기를 사용하든 발생하기 쉬운 문제입니다. 은행 명세서 PDF를 Excel로 변환하는 방법에 대한 r/paralegal 게시물의 누군가가 그 결과를 정확히 설명합니다: "내보내면 일부 데이터가 셀에 합쳐져 있어서 셀 병합/병합 해제가 매우 번거롭습니다."
비밀번호는 페이지를 읽을 수 있는지 여부를 결정합니다. 행이 Excel로 이동하는 과정에서 살아남는지에 대해서는 아무것도 알려주지 않습니다.
r/pdf 게시물의 도구 목록에서 확인하지 않은 부분이 바로 이것입니다. 거기 언급된 모든 제품은 파일을 열 수 있는지 여부로 평가되었으며, 어떤 답변도 이후 출력 결과가 어땠는지 보고하지 않았습니다. 접근과 구조는 별개의 문제이며 해결 방법도 다릅니다. PDF에서 구조화된 데이터로의 가이드는 각 변환 경로가 레이아웃을 잃기 쉬운 이유를 다룹니다. 목표가 테이블이 아닌 서식 있는 Word 파일이라면 그것은 또 다른 경로이며, 일반적인 PDF to Word 서식 오류에서 다루는 것처럼 나름의 방식으로 실패합니다.
배치 처리에서 파일별로 다른 것은 비밀번호만이 아니다
폴더 단위 처리에는 단일 파일 도구가 다루지 못하는 변수가 하나 더 있다. 비밀번호는 보통 발신자마다 다르므로, 세션당 하나의 비밀번호를 전제로 한 워크플로는 배치 처리에서 깨진다. r/Bookkeeping에 질문을 올린 한 사용자는 그 규모를 명확히 보여준다. "500개가 넘는 PDF 은행 거래 내역서를 Excel로 일괄 변환하기 위한 최고의 오프라인 도구는?"
서로 다른 세 은행의 거래 내역서는 흔히 서로 다른 세 가지 비밀번호 체계를 사용하는데, 이는 생년월일, 계좌 번호 일부, 또는 고객 ID로 구성된다. 이는 문서가 전달되는 방식에서 비롯된 의도적인 결과다. Gramm-Leach-Bliley Act의 Safeguards Rule에 따라 금융 기관은 전송 중 및 저장 중인 고객 정보를 보호해야 하며, 16 CFR 314.4(c)(3)은 이를 위한 방법으로 암호화를 명시한다. 이메일로 발송된 거래 내역서를 암호화하는 것은 은행이 제 역할을 하는 것이므로, 비밀번호는 기다리면 해결될 실수가 아니다.
잠금 해제 우선 방식의 비용 두 가지는 규모가 커졌을 때만 드러난다. 첫 번째는 복호화된 사본이다. 거래 내역서의 잠금을 해제하면 민감한 문서의 보호되지 않은 버전이 디스크에 기록되며, 폴더 방식의 워크플로를 따르는 사람은 다운로드 디렉터리에 그런 파일을 수십 개 쌓아두게 된다. 두 번째는 전달 과정이다. 온라인 잠금 해제 도구는 파일 업로드를 요구하는데, 이는 은행이 공개된 상태로 유통되지 않도록 정확히 암호화한 바로 그 문서다.
잠금 해제를 먼저 하면 비밀번호 문제는 해결되지만, 암호화되지 않은 금융 문서가 가득한 폴더라는 두 번째 문제가 조용히 생긴다. 실제 고객 파일을 다루는 월간 업무에서 그 대가는 원래의 불편함보다 더 나쁘다.
비밀번호로 바로 추출하기 — 잠금 해제 없이
해결 방법은 중간 단계의 복호화된 파일을 생략하고, 이미 보유한 비밀번호로 추출 도구가 보호된 문서를 직접 열게 하는 것입니다. 문서에 대한 권한이 있음을 증명할 수 있다면 별도의 잠금 해제 단계가 전혀 필요하지 않습니다. 비밀번호를 입력받는 도구만 있으면 됩니다.
ImageToTable.ai는 비밀번호를 세 곳에서 처리하며, 첫 번째가 가장 자주 사용하게 될 경로입니다. 암호화된 PDF를 선택하면 페이지 선택기가 아무것도 렌더링하기 전에 비밀번호를 요청합니다. 이때 PDF.js가 모든 웹 뷰어에 노출하는 것과 동일한 브라우저 내 프롬프트 메커니즘을 비밀번호 콜백을 통해 사용합니다. 한 번 입력하면 페이지가 렌더링되고, 잠금 해제된 복사본이 디스크에 저장되지 않으며, 선택한 페이지에서 추출이 실행됩니다.
반복적으로 받는 명세서의 경우 두 번째 경로는 그 단계마저 제거합니다. 이메일 받은 편지함은 계정에 문서를 전달할 수 있는 전용 주소를 제공하며, 저장된 비밀번호 목록을 유지합니다. 도착한 암호화된 첨부 파일은 자동으로 해당 목록과 대조되고, 첫 번째로 일치하는 비밀번호가 명세서를 바로 처리 대기열로 보냅니다. 은행의 비밀번호 체계로 한 번 설정해 두면 월간 명세서가 도착하고, 열리고, 직접 건드릴 필요 없이 대기열에 들어옵니다. 이것이 수십 개 파일이 들어 있는 폴더에 대한 실질적인 해답이며, 원래 요청의 "오프라인" 부분을 직접 다룰 가치가 있는 이유이기도 합니다.
세 번째 경로는 코드로 자동화하는 모든 사용자를 위한 것입니다. 공개 API는 문서를 업로드할 때 password 매개변수를 허용하므로, 스크립트가 비밀번호와 함께 보호된 파일을 제출하고 구조화된 결과를 읽을 수 있습니다. 세 경로 모두 원본 파일에서 암호화를 제거하지 않습니다. 제공한 키로 파일을 열어 데이터를 생성할 뿐, 보호되지 않은 복사본을 만들지 않습니다.
파일이 열리면 추출 자체가 출력의 유용성을 결정하는 부분입니다. 맞춤 열 추출은 "날짜", "설명", "금액"과 같이 원하는 열 이름을 입력하면 그 이름이 결과의 정확한 헤더가 되는 기능입니다. AI는 페이지에서 값이 위치한 곳이 아니라 의미를 이해하여 각 값을 찾으므로, 동일한 열 집합이 다른 은행의 명세서에서도 그대로 작동합니다. 이것이 우연히 감지한 테이블을 반환하는 변환기와 사용자가 정의한 테이블을 반환하는 추출의 차이입니다.
명세서에 특히 중요한 두 가지 보조 설정이 있습니다. 다중 페이지 병합은 동일한 문서에 속하는 페이지를 그룹화하는 규칙을 정의할 수 있게 해 주므로, 네 페이지에 걸친 명세서가 거래당 한 행으로 접히고 계좌 번호가 모든 줄에 전달됩니다. 그리고 Bbox가 있는 검토 모드는 값이 어디서 왔는지 보여 줍니다. 추출된 셀 위에 마우스를 올리거나 클릭하면 원본 페이지의 해당 영역이 강조 표시되어, 명세서를 다시 읽지 않고도 잔액을 확인할 수 있습니다. ImageToTable.ai는 인쇄된 테이블 데이터에 대해 최대 99%의 정확도를 보고하며, 페이지당 약 3분의 수동 입력 대비 5~10초 만에 처리합니다.
파일은 안전하게 처리되며 저장되지 않습니다.
동일한 방법은 명세서 외의 다른 잠긴 문서에도 적용됩니다. 보호된 PDF로 제공되는 공과금 고지서, 보험 문서, 고객 기록 모두 AI가 PDF를 읽을 수 있는지에 대한 일반적인 질문에서 출발하는 동일한 3단계 경로를 따르며, 이들을 하나의 통합 문서로 변환하는 방법은 코드 없이 문서 일괄 처리 가이드에 설명되어 있습니다. 문서가 텍스트 PDF가 아닌 스캔 이미지라면 비밀번호는 두 가지 문제 중 첫 번째에 불과하며, 스캔 PDF용 OCR이 두 번째 문제를 해결합니다. 단일 문서, 양식 형식의 작업에는 자체 열을 사용하여 PDF를 Excel로 변환하는 방법이 더 짧은 가이드입니다.
이 경로가 수행하지 않는 작업
이 워크플로는 이미 비밀번호를 보유한 문서를 열고 데이터를 추출하며, 재사용을 위해 파일에서 암호화를 제거하지 않습니다. 일상적인 작업에 적용하기 전에 이 두 가지 제한 사항을 알아두는 것이 좋습니다.
비밀번호 자체를 우회할 방법은 없습니다. 파일의 열기 비밀번호가 없으면 프로세스는 거기서 중단되며, 그 외의 방법을 약속하는 도구는 추측(40비트 취약점이 의미하는 바)을 하거나 다른 상황을 설명하는 것입니다. 이 도구는 문서에 접근 권한이 있고 단순히 데이터를 추출해야 하는 사용자를 위해 만들어졌습니다.
또한 잠금 해제된 사본을 생성하지 않습니다. 출력물은 스프레드시트이지 복호화된 PDF가 아니므로, 다운스트림 시스템이 원본 파일의 비밀번호 없는 버전을 특별히 요구하는 경우에는 신뢰할 수 있는 잠금 해제 도구가 여전히 필요합니다.
일부 사용자에게 이 도구를 배제하게 만드는 한 가지 제약은 실행 환경입니다. ImageToTable.ai는 클라우드 서비스입니다. 비밀번호는 브라우저에서 입력되고 렌더링된 페이지는 클라우드에서 처리됩니다. 어떤 페이지도 기기 밖으로 나가지 않아야 한다는 요구 사항이 진짜라면, 이 도구는 적합하지 않으며 UI를 아무리 신중하게 바꿔도 그 사실은 변하지 않습니다. 진정한 온디바이스 작업을 위해서는 현실적인 옵션은 로컬 방식입니다. macOS Preview나 데스크톱 Acrobat을 통한 내보내기, 또는 OCRmyPDF와 Tesseract 같은 로컬 스택 실행이 그것입니다. 이러한 방식은 모든 데이터를 컴퓨터에 보관합니다. 다만 더 많은 설정이 필요하고, 스캔의 경우 문서 세트별로 더 많은 튜닝이 필요합니다. 올바른 선택은 오프라인이 선호 사항인지 엄격한 규칙인지에 따라 달라집니다.
마지막으로, 잠긴 스캔은 여전히 스캔입니다. 암호화와 이미지 품질은 독립적이므로, 사진에서 생성된 보호된 PDF는 다른 이미지 전용 문서와 동일한 OCR 처리가 필요합니다. 잠금을 해제한다고 해서(사전에 하든 단계에서 하든) 텍스트 레이어가 추가되지는 않습니다.
비밀번호로 보호된 PDF 및 Excel: 자주 묻는 질문
소유자 비밀번호와 사용자 비밀번호의 차이점은 무엇인가요?
사용자 비밀번호는 열기 비밀번호라고도 하며, 문서를 암호화하고 문서의 내용을 읽기 전에 필요합니다. 소유자 비밀번호는 권한 비밀번호라고도 하며, 작성자가 제한하려는 인쇄나 복사와 같은 작업을 기록합니다. PDF 사양 및 qpdf 문서에 따르면 권한 제한은 암호화가 아닌 뷰어에 의해 적용되므로, 이를 무시하기로 선택한 소프트웨어는 무시할 수 있습니다. 파일이 프롬프트 없이 열린다면 거의 확실히 두 번째 종류에 해당합니다.
비밀번호가 없는 PDF에서 데이터를 추출할 수 있나요?
아니요. 이 문서는 본인이 접근할 권리가 있는 문서(예: 본인의 명세서 또는 제공받은 고객 파일)를 처리하는 방법에 관한 것입니다. 열기 비밀번호를 모르는 경우 올바른 방법은 발급자에게 문의하는 것이며, 발급자는 일반적으로 파일을 다시 보내거나 다른 형식으로 데이터를 제공할 수 있습니다. 알 수 없는 열기 비밀번호를 우회할 합법적인 방법은 없습니다.
PDF 비밀번호가 서버로 전송되나요?
비밀번호 프롬프트는 문서가 렌더링되기 전에 브라우저의 페이지 선택기에서 발생하며, 이는 PDF.js 기반 뷰어가 비밀번호를 요청하는 방식과 동일합니다. 그런 다음 선택한 페이지는 클라우드 서비스에서 처리됩니다. 정책상 문서의 일부라도 컴퓨터 밖으로 나가는 것을 금지하는 경우, 설정 변경으로 해결할 수 있는 문제가 아니라 작업을 로컬에서 수행해야 하는 이유로 간주하세요.
동일한 비밀번호를 공유하는 명세서 폴더 전체를 처리할 수 있나요?
네, 이것이 바로 저장된 비밀번호 목록의 용도입니다. 비밀번호를 이메일 받은 편지함 설정에 한 번 저장하면 도착하는 모든 암호화된 첨부 파일에 자동으로 적용됩니다. 명세서마다 다른 비밀번호를 사용하는 경우 각 방식을 동일한 목록에 추가하면 첨부 파일별로 매칭이 이루어집니다.
완전히 오프라인으로 처리할 수 있나요?
이 도구로는 불가능합니다. 클라우드 추출 서비스이므로, 오프라인이 필수 조건이라면 로컬 소프트웨어를 대신 계획하세요: 데스크톱 Acrobat, macOS Preview, 또는 자체 머신에서 실행되는 OCR 도구. 오프라인이 선호 사항이지 필수 규칙이 아니라면, 클라우드 경로는 복호화 복사와 파일별 수동 작업을 제거해 주며, 이것이 일반적으로 더 큰 비용입니다.
유용한 전환은 "잠금 해제"를 작업으로 취급하지 않는 것입니다. 접근 권한이 비밀번호가 해결하는 부분이며, 비밀번호를 확보하면 몇 초면 되는 부분이기도 합니다. 사용 가능한 스프레드시트를 얻을지 결정하는 작업은 그 이후의 모든 것입니다: 정의하는 열, 페이지가 전체 문서로 다시 그룹화되는지 여부, 숫자가 출처 페이지로 추적될 수 있는지 여부. 보호된 명세서 폴더는 비밀번호를 변장으로 쓴 데이터 문제입니다.