AI PDF 도구는 요약만 합니다.
당신에게 필요한 것은 재사용할 수 있는 테이블이었습니다.
AI PDF 도구에 테이블을 요청하면 다른 결과가 나오는 경우가 많습니다: 문단, 불릿 요약, 또는 채팅 창에 묻힌 답변. 정렬하거나 합산하거나 다음 문서와 대조하려고 하기 전까지는 진전된 것처럼 보입니다. r/pdf의 한 게시물은 이 패턴을 한 줄로 설명합니다: 도구가 "너무 제한적이거나 너무 지저분하다"고 느껴진다는 것입니다 (r/pdf). 읽기 자체는 보통 괜찮습니다. 문제는 결과물에 있습니다. 요약과 테이블은 서로 다른 종류의 출력이기 때문입니다.

주요 요점
- 대부분의 추출 도구는 단일 정확도 수치를 보고하며, 그 수치가 충분히 높아서 더 이상 비교를 멈추게 됩니다.
- 모델이 개별 필드에서 86.3%를 기록해도 행 전체를 완벽하게 맞추는 비율은 절반 미만일 수 있습니다.
- 중요한 테스트는 정확도가 아니라 하나의 예/아니오 질문입니다: 파일을 업로드하기 전에 열 이름을 지정할 수 있습니까?
요약과 테이블은 서로 다른 두 가지 산출물입니다

요약은 원본을 설명하는 문서입니다. 테이블은 사전에 정의한 스키마에 모든 파일의 데이터를 채우는 형식입니다. 사람의 개입 없이 다음 PDF에도 재사용할 수 있는 것은 오직 테이블뿐입니다.
도구가 요약을 생성하면 산문 형식으로 출력됩니다. 그 산문의 형태는 답변 시점에 결정됩니다. 여기서는 세 개의 불릿 포인트, 저기서는 짧은 문단, 문서가 복잡하면 더 긴 설명이 나옵니다. 출력물은 읽기 위한 것이며, 읽는 것 자체가 목적입니다.
테이블은 작동 방식이 다릅니다. 파일을 열기 전에 열을 결정합니다. 예를 들어 공급업체, 송장 번호, 납기일, 합계와 같은 항목입니다. 그러면 도구는 배치의 모든 문서에서 동일한 열을 채웁니다. 가치는 그 구조에 있습니다. 40번째 행도 1번째 행과 동일한 열을 가지므로, 추가 정리 없이 정렬, 합산, 가져오기가 가능합니다.
업계에서는 이 두 가지 작업을 하나의 명칭으로 묶어 부르면서도, 실제로는 구분하고 있습니다. Gartner는 지능형 문서 처리를 "다양한 형식과 레이아웃의 문서 콘텐츠"에서 데이터를 추출하는 소프트웨어로 정의하며, 2025 Critical Capabilities 평가에서는 이 작업을 증강 읽기 및 처리와 데이터 추출 및 보존이라는 별개의 사용 사례로 구분합니다 (Gartner). Forrester의 2025년 문서 마이닝 및 분석 시장 업데이트도 다른 관점에서 같은 지적을 합니다. 생성형 AI와 에이전트형 AI가 이 카테고리를 재편하고 있으며, 구매자는 이제 작업에 맞는 공급업체 유형을 선택해야 한다는 것입니다 (Forrester).
실제로 도구는 두 가지 유형으로 나뉩니다. 읽기 측면: ChatGPT, Claude, Gemini, Adobe Acrobat의 AI Assistant, NotebookLM. 추출 측면: ABBYY, Google Document AI, Microsoft의 Azure Document Intelligence, AWS Textract, Rossum. 일부 제품은 두 영역을 모두 다루기도 하는데, 바로 그렇기 때문에 브랜드가 아니라 출력 계약을 테스트해야 하는 것입니다.
| 작업 내용 | 요약 또는 채팅 도구 | 추출 도구 |
|---|---|---|
| 출력 형태 | 답변 시점에 모델이 결정 | 파일을 읽기 전에 사용자가 결정 |
| 받는 결과 | 산문, 불릿, 또는 채팅 답변 | 스프레드시트의 행과 열 |
| 같은 파일, 두 번째 실행 | 문구와 구조가 바뀔 수 있음 | 같은 열 유지 — 열이 사용자의 것이기 때문 |
| 파일 10개를 한 번에 | 파일당 대화 하나 | 전체 폴더에서 테이블 하나 |
| 가장 적합한 경우 | 문서의 내용을 이해할 때 | 내용을 계산 가능한 데이터로 변환할 때 |
| 약한 분야 | 여러 파일에 걸쳐 고정 스키마 생성 | 문서에 대한 설명, 해석, 또는 논의 |
이 글의 나머지 부분에서는 출력을 스프레드시트에 붙여넣느라 오후를 보내기 전에 두 도구를 구분하는 방법과, 어떤 것이 필요한지 알게 된 후 무엇을 요청해야 하는지에 대해 설명합니다.
같은 도구가 매번 다른 테이블을 주는 이유

출력 형태는 사용자가 아니라 모델의 몫이므로, 페이지의 텍스트가 바뀌지 않았더라도 같은 파일을 두 번 실행하면 결과가 달라질 수 있습니다.
이는 더 강력한 모델이 조용히 해결해 주는 결함이 아닙니다. 이런 시스템이 만들어지는 방식 자체가 그렇습니다. OpenAI의 API 문서에 따르면 채팅 완성은 "기본적으로 비결정적"이며, 요청마다 출력이 달라질 수 있다고 합니다 (OpenAI). Microsoft의 재현 가능한 출력 문서는 더 나아가 고정된 시드와 동일한 시스템 지문을 사용하더라도 "결정성이 보장되지 않으며" 어느 정도 변동성이 일반적이라고 설명합니다 (Microsoft Learn).
단일 요약을 읽는 사람은 이를 알아차리지 못합니다. 하지만 열 개의 요약을 한 시트로 병합하는 사람은 즉시 알아차립니다. 두 번째 실행에서 열 이름이 바뀌거나, 두 필드의 순서가 바뀌거나, 두 값을 한 셀로 합쳐버릴 수 있기 때문입니다.
정확도 수치도 같은 문제를 숨기고 있습니다. Cleanlab의 구조화 출력 벤치마크는 대부분의 도구 페이지에서 혼동하는 두 가지 측정값을 구분합니다. 필드 정확도는 개별 필드가 올바른 비율이고, 출력 정확도는 모든 필드가 올바른 레코드의 비율입니다. 데이터 테이블 세트에서 gpt-4.1-mini는 필드 수준에서 86.3%, 레코드 수준에서 45%를 기록했습니다. 보험 청구의 경우 레코드 정확도는 30%~40% 사이였고, 개인 정보 추출의 경우 26%~46% 사이였습니다(Cleanlab).
90% 필드 수치가 안심이 되지만 전체 행이 필요할 때는 이야기가 다릅니다. 각각 95%인 필드 10개는 특정 행이 완전히 깨끗할 확률이 대략 60%에 불과하며, 배치가 커질수록 오류가 누적됩니다.
요약이 괜찮아 보이는데 그 아래 데이터가 불완전한 데는 두 번째 이유가 있습니다. PDF는 문자가 페이지의 어느 위치에 있는지는 저장하지만, 어느 열이나 행에 속하는지는 저장하지 않습니다. NVIDIA 엔지니어들은 PDF 추출 연구에서 이 실패를 직접 설명합니다. 일반 비전 모델은 내용을 잘못 읽거나, 포함된 텍스트를 건너뛰거나, 페이지에 없던 제목을 환각할 수 있는 반면, 구조를 인식하는 파이프라인은 테이블의 더 많은 부분을 온전하게 유지했습니다(NVIDIA). 문단은 모든 항목을 설명할 필요가 없습니다. 테이블은 그래야 하며, 그것이 도구를 평가할 기준입니다.
실제 사용자들은 구조를 요청하고 설명을 받을 때 이런 문제를 겪습니다. r/ChatGPT 스레드 하나는 100명이 포함된 PDF에서 스프레드시트를 요청하는 것으로 시작합니다(r/ChatGPT). 다른 스레드는 300KB 미만의 30~40페이지 PDF도 채팅 모델이 안정적으로 요약하기에는 너무 크다고 보고합니다(r/ChatGPT). 문제는 요청된 출력에 있습니다.
규칙 하나로 요약 도구와 추출 도구를 구분한다
업로드하기 전에 출력 열 이름을 지정할 수 있는지 물어보세요. 도구가 허용하지 않는다면, 그 도구가 답변의 형태를 대신 결정하고 있는 것입니다.
이 한 가지 질문이 어떤 기능 목록보다 빠르게 구조화 추출과 요약을 구분합니다. 요약 도구는 파일을 받아 자신이 선택한 구조를 반환합니다. 추출 도구는 파일과 사용자의 열 이름을 받아 그 이름을 테이블의 헤더로 반환합니다.
이 규칙은 프롬프트를 바꿔 말해도 격차가 좁혀지지 않는 이유도 설명합니다. 더 나은 프롬프트는 하나의 답변을 개선할 수 있습니다. 그러나 모델에 50개 파일에서도 유지되는 고정 스키마를 넘겨줄 수는 없습니다. 스키마가 원래 요청에 포함된 적이 없기 때문입니다. 이 차이는 반복 작업에서 가장 중요합니다. 다음 달의 인보이스, 다음 배치의 명세서, 매주 늘어나는 폴더 말입니다.
이 규칙에는 실용적인 후반부가 있습니다. 열 이름을 지정할 수 있게 되면, 값이 어디서 왔는지 물어보세요. 도구가 숫자를 읽은 페이지 영역을 가리킬 수 없다면 검증은 수동으로 남고, 검증할 수 없는 값은 손으로 다시 확인해야 하는 값입니다.
차이를 드러내는 다섯 가지 질문

다섯 가지 질문이 문서를 읽는 도구와 문서를 데이터로 바꾸는 도구를 구분하며, 모두 몇 분 안에 직접 파일로 테스트할 수 있습니다.
업로드하기 전에 열 이름을 지정할 수 있나요?
인터페이스에서 필드 이름을 요청한다면 추출용으로 설계된 것입니다. 입력란이 채팅 창뿐이라면 출력 형태를 직접 정할 수 없습니다.
같은 파일을 두 번 실행하면 헤더가 일치하나요?
헤더 행을 셀별로 비교해 보세요. 이름이 다르거나 순서가 다르면 고정된 스키마가 없다는 뜻이며, 그 위에 세운 어떤 수식도 유지되지 않습니다.
파일이 아니라 폴더를 처리할 수 있나요?
한 번에 한 문서만 처리하도록 설계된 도구는 50개의 답변을 수동으로 병합하게 만듭니다. r/pdf 스레드의 혼란이 바로 여기서 비롯된 것입니다.
레이아웃이 다른 파일도 열을 유지하나요?
다른 은행의 명세서나 다른 업체의 청구서를 추가해 보세요. 실제 문서 세트는 절대 균일하지 않으므로, 이것이 데모와 프로세스의 차이입니다.
하나의 값을 해당 페이지까지 추적할 수 있나요?
셀 하나를 골라 원본에서 찾아보세요. PDF를 직접 다시 열어야 한다면, 추출이 검토 단계를 없앤 것이 아니라 옮긴 것뿐입니다.
도구가 이 중 하나라도 충족하지 못하면 읽기 도구로 취급하세요. 그 역할에서는 여전히 훌륭할 수 있습니다.
대신 요청할 것
PDF를 테이블로 변환하는 워크플로우에서 가장 먼저 고쳐야 할 점은 출력 결과를 누가 정의하느냐입니다. 원하는 열 이름을 지정하고 그 이름이 헤더가 되도록 하면, 첫 번째 파일부터 50번째 파일까지 계약 조건이 사용자의 것이 됩니다.
이것이 실제로 맞춤 열 추출이 의미하는 바입니다. 모델이 반환할 내용을 결정하게 두는 대신, "Statement Date", "Description", "Amount"처럼 필요한 필드 이름을 직접 입력하면 도구가 페이지에서의 위치가 아니라 의미를 기준으로 각 값을 찾습니다. 열 목록이 사용자로부터 오기 때문에 다음 공급업체가 다른 레이아웃을 보내도 변경되지 않습니다. 이것이 출력 결과를 단순히 읽을 수 있는 수준이 아니라 재사용 가능하게 만드는 속성입니다.
두 번째로 요청할 것은 일괄 처리입니다. 일괄 우선 처리는 문서 폴더가 입력되면 모든 파일에 동일한 헤더 행이 적용된 하나의 테이블이 출력된다는 의미입니다. 이것이 바로 채팅 인터페이스가 구조적으로 가장 취약한 지점입니다. 문서별 대화 하나에 맞춰 설계되어 있어 병합은 나중에 수작업으로, 시간을 절약하려던 사람이 해야 합니다.
두 가지 작은 설정이 전체 그림을 완성합니다. 열이 페이지에 인쇄된 필드가 아니라 계산이라면, 계산 열을 사용하면 "Line Total (Qty × Unit Price)"처럼 열 이름에 계산식을 설명할 수 있어 AI가 추출 중에 산술을 수행하고 원시 숫자 대신 결과값을 얻을 수 있습니다. 그리고 Bbox가 포함된 검토 모드를 사용하면 셀에 마우스를 올렸을 때 해당 값이 읽혀진 원본 영역을 볼 수 있어, 위의 다섯 번째 질문에 몇 분이 아닌 몇 초 만에 답할 수 있습니다.
실제로 필요한 출력이 테이블이 아니라 문서 전체라면 추출 도구는 여전히 적합하지 않으며, 변환 모드가 올바른 선택입니다. ImageToTable.ai의 Word로 모드는 원본 레이아웃을 편집 가능한 Word 파일로 재구성하며, 이는 목표가 데이터 행이 아니라 읽을 수 있는 문서일 때 올바른 출력입니다.
파일은 안전하게 처리되며 저장되지 않습니다.
동일한 접근 방식은 PDF를 하나의 Excel 시트로 변환하는 가이드에서 다른 각도로 설명되며, 모델이 의미를 기준으로 필드를 찾는 메커니즘은 AI 문서 추출이란 무엇인가와 작동 방식에서 다룹니다. 파일에 네이티브 페이지와 스캔 페이지가 섞여 있다면, 방법별 분석은 PDF를 구조화된 데이터로 변환하는 가이드에 있습니다.
추출이 멈추는 지점과 챗봇이 적합한 도구인 경우
추출 도구는 "값이 무엇인지"에 답합니다. "이 문서가 무엇을 의미하는지"에는 답하지 않으며, 요약을 작성해 주지도 않습니다.
이 한계는 명확히 밝힐 가치가 있습니다. 두 작업은 혼동하기 쉽기 때문입니다. 계약서에 대한 대화형 해석, 보고서의 서술형 요약, 또는 정책에 대한 질문에 대한 답변을 원한다면 ChatGPT, Claude, Gemini, Adobe의 AI Assistant와 같은 일반 어시스턴트가 올바른 도구입니다. 이들 중 여러 도구는 깨끗한 단일 문서를 잘 처리합니다. 이해를 위한 도구로는 올바른 선택이지만, 파일 폴더에서 동일한 고정 테이블을 생성하는 작업에는 잘못된 선택입니다.
추출에도 분명한 한계가 있습니다. 요청한 필드를 반환할 뿐, 그에 대한 해석을 제공하지는 않습니다. 손글씨와 품질이 낮은 스캔은 정확도를 낮추며, 지급이나 규정 준수에 사용되는 모든 작업에는 검토 단계가 중요한 이유입니다. 도구가 찾을 수 없는 값은 추측을 유도하는 것이 아닙니다. 좋은 도구는 그럴듯한 숫자를 만들어 내기보다 비워 두거나 플래그를 표시합니다.
작업이 구체적으로 이미지나 사진에서 데이터를 추출하는 것이라면, 동일한 논리가 다른 입력에 적용되며 손글씨 문서와 스크린샷에 대해 다루고 있습니다. 일반 어시스턴트와 전용 도구를 비교하고 있다면 ChatGPT 비교에서 그 장단점을 직접 확인할 수 있습니다.
AI PDF 도구와 구조화된 추출: FAQ
PDF를 요약하는 것과 데이터를 추출하는 것은 같은 것인가요?
아닙니다. 요약은 원본을 설명하고 읽기 위한 문서입니다. 추출은 사전에 정의한 열로 구성된 테이블을 생성하며, 그 가치는 모든 파일에서 동일한 열이 반환된다는 점입니다. 하나의 도구가 두 작업을 모두 수행할 수 있지만, 출력 계약은 다르며, 그중 하나만 수동 정리 없이 다음 배치에 재사용할 수 있습니다.
AI PDF 도구마다 결과가 다른 이유는 무엇인가요?
채팅 완성은 기본적으로 비결정적이기 때문입니다. OpenAI의 API 문서에도 명시되어 있고, Microsoft 문서에서도 고정 시드를 사용해도 결정성이 보장되지 않는다고 설명합니다. 모델은 생성 시점에 답변의 형태를 선택합니다. 그 형태가 사용자가 제공한 스키마로 고정되지 않았다면, 같은 파일에서도 실행할 때마다 결과가 달라질 수 있습니다.
스캔한 PDF나 사진에서 표를 얻을 수 있나요?
네, 도구가 포함된 텍스트 레이어에 의존하지 않고 페이지를 이미지로 읽는다면 가능합니다. 스캔한 PDF와 사진에는 텍스트 레이어가 없으므로 텍스트 기반 가져오기는 아무것도 반환하지 않습니다. 비전 기반 추출 도구는 픽셀을 직접 읽으므로, 촬영한 영수증도 처리할 수 있는 이유와 같습니다.
더 나은 프롬프트만 있으면 되나요?
더 나은 프롬프트는 단일 결과를 개선할 수 있으므로 시도해 볼 가치가 있습니다. 하지만 50개 파일에 걸쳐 고정된 열 집합을 만들지는 못하며, 한 번의 실행으로 처리할 수 있는 파일 수의 상한선도 높이지 않습니다. 이는 도구의 구조적 속성일 뿐, 문구 문제가 아닙니다.
실제로 요약이 필요하다면 어떻게 해야 하나요?
읽기용으로 만들어진 도구를 사용하세요. ChatGPT, Claude, Gemini, Adobe Acrobat의 AI Assistant는 문서에 대한 서술형 요약이나 질문에 모두 합리적인 선택입니다. 추출 도구는 다른 출력에 최적화되어 있으므로, 추출 도구에 산문을 요청하는 것은 요약 도구에 안정적인 스키마를 요청하는 것만큼이나 부적합합니다.
하나의 도구로 둘 다 할 수 있나요?
일부 제품은 읽기와 추출을 모두 지원합니다. 그런 경우에는 위의 다섯 가지 질문으로 추출 측면을 평가하세요. 읽기 품질과 스키마 안정성은 별개의 속성이기 때문입니다. 요약을 훌륭하게 해내는 도구라도 같은 파일을 두 번 실행하면 다른 헤더를 반환할 수 있습니다.
유용한 전환은 "어떤 AI가 가장 똑똑한가"에서 "이 작업의 형태는 무엇인가"로 바꾸는 것입니다. 요약과 표는 서로 다른 산출물이며, 문서를 잘 읽는 도구가 폴더 전체를 스프레드시트로 바꾸는 도구라고 단정할 수 없습니다. 먼저 무엇이 필요한지 결정하면, 프롬프트를 바꿀지 도구를 바꿀지에 대한 질문은 저절로 답이 됩니다.