비정형 데이터 추출 — 자유 형식 문서를 템플릿 없이 구조화된 스프레드시트로 변환
스크린샷, 스캔본, 양식의 데이터를 수동으로 스프레드시트에 입력하는 데 페이지당 3분이 걸리지만, 이 도구는 5~10초 만에 추출합니다. 템플릿, 교육, 문서 유형별 사전 분류가 필요 없습니다.
페이지당 5~10초 · 인쇄 텍스트 최대 99% 정확도 · PDF / 스크린샷 / 사진 · 문서별 설정 불필요
모든 비정형 문서에서 추출할 수 있는 항목
필요한 열 이름을 입력하기만 하면 됩니다. AI가 페이지의 모든 값을 위치가 아닌 의미를 이해하여 찾아냅니다. 동일한 스키마가 스크린샷, 양식, 계약서, 영수증, 필기 노트 등에서 유형별 설정 없이도 작동합니다.
이는 예시 열 이름입니다. 문서에 중요한 필드를 직접 정의할 수 있으며, 동일한 스키마가 재구성 없이 모든 형식에서 작동합니다.
비정형 데이터에는 시각적 구조가 있습니다 — 기존 OCR은 이를 볼 수 없습니다
'비정형'이 혼란스럽다는 뜻은 아닙니다. 스크린샷에는 제목, 섹션, 숫자가 있지만 표 격자는 없습니다. 스캔된 양식에는 레이블, 상자, 서명이 있지만 선택 가능한 텍스트 레이어는 없습니다. 추출 문제는 구조가 부족해서가 아니라, 평문만 이해하는 도구를 사용하기 때문입니다.
기존 도구가 놓치는 부분
OCR은 필드 식별 없이 평문만 출력합니다. "INV-2024-8932" 문자열과 "$12,345.00"이 같은 블롭으로 나옵니다. r/AskProgramming의 한 개발자는 "이런 테이블을 파싱하는 것은 완전히 새로운 문제를 제기한다"고 설명했습니다. OCR은 문자를 제공할 뿐, 열을 제공하지 않기 때문입니다.
NLP 텍스트 파서는 선택 가능한 텍스트가 필요합니다. 스크린샷, 문서의 모바일 사진, 스캔된 양식에는 텍스트 레이어가 없습니다. PDF 텍스트 추출이나 HTML 콘텐츠에 의존하는 파서는 휴대폰 카메라로 찍은 JPEG에서는 작동할 대상이 없습니다.
템플릿 기반 도구는 레이아웃별로 영역을 그리므로 형식이 바뀌면 모두 깨집니다. 한 스크린샷이 왼쪽 정렬 레이아웃을 사용하고 다른 스크린샷이 카드 기반 레이아웃을 사용하면 영역 좌표가 실패합니다. 템플릿 파서는 형식 다양성에 따라 선형적으로 확장되며, 설계상 '비정형' 데이터를 처리하지 못합니다.
Vision AI가 레이아웃을 직접 읽는 방식
Vision AI는 페이지를 시각적 전체로 읽습니다. 오른쪽 상단 근처의 굵은 숫자가 합계이고, 아래 정렬된 행 블록이 라인 항목 섹션임을 인식합니다. 단순한 문자 위치가 아닌 시각적 계층 구조를 이해합니다.
맞춤 열 추출은 텍스트 레이어가 아닌 픽셀 단위로 작동합니다. 원하는 필드(Date, Total, Party Name)를 입력하면 AI가 시각적 레이아웃의 어느 위치에서든 의미적 의미를 기반으로 일치하는 값을 찾습니다. 문서가 텍스트가 포함된 PDF이든, 화이트보드의 휴대폰 사진이든 관계없이 작동합니다.
모든 형식에 하나의 스키마 — 유형별 설정 불필요. 송장 PDF, 대시보드 스크린샷, 손으로 작성한 양식 모두 동일한 열 정의를 사용합니다. AI는 적용할 추출 규칙을 결정하기 위해 문서 유형 분류기가 필요하지 않습니다. "비정형 데이터"는 정형 문서를 처리하는 동일한 메커니즘, 즉 시각적 이해를 통해 처리됩니다.
비정형 문서 혼합 배치 처리의 실제 모습
실제 작업에서는 한 번에 한 가지 문서 유형만 다루는 경우가 드뭅니다. 아래는 동일한 열 정의로 완전히 다른 세 가지 비정형 소스에서 단일 배치로 데이터를 추출하는 예시입니다.
분류 없이 업로드
PDF 계약서, 대시보드 PNG 스크린샷, 손글씨 메모 사진을 하나의 배치에 드래그 앤 드롭하세요. 형식 변환, 사전 분류, 파일명 변경이 필요 없습니다. AI는 각 페이지의 시각적 콘텐츠를 독립적으로 읽습니다. JPEG든 스캔된 PDF든 동일한 방식으로 처리됩니다.
열은 한 번만 정의
날짜, 참조 번호, 합계/금액, 당사자명, 상태를 입력하세요. 계약서에서는 발효일과 총액을, 스크린샷에서는 화면에 보이는 주문 ID와 금액을, 손글씨 메모에서는 이름과 숫자를 추출합니다. 페이지에 없는 필드는 공란으로 남습니다. 배치가 실패하지 않습니다.
통합 테이블로 내보내기
각 문서는 하나의 행이 됩니다. 열은 사용자가 정의한 대로 일치합니다. 날짜와 금액은 추출 과정에서 표준화되므로 별도 정리가 필요 없습니다. XLSX, CSV, JSON 형식으로 내보내 피벗 테이블, ERP 시스템, 또는 분석 도구에서 바로 사용할 수 있습니다. 모든 형식에서 페이지당 5~10초 내에 처리됩니다.
최적의 사용 환경과 주의할 점
모든 문서에 완벽하게 적용되는 도구는 없습니다. 이 접근 방식이 가장 효과적인 경우와 대안이 더 적합한 경우를 알려드립니다.
가장 효과적인 경우
150 DPI 이상의 인쇄물 또는 캡처 문서. PDF, 사진, 스크린샷에서 날짜, 금액, 참조 번호 등 표준 필드의 정확도가 최대 99%에 달합니다.
시각적 구조가 명확한 문서. 본문과 분리된 제목, 구분된 레이블 섹션, 눈에 띄는 필드-값 쌍이 AI가 콘텐츠를 정확하게 열에 매핑하는 데 도움을 줍니다.
사전 분류가 필요 없는 혼합 형식 배치. 송장, 스크린샷, 필기 노트를 함께 업로드하세요. 각 페이지는 동일한 열 정의로 개별 처리됩니다.
주의해야 할 경우
흐릿하거나 심하게 번진 이미지. 감열지 영수증, 초점이 맞지 않은 사진, 100 DPI 미만 스캔본은 작은 글씨를 잘못 읽을 수 있습니다. 실용적인 기준은 텍스트를 육안으로 명확히 구분할 수 있다면 AI도 정확히 추출할 가능성이 높다는 점입니다.
전체 텍스트 서사 추출. 이 도구는 사용자가 지정한 필드를 추출하며, 모든 단어의 완전한 기록을 생성하지는 않습니다. 계약서 문단의 전체 텍스트가 필요하다면 전체 텍스트 OCR 파이프라인을 대신 고려하세요.
자주 묻는 질문
이 도구에서 말하는 "비정형 데이터"란 정확히 무엇인가요?
시각적 구조는 있지만, 파싱 가능한 표(grid)가 없고 선택 가능한 텍스트 레이어도 없는 문서를 의미합니다. 대시보드 스크린샷에는 참조번호 / ID 번호와 합계 / 금액이 시각적으로 표시되어 있지만, 그 데이터가 HTML 테이블이나 CSV 행 안에 있는 것은 아닙니다. 기존 OCR은 문자를 읽지만, 저희 AI는 레이아웃을 읽고 사용자가 정의한 열에 값을 매핑합니다.
스크린샷과 스캔된 계약서에서 동일한 필드를 추출할 수 있나요?
네, 이것이 맞춤 열 추출의 핵심 설계입니다. 열 이름을 한 번만 입력하세요 — 문서 날짜, 합계 / 금액, 당사자 이름. AI는 시각적 이해를 바탕으로 각 페이지에서 독립적으로 추출합니다. 스크린샷은 화면상의 값을 제공하고, 계약서는 인쇄된 필드를 제공합니다. 동일한 스키마, 다른 문서 유형, 유형별 설정이 전혀 필요 없습니다.
모바일 사진이나 스크린샷처럼 텍스트 레이어가 없는 문서에서는 추출이 어떻게 작동하나요?
AI가 픽셀을 직접 처리합니다. 텍스트를 먼저 추출하기 위해 OCR이 필요하지 않으며, 그다음에 구조화하는 별도 단계도 필요하지 않습니다. 시각적 레이아웃을 전체적으로 파악하여 필드 레이블을 식별하고, 해당 값을 읽은 후, 한 번의 과정으로 열 이름에 매핑합니다. 이것이 선택 가능한 텍스트가 필요한 NLP 기반 도구나, 여전히 사용자가 정리해야 하는 비정형 텍스트를 출력하는 기존 OCR과의 핵심 차이점입니다.
양식이나 편지처럼 명확한 표(grid)가 없는 문서의 추출 정확도는 어느 정도인가요?
150 DPI 이상의 깨끗한 인쇄 문서의 경우, 표준 필드에서 최대 99%의 정확도를 달성합니다. 시각적 계층 구조가 명확한 레이아웃이 가장 좋은 성능을 보입니다. 눈에 띄는 필드 레이블 없이 빽빽하게 채워진 자유 형식의 단락은 추출률이 낮아질 수 있습니다. AI는 어떤 텍스트가 어떤 열 이름에 해당하는지 식별하기 위해 시각적 단서에 의존하기 때문입니다.
손글씨 콘텐츠도 처리할 수 있나요, 아니면 인쇄된 텍스트만 가능한가요?
둘 다 가능합니다. 비전 모델은 별도의 손글씨 모드 없이 동일한 과정에서 인쇄된 텍스트와 함께 손글씨를 읽습니다. 깔끔한 블록체 손글씨는 이름, 금액과 같은 짧은 필드에서 90~95%의 정확도를 보입니다. 밀집된 필기체나 매우 희미한 연필 필기는 70~85%로 떨어질 수 있습니다. 서명의 경우, 도구는 텍스트 인식을 시도하지 않고 존재 여부를 감지합니다. 서명 확인은 데이터 추출과 근본적으로 다른 문제이기 때문입니다.
더 읽어보기: 문서 변환 vs 문서 추출 — 비정형 콘텐츠를 다른 파일 형식으로 변환하는 것과 그로부터 정형 데이터를 추출하는 것이 근본적으로 다른 이유 · AI가 문서를 읽는 방법 — 비전 모델이 문서 레이아웃을 이해하고, 콘텐츠와 장식을 구분하며, 의미 기반으로 데이터를 추출하는 방법에 대한 이해하기 쉬운 설명 · 모든 문서에서 특정 필드 추출하기 — 스크린샷, 양식, 필기 노트 등 비정형 문서 유형을 위한 실용적인 열 이름 지정 가이드