VLM Powered OCR

비정형 데이터 추출 — 자유 형식 문서를 템플릿 없이 구조화된 스프레드시트로 변환

스크린샷, 스캔본, 양식의 데이터를 수동으로 스프레드시트에 입력하는 데 페이지당 3분이 걸리지만, 이 도구는 5~10초 만에 추출합니다. 템플릿, 학습, 문서 유형별 사전 분류가 필요 없습니다.

페이지당 5~10초 · 인쇄 텍스트 최대 99% 정확도 · PDF / 스크린샷 / 사진 · 문서별 설정 불필요

PDF / JPG / PNG
스크린샷
필기
XLSX / CSV

시각적 이해가 OCR로는 불가능한 작업을 가능하게 하는 이유

OCR은 문자를 출력합니다. Vision AI는 페이지를 읽습니다. 상단 근처의 굵은 레이블이 제목이고, 그 오른쪽에 있는 숫자가 해당 값이며, 아래 정렬된 행들이 관련 항목임을 인식합니다. 이러한 기능은 텍스트 문자열이 아닌 픽셀을 읽는 추출 방식에서만 가능합니다.

시각적 레이아웃 인식

HTML이나 PDF 구조를 파싱하지 않고, 시각적 위치를 기반으로 제목, 섹션, 구분선, 레이블-값 쌍을 식별합니다. 스크린샷이나 사진에는 이러한 구조가 존재하지 않기 때문입니다.

레이블-값 근접 매핑

"총 납부액" 옆에 있는 "$4,287.50"이 총액임을 감지합니다. 레이블의 표현이 다르거나 페이지마다 위치가 달라도 가능합니다.

스크린샷 및 사진 네이티브 처리

픽셀에서 직접 추출합니다. 텍스트 레이어가 필요 없습니다. 대시보드 스크린샷, 화이트보드 사진, 양식 사진 모두 동일하게 처리됩니다.

시각적 맥락에서의 필기-텍스트 변환

인쇄된 텍스트와 함께 동일한 페이지에 있는 필기 필드 값을 읽습니다. 인쇄된 "신청자:" 레이블 아래의 필기된 이름이 신청자 이름임을 인식합니다.

다중 열 및 다중 블록 파싱

나란히 있는 텍스트 열, 삽입 상자, 분리된 정보 블록이 있는 레이아웃을 처리합니다. 왼쪽 열의 주소와 오른쪽 열의 요약이 서로 다른 출력 필드에 속함을 인식합니다.

양식 요소 감지

체크박스, 라디오 버튼, 작성된 양식 필드를 인식합니다. 기존 OCR이 장식용 표시로 처리하는 시각적 상태를 데이터 포인트로 감지합니다.

이러한 기능은 사람이 문서를 보고 각 부분의 의미를 이해하는 것과 같은 방식으로 페이지를 시각적으로 읽음으로써 가능합니다. 텍스트 추출 단계나 좌표 기반 템플릿이 필요하지 않습니다.

비정형 데이터에도 시각적 구조는 존재합니다 — 기존 OCR은 이를 볼 수 없습니다

'비정형'이 혼란스럽다는 뜻은 아닙니다. 스크린샷에는 제목, 섹션, 숫자가 있지만 표 격자가 없을 뿐입니다. 스캔한 양식에는 레이블, 입력란, 서명이 있지만 선택 가능한 텍스트 레이어가 없을 뿐입니다. 추출의 문제는 구조가 부재해서가 아니라, 평문만 이해하는 도구를 사용하기 때문입니다.

기존 도구가 놓치는 부분

01

OCR은 필드 식별 없이 평문만 출력합니다. "INV-2024-8932" 문자열과 "$12,345.00"이 같은 블롭으로 나옵니다. r/AskProgramming의 한 개발자는 "이런 테이블을 파싱하는 것은 완전히 새로운 문제를 제기한다"고 설명했습니다. OCR은 문자를 제공할 뿐, 열을 제공하지 않기 때문입니다.

02

NLP 텍스트 파서는 선택 가능한 텍스트가 필요합니다. 스크린샷, 문서의 모바일 사진, 스캔된 양식에는 텍스트 레이어가 없습니다. PDF 텍스트 추출이나 HTML 콘텐츠에 의존하는 파서는 휴대폰 카메라로 찍은 JPEG에서는 작동할 대상이 없습니다.

03

템플릿 기반 도구는 레이아웃별로 영역을 그리므로 형식이 바뀌면 모두 깨집니다. 한 스크린샷이 왼쪽 정렬 레이아웃을 사용하고 다른 스크린샷이 카드 기반 레이아웃을 사용하면 영역 좌표가 실패합니다. 템플릿 파서는 형식 다양성에 따라 선형적으로 확장되며, 설계상 '비정형' 데이터를 처리하지 못합니다.

Vision AI가 레이아웃을 직접 읽는 방식

01

Vision AI는 페이지를 시각적 전체로 읽습니다. 오른쪽 상단 근처의 굵은 숫자가 합계이고, 아래 정렬된 행 블록이 라인 항목 섹션임을 인식합니다. 단순한 문자 위치가 아닌 시각적 계층 구조를 이해합니다.

02

맞춤 열 추출은 텍스트 레이어가 아닌 픽셀 단위로 작동합니다. 원하는 필드(Date, Total, Party Name)를 입력하면 AI가 시각적 레이아웃의 어느 위치에서든 의미적 의미를 기반으로 일치하는 값을 찾습니다. 문서가 텍스트가 포함된 PDF이든, 화이트보드의 휴대폰 사진이든 관계없이 작동합니다.

03

모든 형식에 하나의 스키마 — 유형별 설정 불필요. 송장 PDF, 대시보드 스크린샷, 손으로 작성한 양식 모두 동일한 열 정의를 사용합니다. AI는 적용할 추출 규칙을 결정하기 위해 문서 유형 분류기가 필요하지 않습니다. "비정형 데이터"는 정형 문서를 처리하는 동일한 메커니즘, 즉 시각적 이해를 통해 처리됩니다.

현장 기술자가 현장 사진을 서비스 보고서로 바꾸는 방법 — 한 글자도 입력하지 않고

현장 서비스는 모든 방문에서 비정형 시각 데이터를 생성합니다: 작성된 양식 사진, 계량기 디스플레이 스냅샷, 장비 태그 이미지. 각 사진에는 데이터가 담겨 있지만, 누군가가 보고서에 입력하기 전까지 그 데이터는 픽셀 속에 갇혀 있습니다.

1

현장 방문 20회, 사진 60장, 업로드 한 번

현장 서비스 팀이 세 곳의 고객 사이트에서 20회 방문을 완료합니다. 각 기술자는 완료된 검사 양식, 계량기 판독 디스플레이, 그리고 사고 보고서의 사진을 찍습니다. 60장의 휴대폰 사진이 모두 함께 업로드됩니다 — 파일 이름 변경, 고객별 분류, JPG 형식 변환이 필요 없습니다.

2

세 가지 양식 레이아웃, 하나의 추출 스키마

열을 한 번만 정의하세요: 고객 사이트 ID, 검사 날짜, 계량기 판독값(kWh), 이상 징후 플래그, 기술자 메모, 서명 있음. AI가 각 사진의 시각적 레이아웃을 독립적으로 읽습니다 — 검사 양식의 그리드, 계량기 디스플레이의 디지털 판독값, 사고 보고서의 자유 텍스트 블록이 모두 동일한 출력 열에 매핑됩니다.

3

서비스 파견 보고서, 자동 생성

완전한 파견 보고서를 내보냅니다: 20개 행, 방문당 하나씩. 계량기 판독값은 숫자 값으로 표준화됩니다. 서명 존재 여부는 서명 블록의 시각적 검사를 통해 감지됩니다. 이상 징후 플래그는 체크박스 감지로 채워집니다. 현장 기술자의 데이터 입력 시간 0분, OCR 사전 처리 0회, 고객별 양식 템플릿 0개. 사진이 직접 보고서 데이터가 됩니다 — 중간 단계가 없습니다.

시각적 판독이 효과적인 경우와 시각적 구조만으로 부족한 경우

Vision AI는 시각적 패턴을 인식하여 문서를 읽습니다. 이러한 패턴이 존재할 때 이 접근 방식이 가장 강력하며, 그렇지 않은 경우에는 다른 전략이 필요합니다.

시각적 추출이 뛰어난 경우

명확한 시각적 계층 구조를 가진 문서. 값 옆의 굵은 레이블, 구분된 섹션, 뚜렷한 필드 상자, 보이는 구분선은 모두 강력한 추출 신호를 제공합니다. 페이지가 데이터 요소를 시각적으로 더 잘 분리할수록 정확도가 높아집니다.

텍스트 레이어가 없는 원본 자료. 스크린샷, 휴대폰 사진, 이미지 전용 PDF — 기존 OCR 및 구문 분석 파이프라인이 시작할 텍스트 레이어가 없는 형식입니다. 시각적 추출은 이러한 문서 유형에서 유일하게 작동하는 접근 방식입니다.

혼합 형식 및 혼합 품질 배치. 깨끗한 PDF, 오래된 스캔본, 휴대폰 사진, 압축된 스크린샷 — 모두 하나의 업로드에 포함됩니다. 각 페이지는 시각적 입력으로 독립적으로 읽히므로 배치 내 품질 변동이 다른 페이지에 영향을 미치지 않습니다.

시각적 구조가 불충분한 경우

레이블이 없는 조밀한 산문. 단락에 그림이 포함된 서술형 텍스트 페이지로, 값 앞에 필드 레이블이 없는 경우입니다. AI는 식별 가능한 정보를 추출하지만, 시각적 레이블-값 쌍이 없는 산문은 의미적 기준점이 적습니다.

겹치거나 장식이 많은 레이아웃. 텍스트 위의 워터마크, 필드 값을 가로지르는 전경 요소, 또는 전경 가독성을 방해하는 패턴의 배경입니다. AI는 적당한 노이즈를 잘 처리하지만, 심한 시각적 간섭은 신뢰도를 낮춥니다.

장식적이거나 양식화된 손글씨. 깔끔한 인쇄체 손글씨는 안정적으로 추출됩니다(90-95%). 장식적 캘리그래피, 빽빽한 필기체, 또는 매우 희미한 연필 글씨는 수동 확인이 필요할 수 있습니다. 시각적 형식 유연성보다 대규모 구조화된 문서 추출이 주된 목적이라면, 설정 비용에 초점을 맞춘 워크플로를 위해 자동화 페이지를 참조하세요.

자주 묻는 질문

이 도구에서 말하는 "비정형 데이터"란 정확히 무엇인가요?

시각적 구조는 있지만, 파싱 가능한 표(grid)가 없고 선택 가능한 텍스트 레이어도 없는 문서를 의미합니다. 대시보드 스크린샷에는 참조번호 / ID 번호합계 / 금액이 시각적으로 표시되어 있지만, 그 데이터가 HTML 테이블이나 CSV 행 안에 있는 것은 아닙니다. 기존 OCR은 문자를 읽지만, 저희 AI는 레이아웃을 읽고 사용자가 정의한 열에 값을 매핑합니다.

스크린샷과 스캔된 계약서에서 동일한 필드를 추출할 수 있나요?

네, 이것이 맞춤 열 추출의 핵심 설계입니다. 열 이름을 한 번만 입력하세요 — 문서 날짜, 합계 / 금액, 당사자 이름. AI는 시각적 이해를 바탕으로 각 페이지에서 독립적으로 추출합니다. 스크린샷은 화면상의 값을 제공하고, 계약서는 인쇄된 필드를 제공합니다. 동일한 스키마, 다른 문서 유형, 유형별 설정이 전혀 필요 없습니다.

모바일 사진이나 스크린샷처럼 텍스트 레이어가 없는 문서에서는 추출이 어떻게 작동하나요?

AI가 픽셀을 직접 처리합니다. 텍스트를 먼저 추출하기 위해 OCR이 필요하지 않으며, 그다음에 구조화하는 별도 단계도 필요하지 않습니다. 시각적 레이아웃을 전체적으로 파악하여 필드 레이블을 식별하고, 해당 값을 읽은 후, 한 번의 과정으로 열 이름에 매핑합니다. 이것이 선택 가능한 텍스트가 필요한 NLP 기반 도구나, 여전히 사용자가 정리해야 하는 비정형 텍스트를 출력하는 기존 OCR과의 핵심 차이점입니다.

양식이나 편지처럼 명확한 표(grid)가 없는 문서의 추출 정확도는 어느 정도인가요?

150 DPI 이상의 깨끗한 인쇄 문서의 경우, 표준 필드에서 최대 99%의 정확도를 달성합니다. 시각적 계층 구조가 명확한 레이아웃이 가장 좋은 성능을 보입니다. 눈에 띄는 필드 레이블 없이 빽빽하게 채워진 자유 형식의 단락은 추출률이 낮아질 수 있습니다. AI는 어떤 텍스트가 어떤 열 이름에 해당하는지 식별하기 위해 시각적 단서에 의존하기 때문입니다.

손글씨 콘텐츠도 처리할 수 있나요, 아니면 인쇄된 텍스트만 가능한가요?

둘 다 가능합니다. 비전 모델은 별도의 손글씨 모드 없이 동일한 과정에서 인쇄된 텍스트와 함께 손글씨를 읽습니다. 깔끔한 블록체 손글씨는 이름, 금액과 같은 짧은 필드에서 90~95%의 정확도를 보입니다. 밀집된 필기체나 매우 희미한 연필 필기는 70~85%로 떨어질 수 있습니다. 서명의 경우, 도구는 텍스트 인식을 시도하지 않고 존재 여부를 감지합니다. 서명 확인은 데이터 추출과 근본적으로 다른 문제이기 때문입니다.

더 읽어보기: 문서 변환과 문서 추출의 차이 — 비정형 콘텐츠를 다른 파일 형식으로 변환하는 것과 그로부터 구조화된 데이터를 추출하는 것이 근본적으로 다른 이유 · AI가 문서를 읽는 방법 — 비전 모델이 문서 레이아웃을 이해하고, 콘텐츠와 장식을 구분하며, 의미 기반으로 데이터를 추출하는 방식에 대한 이해하기 쉬운 설명 · 모든 문서에서 특정 필드 추출하기 — 스크린샷, 양식, 필기 노트 등 비정형 문서 유형을 위한 실용적인 열 이름 지정 가이드

📮 contact email: [email protected]