VLM Powered OCR

OCR API — 개발자용 문서 텍스트 및 정형 데이터 추출

대부분의 OCR API는 원시 텍스트와 좌표만 반환하므로, 문서 유형별로 파싱 코드를 직접 작성해야 합니다. 이 통합 접근 방식은 텍스트를 추출하는 동시에 필드를 이해하여, 사용자가 정의한 열 이름별로 정형 데이터를 한 번에 출력합니다.

Enterprise-grade security · TLS 1.3 encrypted

REST API
PDF/JPG/PNG
JSON + XLSX 내보내기
Basic+ API 액세스

모든 문서에서 추출할 수 있는 항목

필요한 열 이름을 입력하세요. AI는 위치가 아닌 의미를 이해하여 모든 페이지에서 해당 값을 찾아냅니다. 구조화된 JSON 결과를 얻고, 스프레드시트가 필요할 때는 일괄로 포맷된 .xlsx 워크북으로 내보낼 수 있습니다.

원시 문서 텍스트
송장 번호
날짜
총 금액
공급업체명
품목 목록
구매 주문 번호
세액
마감일
문서 유형

OCR API로는 절반만 해결됩니다

OCR API는 텍스트와 좌표만 제공합니다. 감지된 여러 단어 사이에 떠 있는 문자열 "INV-2024-0892" 대신 Invoice Number: INV-2024-0892를 얻으려면 두 번째 처리 계층이 필요합니다.

01
구조 없는 원시 텍스트 덤프

OCR API는 좌표가 포함된 평문 문자열이나 단어 목록을 반환합니다. 숫자 $322.38과 레이블 "TOTAL"은 출력에서 다른 텍스트와 구분할 수 없습니다. 코드가 직접 어떤 숫자가 합계인지, 소계인지, 개별 항목인지 파악해야 합니다.

02
문서 레이아웃마다 별도의 파싱 코드 필요

좌표는 페이지 기준 상대값입니다. (x=100, y=200) 위치에서 송장 번호를 추출하는 규칙은 다른 공급업체의 레이아웃이 (x=300, y=150)에 배치하는 순간 작동하지 않습니다. 공급업체별 파싱 로직을 유지하는 것은 확장이 불가능합니다.

03
후처리 파이프라인은 복잡성과 비용 증가

Reddit의 개발자들은 일관되게 OCR 출력과 실제 사용 가능한 데이터 간의 차이를 "매우 실망스럽다"고 설명합니다. API는 제 역할을 했지만, 데이터는 여전히 바로 사용할 수 없는 상태입니다.

01
열 이름으로 구조화된 데이터 출력

원하는 필드를 정의하면 AI가 이를 JSON 또는 스프레드시트에서 명명된 열로 반환합니다. 원시 텍스트에 레이블을 붙이고 정렬할 필요가 없습니다.

02
레이아웃 독립적인 시맨틱 추출

AI가 Invoice Number의 의미를 이해하기 때문에 페이지 내 위치와 관계없이 찾아냅니다. 공급업체가 템플릿을 변경해도 추출은 계속 작동하며, 규칙을 업데이트할 필요가 없습니다.

03
업로드부터 구조화된 출력까지 단일 파이프라인

별도의 OCR 단계, 파싱, 필드 추출 과정이 필요 없습니다. PDF나 이미지를 업로드하고 열을 정의하면 단일 응답으로 구조화된 데이터를 받을 수 있습니다. 종단 간 구조화된 데이터가 필요한 팀에게 이 통합 접근 방식은 OCR → 파싱 → 추출 체인을 유지하는 것보다 간단합니다.

업로드부터 구조화된 데이터까지 한 번에

중간 파싱 단계 없이 API를 통해 송장 배치를 처리할 때의 과정입니다.

1

API 또는 웹 인터페이스로 파일 업로드

PDF, JPG, PNG 등 단일 문서 또는 혼합 형식을 동일 배치로 전송하세요. API는 멀티파트 업로드를 지원하며 상태 폴링을 위해 즉시 작업 ID를 반환합니다. 각 파일은 비동기적으로 대기열에 추가되어 처리되며, 웹 UI와 API 엔드포인트는 동일한 엔진으로 구동됩니다.

2

열 스키마 정의

필요한 필드를 지정하세요 — Invoice Number, Date, Vendor, Line Items (Description / Quantity / Unit Price / Total), Tax, Grand Total. AI가 각 문서를 시맨틱하게 읽고 페이지 내 위치와 관계없이 값을 열 이름에 매핑합니다.

3

구조화된 데이터 검색 — JSON 또는 Excel

각 문서는 지정된 열이 채워진 상태로 반환됩니다. field:value 쌍의 JSON으로 개별 결과를 가져오거나, 스프레드시트 작업을 위해 배치를 형식화된 .xlsx 워크북으로 다운로드하세요. 정규식 패턴을 작성하거나, 좌표 매칭을 디버깅하거나, 후처리 파이프라인을 유지할 필요가 없습니다.

이 접근 방식을 사용해야 하는 경우

가장 적합한 경우

  • 문서에서 단순한 원시 텍스트가 아닌 구조화된 필드:값 쌍이 필요한 경우.
  • 다양한 출처의 문서가 서로 다른 레이아웃을 가지고 있는 경우 — 시맨틱 추출은 규칙 변경 없이 적응합니다.
  • 후처리 파이프라인을 생략하려는 경우 — 추출 결과를 데이터베이스, API 응답 또는 스프레드시트에 바로 로드할 수 있습니다.
  • 팀에 추출 규칙을 구축하고 유지 관리할 전담 NLP 또는 문서 파싱 엔지니어링 리소스가 없는 경우.

주의가 필요한 경우

  • 자유 형식 텍스트 재구성을 위해 문자별 정확한 경계 상자 좌표가 포함된 원시 OCR 텍스트가 필요한 경우 — 이 접근 방식은 전체 레이아웃 형상이 아닌 명명된 필드를 출력합니다.
  • 파이프라인이 페이지당 1센트 미만의 비용으로 매달 수백만 개의 문서를 처리하는 경우 — 처리량 요구 사항에 따라 볼륨 기반 가격을 평가하세요.
  • 극도로 필기체가 심하거나 심각한 물리적 손상이 있는 스캔본은 추출 정확도를 떨어뜨릴 수 있습니다 — 깨끗한 인쇄물과 스캔 문서에서 가장 높은 신뢰도를 얻을 수 있습니다.

자주 묻는 질문

스캔된 PDF에서 Invoice NumberTotal Amount를 API로 추출할 수 있나요?

네, 가능합니다. 스캔된 PDF는 이미지로 처리됩니다. 시각 AI가 페이지를 직접 읽기 때문에 텍스트 레이어에 의존하지 않습니다. Invoice NumberTotal Amount를 열 이름으로 정의하면, PDF가 디지털 생성 문서든 스캔 문서든 관계없이 API가 해당 값을 명명된 필드로 응답에 반환합니다.

Google Cloud Vision이나 AWS Textract와 어떻게 다른가요?

Google Cloud Vision과 AWS Textract는 필드가 이미 레이블이 지정된 문서에 대해 원시 텍스트와 경계 상자 또는 키-값 쌍을 반환합니다. 반면, 이 API는 시맨틱 이해를 통해 사용자가 정의한 필드를 반환합니다. 예를 들어 Vendor Name을 요청하면, 문서에 명시적으로 레이블이 없어도 공급업체 이름을 찾아냅니다. 문서가 아닌 사용자가 출력 스키마를 정의하는 방식입니다.

문서마다 행 개수가 다른 라인 항목은 어떻게 처리하나요?

Line Items와 같은 열을 정의하고, 하위 필드(Description, Quantity, Unit Price, Total)를 중첩하여 설정하세요. AI는 문서당 3행이든 30행이든 모든 라인 항목을 감지하여 JSON 배열 또는 내보내기 시 확장된 행으로 반환합니다.

통합 전에 OCR API를 어떻게 평가할 수 있나요?

API 통합을 구축하기 전에 웹 UI의 게스트 데모를 통해 출력 품질을 평가할 수 있습니다. API 액세스는 계정 API 키를 사용하며 유료 요금제에서 이용 가능합니다. 웹 인터페이스와 API는 동일한 추출 엔진을 공유하므로, 테스트 출력은 통합 여부를 결정하는 데 유용합니다.

지원되는 입력 및 출력 형식은 무엇인가요?

업로드: PDF, JPG, PNG, WebP, AVIF. 출력: 사용자 정의 열 이름을 키로 하는 구조화된 JSON과 일괄 수준에서 다운로드 가능한 .xlsx 파일 내보내기를 지원합니다.

📮 contact email: [email protected]