개요
ImageToTable.ai는 문서를 구조화된 데이터로 변환하며, 여기서 구조화된 데이터란 단순한 텍스트 값 이상을 의미합니다. 원하는 열을 지정하면 AI가 해당 열을 채웁니다. 페이지에서 값을 읽거나, 문서에 표시된 수치로 값을 계산하거나, 문서에 명시되지 않은 값을 판단하거나, 서명이나 로고와 같은 시각적 요소를 찾아 이미지에서의 위치를 반환합니다. 여러 페이지로 구성된 문서의 결과는 하나의 레코드로 병합되며, 완성된 테이블은 정렬, 합계, 필터링 및 다른 시스템에 전달할 수 있는 행과 열로 내보내집니다. 어떤 단계에서도 수작업으로 다시 입력할 필요가 없습니다.
ImageToTable.ai란 무엇인가
문서를 입력하면 구조화된 데이터가 출력되며, 그 사이에 수작업 재입력은 없습니다. ImageToTable.ai에 이미지, 스크린샷, PDF, Word 문서 또는 일반 텍스트를 지정하면 정렬, 합계, 필터링, 결합 및 다른 시스템에 전달할 수 있는 행과 열로 정보를 반환합니다. 그 과정에서 단순히 텍스트를 읽는 것 이상을 수행합니다. 문서에 표시된 수치로 값을 계산하고, 문서에 명시되지 않은 값을 판단하며, 페이지에서 서명, 로고 또는 도장과 같은 시각적 요소를 찾아냅니다.
이 도구가 대체하는 작업은 수동 데이터 입력입니다. 영수증, 인보이스, 은행 명세서 또는 양식에서 값을 읽고 스프레드시트에 행별로 입력하는 작업입니다. ImageToTable.ai를 사용하면 입력 단계가 사라지고 테이블이 이미 채워진 상태로 반환됩니다.
파일에서 완성된 테이블까지의 경로는 매번 동일합니다. 값이 추출되고, 계산 또는 판단하도록 설정한 열이 결과를 생성하며, 여러 조각으로 도착한 문서의 결과는 하나의 레코드로 병합되고, 완성된 테이블은 구조화된 데이터로 내보내집니다.
한 번에 하나씩이 아닌 파일 집합 단위로 작동합니다. 함께 제출한 파일은 배치를 구성하며, 이 배치가 처리, 검토 및 내보내기의 단위입니다. 파일이 기여하는 행 수는 파일 내용에 따라 달라집니다.
이 제품이 아닌 것
이 제품이 자주 함께 분류되는 두 가지와 그 차이점은 다음과 같습니다:
- 텍스트 전용 OCR 도구가 아닙니다. OCR은 페이지의 문자를 읽고 텍스트를 반환합니다. 영수증에 어떤 단어가 있는지는 알 수 있지만, 그중 어느 것이 판매자, 합계, 또는 세금인지는 알 수 없습니다. ImageToTable.ai는 문서가 의미하는 바와 말하는 바를 모두 읽으므로, 고정된 라벨이 위치를 알려주지 않아도 요청한 값을 찾을 수 있습니다. 또한 텍스트를 전혀 읽지 않고 초상화나 서명과 같은 시각적 요소를 찾을 수도 있습니다.
- 엔터프라이즈 문서 워크플로우 플랫폼이 아닙니다. 승인 체인을 설계하거나, 팀 간 문서를 라우팅하거나, 유용한 작업이 시작되기 전에 기록 시스템과 통합하기 위한 시스템이 아닙니다. 파일과 반환받고자 하는 값 목록에서 시작하며, 출력은 테이블입니다.
이 제품이 속한 범주는 구조화된 데이터 추출입니다. 문서가 입력되고 구조화된 데이터가 출력됩니다. 결과를 결정하는 것이 데이터가 페이지에 배치된 위치가 아니라 요청하는 내용이기 때문에 의미론적 또는 의도 기반 추출이라고도 설명됩니다.
열 이름을 지정하면 AI가 값을 찾습니다
이것이 전체 모델입니다. 원하는 열을 나열하면 — 스프레드시트의 헤더로 입력할 것과 동일한 이름 — AI가 각 문서를 읽고 각 이름에 속하는 값을 반환합니다. 설계할 파싱 템플릿도, 필드 주위에 그릴 영역도, 문서에 대해 훈련시킬 모델도 없습니다.
열 이름이 의미를 담고 있기 때문에 동일한 목록이 레이아웃이 다른 문서에서도 작동합니다. 값을 찾기 위해 값이 모든 페이지의 동일한 위치에 있을 필요는 없습니다. 목록은 단일 실행에 사용하거나 재사용 가능한 템플릿으로 저장할 수 있습니다. 열 이름을 전혀 지정하지 않으려면 AI가 문서를 읽고 테이블 구조를 직접 제안할 수 있습니다.
열의 값이 페이지에 인쇄된 텍스트일 필요는 없습니다. 열이 반환하는 것은 해당 지시문이 요청하는 내용에 따라 결정됩니다:
- 인쇄된 값 읽기 — 기본값으로, 값이 나타난 대로 가져옵니다.
- 값 계산 — 문서에 표시된 수치에서 계산합니다.
- 값 판단 또는 추론 — 문서에 명시되지 않은 값을 결정합니다.
- 시각적 요소 찾기 — 텍스트를 읽는 대신 페이지에서 초상화, 서명, 로고 또는 스탬프를 찾아 위치를 반환합니다. 앱은 해당 영역의 잘린 미리보기를 표시하고, 찾은 요소가 테이블에 들어갑니다.
계산, 판단, 찾기는 이 제품을 단순한 페이지 읽기와 구별하는 요소이며, 네 가지 모두 열의 지시문이 요청하는 내용에 따라 동일한 방식으로 설정됩니다. 사용자 지정 열에서 각 유형을 작성하는 방법을 다룹니다.
계정이 모델 티어 척도에서 어디에 있는지에 따라 어떤 AI 모델이 작업을 수행하는지 결정되며, 따라서 각 파일의 크레딧 비용도 결정됩니다. 하나의 실제 문서가 여러 사진이나 페이지로 도착하는 경우, 다중 페이지 병합이 해당 결과를 단일 레코드로 다시 접을 수 있습니다.
다음 단계
이 페이지는 안내서이지 매뉴얼이 아닙니다. 첫 결과를 얻는 가장 빠른 경로는 빠른 시작에 있으며, 사이트의 나머지 부분에서 사용하는 용어는 용어집에 정의되어 있습니다.
- 빠른 시작 — 가입부터 첫 번째 구조화된 테이블까지 가장 빠른 경로입니다.
- 템플릿 및 열 — 템플릿이 무엇인지, 열이 무엇으로 구성되는지, 저장된 템플릿을 어디에서 재사용할 수 있는지에 대해 설명합니다.
- 사용자 지정 열 — 열이 값을 직접 읽거나, 계산하거나, 추론하거나, 시각적 요소를 찾는 방법을 설명합니다.
- 모델 티어 — 계정 뒤에 있는 처리 품질 수준과 크레딧에 미치는 영향을 설명합니다.
- 다중 페이지 병합 — 여러 파일로 도착한 문서를 하나의 레코드로 접는 방법을 설명합니다.
- 배치 — 파일이 처리 과정에서 어떻게 그룹화되고, 이름이 지정되며, 추적되는지 설명합니다.
- 제한 및 사양 — 지원되는 파일 유형, 페이지 및 크기 제한, 플랜 제한을 설명합니다.
웹 앱 대신 API로 구축하려는 경우, 개발자 문서는 별도 사이트에 있습니다: API 문서를 참조하세요.