OCR 이미지를 텍스트로 — 기존 OCR이 실패하는 이미지에서 Vision AI가 텍스트 추출, 수동 설정 불필요
JPG, PNG, WebP, HEIC, PDF 및 스크린샷에서 텍스트, 날짜, 금액, 참조 번호 및 필드 수준 데이터를 추출합니다 — 기존 OCR은 압축 아티팩트를 잘못된 문자로 오인하고, 다국어 문서에 수동 언어 선택이 필요하며, 표 구조를 뒤섞인 단어의 흐름으로 평탄화합니다. Vision AI는 문맥 속 단어의 의미를 이해하여 페이지를 읽습니다 — 페이지당 5–10초, 템플릿 설정 제로.
페이지당 5–10초 · 필드 수준 정확도 최대 99% · JPG / PNG / WebP / HEIC / PDF · 템플릿 설정 제로
추출 가능한 항목 — 모든 이미지에서 명명된 열 또는 편집 가능한 텍스트로
대부분의 OCR 도구는 단순한 텍스트 블록만 제공합니다 — 모든 단어, 숫자, 라벨이 하나의 흐름으로 쏟아집니다. 어느 조각이 공급업체 이름인지, 어느 숫자가 합계인지 직접 식별하여 각각 올바른 스프레드시트 셀에 복사해야 합니다. 여기서는 원하는 열을 지정하기만 하면 됩니다 — 날짜, 금액, 공급업체, 참조 번호 — AI가 페이지에서 각 값을 위치가 아닌 의미를 이해하여 찾아냅니다. 이것이 맞춤 열 추출입니다: 출력 스키마를 정의하면 AI가 정확히 필요한 필드를 채워줍니다 — 모든 이미지 형식, 모든 레이아웃에서 말이죠. 또는 원본 서식이 유지된 전체 텍스트가 필요하다면 한 번의 클릭으로 편집 가능한 Word 문서로 내보낼 수 있습니다. 위의 데모를 사용해 보세요 — 가입 불필요, 하루 3개 무료 문서.
동일한 열 정의가 인보이스, 영수증, 은행 명세서, 구매 주문서, 계약서 및 기타 모든 문서 유형에서 텍스트와 데이터를 추출하며, 동일한 배치에서 유형별 설정이 전혀 필요 없습니다. JPG, PNG, WebP, HEIC, PDF 및 스크린샷은 모두 동일한 파이프라인으로 들어갑니다. Vision AI가 재구성된 텍스트 레이어가 아닌 픽셀을 직접 읽기 때문이며, 이것이 이미지 텍스트 변환이 모든 형식에서 동일하게 작동하는 이유입니다. 화면 캡처도 동일한 조건으로 이 목록에 포함됩니다 — 스크린샷 텍스트 추출은 캡처별 처리 없이 동일한 모델로 실행됩니다.
OCR은 문자 모양을 픽셀 단위로 대조합니다. Vision AI는 단어가 문맥에서 갖는 의미를 이해하며 문서를 읽습니다.
기존 OCR은 패턴 매칭 엔진처럼 작동합니다. 이미지에서 개별 문자 모양을 분리해 각각을 알려진 글꼴 데이터베이스와 비교합니다. 픽셀 경계가 깨끗하고 글꼴이 표준이면 매칭이 정확합니다. 하지만 이미지가 압축되었거나, 텍스트가 다국어이거나, 레이아웃이 복잡하면 매칭이 실패하고 오류가 연쇄적으로 발생합니다. 이는 더 나은 학습 데이터로 해결할 수 있는 정확도 문제가 아닙니다. 문자 모양 매칭은 보이지 않는 것을 채워 넣을 수 없고, 압축된 JPG 속 "1nv0ice"가 "Invoice"여야 한다는 것을 이해하지 못하며, 일본어로 작성되고 영어 필드 라벨이 있는 문서에 두 세트의 문자 매핑을 동시에 적용해야 한다는 것을 인식하지 못하는 근본적인 아키텍처 한계입니다. Vision AI는 완전히 다른 메커니즘입니다. 사람이 읽는 방식으로 페이지를 읽어 전체 시각적 장면을 한 번에 처리하고, 문서에서의 역할에 따라 각 단어를 해석합니다. 날짜는 형식과 무관하게 날짜이고, 공급업체 이름은 위치와 무관하게 공급업체 이름이며, 언어 감지는 같은 문장 안에서 자동으로 이루어집니다.
기존 OCR: 어떤 정확도 벤치마크도 숨길 수 없는 3가지 실패 모드
압축 아티팩트가 문자 경계를 파괴합니다 — OCR이 "단순히 덜 정확한" 문자가 아니라 잘못된 문자를 읽습니다. JPEG 압축과 스크린샷 축소는 문자 형태 매칭이 의존하는 가장자리를 흐리게 만듭니다. 압축된 이미지의 "Invoice #12345"는 "v"와 "4" 주변의 픽셀이 흐릿해집니다. OCR 엔진은 누락된 문자를 보지 못합니다 — 흐릿한 형태를 완전히 다른 문자로 잘못 식별합니다: "Invo1ce #1234S." 이는 부분 수정이 가능한 무작위 오류가 아닙니다. 한 r/LLMDevs 사용자가 지적했듯이: "95% 정확도는 문서 20개 중 1개에 오류가 있다는 뜻이 아닙니다. 단어 20개 중 1개에 오류가 있다는 뜻입니다. 즉, 기본적으로 모든 문서에 오류가 있습니다." 문자 정확도 99%에도 불구하고 인보이스 합계, PO 번호, 세금 금액 같은 중요 필드에 잘못된 값이 생성되면, 다른 문자가 얼마나 정확했는지와 관계없이 출력 결과는 쓸모없게 됩니다.
다국어 문서는 수동 언어 선택이 필요합니다 — 잘못 고르면 페이지 전체가 알아볼 수 없는 문자가 됩니다. 기존 OCR 엔진은 문자 형태를 특정 문자 집합에 매핑합니다. 처리 전에 어떤 매핑을 사용할지 알아야 합니다. 이것이 OnlineOCR.net이 46개 언어 드롭다운에서 선택하도록 요구하는 이유입니다. 영어 헤더와 일본어 품목이 있는 문서는 선택을 강요합니다: 영어를 선택하면 일본어 문자가 임의의 기호가 되고, 일본어를 선택하면 영어 필드가 손상됩니다. 제3의 옵션은 없습니다 — OCR 엔진은 페이지 전체에 하나의 문자 맵만 적용합니다. 국제 인보이스, 세관 서류, 다국어 계약서를 처리하는 기업에게 이는 사소한 불편이 아닙니다 — 혼합 언어 문서에 대한 단일 패스 OCR을 근본적으로 불가능하게 만듭니다.
혼합 형식 배치는 각각 별도의 전처리가 필요합니다 — PDF에서 작동하는 도구는 스크린샷에서는 작동하지 않습니다. 기존 OCR 파이프라인은 형식에 민감합니다: 스캔한 PDF는 기울기 보정과 DPI 정규화가 필요하고, 휴대폰 사진은 대비 향상과 그림자 제거가 필요하며, 압축된 스크린샷은 아티팩트 감소가 필요합니다. 각 입력 유형은 서로 다른 전처리 경로를 거치며 — 한 형식에 도움이 되는 전처리가 다른 형식에는 해가 될 수 있습니다. r/datacurator 사용자가 형식 간 도구 전환의 현실을 설명했습니다: "여기서 언급된 몇 가지 제안을 시도해 봤지만 성공한 것은 없었습니다." 도구는 하나의 테스트 파일에서는 작동했지만 다음 형식에서는 실패했습니다. r/datasets 사용자가 요약한 분할 도구의 함정: "Tabula는 텍스트를 읽지 못하고 Omnipage는 열을 읽지 못합니다." 두 도구, 두 가지 서로 다른 형식 실패 — 그리고 실제 비용은 서로 다른 파이프라인의 출력을 수동으로 병합하는 단계입니다.
Vision AI OCR: 이미지 입력, 구조화된 열 또는 Word 문서 출력 — 단 한 번에
Vision AI는 페이지를 문자 단위도, 픽셀 단위도 아닌 시각적 전체로 읽습니다. 별도의 문자 감지 단계도, 글꼴 매칭 데이터베이스도, 개별 모양에서 텍스트를 재구성하는 과정도 없습니다. 모델은 사람이 문서를 보는 방식, 즉 단어, 숫자, 표, 레이아웃이 서로 관계를 맺고 있는 완전한 시각적 장면으로 문서를 봅니다. 압축된 "Invo1ce #1234S"는 픽셀 수준의 문자 모양으로 평가되지 않습니다. AI는 문서 헤더 블록을 보고 인보이스 번호의 의미적 패턴을 인식하여 "Invoice #12345"를 정확히 추출합니다. 이는 미미한 수준의 정확도 개선이 아니라 문자 매칭이 실패하는 방식으로는 실패하지 않는 전혀 다른 메커니즘입니다. 모델이 픽셀을 직접 처리하기 때문에 형식 유형에 관계없이 성능이 일관됩니다. 영수증의 휴대폰 사진, 계약서의 스캔 PDF, 결제 확인 화면의 스크린샷 모두 동일한 파이프라인을 거쳐 동일한 품질의 결과를 냅니다.
라틴어, CJK, 아랍어, 키릴 문자 자동 감지 — 언어 드롭다운도, 수동 전환도 없습니다. Vision AI는 다국어 사용자가 읽는 방식으로 언어를 처리합니다. 텍스트의 시각적 형태를 보고 사전 구성된 문자 매핑이 아닌 문맥으로 어떤 언어 체계에 속하는지 이해합니다. 영어 헤더 필드와 일본어 본문이 있는 문서도 한 번에 처리됩니다. AI는 여러분이 읽을 때와 같은 방식으로 언어 전환을 시각적으로 식별합니다. 주요 언어군 — 라틴 문자, CJK(중국어, 일본어, 한국어), 아랍어, 키릴 문자 — 모두 기본적으로 지원됩니다. 이는 기존 OCR 파이프라인에서 가장 큰 수동 단계, 즉 잘못 선택하면 OCR을 아예 하지 않는 것보다 나쁜 결과를 만드는 언어 선택을 완전히 제거합니다.
형식 독립적 처리 — JPG, PNG, WebP, HEIC, PDF, 스크린샷 모두 동일한 파이프라인으로 처리되며, 동일한 열 정의가 모든 형식에 적용됩니다. Vision AI가 픽셀을 직접 읽기 때문에 형식별 전처리가 필요하지 않습니다. 스캔 문서의 기울기 보정, 휴대폰 사진의 대비 정규화, 압축 이미지의 아티팩트 제거 단계가 모두 필요 없습니다. 같은 배치에 파일 형식을 섞어도 됩니다. 영수증 사진, 스캔된 PDF 인보이스, 결제 확인 스크린샷, 손글씨 메모의 HEIC 이미지 — 모두 함께 업로드되고, 동일한 파이프라인으로 처리되며, 일치하는 열로 하나의 Excel에 병합됩니다. 직접 추출 외에도 계산 열을 정의할 수 있습니다. 추출 중 수행되는 계산으로, 예를 들어 Line Total (Qty × Unit Price)과 같은 결과를 추출 후 수식 없이 얻을 수 있습니다. 그리고 추론 열: 문서 내용을 기반으로 한 AI 분류입니다. 예를 들어 Category (options: Meals/Transport/Office) — AI가 각 영수증을 읽고 문서에 "Category" 필드가 없어도 올바른 카테고리를 할당합니다. 동일한 열 스키마는 문서별 설정 없이 배치의 모든 문서 유형에 적용됩니다 — AI가 위치가 아닌 의미로 필드를 찾기 때문입니다.
차이는 단순한 정확도 향상이 아닙니다. 문자 모양을 대조하다 모양이 흐려지면 실패하는 도구와, 페이지를 읽고 직접 읽는 것과 똑같은 방식으로 실제로 필요한 것을 추출하는 도구 사이의 차이입니다.
작동 방식 — 모든 이미지에서 1분 안에 구조화된 데이터로, 업로드와 내보내기 사이에 수동 단계 없음
무료 OCR 도구를 사용하다 익숙한 한계에 부딪힌 적이 있다면 — 다단 레이아웃에서 텍스트가 추출되지만 뒤섞이거나, 압축된 이미지에서 문자가 깨지거나, 다국어 문서에서 수동 언어 선택이 막히는 경우 — 업로드부터 구조화된 출력까지 한 번에 처리하는 워크플로우를 소개합니다.
이미지 업로드 — 모든 형식, 한 번의 배치, 형식별 전처리 불필요
JPG 및 PNG 사진, WebP·HEIC 이미지, 네이티브·스캔 PDF, 웹페이지 스크린샷을 모두 같은 배치에 넣으세요. 각 이미지는 동일한 Vision AI 모델로 독립 처리되므로, 형식 혼합 시 전처리 파이프라인, 분류 우선 라우팅, 파일 유형별 수동 품질 검사가 필요 없습니다. 다른 사람에게서 이미지를 받는 경우 — 인보이스 사진을 보내는 클라이언트, 지출 영수증 스크린샷을 제출하는 팀원 — 수집 링크를 생성하세요. 업로더가 계정 없이도 처리 대기열에 파일을 추가할 수 있는 공유 URL입니다. 파일은 대시보드에 도착하여 추출 준비가 완료됩니다.
JPG / PNG / WebP / HEIC / PDF / 스크린샷 — 모든 형식을 하나의 파이프라인으로.
원하는 열 이름을 지정하거나 — AI가 자동 감지하여 테이블 구조를 생성하게 하세요
인터페이스에 열 이름을 입력하세요 — Vendor, Date, Amount, Reference #, Tax. 이 이름들이 출력 스프레드시트의 정확한 헤더가 됩니다. AI는 의미론적 이해를 통해 각 페이지의 값을 찾아냅니다 — 날짜는 "03/15/2026," "15 March 2026," 또는 "March 15, 2026"로 표기되어도 날짜입니다. 시스템이 한 번도 본 적 없는 형식의 새 공급업체 인보이스도 모든 열을 정확히 채웁니다. 어떤 필드가 올지 모르겠나요? 열을 비워 두세요 — AI가 문서의 정보를 자동으로 식별하여 구조화된 테이블을 생성합니다. 구조화된 데이터 대신 원본 레이아웃의 텍스트가 필요하다면, 한 번의 클릭으로 편집 가능한 Word 문서를 생성하는 Word로 파이프라인으로 전환하세요.
모든 문서에 동일한 열 스키마 — 공급업체별·형식별 설정 제로.
구조화된 데이터 다운로드 — 각 이미지는 한 행이 되고, 입력한 모든 열 이름은 열 머리글이 됩니다
각 이미지는 스프레드시트에서 한 행을 생성합니다. 열은 입력한 이름과 정확히 일치합니다 — 추측 없음, 재라벨링 없음, "찾기 및 바꾸기" 과정 없음. 특정 페이지에서 찾을 수 없는 필드는 비워 둡니다 — 배치가 실패하지 않으며 AI는 존재하지 않는 값을 만들어 내지 않습니다. XLSX, CSV 또는 JSON으로 내보낼 수 있습니다. 날짜는 추출 중에 표준화됩니다 — 파일 간 "03/15/26" vs "15-03-2026" 불일치 없음. 금액과 참조 번호는 일관된 형식으로 정리됩니다. 스프레드시트는 피벗 테이블, ERP 가져오기 또는 분석에 즉시 사용할 수 있습니다 — 수동 재포맷 없음, 원시 OCR 출력에서 복사-붙여넣기 없음, Excel의 "텍스트 나누기" 마법사 없음. 처리 속도는 페이지당 5~10초로, 동일 작업에 필요한 약 3분의 수동 데이터 입력과 비교되며, 무료 도구가 요구하는 별도의 단일 파일 OCR 출력을 병합하는 추가 단계도 필요 없습니다.
페이지당 5~10초. 표준화된 필드, 분석 준비 완료.
열 이름 지정, 이미지 업로드, 구조화된 스프레드시트 다운로드까지 전체 워크플로우는 소규모 배치의 경우 1분 안에 완료됩니다. 기존 OCR이 사용자에게 남겨두는 수동 단계 — 추출된 텍스트를 올바른 스프레드시트 셀에 복사하는 작업 — 은 추출 중에 처리되며, 이후가 아닙니다. 모든 파일은 TLS로 전송되며 처리 후 자동으로 삭제됩니다.
Vision AI OCR이 가장 효과적인 경우 — 그리고 기존 OCR이 여전히 자리 잡고 있는 경우
모든 텍스트 추출 도구가 보편적으로 작동하지는 않습니다. Vision AI OCR과 기존 OCR은 각각 다른 강점을 가지고 있습니다 — 하나는 의미를 읽고, 다른 하나는 형태를 매칭합니다. 각 접근 방식이 가장 강력한 결과를 내는 영역과 기대치를 조정해야 하는 영역을 소개합니다.
Vision AI OCR이 가장 효과적인 경우
일반 품질의 문서에서 인쇄되거나 깔끔하게 타이핑된 텍스트 — 기본 PDF부터 휴대폰 사진까지. 텍스트를 육안으로 명확히 읽을 수 있다면 Vision AI가 이를 정확히 추출하여 올바른 명명된 열에 배치합니다. 형식별 전처리 없이 모든 일반적인 이미지 형식에서 작동합니다.
다국어 문서 및 혼합 언어 배치 — 수동 언어 선택 불필요. 여러 언어 스크립트가 포함된 문서는 자동 언어 감지로 한 번에 처리됩니다. 이는 페이지 전체에 하나의 문자 맵을 적용하는 기존 OCR보다 가장 큰 장점입니다.
최종 목표가 명명된 열이 있는 구조화된 스프레드시트인 워크플로 — 원시 텍스트 블록이 아닌 경우. 최종 목표가 단순 텍스트 덤프가 아닌 레이블이 지정된 열이 있는 스프레드시트라면, Vision AI 접근 방식은 완성된 스프레드시트를 직접 제공합니다. 수동 필드 식별, 원시 텍스트에서 셀로 복사-붙여넣기, "텍스트를 열로" 마법사가 필요 없습니다.
가변 레이아웃 문서 — 소스별 템플릿 유지보수 불필요. 20개 공급업체의 인보이스, 50개 판매자의 영수증, 10가지 다른 형식의 양식 — 모두 동일한 열 정의로 처리됩니다. 소스별 템플릿을 만들 필요도 없고, 공급업체가 레이아웃을 재설계할 때 파싱 규칙을 업데이트할 필요도 없습니다.
기존 OCR이 여전히 유용한 경우
깨끗하고 고해상도이며 단일 언어로 된 단순 단일 열 레이아웃의 스캔. 단순한 문서의 경우 — 단일 글꼴, 단일 언어 책 페이지의 선명한 300 DPI 스캔 — Tesseract와 같은 기존 OCR 엔진은 매우 낮은 비용으로 거의 완벽한 결과를 제공합니다. 압축된 이미지에서 실패하는 문자 매칭 메커니즘은 깨끗한 입력에서는 설계된 대로 정확히 작동합니다. 문서가 지속적으로 고품질이고 단일 언어라면 기존 OCR도 충분히 유능한 도구입니다.
필기 비중이 높은 문서 — 특히 밀집된 필기체 — 는 두 방식 모두에서 필드 정확도를 떨어뜨립니다. 깨끗한 양식의 또박또박한 블록체 필기는 Vision AI로 90–95%의 필드 정확도를 달성합니다. 그러나 밀집된 필기체, 연한 연필 자국, 번진 주석, 퇴색한 감열지 영수증은 정확도를 75–85%까지 떨어뜨릴 수 있습니다. 필기 위주의 워크플로우에서는 어떤 도구를 사용하든 사람의 육안 검수를 예산에 포함하세요.
150 DPI 미만의 저해상도 이미지는 어떤 방식으로도 정확도를 떨어뜨립니다 — Vision AI가 더 탄력적이지만 면역은 아닙니다. 팩스 품질로 스캔한 문서, 이메일 첨부 파일의 과도하게 압축된 JPEG, 텍스트가 픽셀화된 원거리 촬영 사진은 정확도가 낮아집니다. 300 DPI로 스캔하고 텍스트가 프레임 대부분을 채우도록 하면 두 방식 모두에서 최상의 결과를 얻을 수 있습니다.
이 도구는 문서를 데이터로 추출하는 도구입니다 — ERP와 통합하거나, 결제를 처리하거나, 다운스트림 승인 워크플로우를 자동화하지 않습니다. 문서를 구조화된 Excel, CSV, JSON 또는 Word 출력으로 변환합니다. 회계 시스템, ERP 또는 AP 자동화 플랫폼과의 연결은 이러한 표준 내보내기 형식을 통해 이루어집니다. 네이티브 ERP 커넥터와 다단계 워크플로우 자동화가 필요한 조직에는 엔터프라이즈 IDP 플랫폼이 더 완전한 솔루션입니다.
자주 묻는 질문
Vision AI 텍스트 추출은 기존 OCR과 어떻게 다르며, 기존 OCR이 여전히 잘 작동하는 경우는 언제인가요?
기존 OCR은 글자 모양을 픽셀 단위로 글꼴 데이터베이스와 대조합니다. 깨끗하고 고해상도이며 단일 언어, 단일 열로 된 스캔에서는 잘 작동합니다. 이러한 이상적인 조건에서 Tesseract와 같은 도구는 저비용으로 거의 완벽한 결과를 제공합니다. 그러나 조건이 저하되면 메커니즘이 무너집니다. 압축 아티팩트가 픽셀 경계를 흐릿하게 만들어 문자 식별 오류가 발생하고, 다국어 문서는 수동으로 언어를 선택해야 하며, 다중 열 레이아웃은 텍스트 스트림이 뒤섞여 나옵니다. Vision AI는 페이지를 시각적 전체로 읽습니다. 개별 문자 픽셀을 대조하는 대신 맥락 속의 단어를 봅니다. 날짜는 형식과 관계없이 날짜로 인식되고("03/15/2026" vs "15 March 2026"), 단일 문서 내에서 언어 전환이 자동으로 이루어지며, AI가 텍스트 블록 간의 공간적 관계를 이해하므로 레이아웃 구조가 보존됩니다. 사전과 일치하지 않는 문자를 지적하는 맞춤법 검사기와 문장을 이해하고 단어가 무엇이어야 하는지 채워 넣는 독자의 차이로 생각하면 됩니다.
기존 OCR이 문자를 잘못 읽는 압축되거나 흐릿하거나 저품질의 이미지에서 텍스트를 추출할 수 있나요?
네, 가능합니다. 이것이 메커니즘 차이가 가장 중요해지는 부분입니다. 기존 OCR은 문자 모양을 대조하기 위해 깨끗한 픽셀 경계에 의존합니다. JPEG 압축, 스크린샷 축소, 사진 노이즈는 모두 이러한 경계를 흐릿하게 만들어 문자 수준의 오류를 발생시킵니다. Vision AI는 이미지를 전체적으로 읽습니다. 필드 레이블, 문서 구조, 주변 텍스트 패턴 등 전체적인 시각적 맥락을 보고 각 단어가 무엇이어야 하는지 추론하며, 각 문자를 개별적으로 대조하지 않습니다. 숫자 주변에 픽셀 노이즈가 있는 압축된 인보이스 스크린샷의 "Amount: $1,234.56"도 금융 문서의 필드 레이블 뒤에 달러 기호와 숫자가 오는 금액 의미 패턴을 인식하므로 올바르게 읽습니다. 그러나 150 DPI 미만의 매우 낮은 해상도 이미지는 어떤 접근 방식으로도 정확도가 떨어집니다. 300 DPI로 스캔하고 텍스트가 프레임을 채우도록 하는 것이 가장 좋은 결과를 만듭니다. 목표가 단순히 이미지에서 텍스트 추출이라면, 이 전체적 읽기 방식이 문자 대조가 실패하는 곳에서도 출력을 깨끗하게 유지합니다.
이 도구는 언어를 자동으로 감지하나요, 아니면 기존 OCR처럼 언어를 수동으로 선택해야 하나요?
Vision AI는 같은 페이지 내에서 언어를 자동으로 감지하므로 수동 선택이 필요 없습니다. OnlineOCR.net 같은 기존 OCR 도구는 처리 전에 언어 드롭다운에서 선택해야 합니다. OCR 엔진은 문서 전체에 하나의 문자 맵을 적용합니다. 영어 헤더와 일본어 본문이 섞인 문서는 불가능한 선택을 강요합니다. 영어를 선택하면 일본어 문자가 임의의 기호로 바뀌고, 일본어를 선택하면 영어 필드가 손상됩니다. Vision AI는 다국어 사용자가 읽는 방식으로 언어를 처리합니다. 텍스트의 시각적 형태를 식별하고 문맥을 통해 어떤 언어 체계에 속하는지 이해합니다. 주요 언어군이 기본 지원됩니다: 라틴 문자 언어, CJK(중국어, 일본어, 한국어), 아랍어, 키릴 문자. 문서에 어떤 언어가 포함되어 있는지 미리 알 필요 없이 AI가 추출 중에 감지를 처리합니다.
지원되는 이미지 형식은 무엇이며, JPG, PNG, WebP, HEIC, PDF, 스크린샷을 한 배치에 섞을 수 있나요?
모든 일반적인 이미지 형식이 지원됩니다: JPG, PNG, WebP, HEIC, PDF, 웹페이지 스크린샷. 이러한 형식은 단일 배치에서 모두 혼합할 수 있습니다. 영수증 사진, 스캔된 PDF 인보이스, 결제 확인 WebP 스크린샷, iPhone의 HEIC 이미지가 모두 같은 처리 큐에 함께 업로드됩니다. 각 이미지는 동일한 Vision AI 모델로 독립적으로 처리되므로 형식 혼합에 전처리, 분류 우선 라우팅, 파일 유형별 수동 품질 검사가 필요 없습니다. AI가 재구성된 텍스트 레이어를 거치지 않고 픽셀을 직접 읽기 때문에 모든 형식이 동일한 파이프라인으로 들어갑니다. 결과는 배치의 모든 파일을 포함하는 하나의 통합 스프레드시트 또는 Word 문서입니다.
이미지에서 특정 필드만 추출할 수 있나요? 아니면 모든 텍스트를 추출해야 하나요?
추출할 내용을 정확히 선택할 수 있습니다. 기존 OCR은 페이지의 모든 텍스트를 하나의 평평한 블록으로 제공합니다. 그런 다음 필요한 부분을 수동으로 찾아야 합니다. 여기서는 원하는 열을 지정하면 됩니다 — Date, Amount, Vendor, Reference #, Tax — AI가 각 페이지에서 해당 필드를 정확히 찾아 정의한 열만 채웁니다. 목록에 없는 필드는 무시됩니다. 2개 열만 추출하거나 20개 이상 추출할 수 있습니다. 이 기능은 같은 배치의 모든 문서 유형에서 작동합니다. 동일한 열 정의가 인보이스, 영수증, 구매 주문서, 은행 명세서에서 날짜와 금액을 유형별 설정 없이 추출합니다. 선택적 필드 추출과 전체 문서 텍스트 변환 사이에서 작업 흐름이 전환되는 경우, 인터페이스는 두 경로(구조화된 열 추출 및 레이아웃을 보존하는 전체 텍스트 출력)를 같은 도구에서 모두 지원합니다.
전체 편집 가능한 텍스트, Word 출력, 또는 구조화된 필드가 필요한지 확실하지 않다면 온라인 OCR 경로 안내에서 시작하여 출력 경로를 선택하세요.
더 읽기: OCR vs Vision AI: 언제 무엇을 선택할지 — 기존 OCR을 유지할 때와 업그레이드할 때를 결정하는 프레임워크 · Vision AI vs OCR: 레이아웃 보존 비교 — 다중 열, 테이블, 혼합 형식 문서가 OCR을 무너뜨리는 이유와 Vision AI가 처리하는 방법 · AI 손글씨 인식 vs 기존 OCR 정확도 — 인쇄체, 블록체, 필기체의 실제 벤치마크