레퍼런스
문서 AI에 대한 데이터 레퍼런스 및 용어 정의 모음입니다. 각 페이지는 출처 검증 완료되었으며 인용할 수 있도록 설계되었습니다.
통계
자사 직접 비교: SROIE 361건 + CORD 100건 영수증 대상 docTR vs Docling — 지연 시간 6.7배, 비용 8.3배, CER 3.0배, 정규식 필드 반전 2.9배. 방법론.
자체 비교: SROIE 361건 + CORD 100건 영수증 대상 docTR vs Surya2 — CER 동률, 필드 F1 4.2배 역전, 비용 22배 격차, 방법론.
자체 벤치마크: SROIE 361건 + CORD 100건 영수증 대상 EasyOCR vs docTR 비교 — docTR CER 30% 감소, LLM 필드 F1 1.66배; EasyOCR 정규식 F1 1.93배.
자체 벤치마크: RTX 4090에서 오픈소스 엔진 8종의 1,000페이지당 OCR 비용 — $0.048 (docTR) ~ $1.061 (Surya2). SROIE + CORD, 방법론 포함.
RTX 4090에서 8개 오픈소스 OCR 엔진의 페이지당 지연 시간 — p50 기준 108.7ms(docTR)~2,668ms(Surya2). p95 꼬리 지연 시간, 처리량, 방법론.
자체 비교 테스트: 영수증 인식 PaddleOCR vs EasyOCR — CER 0.204 vs 0.283, 정규식 F1 2.2배, 비용 격차 2배, LLM 역설. 방법론.
자체 벤치마크: SROIE 361건 + CORD 100건 영수증 대상 Surya2 vs Unlimited-OCR vs PaddleOCR-VL — 필드 F1, CER 공정성, 비용, 지연 시간 비교.
자체 비교 테스트: 361개 SROIE 및 100개 CORD 영수증을 대상으로 한 Tesseract(CPU)와 PaddleOCR(GPU)의 CER, 필드 F1, 처리량, 비용 및 방법론 비교.
자체 벤치마크: 361개 SROIE + 100개 CORD 영수증에 대해 오픈소스 OCR 엔진 8종과 문서 파싱 VLM을 비교 — CER, 필드 F1, 레이턴시, 비용. 방법론 포함.
VLM CER이 부풀려지는 이유: 대소문자 통합과 정답 구조가 가상의 오류를 추가합니다. 자체 SROIE + CORD 데이터 — 필드 F1이 공정한 교차 계열 지표입니다.
자체 벤치마크: 영수증 필드 추출에서 LLM 후처리가 regex를 능가, SROIE + CORD 기준 8개 OCR 모델의 필드 F1 및 방법론 포함.
461장의 영수증(SROIE + CORD)에 대한 5개 오픈소스 OCR 모델의 자체 벤치마크: CER, WER, 필드 F1, 지연 시간, 1,000페이지당 비용.
문서 자동화의 예외 발생률: 최고 수준 9% vs 평균 22%, 근본 원인, 검토 비용, 임계값 트레이드오프 — 모든 출처 인용 포함.
문서 처리 비용에 대한 독립 벤치마크: 수작업 $8-16, 템플릿 $2-5, AI는 페이지당 $0.02부터. 문서 유형, 크기, 지역별 비교.
필기 OCR 정확도 데이터: IAM CER 1.2-1.7%, 아랍어 8.9-16%, 역사적 문서 71-82%. 문자 체계, 모델 및 문서 유형별 분석. 인용 가능한 출처 15개.
인보이스 처리 시간 벤치마크: 수동 터치 12.5분 대 사이클 9.2일, 방법·복잡도·단계별 비교 — 인용을 위한 전체 출처 포함.
데이터 입력 자동화 ROI에 대한 독립 벤치마크: 3~12개월 투자 회수 기간, 60~80% 절감, 손익분기 물량, 그리고 수익을 모델링하는 공식 제공.
문서 유형별 OCR 정확도에 대한 독립 벤치마크: 디지털 PDF 99.2-99.8%, 스캔 98-99%, 필기 46-95%, 표 TEDS. 인용 가능한 출처 15개.
영수증 OCR 정확도를 상태 및 필드별로 분석: 깨끗한 스캔 90% 이상, 바랜 감열지 55-73%, 휴대폰 촬영 67-69%. 총액 95-99%, 판매자명 73-88%. 출처 14곳.
수동 데이터 입력 오류율에 대한 독립 벤치마크: 필드 수준 1-4%, 레코드 수준 최대 40%, 문서 유형, 산업 및 직무별 분석.
정의
데이터 캡처는 종이, 스캔, PDF, 사진을 기계가 읽을 수 있는 데이터로 변환합니다. 작동 방식, 유형, 오해에 대해 알아봅니다.
ICR은 손으로 인쇄된 텍스트를 위한 머신러닝 문자 인식 기술입니다. OCR에서 어떻게 발전했는지, ICR과 OCR 및 IWR의 차이점, 그리고 어디에 사용되는지 알아보세요.
키 정보 추출(KIE)은 문서에서 인보이스 번호와 날짜 같은 필드를 구조화된 데이터로 추출합니다. 작동 방식, 경계, 오해에 대해 다룹니다.
검색 가능한 PDF는 보이지 않는 OCR 텍스트 레이어가 포함된 스캔 문서로, 텍스트를 선택·복사하고 Ctrl+F로 검색할 수 있습니다. 작동 방식, PDF/A 규칙, 일반적인 함정을 다룹니다.
필드 단위 정확도는 올바르게 추출된 필드를 세고, 문자 단위 정확도는 올바르게 읽힌 문자를 셉니다. 문자 정확도 99%가 데이터 정확도 99%를 의미하지는 않습니다.
IDP는 문서에서 데이터를 캡처, 분류, 추출, 검증하는 AI 소프트웨어입니다. 작동 방식, OCR에서 LLM으로의 진화, 오해에 대해 알아봅니다.
STP 비율은 사람의 개입 없이 처리된 문서의 비율을 측정합니다 — 업계 평균 32%, 최고 수준 49%, AI 60-80%. 공식과 오해를 다룹니다.
OCR은 인쇄, 필기, 또는 타자된 텍스트의 이미지를 기계가 읽을 수 있는 데이터로 변환합니다. 작동 방식, OCR의 4가지 유형, 역사, 그리고 사용 사례를 다룹니다.