Surya2 vs Unlimited-OCR vs PaddleOCR-VL:영수증 VLM 벤치마크 (2026)

최종 검토: 2026-08-18 · 실행 등급: 공식 · 자체 3사 VLM 벤치마크 · 엔진 3개 × 영수증 데이터셋 2개

이 페이지에서 다루는 내용: 기본 8개 엔진 벤치마크에 포함된 세 가지 문서 파싱 VLM의 자체적이고 재현 가능한 3사 비교 — Surya2(surya-ocr 0.22.1, 650M), Unlimited-OCR(vLLM 서빙), PaddleOCR-VL(1.6, 0.9B) — 을 두 개의 영수증 데이터셋에서 수행합니다: SROIE 2019 영어 영수증 및 CORD v2 인도네시아어 영수증. 엔진별 비교 지표: 문자 오류율(CER), 단어 오류율(WER), 두 가지 후처리 방식에서의 필드 추출 F1 점수, p50/p95 지연 시간, 분당 페이지 수, 페이지 1,000장당 비용. 모든 수치는 공개 OCR 벤치마크 저장소(ImageToTableai/benchmark-ocr)에 게시된 CSV 행에서 비롯됩니다 — 제3자 보고서의 집계가 아닌 재현 가능한 실험 데이터입니다.
이 페이지에서 다루지 않는 내용: 영수증 이외의 모든 문서 유형 — 표, 양식, 청구서, 계약서, 장문 문서는 제외됩니다. 세 엔진의 마케팅 강점은 여기서 측정하지 않습니다. 클라우드/API OCR 서비스, 기본 실행의 나머지 5개 엔진, 파인튜닝 모델은 범위에서 제외됩니다. 전체 8개 엔진 종합 비교는 텍스트 엔진 대 문서 이해 모델에서 확인할 수 있습니다.

이 페이지의 모든 수치 범위: 영수증, 단일 GPU 티어, 2026년 8월 모델 버전. 이 결과를 청구서, 표, 복잡한 레이아웃에 확대 적용하지 마십시오 — 벤치마크는 영수증 OCR 및 영수증 필드 추출만 측정합니다. 모든 수치는 벤치마크의 results/summary_metrics.csv 및 results/field_method_comparison.csv에서 비롯되며, 공개 GitHub 저장소에 미러링되어 행 단위로 인용됩니다.

세 개의 문서 파싱 VLM이 동일한 361장의 영어 영수증을 읽었으며, 원시 문자 오류율(CER)은 3.4배 차이를 보였습니다 — SROIE 2019 CER 0.1915(Surya2) 대 0.6552(Unlimited-OCR), PaddleOCR-VL은 중간인 0.3370을 기록했습니다. 이 격차는 주로 출력 규약의 차이이지, 읽기 능력의 차이가 아닙니다: VLM은 대소문자를 통합하고, 라벨/값 줄을 병합하며, 텍스트를 재정렬하는데, CER은 이러한 정규화 각각을 오류로 집계합니다. 세 엔진을 실제 출력이 목표로 하는 지표 — 필드 추출 — 에 적용하면 격차는 급격히 줄어듭니다: 기본 정규식 필드 F1 점수는 세 엔진 모두 0.3183–0.3376 범위였으며, LLM 후처리기가 텍스트를 읽은 후에는 0.5921–0.6139로 수렴했습니다. 세 엔진이 진정으로 차별화되는 지점은 인도네시아 영수증과 운영 환경입니다.

두 숫자로 요약되는 트레이드오프: PaddleOCR-VL은 영수증 페이지를 694.3 ms p50으로 읽고 1,000페이지당 $0.205의 비용이 듭니다; Surya2는 2,668.0 ms p50으로 읽고 1,000페이지당 $1.061의 비용이 듭니다 — 동일한 영수증, 동일한 테스트 분할, 동일한 RTX 4090 기준입니다. 세 엔진 중 가장 저렴하고 가장 느린 엔진이 같은 머신이며, 영수증에서 문자 수준 "품질" 선두주자가 실행 비용이 가장 높습니다. 세 엔진 중 어느 것도 모든 곳에서 "승리"하지 않습니다; 이 페이지의 목적은 벤치마크의 각 축이 어떻게 필드를 나누는지 보여주는 것입니다.

3.4배
SROIE 2019에서 세 VLM 간 원시 CER 격차(0.1915 → 0.6552) — 주로 출력 규약에 의한 것이지 읽기 능력의 차이가 아님
0.3412
PaddleOCR-VL의 CORD 정규식 필드 F1 — 벤치마크 내 8개 엔진 중 최고이며, LLM 도움 없이 인도네시아 영수증 필드를 유용한 수준으로 추출하는 유일한 엔진
$0.205 vs $1.061
PaddleOCR-VL의 1,000페이지당 비용 대 Surya2의 비용 — 동일한 RTX 4090에서 5.2배 저렴하고 3.8배 빠름(694.3 vs 2,668.0 ms p50)(summary_metrics.csv, cost_per_1000_pages / latency_p50_ms, sroie_2019 행)

세 엔진 모두 문서 파싱 VLM입니다. 문서 이미지 전체를 읽고 이해된 텍스트를 출력하는 신경망 모델로, 대소문자를 통일하고 라벨/값 쌍을 한 줄로 병합하며 행을 읽기 순서대로 재배열합니다. 반면 기존 OCR 엔진은 원래 대소문자를 유지한 원시 문자 스트림을 반환합니다. 이러한 출력 방식 덕분에 이들의 필드 추출 수치는 기본 상태에서도 우수하지만, 원시 문자 오류율 수치는 오해를 불러일으키며, 이는 다음 섹션에서 확인할 수 있습니다. VLM 계열 내에서도 세 모델은 크기와 학습 목표에서 뚜렷이 구분됩니다: Surya2는 6억 5천만 파라미터 규모의 텍스트 중심 모델로, 깨끗한 전체 페이지 전사에 특화되어 있습니다. PaddleOCR-VL은 0.9B 규모의 컴팩트한 범용 모델로, 언어·표·수식 전반에 걸친 폭넓은 적용을 목표로 합니다. Unlimited-OCR은 장문 문서 및 일괄 파싱에 특화되어 있으며, 모든 CER 수치에 적용되는 중요한 주의사항이 있습니다: 문자 오류율(CER)은 정답 문자 대비 삽입·삭제·치환을 집계하므로, VLM이 수행하도록 훈련된 정규화를 정확히 불이익으로 반영합니다. 필드 수준 F1 점수가 VLM 간 비교에 더 공정한 기준이며, 이 페이지의 핵심 지표입니다.

VLM에 CER을 사용하지 않는 이유: 3.4배 격차는 출력 방식의 차이이지 읽기 능력의 차이가 아닙니다

원시 CER 수치만 보면 Unlimited-OCR은 실패한 모델처럼 보이고 Surya2는 세계적 수준처럼 보입니다. 두 해석 모두 출력 스타일의 산물입니다. CER 0.6552를 기록한 동일한 Unlimited-OCR 텍스트는 WER 0.4779를 기록합니다. 단어는 살아남지만 문자가 손상된 것처럼 보이는 이유는 대소문자 통일이 단어를 깨지 않으면서 문자를 대체하기 때문입니다. PaddleOCR-VL의 수치는 이 패턴을 뒤집습니다. CORD CER 1.0805는 8개 엔진 중 최악이지만 CORD 필드 F1 0.3412는 8개 엔진 중 최고입니다 — 벤치마크 자체의 CSV가 CER 순위를 반박합니다.

그 메커니즘은 두 층으로 구성됩니다. 1층 — 정규화 비용: 문서 파싱 VLM은 “이해된” 텍스트를 출력합니다 — TAN CHAY YEE는 tan chay yee가 되고, INVOICE NO : PEGIV는 라벨과 값을 한 줄로 병합합니다. CER은 정확한 문자 일치 방식이므로, 접힌 대소문자와 병합된 줄은 필드 값이 정확하더라도 모두 오류로 집계됩니다. 공개된 SROIE 예측값에 대한 벤치마크의 오류 분해 분석에 따르면, 원시 CER 예산의 약 5분의 1은 대소문자 치환, 약 10분의 1은 줄 병합/누락에 기인합니다. 세 엔진은 이 비용을 서로 다른 비율로 부담합니다 — Unlimited-OCR의 과도한 대소문자 통일은 CER을 WER보다 훨씬 크게 부풀리는 반면, PaddleOCR-VL의 줄/라벨 병합은 WER(0.6462)을 자체 CER(0.3370)보다 높게 만듭니다. 2층 — CORD의 정답 구조 인플레이션: CORD의 정답 텍스트에는 주석 구조가 포함되어 있어, 실제 언어 불일치에 더해 모든 엔진의 CER이 체계적으로 부풀려집니다 — 전체 엔진의 CORD CER 클러스터 0.90–1.08은 이러한 인플레이션이 특정 모델의 문제가 아니라 말뭉치 전반에 걸친 현상임을 확인시켜 줍니다.

지표 (SROIE 2019, n=361)Surya2Unlimited-OCRPaddleOCR-VL출처
문자 오류율(CER)0.19150.65520.3370summary_metrics.csv · cer, surya2/unlimited_ocr/paddleocr_vl_vllm sroie_2019 행
단어 오류율(WER)0.27350.47790.6462summary_metrics.csv · wer, 동일 행

표: summary_metrics.csv — cer 및 wer 열, sroie_2019 행. 정확한 값: Surya2 cer 0.19147 / wer 0.27352; Unlimited-OCR cer 0.65524 / wer 0.47788; PaddleOCR-VL cer 0.33696 / wer 0.64623. 낮을수록 우수하며, 세 실행 모두 error_rate 0.0으로 완료되었습니다. CER 기준으로 VLM 순위를 매기지 마십시오: Unlimited-OCR의 CER/WER 괴리와 PaddleOCR-VL의 CORD CER-대-필드 F1 역전은 이 벤치마크 프로토콜이 VLM 행에 대해 지적하는 바로 그 출력 규약 아티팩트입니다.

레이어 1과 2의 결과로, 이 페이지의 나머지 모든 섹션은 세 VLM을 필드 추출 F1과 운영 범위 기준으로 비교하며, CER은 해당 주의 사항과 함께만 인용합니다. 이는 문서 파싱 VLM 행에 대한 벤치마크의 프로토콜 규칙이며, 올바른 관점입니다. 영수증 파이프라인은 문자 스트림이 아닌 필드를 소비합니다.

기본 제공 필드 추출: 구조화된 출력은 VLM 제품군의 특징

각 엔진의 원시 텍스트를 SROIE 영수증의 네 가지 필드에 대해 동일한 고정 정규식 패턴으로 실행합니다. 이는 전통적인 OCR + 규칙 기반 핵심 정보 추출(KIE) 방식입니다. 세 가지 VLM은 0.02포인트 차이 내에 위치합니다: Unlimited-OCR 0.3376, PaddleOCR-VL 0.3368, Surya2 0.3183. 세 모델 모두 8개 엔진 실행에서 상위 4위 안에 들었으며, 그중 두 모델은 최고의 전통 엔진을 능가했고, 나머지 하나는 0.007포인트 차이로 뒤처졌습니다. 이들의 "이해된 텍스트"는 LLM 후처리기 없이도 필드 소비자에게 도달합니다. 이는 원시 문자 OCR 엔진에는 없는 제품군의 특징입니다.

필드 값 F1은 추출된 필드 값의 정밀도와 재현율에 대한 조화 평균으로, 정답과 비교합니다: 1.0은 모든 영수증 필드가 완벽하게 복구되었음을 의미하고, 0은 아무것도 복구되지 않았음을 의미합니다. VLM 제품군의 우위 뒤에 있는 메커니즘은 위에서 설명한 출력 형태입니다. CER을 높이는 동일한 대소문자 통일, 레이블 구조화 텍스트가 추출 패턴과 우연히 일치합니다. "정규식 필드 추출" 열은 벤치마크의 postprocessed_sroie_receipt_regex_* 메트릭입니다. 이는 OCR 텍스트 + 다운스트림 규칙 기반 추출을 측정하며, 기본 구조화된 출력이 아닙니다. 동일한 패턴 세트가 모든 엔진에 적용되었습니다. 대조적으로, 전통 엔진의 정규식 필드 F1은 docTR 0.0766, EasyOCR 0.1477, Docling 0.2237, Tesseract 0.2335입니다. VLM이 아닌 7개 엔진 중 6개가 세 모델 중 최하위 모델보다 낮습니다.

SROIE 2019 필드 F1을 후처리 방법별로 비교: 정규식 패턴을 통한 세 VLM은 Surya2 31.8%, Unlimited-OCR 33.8%, PaddleOCR-VL 33.7%입니다. LLM 후처리(deepseek-v4-flash)를 통해서는 61.4%, 60.5%, 59.2%로 수렴합니다.

출처: field_method_comparison.csv — regex_field_value_f1 / llm_field_value_f1 열, sroie_2019 행. LLM 후처리기: deepseek-v4-flash. 엔진당 361개 샘플(llm_ok_count).

정규식 후처리(SROIE 2019, n=361)Surya2Unlimited-OCRPaddleOCR-VL출처
필드 값 F10.31830.33760.3368field_method_comparison.csv · regex_field_value_f1, surya2/unlimited_ocr/paddleocr_vl_vllm sroie_2019 행
필드 값 정확도0.29990.30890.3102field_method_comparison.csv · regex_field_value_accuracy, 동일 행
문서 필드 완전 일치0.01940.00280.0028field_method_comparison.csv · regex_document_fields_exact, 동일 행

표: field_method_comparison.csv — 정규식 열, sroie_2019 행. 이는 postprocessed_sroie_receipt_regex_* 지표입니다. 각 엔진의 OCR 텍스트에 고정 패턴을 적용한 결과입니다. Surya2의 0.3183은 세 엔진 중 가장 낮지만, 여덟 엔진 중 네 번째 순위이며 최고 전통 엔진보다 0.007 낮습니다.

LLM 지렛대: 세 엔진의 수렴

세 엔진의 OCR 텍스트를 구조화 추출 프롬프트와 함께 LLM 후처리기에 입력하면, 기본 성능 격차는 거의 동률로 좁혀집니다: Surya2 0.6139, Unlimited-OCR 0.6054, PaddleOCR-VL 0.5921 — 0.022포인트 차이로, 건강한 엔진의 벤치마크 수렴 구간(0.57~0.62)에 완전히 포함됩니다. 이제 결정적 구성 요소는 VLM이 아니라 후처리기입니다.

이는 전체 8개 엔진 실행에서 나타나는 것과 동일한 수렴 패턴입니다: LLM은 문자 형태를 대조하는 대신 의미를 이해하므로, 작업에 충분히 읽을 수 있는 텍스트라면 업스트림 텍스트 품질의 대부분 차이를 흡수합니다. 세 VLM 모두 이 조건을 충족하며, 모두 수렴 구간 안에 들어옵니다. 이 지렛대에는 비용이 따릅니다: LLM 호출은 문서당 OCR 시간에 더해 중앙값 대기 시간 약 1.9~2.3초를 추가합니다. 이는 동기식 페이지별 대기보다 비동기 일괄 처리를 선호하게 만듭니다. 문서 수준 정확도 — 네 필드가 모두 일치한 영수증의 비율 — 는 세 엔진 모두 낮게 유지되며(0.1219~0.1551), 필드별 F1 점수가 실질적인 운영 지표임을 상기시킵니다.

LLM 후처리 (SROIE 2019, n=361)Surya2Unlimited-OCRPaddleOCR-VL출처
필드값 F1 점수 (LLM)0.61390.60540.5921field_method_comparison.csv · llm_field_value_f1, surya2/unlimited_ocr/paddleocr_vl_vllm sroie_2019 행
필드값 정확도 (LLM)0.61360.60460.5852field_method_comparison.csv · llm_field_value_accuracy, 동일 행
문서 필드 완전 일치 (LLM)0.15510.13020.1219field_method_comparison.csv · llm_document_fields_exact, 동일 행
LLM 중앙값 대기 시간 (ms)2,261.71,982.01,946.7field_method_comparison.csv · llm_median_latency_ms, 동일 행

표: field_method_comparison.csv — llm_* 열, sroie_2019 행. LLM 모델: 온도 0의 deepseek-v4-flash. LLM 대기 시간은 API에서 발생하며 엔진 대기 시간(summary_metrics.csv latency_p50_ms)과 별개입니다.

CORD: 컴팩트 제너럴리스트의 승리

CORD v2는 이 벤치마크의 교차 언어 스트레스 테스트이며, 세 VLM이 실제로 차별화되는 지점입니다. 동일한 영어 형식의 정규식 패턴을 통해 PaddleOCR-VL은 인도네시아 영수증 필드를 0.3412 필드 F1로 추출합니다 — 전체 벤치마크의 8개 엔진 중 최고 수치 — 반면 Surya2는 0.2458, Unlimited-OCR은 0.1079에 그칩니다. 컴팩트 제너럴리스트의 학습 폭은 텍스트 중심 및 장문 문서 모델이 뒤처지는 지점을 정확히 보여줍니다.

모든 CORD CER 값은 벤치마크 프로토콜에 따라 격리되며 어떤 SROIE 순위에도 병합되지 않습니다. CORD의 정답 데이터에는 주석 구조가 포함되어 있어, 정규식 패턴은 영어 형식에 맞춰 작성되었습니다. 아래 CORD 비교는 필드 메트릭만 포함합니다. LLM 후처리기 하에서는 SROIE에서와 마찬가지로 언어 충격이 흡수됩니다. 세 모델은 0.4678~0.5203 필드 F1로 다시 수렴합니다(Surya2 0.5203, PaddleOCR-VL 0.5198, Unlimited-OCR 0.4678) — 교차 언어의 무거운 작업은 엔진이 아닌 후처리기가 수행합니다.

엔진별 CORD v2 정규식 필드 F1: PaddleOCR-VL 34.1% — 벤치마크의 8개 엔진 중 최고 — vs Surya2 24.6%, Unlimited-OCR 10.8%. 필드 메트릭만 포함하며, CORD CER은 프로토콜에 따라 격리됩니다.

출처: summary_metrics.csv — field_f1_regex 열, cord_v2 행. PaddleOCR-VL 0.3412은 파일의 16개 행 전체에서 최대 field_f1_regex입니다. CORD 정규식에서 다음으로 좋은 값은 Surya2 0.2458입니다.

CORD v2, 인도네시아 영수증(n=100)Surya2Unlimited-OCRPaddleOCR-VL출처
필드 값 F10.24580.10790.3412summary_metrics.csv · field_f1_regex, surya2/unlimited_ocr/paddleocr_vl_vllm cord_v2 행
필드 값 F1(LLM)0.52030.46780.5198field_method_comparison.csv · llm_field_value_f1, 동일 행
문자 오류율(CER) — 격리됨0.89590.92241.0805summary_metrics.csv · cer, 동일 행

표: summary_metrics.csv (field_f1_regex / cer) 및 field_method_comparison.csv (llm_field_value_f1), cord_v2 행. CORD 수치를 SROIE 순위에 병합하지 마십시오: CORD CER은 실제 언어 불일치와 정답 데이터의 주석 구조 팽창이 결합된 것입니다. PaddleOCR-VL의 CER 1.0805는 8개 엔진 중 가장 높은데, 이는 정규화된 깨끗한 출력이 CORD의 구조 중심 정답 데이터와 가장 멀리 떨어져 있기 때문입니다 — 반면 정규식 필드 F1은 벤치마크 최고입니다.

운영 범위: 3.8배 지연 시간, 5.2배 비용

필드 정확도는 수렴하지만 운영 비용은 그렇지 않습니다. 동일한 RTX 4090에서 동일한 기록된 $0.76/시간 요금으로 PaddleOCR-VL은 페이지당 694.3 ms p50으로 분당 68.2페이지를 처리하며 1,000페이지당 $0.205가 소요됩니다. Unlimited-OCR은 중간 범위로 분당 34.4페이지, 1,600.7 ms p50, 1,000페이지당 $0.388입니다. Surya2는 가격 및 지연 시간 측면에서 예외로 분당 12.1페이지, 2,668.0 ms p50, 1,000페이지당 $1.061입니다. 가장 빠른 VLM은 동일한 하드웨어에서 가장 느린 모델보다 3.8배 빠르고 5.2배 저렴합니다.

비용은 벽시계 실행 시간 × RunPod RTX 4090 요금으로 계산되며, 모델 초기화를 포함합니다 — GPU 시간에 대해 실제로 지불하게 될 가격입니다. 처리량은 동일한 초기화를 포함한 벽시계 기준 분당 페이지 수입니다. 지연 시간 p50/p95는 워밍 후 점수화 방식으로 측정된 정상 상태의 페이지당 추론 시간입니다. Surya2의 꼬리 지연 시간은 비례적으로 더 나쁩니다 — PaddleOCR-VL의 1,154.3 ms p95 대비 5,872.2 ms p95 — 이는 VLM 프리필/디코드 급증이 첫 페이지의 꼬리 지연 시간을 지배하기 때문입니다. 서로 대조하기보다 함께 읽어야 할 두 가지 수치: PaddleOCR-VL은 p50이 가장 낮지만 CORD에서 Unlimited-OCR의 벽시계 처리량에 추월당합니다 — 벽시계 수치에는 모델 초기화가 포함되며, Unlimited-OCR의 vLLM 배치 처리는 순서를 뒤집을 만큼 효율적입니다.

SROIE 2019의 페이지당 중앙값 지연 시간(p50, ms): PaddleOCR-VL 694.3 ms, Unlimited-OCR 1,600.7 ms, Surya2 2,668.0 ms — 가장 빠른 모델과 가장 느린 모델 간 3.8배 차이. 정상 상태, 워밍 후 점수화.

출처: summary_metrics.csv — latency_p50_ms 열, sroie_2019 행. Surya2 2667.9800, Unlimited-OCR 1600.7459, PaddleOCR-VL 694.2519. 정상 상태 지연 시간.

SROIE 2019의 1,000페이지당 비용: PaddleOCR-VL $0.205, Unlimited-OCR $0.388, Surya2 $1.061 — 5.2배 차이. 비용에는 모델 초기화가 포함됩니다. 아래 표에 정확한 값이 있습니다.

출처: summary_metrics.csv — cost_per_1000_pages 열, sroie_2019 행. Surya2 1.0609, Unlimited-OCR 0.3879, PaddleOCR-VL 0.2048. 비용 = 벽시계 실행 시간 × $0.76/시간, 가격은 실행 매니페스트에 타임스탬프로 기록됨.

운영 범위(SROIE 2019, n=361)Surya2Unlimited-OCRPaddleOCR-VL출처
지연 시간 p50 (ms)2,668.01,600.7694.3summary_metrics.csv · latency_p50_ms, surya2/unlimited_ocr/paddleocr_vl_vllm sroie_2019 행
지연 시간 p95 (ms)5,872.22,521.91,154.3summary_metrics.csv · latency_p95_ms, 동일 행
분당 페이지 수12.134.468.2summary_metrics.csv · pages_per_minute, 동일 행
1,000페이지당 비용$1.061$0.388$0.205summary_metrics.csv · cost_per_1000_pages, 동일 행

표: summary_metrics.csv — latency_p50_ms / latency_p95_ms / pages_per_minute / cost_per_1000_pages, sroie_2019 행. 세 엔진 모두 GPU; 비용에는 모델 초기화가 포함되며, 순수 정상 상태 처리량이 아님. 정확한 값: Surya2 p50 2668.0 / p95 5872.2 / 12.1 pg/min / $1.0609; Unlimited-OCR p50 1600.7 / p95 2521.9 / 34.4 pg/min / $0.3879; PaddleOCR-VL p50 694.3 / p95 1154.3 / 68.2 pg/min / $0.2048.

누가 언제 승자인가: 요약 그리드

“더 나은” 것은 작업 부하에 따라 달라지며, 이 세 VLM 간의 축은 명확히 갈립니다: 필드 정확도는 수렴하고, 원시 문자 텍스트는 Surya2에 유리하며, 교차 언어 필드는 PaddleOCR-VL에 유리하고, 모든 비용/지연 시간/처리량 축은 PaddleOCR-VL에 유리하며 Unlimited-OCR은 중간에 있습니다. 솔직한 결론은 영수증의 경우, 파이프라인에 어떤 후처리기가 있든 VLM 선택은 거의 중요하지 않다는 것입니다 — 그리고 후처리기가 없으면, 저렴한 소형 범용 모델이 일반적으로 중요한 축에서 값비싼 전문 모델을 능가합니다.

깨끗한 영어 원시 텍스트 CER — Surya2
0.1915 vs 0.3370 vs 0.6552
SROIE CER, 8개 엔진 실행에서 최고의 원시 문자 정확도를 위해 기존 docTR(0.1971)과 동률 — PaddleOCR-VL 대비 3.8배의 지연 시간을 대가로.
자체 교차 언어 필드 — PaddleOCR-VL
0.3412 정규식 F1 (CORD)
벤치마크의 8개 엔진 중 가장 높은 CORD 정규식 필드 F1 — LLM 도움 없이 유용한 수준으로 인도네시아 영수증 필드를 추출하는 유일한 엔진; 다음으로 좋은 것은 0.2458의 Surya2.
기본 SROIE 필드 F1 — 동률
0.3183 – 0.3376
세 엔진 간 정규식 후처리 필드 F1 대역 — 0.02포인트, 세 엔진 모두 8개 엔진 중 상위 4위 안에 듦; 두 엔진은 최고의 기존 엔진(PaddleOCR 0.3254)을 능가하고, Surya2는 0.007 차이로 뒤처짐.
LLM 후처리기 사용 시 — 동률
0.5921 – 0.6139
SROIE에서 LLM 후처리(deepseek-v4-flash) 필드 F1 — 벤치마크의 0.57–0.62 수렴 대역 내 0.022포인트 차이; 이제는 VLM이 아니라 후처리기가 결정함.
가장 저렴하고 빠른 VLM — PaddleOCR-VL
694.3 ms · $0.205
SROIE에서 세 엔진 중 가장 낮은 p50 지연 시간과 1,000페이지당 가장 낮은 비용 — 동일한 RTX 4090에서 $0.76/hr 기준 Surya2보다 3.8배 빠르고 5.2배 저렴.
중간 규모 균형 — Unlimited-OCR
1,600.7 ms · $0.388
중간 범위 작동 지점으로 세 엔진 중 최고의 기본 SROIE 필드 F1(0.3376) 제공 — 어느 극단도 필요하지 않을 때 합리적인 기본값.

자주 묻는 질문

영수증 문서 파싱에 가장 정확한 VLM은 무엇입니까?

필드 추출의 경우, 영어 영수증에서는 3개 엔진이 거의 동률입니다: Surya2, Unlimited-OCR, PaddleOCR-VL 전반에 걸쳐 SROIE 정규식 필드 F1 점수 0.3183–0.3376, LLM 필드 F1 점수 0.5921–0.6139입니다. 인도네시아 영수증의 경우 결과는 달라집니다: PaddleOCR-VL의 CORD 정규식 필드 F1 점수 0.3412는 벤치마크의 8개 엔진 중 최고입니다. 원시 CER은 VLM 순위를 매기는 데 사용해서는 안 됩니다. 이는 출력 규칙을 오류로 계산하기 때문입니다.

Unlimited-OCR이 SROIE에서 최악의 CER을 보이면서도 최고의 정규식 필드 F1 점수를 기록하는 이유는 무엇입니까?

두 지표가 서로 다른 출력을 평가하기 때문입니다. Unlimited-OCR의 과도한 대소문자 변환은 문자 수준 오류를 부풀립니다. CER 0.6552 대 WER 0.4779가 그 증거입니다. 반면, 동일한 정규화된 텍스트는 다른 어떤 엔진보다 고정 추출 패턴과 더 잘 일치합니다: SROIE 정규식 필드 F1 점수 0.3376으로 8개 엔진 실행 중 최고치입니다.

PaddleOCR-VL의 CORD CER이 벤치마크에서 최악인데 CORD 필드 F1 점수가 최고인 이유는 무엇입니까?

CORD의 정답 데이터에 주석 구조가 포함되어 있고 PaddleOCR-VL의 출력이 가장 깔끔하고 정규화되어 있기 때문입니다. 즉, 구조가 포함된 텍스트와 가장 멀리 떨어져 있어 편집 거리가 가장 큽니다(CER(문자 오류율) 1.0805). 동일한 출력 스타일이 추출 패턴에 잘 맞습니다: CORD 정규식 필드 F1 점수 0.3412로 8개 엔진 중 최고입니다. 이러한 역전 현상은 CORD CER이 모델별 품질 판독값이 아님을 보여주는 벤치마크 자체의 증명입니다.

PaddleOCR-VL은 Surya2보다 얼마나 빠르고 저렴합니까?

3.8배 낮은 p50 지연 시간, 5.6배 높은 처리량, 5.2배 낮은 1,000페이지당 비용을 동일한 RTX 4090에서 시간당 $0.76으로 측정했습니다.

LLM 후처리기를 추가하면 세 VLM의 성능이 동일해집니까?

거의 그렇습니다 — SROIE에서 LLM 필드 F1 점수 0.5921~0.6139, 벤치마크의 0.57~0.62 수렴 범위 내 0.022포인트 차이입니다. 이 수렴의 비용은 문서당 약 1.9~2.3초의 추가 중앙 LLM 지연 시간이며, 이는 비동기 일괄 처리를 선호합니다.

영수증 파이프라인은 세 VLM 중 어떤 것을 선택해야 합니까?

파이프라인이 소비하는 축에 따라 다릅니다. 후처리기 없는 기본 교차 언어 필드의 경우 PaddleOCR-VL의 CORD 정규식 F1(0.3412)이 측정된 유일한 유용한 수준입니다. 가장 저렴하고 빠른 VLM 서빙의 경우에도 PaddleOCR-VL입니다. 비용과 지연 시간이 제약이 아닐 때 깨끗한 원본 영어 텍스트의 경우 Surya2의 CER(0.1915)이 가장 강력합니다. 중간 규모의 균형 잡힌 지점의 경우 Unlimited-OCR입니다. 파이프라인에 LLM 후처리기가 있으면 영수증에서 선택의 중요성은 거의 없습니다 — 세 모델 모두 수렴 범위에 속합니다. 이러한 결과는 2026년 8월에 하나의 GPU 계층에서 영어 및 인도네시아어 영수증에 대해 유효합니다. 프로덕션 결정은 대상 코퍼스에서 다시 실행해야 합니다.

이 페이지의 숫자는 어디서 왔나요?

모든 수치는 자사 벤치마크의 공개 CSV 행입니다 — results/summary_metrics.csv 및 results/field_method_comparison.csv — ImageToTableai/benchmark-ocr에 호스팅되어 있으며, 각 실행마다 환경 지문을 위해 편집된 manifest.json 하나가 포함됩니다. 데이터셋 정의는 아래에 인용된 SROIE 2019 및 CORD 논문에서 비롯됩니다.

방법론 및 출처

프로토콜

이 페이지는 독립적이고 재현 가능한 벤치마크 실행의 세 가지 비교 결과를 보고합니다 — 제3자 주장의 조사도, 공급업체 비교 페이지도 아닙니다. 고정 테스트 분할만 사용: SROIE 2019 테스트 및 CORD v2 테스트; 학습 분할은 평가하지 않았습니다. 세 엔진 모두 동일한 이미지, 동일한 정답, 동일한 측정 프로토콜을 사용했습니다. 세 실행 모두 error_rate 0.0으로 완료되었습니다. 기본 실행에는 총 8개 엔진이 포함되며, 이 페이지는 명명된 세 VLM만 비교하고, 전체 8개 엔진 결과는 Traditional OCR vs Document Parsing VLMs에 별도로 게시됩니다.

런타임 환경

  • 하드웨어: 세 엔진 모두 동일한 NVIDIA RTX 4090(24GB)에서 실행; GPU 비용은 RunPod 온디맨드 요금 $0.76/hr로 계산되며, 가격은 각 실행의 편집된 manifest에 타임스탬프로 기록됩니다.
  • 엔진: 기본 상태, 파인튜닝 없음. 버전 고정: Surya2 (surya-ocr 0.22.1) 및 PaddleOCR-VL 1.6, 둘 다 vLLM 서빙; Unlimited-OCR은 공개적으로 고정된 버전 없이 vLLM 서빙 — 공개 저장소 모델 테이블(README.md) 및 실행 manifest 기준.
  • LLM 후처리기: 결정적 출력을 위해 온도 0으로 API를 통한 deepseek-v4-flash; 세 엔진 모두의 모든 LLM 필드 행에 사용된 단일 모델입니다.
  • 비용 기준: 벽시계 실행 시간 × $0.76/hr, 모델 초기화 포함 — 배치 처리는 페이지당 비용을 낮춥니다.
  • 필드 후처리: SROIE 정규식 필드 메트릭은 postprocessed_sroie_receipt_regex_* — 고정 패턴 세트로 OCR 텍스트에서 추출된 필드입니다. 이는 어떤 모델의 기본 구조화 출력이 아닌 OCR + 다운스트림 추출을 측정합니다. LLM_* 열은 OCR 텍스트 + LLM 추출을 측정합니다. 두 파이프라인은 절대 혼합되지 않습니다.

지표 정의

  • CER: OCR 텍스트와 정답 간의 편집 거리를 정답 문자 수로 나눈 값입니다. 낮을수록 좋습니다. 문서 파싱 VLM에 불리합니다: 대/소문자 구분, 라벨/값 병합, 줄 순서 변경을 필드 값이 정확하더라도 오류로 간주합니다. 이 페이지에서는 한계점과 함께만 제시합니다.
  • WER: 단어 단위로 계산하는 동일한 편집 거리 지표입니다. CER과 WER이 크게 벌어지는 경우, 그 격차는 오독이 아니라 출력 정규화가 원인임을 나타냅니다.
  • 필드 값 F1: OCR 텍스트에 고정 정규식 패턴을 적용하여 추출한 필드 값의 정밀도/재현율 조화 평균입니다. 열 이름: regex_field_value_f1. 점수 0은 추출된 필드 값이 없음을 의미합니다.
  • 필드 값 F1(LLM): LLM 후처리기 출력에 대한 동일 지표입니다. 열 이름: llm_field_value_f1. 두 파이프라인은 서로 다르며 절대 혼합되지 않습니다.
  • 문서 필드 정확 일치: 모든 대상 필드가 정확히 일치한 문서의 비율입니다. 필드별 F1보다 훨씬 엄격한 기준입니다.
  • 지연 시간 p50/p95 및 페이지/분: 정상 상태의 페이지당 추론 시간과 모델 초기화를 포함한 실측 처리량입니다.
  • 1,000페이지당 비용: 기록된 $0.76/hr 요율로 1,000페이지를 처리하는 데 청구되는 GPU 시간입니다.

출처 목록

  1. summary_metrics.csv (GitHub raw). 16개 행 = 8개 모델 × 2개 데이터셋. 열: model, compute_type, dataset, cer, wer, field_f1_regex, field_acc_regex, latency_p50_ms, latency_p95_ms, cost_per_1000_pages, pages_per_minute, error_rate. 이 페이지의 모든 CER/WER, 지연 시간, 비용, 처리량 수치는 여기의 surya2, unlimited_ocr, paddleocr_vl_vllm 행에서 비롯됩니다.
  2. field_method_comparison.csv (GitHub raw). 16개 행; 열: model, dataset, llm_model (= deepseek-v4-flash), regex/llm 필드 값 정확도 및 F1, document-fields-exact, llm_median_latency_ms, 토큰 수. 모든 regex/LLM 필드 F1 수치는 여기의 세 가지 명명된 엔진 행에서 비롯됩니다.
  3. ImageToTableai/benchmark-ocr 저장소. 결과 CSV, 비식별 처리된 실행 매니페스트, 고정 프로토콜, 재현을 위한 데이터셋 샘플 목록을 호스팅하는 공개 저장소입니다.
  4. results/manifests/ (GitHub). 게시된 각 실행에 대한 비식별 처리된 manifest.json 1개. 모델 버전, GPU/드라이버, torch/CUDA/Python 버전, 가격 타임스탬프가 포함된 비용 메타데이터, 아티팩트 해시를 포함합니다.
  5. Huang et al., "ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction" (2019). SROIE 2019 데이터셋 정의, 작업 구조, 라이선스(CC-BY-4.0).
  6. Park et al., "CORD: A Consolidated Receipt Dataset for Post-OCR Parsing" (2020). CORD v2 데이터셋 정의, 중첩 필드 스키마, 라이선스(CC-BY-4.0).

한계

  • VLM에 대한 CER 불공정성이 이 페이지가 필드 지표로 구축된 이유입니다: 문서 파싱 VLM은 대소문자를 통합하고, 라벨/값 줄을 병합하며, 텍스트 순서를 재배치하므로 원시 CER 점수는 출력 규칙을 오류로 처리합니다 — Unlimited-OCR의 CER(0.6552)과 WER(0.4779)의 차이, PaddleOCR-VL의 CORD 역전은 모두 그러한 불이익의 산물입니다. CER로 VLM을 순위 매기는 모든 비교는 읽기 능력이 아닌 출력 스타일의 측정치로 취급해야 합니다.
  • 문서 범위 — 영수증 전용: SROIE + CORD. 여기에는 문서 파싱 VLM이 가장 큰 장점을 주장하는 레이아웃/표/수식/장문 문서 처리에 대한 측정이 전혀 포함되어 있지 않습니다. 세 엔진 모두의 마케팅 강점은 측정되지 않았습니다. 이 페이지를 사용하여 "VLM X가 모든 면에서 우월하다"라고 결론 내리지 마십시오.
  • 표본 크기: 영어 영수증 361장 + 인도네시아어 영수증 100장. 필드 F1과 CER은 코퍼스에 민감하므로, 수백 분의 1 수준의 한 자리 수 차이는 노이즈로 취급해야 하며 엔지니어링 진실로 간주해서는 안 됩니다.
  • 단일 GPU 티어 및 단일 가격: 모든 수치는 실행 매니페스트에 타임스탬프가 기록된 2026년 8월의 RTX 4090 1대, 시간당 $0.76에서 비롯됩니다. 다른 GPU, 멀티 GPU 서빙, 배치 스케줄링 또는 가격 변동은 지연 시간, 처리량, 비용을 변화시킵니다 — 예산 수립 전 현재 요율로 비용을 다시 산출하십시오.
  • 단일 LLM 후처리기: 모든 LLM 행은 temperature 0에서 deepseek-v4-flash를 사용합니다. 다른 LLM을 사용하면 절대 필드 F1이 달라지며, 수렴 순서도 경계에서 달라질 수 있습니다. LLM 지연 시간은 API로 인해 발생하며 어떤 엔진 자체 지연 시간에도 포함되지 않습니다.
  • CORD 격리: CORD 정답 데이터에는 주석 구조가 내장되어 있고, 정규식 패턴은 영어 형식에 맞게 작성되었습니다. CORD CER은 언어 불일치 + 정답 데이터 과대평가를 반영하며 모델별 품질을 나타내지 않습니다. CORD 행은 맥락과 함께 인용되며 어떤 SROIE 순위에도 절대 병합되지 않습니다.
  • 버전 고정: 결과는 Surya2 0.22.1, PaddleOCR-VL 1.6, Unlimited-OCR vLLM 서빙 기준입니다. Unlimited-OCR은 벤치마크의 게시된 모델 테이블에 공개적으로 고정된 버전 번호가 없으므로 해당 행을 정확한 릴리스로 추적할 수 없습니다. 어떤 엔진의 최신 릴리스든 이 페이지의 모든 수치를 바꿀 수 있습니다.
  • 정규식 튜닝: 패턴 세트는 데이터셋당 한 번 작성되었습니다. 형식별로 과도하게 튜닝된 패턴 라이브러리는 자체 레이아웃에서 더 높은 점수를 얻을 수 있습니다 — 대신 LLM이 제거하는 유지보수 비용이 발생합니다.

관련 참고 자료: docTR vs Surya2 영수증 벤치마크 · 전통적 OCR vs 문서 파싱 VLM · 복잡한 레이아웃에서 어떤 추출 방식이 우세한가 · 필드별 점수 대 문자별 점수 · 영수증 OCR 정확도

관련 자료: AI OCR과 기존 OCR 비교 · 이미지 데이터 추출과 OCR 엔진 비교 · AI 문서 추출 가격 (2026)

📮 contact email: [email protected]