1,000페이지당 OCR 비용오픈소스 엔진 8종 벤치마크 (2026)

최종 검토: 2026-08-18 · 실행 티어: 공식 · 자체 벤치마크 · 엔진 8종 × 영수증 데이터셋 2종

이 페이지에서 다루는 내용: 동일한 NVIDIA RTX 4090에서 SROIE 2019 및 CORD v2의 동일한 고정 테스트 분할을 대상으로 실행한 8개 오픈소스 OCR/문서 파싱 엔진(Tesseract, PaddleOCR, EasyOCR, docTR, Docling, Surya2, Unlimited-OCR, PaddleOCR-VL)의 1,000페이지당 비용에 대한 자체적이고 재현 가능한 측정입니다. 모든 수치는 공개 OCR 벤치마크 저장소(ImageToTableai/benchmark-ocr)에 게시된 CSV 행에서 비롯됩니다. 타사 보고서를 종합한 것이 아닌, 재현 가능한 실험 데이터입니다.
이 페이지에서 다루지 않는 내용: 영수증 이외의 모든 문서 유형. 클라우드/API OCR 서비스, 파인튜닝 모델, GPU 구매/상각, 스토리지 및 이그레스, LLM 필드 추출 달러 비용은 범위에서 제외됩니다. 8개 엔진 전체의 정확도/지연 시간 종합은 8개 엔진 OCR vs VLM 벤치마크에서 확인할 수 있습니다.

범위 설명: 이 페이지의 모든 달러 수치는 단일 GPU 티어(RTX 4090)와 단일 가격 타임스탬프 기준입니다. 예산 수립 전에 현재 요금으로 다시 계산하세요. 영수증 데이터셋만 사용(SROIE 2019, CORD v2). 비용 = wall-clock runtime × 시간당 요금.

동일한 GPU, 동일한 영수증, 동일한 $0.76/시간 과금 기준에서 8개 오픈소스 엔진의 1,000페이지당 OCR 비용은 22.2배 차이가 납니다. SROIE 2019 기준 $0.0479(docTR)부터 $1.0609(Surya2)까지입니다. 엔진 선택만으로도 오픈소스 OCR 비용이 한 자릿수 이상 달라지며, 순위는 정확도가 아닌 wall-clock time을 따릅니다. 가장 저렴한 엔진(docTR)은 두 번째로 낮은 문자 오류율을 보이고, 가장 비싼 엔진(Surya2)은 가장 낮은 문자 오류율을 보입니다.

작성자들이 가장 자주 필요로 하는 두 숫자: 측정된 가장 저렴한 엔진의 1,000페이지당 $0.048 vs 가장 비싼 엔진의 1,000페이지당 $1.061 — 동일한 테스트 분할, 동일한 GPU 티어, 동일한 가격 타임스탬프 기준입니다. Tesseract는 CPU 전용입니다. 청구되는 GPU 시간을 소비하지 않으며, 소스 CSV의 비용 셀은 의도적으로 비어 있습니다. 0도 아니고 무료도 아닙니다.

$0.0479
측정된 가장 저렴한 GPU 엔진: SROIE 2019의 docTR, RTX 4090 @ $0.76/시간, 모델 초기화 포함 비용
22.2×
SROIE에서 가장 저렴한 GPU 엔진과 가장 비싼 GPU 엔진 간 비용 차이 — 동일한 머신, 동일한 영수증, 동일한 청구 기준
$1.0609
측정된 가장 비싼 GPU 엔진: SROIE 2019의 Surya2 — 또한 최고의 문자 정확도(CER 0.1915), 비용과 정확도의 분리를 한 행에서 확인

1,000페이지당 비용은 기록된 시간당 요금으로 1,000페이지를 처리하는 데 청구된 GPU 시간입니다 — 실제 소요 시간 × $0.76/시간. 여기서 실제 소요 시간에는 모델 초기화가 포함됩니다. 이 페이지의 전체 비용 순위는 정확히 그 방식으로 계산되며, 계산 과정은 자체 비용 추정 방법 섹션과 각 표의 출처 줄에 나와 있습니다.

요금이 시간 단위로 측정되므로 비용은 정확도가 아닌 시간에 비례합니다: 한 페이지를 109ms에 읽는 엔진은 동일한 요금으로 2,668ms에 읽는 엔진보다 약 25배 저렴합니다. 모든 엔진의 비용은 배치 크기가 커질수록 더 낮아지는데, 일회성 모델 초기화 비용이 더 많은 페이지에 분산되기 때문입니다 — 아래의 $ 수치는 벤치마크 실행 패턴을 반영한 것으로, 실제 실행 비용과는 다를 수 있습니다.

SROIE 2019: 1,000페이지당 비용 순위

361개의 영어 영수증에서 전통적인 2단계 OCR 엔진은 저렴한 쪽에, 문서 파싱 VLM은 비싼 쪽에 위치합니다 — 하지만 각 계열 내부의 차이가 놀라운 점입니다: 0.9B 경량 VLM인 PaddleOCR-VL은 $0.2048로 가장 저렴한 엔진의 4.3배 이내에 위치하는 반면, 같은 VLM 계열인 Surya2는 가장 저렴한 엔진의 22.2배 비용이 듭니다 — VLM 클러스터 내부에서만 5.2배의 차이가 납니다.

SROIE 2019의 1,000페이지당 비용: docTR $0.048, EasyOCR $0.110, PaddleOCR-VL $0.205, PaddleOCR $0.221, Unlimited-OCR $0.388, Docling $0.398, Surya2 $1.061. Tesseract는 CPU 전용.

출처: summary_metrics.csv — cost_per_1000_pages 열, sroie_2019 행. docTR 0.0479, EasyOCR 0.1098, PaddleOCR-VL 0.2048, PaddleOCR 0.2214, Unlimited-OCR 0.3879, Docling 0.3978, Surya2 1.0609. Tesseract CPU 전용: CSV에서 셀 비어 있음. 비용 = 실제 소요 시간 × $0.76/시간, 모델 초기화 포함.

순위모델유형비용 / 1K 페이지페이지/분출처
1docTR전통적 OCR (GPU)$0.0479449.3summary_metrics.csv · doctr/sroie_2019 행
2EasyOCR전통적 OCR (GPU)$0.1098124.5summary_metrics.csv · easyocr/sroie_2019 행
3PaddleOCR-VL문서 파싱 VLM$0.204868.2summary_metrics.csv · paddleocr_vl_vllm/sroie_2019 행
4PaddleOCR전통적 OCR (GPU)$0.221479.7summary_metrics.csv · paddleocr/sroie_2019 행
5Unlimited-OCR문서 파싱 VLM$0.387934.4summary_metrics.csv · unlimited_ocr/sroie_2019 행
6Docling파이프라인 파서$0.397856.7summary_metrics.csv · docling/sroie_2019 행
7Surya2문서 파싱 VLM$1.060912.1summary_metrics.csv · surya2/sroie_2019 행
—Tesseract전통적 OCR (CPU)n/a (CPU 전용, GPU 비용 없음)78.6summary_metrics.csv · tesseract/sroie_2019 행

표: summary_metrics.csv — cost_per_1000_pages / pages_per_minute, sroie_2019 행. GPU 실행 비용 $0.76/시간; Tesseract는 CPU 전용으로 실행. 비용에는 모델 초기화가 포함되므로 페이지당 비용은 배치가 클수록 낮아집니다.

비용은 정확도가 아닌 처리량에 비례합니다

엔진을 비용 기준과 문자 정확도 기준으로 각각 순위를 매기면 두 순위는 거의 일치하지 않습니다. SROIE에서 최고의 원시 텍스트 품질은 Surya2(CER 0.1915)가 차지했으며, 이는 가장 비싼 엔진($1.0609)입니다. 두 번째로 좋은 품질은 docTR(CER 0.1971)이 차지했으며, 이는 가장 저렴한 엔진($0.0479)입니다. 비용은 시간에 대한 청구서입니다. Surya2의 분당 12.1페이지 처리량은 동일한 시간당 요금에서 docTR의 분당 449.3페이지보다 약 37배 적은 처리량을 제공합니다.

아키텍처 가중치 상관관계는 실제로 존재하지만 느슨합니다. 클래스 전체로 보면 문서 파싱 VLM(Surya2, Unlimited-OCR, PaddleOCR-VL)이 기존의 2단계 OCR 엔진(docTR, EasyOCR, PaddleOCR)보다 위에 있으며, 파이프라인 파서인 Docling은 그 사이에 있습니다. 그러나 각 클래스 내부의 편차는 큽니다. VLM 클러스터는 5.2배($0.2048 ~ $1.0609), 기존 클러스터는 4.6배($0.0479 ~ $0.2214) 범위입니다. 또한 이번 실행에서 가장 작은 VLM인 PaddleOCR-VL은 가장 저렴한 엔진과 4.3배 차이인 반면, Surya2는 22.2배 차이입니다. 실질적인 시사점: "정확할수록 비싸다"는 가정은 자체 문서에서 측정하기 전까지는 거짓으로 간주하십시오; 이 벤치마크에서 비용 순위와 정확도 순위 간의 관계는 사실상 분리되어 있습니다.

SROIE 2019 분당 페이지 수: docTR 449.3, EasyOCR 124.5, PaddleOCR 79.7, Tesseract 78.6(CPU), PaddleOCR-VL 68.2, Docling 56.7, Unlimited-OCR 34.4, Surya2 12.1. 처리량은 1,000페이지당 비용을 결정하는 실제 실행 시간 요소입니다.

출처: summary_metrics.csv — pages_per_minute 열, sroie_2019 행. 모델 초기화를 포함한 실제 실행 시간 기준 분당 페이지 수. Tesseract는 CPU 전용으로 실행됨.

모델유형CER지연 시간 p50 (ms)페이지/분1K 페이지당 비용docTR 대비 비용출처
docTR전통적 OCR0.1971108.7449.3$0.04791.00×summary_metrics.csv · doctr/sroie_2019 행
EasyOCR전통적 OCR0.2833413.6124.5$0.10982.29×summary_metrics.csv · easyocr/sroie_2019 행
PaddleOCR전통적 OCR0.2045297.079.7$0.22144.62×summary_metrics.csv · paddleocr/sroie_2019 행
Tesseract전통적 OCR (CPU)0.3347670.978.6n/a (CPU)n/asummary_metrics.csv · tesseract/sroie_2019 행
PaddleOCR-VL문서 파싱 VLM0.3370694.368.2$0.20484.28×summary_metrics.csv · paddleocr_vl_vllm/sroie_2019 행
Docling파이프라인 파서0.5909732.056.7$0.39788.31×summary_metrics.csv · docling/sroie_2019 행
Unlimited-OCR문서 파싱 VLM0.65521,600.734.4$0.38798.10×summary_metrics.csv · unlimited_ocr/sroie_2019 행
Surya2문서 파싱 VLM0.19152,668.012.1$1.060922.16×summary_metrics.csv · surya2/sroie_2019 행

표: summary_metrics.csv — cer / latency_p50_ms / pages_per_minute / cost_per_1000_pages, sroie_2019 행. 비용 비율은 docTR의 0.0479에 대한 단순 나눗셈으로 계산됨. Surya2의 CER은 방법론의 대소문자 정규화 주의사항과 함께 해석해야 함. Tesseract의 지연 시간은 CPU 하드웨어 기준이며, 비용 셀은 설계상 비어 있음.

대기 시간 열은 대화형 워크로드 관점을 추가합니다: 볼륨당 비용과 페이지당 대기 시간은 동일한 실제 시간 사실의 두 가지 관점입니다. docTR의 p50 108.7 ms는 1,000페이지당 가장 저렴할 뿐만 아니라 대화형 응답에 근접한 유일한 엔진입니다; Surya2의 p50 2,668 ms는 가장 비싸면서 영수증 처리에서 배치 전용 워크로드입니다. 대기 시간 세부 정보는 형제 8개 엔진 비교에서 분석됩니다.

CORD: 비용은 데이터셋에 따라 달라집니다

문서 세트를 바꾸면 비용 순위가 뒤바뀝니다 — 이는 1,000페이지당 비용이 엔진 상수가 아님을 증명합니다. CORD v2에서 EasyOCR이 가장 저렴한 엔진($0.0863)이 되고 docTR은 2위($0.0939)로 내려가며, 양쪽 끝의 기준점은 유지됩니다: docTR은 하위권에 머물고 Surya2는 가장 비싼 엔진($1.1616)으로 남습니다. CORD의 격차는 13.5배로 좁아집니다.

그 메커니즘은 실제 문서 세트에서의 처리량입니다: CORD의 인도네시아 영수증은 SROIE의 영어 영수증보다 짧고 텍스트 밀도가 낮아 모든 엔진의 분당 페이지 수가 달라지고, 그에 따라 1,000페이지당 비용도 달라집니다. 두 데이터셋은 이 벤치마크에서 의도적으로 분리되어 있습니다 — CORD는 또한 주석 구조 인플레이션이 포함된 정답 데이터로 인해 CER 수치가 신뢰할 수 없습니다 — 따라서 SROIE와 CORD 열을 하나의 순위가 아닌 두 개의 독립적인 데이터 포인트로 취급하십시오.

CORD v2의 1,000페이지당 비용: EasyOCR $0.086, docTR $0.094, Unlimited-OCR $0.206, PaddleOCR-VL $0.241, PaddleOCR $0.342, Docling $0.538, Surya2 $1.162. Tesseract는 CPU 전용.

출처: summary_metrics.csv — cost_per_1000_pages 열, cord_v2 행. EasyOCR 0.0863, docTR 0.0939, Unlimited-OCR 0.2063, PaddleOCR-VL 0.2409, PaddleOCR 0.3419, Docling 0.5382, Surya2 1.1616. Tesseract는 CPU 전용. 동일한 RTX 4090 @ $0.76/시간, 비용은 모델 초기화 포함.

순위모델유형1K 페이지당 비용출처
1EasyOCR전통적 OCR (GPU)$0.0863summary_metrics.csv · easyocr/cord_v2 행
2docTR전통적 OCR (GPU)$0.0939summary_metrics.csv · doctr/cord_v2 행
3Unlimited-OCR문서 파싱 VLM$0.2063summary_metrics.csv · unlimited_ocr/cord_v2 행
4PaddleOCR-VL문서 파싱 VLM$0.2409summary_metrics.csv · paddleocr_vl_vllm/cord_v2 행
5PaddleOCR전통적 OCR (GPU)$0.3419summary_metrics.csv · paddleocr/cord_v2 행
6Docling파이프라인 파서$0.5382summary_metrics.csv · docling/cord_v2 행
7Surya2문서 파싱 VLM$1.1616summary_metrics.csv · surya2/cord_v2 행
—Tesseract전통적 OCR (CPU)n/a (CPU 전용, GPU 비용 없음)summary_metrics.csv · tesseract/cord_v2 행

표: summary_metrics.csv — cost_per_1000_pages, cord_v2 행. CORD는 SROIE 순위와 분리하여 유지합니다. 이 비교의 핵심은 1,000페이지당 비용이 문서 세트에 따라 달라진다는 것이지, 특정 순위가 "우위"에 있다는 것이 아닙니다.

월간 볼륨 시나리오

1,000페이지당 수치는 예산 담당자가 필요한 볼륨 계산에 직접 곱해집니다. SROIE 비용 기준으로 월 100,000페이지에서 docTR의 GPU 시간은 월 $4.79, Surya2는 월 $106.09로, 약 월 $101의 차이가 발생하며, 이는 100만 페이지에서 약 $1,013/월로 확대됩니다. 이는 측정된 1,000페이지당 수치의 산술적 확장이며, 추가 실행이 아닙니다.

월간 볼륨docTR GPU 시간Surya2 GPU 시간차이근거
10,000페이지$0.48 (10 × $0.0479)$10.61 (10 × $1.0609)$10.13summary_metrics.csv cost_per_1000_pages, doctr / surya2 sroie_2019 행; 단순 곱셈으로 파생 — 측정 실행 아님
100,000페이지$4.79 (100 × $0.0479)$106.09 (100 × $1.0609)$101.30
1,000,000페이지$47.88 (1,000 × $0.0479)$1,060.85 (1,000 × $1.0609)$1,012.97

표: SROIE 2019 비용 기준의 파생 추정치 — 측정 실행이 아님. 각 셀은 측정된 cost_per_1000_pages에 천 단위 볼륨을 곱한 단순 계산이며, 동일한 $0.76/hr RTX 4090 요율, 2026년 8월 기준 가격입니다. GPU 시간만 포함 — CPU, 스토리지, 이그레스, 오케스트레이션, LLM 후처리는 제외. 월 1,000만 페이지 기준으로 Surya2 단독으로도 이 기준에서 약 $10,609/월에 도달합니다(10,000 × $1.0609).

Tesseract의 실제 비용 프로필: GPU 비용 없음, 그러나 무료는 아님

Tesseract는 벤치마크에서 유일한 CPU 전용 엔진이며, 비용 셀은 설계상 비어 있습니다 — 청구된 GPU 시간이 없으므로 $0.76/시간으로 청구할 항목이 없습니다. 이는 비용이 없다는 것과는 다릅니다: 실행되는 CPU 인프라는 이 벤치마크가 정량화하지 않는 실제 비용이며, 필드 복구 상한선은 다운스트림 비용을 증가시킬 수 있습니다.

SROIE에서 Tesseract는 CPU에서 여전히 78.6 pages/min을 유지했습니다 — 7개 GPU 엔진 중 4개(PaddleOCR-VL 68.2, Docling 56.7, Unlimited-OCR 34.4, Surya2 12.1)보다 높습니다. 이미 프로비저닝된 CPU 인프라에서 낮은 볼륨으로 사용할 경우 GPU 임대가 전혀 없어 진정으로 비용 효율적입니다. 문제는 텍스트가 아닌 필드가 결과물일 때 드러납니다: Tesseract의 약한 기본 텍스트는 다운스트림 LLM이 복구할 수 있는 범위를 제한합니다 — CORD CER 0.9523에서 CORD LLM 필드 F1은 0.163입니다 — 따라서 GPU 절감액은 다른 곳의 후처리 및 수정 비용으로 상쇄될 수 있습니다. CPU 대 GPU 트레이드오프는 전용 Tesseract vs PaddleOCR 대결의 주제이며, 후처리 상한선은 규칙 기반 vs LLM 추출 비교에서 다룹니다.

파이프라인 비용 ≠ 엔진 비용: LLM 후처리 경계

이 페이지의 모든 숫자는 OCR 엔진의 GPU 비용만을 나타냅니다. 프로덕션 추출 파이프라인은 일반적으로 OCR 텍스트 위에 LLM 필드 추출 패스를 추가합니다 — 벤치마크는 16개 실행 모두에서 하나(deepseek-v4-flash)를 실행했습니다 — 이 패스는 여기의 어떤 엔진 수치에도 나타나지 않는 별도의 토큰당 API 비용입니다.

비교 CSV는 SROIE의 후처리 패스에 대한 토큰 수를 기록합니다 — 예를 들어, docTR의 OCR 텍스트는 네 개의 영수증 필드를 추출하는 데 151,131 prompt + 25,377 completion tokens이 들었습니다 — 이러한 토큰 수는 추가 지출을 추정하는 기준이 됩니다. 이 페이지는 의도적으로 토큰을 달러로 변환하지 않습니다: LLM 가격은 제공업체, 플랜, 모델에 따라 다르며, 어떤 달러 수치도 곧바로 구식이 될 것입니다. 엔진 비용과 파이프라인 비용은 예산의 두 줄입니다. LLM 줄은 프롬프트 설계와 제공업체의 함수이지 OCR 엔진의 함수가 아닙니다.

엔진LLM 프롬프트 토큰(SROIE)LLM 완성 토큰(SROIE)출처
Tesseract128,28524,561field_method_comparison.csv · tesseract/sroie_2019 행
PaddleOCR134,74626,059field_method_comparison.csv · paddleocr/sroie_2019 행
EasyOCR138,68925,607field_method_comparison.csv · easyocr/sroie_2019 행
docTR151,13125,377field_method_comparison.csv · doctr/sroie_2019 행
Surya2130,26226,372field_method_comparison.csv · surya2/sroie_2019 행
Docling157,19126,087field_method_comparison.csv · docling/sroie_2019 행
Unlimited-OCR185,70525,876field_method_comparison.csv · unlimited_ocr/sroie_2019 행
PaddleOCR-VL148,97326,301field_method_comparison.csv · paddleocr_vl_vllm/sroie_2019 행

표: field_method_comparison.csv — llm_prompt_tokens / llm_completion_tokens, sroie_2019 행; llm_model = deepseek-v4-flash. 토큰 수는 361페이지 분량의 SROIE 테스트 분할에서 한 번의 필드 추출 패스를 기준으로 합니다. 이는 LLM 후처리 비용 추정의 기초가 되며, LLM 가격은 제공업체와 요금제에 따라 다르므로 달러 환산은 제공되지 않습니다.

자체 비용 추정 방법

8개 엔진 벤치마크를 다시 실행하지 않아도 자체 워크로드에 대한 합리적인 비용 추정치를 얻을 수 있습니다. 벤치마크의 방법론은 4단계와 예시 하나로 재현됩니다.

  1. 엔진과 측정된 처리량을 선택합니다. 동일한 문서 유형의 대리 지표로 분당 페이지 수 열을 사용합니다. 자체 문서 구성의 경우 소규모 샘플에서 자체 처리량을 측정하세요 — 위 순위는 1,000페이지당 비용이 데이터셋에 따라 달라짐을 보여줍니다.
  2. 볼륨을 실측 시간으로 변환합니다. N페이지에 대해 hours = (model init + N / pages_per_minute) / 60. 모델 초기화는 프로세스/배치당 한 번만 지불되므로 분자에 포함되어야 합니다.
  3. 시간당 요금을 곱합니다. cost = hours × rate. 벤치마크의 요금은 $0.76/hr였습니다. 벤치마크 자체의 실제 예시: docTR SROIE 실행은 361페이지에 대해 81,867ms의 실측 시간이 소요되었으며(performance.run_wall_time_ms in its redacted manifest) → 0.0227 hr × $0.76 = 실행당 $0.0173 → × 1,000 / 361 = 1,000페이지당 $0.0479, CSV 행과 정확히 일치합니다.
  4. 초기화 분할 상환과 배치 크기를 고려합니다. 위 81,867ms에는 361페이지 배치에 대한 초기화가 포함되어 있습니다. 1,000,000페이지에서는 동일한 초기화가 약 2,770배 희석되어 페이지당 비용이 순수 정상 상태 처리량에 근접합니다. 소규모 배치는 초기화 비용을 반복적으로 지불합니다 — 10페이지 배치는 10,000페이지 실행과 동일한 초기화 비용을 지불하므로 1,000페이지당 비용이 소규모 배치에서 급격히 상승합니다. 워크로드가 버스트성이라면 배치를 늘리거나 초기화 비용이 높은 경제성을 수용하세요.
  5. 파이프라인 비용을 별도 라인에 추가합니다. LLM 필드 추출은 토큰당 비용이 청구되고, 저장 및 전송은 바이트당, Tesseract 스타일 CPU 전용 스택은 CPU 시간으로 청구됩니다 — 이 중 어느 것도 이 페이지의 1,000페이지당 수치에 포함되지 않습니다.

이는 벤치마크 자체 비용 기준에서 파생된 대략적인 계산 방법이며, 재무 조언이 아니며 정확한 수치는 하드웨어, 문서 구성, 배치 크기 및 활용도에 따라 달라집니다. $0.76/hr 요금은 2026년 8월 타임스탬프가 찍힌 온디맨드 가격입니다 — 현재 요금으로 다시 계산하세요.

자주 묻는 질문

1,000페이지당 OCR 비용은 얼마인가요?

SROIE 2019 기준 1,000페이지당 $0.048(docTR)에서 $1.061(Surya2) 사이이며, RTX 4090에서 $0.76/hr로 측정했고 가격은 2026년 8월 기준입니다. 비용에는 모델 초기화가 포함되므로 배치 크기가 커질수록 페이지당 비용이 감소합니다. CORD v2에서는 동일한 엔진이 $0.086(EasyOCR)에서 $1.162(Surya2) 범위입니다.

가장 저렴하게 실행할 수 있는 오픈소스 OCR 엔진은 무엇인가요?

docTR이 SROIE에서 1,000페이지당 $0.0479로 측정된 GPU 엔진 중 가장 저렴했습니다. 다만 데이터셋 의존성에 유의해야 합니다. CORD v2에서는 EasyOCR($0.0863)이 docTR($0.0939)보다 근소하게 저렴했습니다. "가장 저렴한" 엔진은 문서 유형에 따라 달라지며, 기준점은 두 데이터셋 모두에서 유지되었습니다.

가장 빠른 엔진이 왜 가장 저렴한가요?

비용이 $0.76/hr 기준 wall-clock 시간으로 계산되기 때문입니다. 페이지당 109ms가 걸리는 엔진(docTR)은 페이지당 2,668ms가 걸리는 엔진(Surya2)의 약 1/25 시간만 지불합니다. 종량제 GPU 과금 체계에서는 처리량이 곧 비용이므로, 비용 순위와 처리량 순위가 거의 정반대입니다.

Tesseract OCR은 무료인가요?

아닙니다. Tesseract는 CPU 전용이므로 과금되는 GPU 시간을 소비하지 않아 벤치마크 CSV에서 비용 셀이 의도적으로 비어 있지만, 이는 0이 아닙니다. 실행되는 CPU 인프라는 실제 비용이며, 필드 복원 한계로 인해 후속 후처리 비용이 증가할 수 있습니다. 이미 프로비저닝된 CPU 하드웨어에서 저용량으로 사용할 경우 실제로 비용 효율적일 수 있습니다. SROIE에서 78.6페이지/분으로 7개 GPU 엔진 중 4개보다 빠릅니다. 하지만 "GPU 비용 없음"과 "무료"는 다른 의미입니다.

Surya2가 1,000페이지당 비용이 왜 그렇게 비싼가요?

SROIE에서 가장 느린 엔진이기 때문입니다: 12.1 pages/min은 동일한 $0.76/hr 요율로 1,000페이지당 가장 많은 wall-clock 시간을 의미합니다. 또한 문자 정확도가 가장 높습니다 (CER 0.1915) — 비용이 정확도가 아닌 시간에 비례한다는 벤치마크의 가장 명확한 예입니다.

볼륨이 증가하면 페이지당 OCR 비용이 낮아지나요?

네, 최소 수준까지는 그렇습니다. 여기서 비용에는 프로세스/배치당 한 번 지불되는 모델 초기화가 포함됩니다; 벤치마크의 docTR 실행은 361페이지에 대해 81,867 ms 내에 초기화를 포함했습니다 (manifest performance.run_wall_time_ms). 따라서 100만 페이지에서는 이 초기화 비용이 거의 0으로 희석되어 비용은 순수한 정상 상태 처리량에 접근합니다. 최소 수준은 정상 상태 비용 자체입니다 — SROIE에서 docTR의 $0.0479/1K는 이미 최소 수준에 가깝습니다; Surya2의 $1.0609는 초기화 오버헤드가 아닌 실제로 느린 정상 상태 추론을 반영합니다.

이 1,000페이지당 수치에 포함되지 않은 것은 무엇인가요?

LLM 후처리, Tesseract 스타일 스택용 CPU/인프라, 스토리지 및 송신, 오케스트레이션, GPU 활용률 격차, 클라우드/API OCR 서비스 — 이 중 어느 것도 이 수치가 나타내는 엔진 GPU 비용에 포함되지 않습니다. 클라우드 API는 또한 기능별 가격 책정으로 호출당 청구되며, 임대 GPU wall-clock 시간과는 다른 비용 모델입니다; 이 페이지에서는 벤치마킹되지 않습니다.

이 숫자는 어디서 나온 것인가요?

모든 수치는 자사 벤치마크의 게시된 CSV 행입니다 — results/summary_metrics.csv 및 results/field_method_comparison.csv — ImageToTableai/benchmark-ocr에서 호스팅되며, 각 실행에는 $0.76/hr 요율, 2026년 8월 가격 타임스탬프, 모델 버전 및 환경 해시를 기록한 편집된 manifest.json이 하나씩 있습니다.

방법론 및 출처

프로토콜

이 페이지는 독립적이고 재현 가능한 벤치마크 실행의 비용 차원을 보고합니다. 제3자 주장에 대한 조사가 아닙니다. 고정 테스트 분할만 사용: SROIE 2019 테스트 및 CORD v2 테스트; 학습 분할은 평가하지 않았습니다. 모든 쌍은 동일한 이미지, 동일한 정답, 동일한 측정 프로토콜을 사용했습니다. 16개 실행 모두 error_rate 0.0으로 완료되었습니다.

런타임 환경 및 비용 기준

  • 하드웨어: 모든 GPU 실행은 NVIDIA RTX 4090(24GB)에서 수행되었습니다. GPU 비용은 RunPod 주문형 요금 $0.76/hr로 계산되며, 가격 타임스탬프(price_recorded_at_utc 2026-08-13T08:00:00Z)는 각 실행의 편집된 매니페스트에 기록되었습니다. Tesseract는 CPU 전용으로 실행되었으며 GPU 비용이 없습니다.
  • 비용 공식: 1,000페이지당 비용 = wall-clock runtime × $0.76/hr ×, 모델 초기화 포함. 비용 추정 섹션의 docTR 작업 예시로 검증됨(81,867 ms → $0.0479/1K).
  • 엔진: 모든 모델은 추가 튜닝 없이 기본 설정으로 실행되었습니다. 버전은 실행 매니페스트에 따라 고정되었습니다.
  • LLM 후처리기: deepseek-v4-flash를 온도 0으로 API를 통해 사용; 해당 토큰 수는 별도 파이프라인 비용의 기준으로 보고되며 — OCR 엔진 비용 수치에는 포함되지 않습니다.
  • 필드 후처리: SROIE 필드 메트릭은 postprocessed_sroie_receipt_regex_* / LLM 변형입니다 — 필드는 기본 구조화된 출력이 아닌 OCR 텍스트에서 추출됩니다.
  • CORD 주의사항: CORD 정답 텍스트에는 주석 구조가 포함되어 있어 모든 엔진의 원시 CER을 부풀립니다. 따라서 CORD 행은 SROIE 순위와 분리하여 유지됩니다. 비용 수치는 CER 주의사항의 영향을 받지 않지만, 두 데이터셋 모두 영수증에 한정됩니다.

지표 정의

  • 1,000페이지당 비용: 기록된 $0.76/hr 요율 기준 1,000페이지 처리에 청구된 GPU 시간으로, 모델 초기화를 포함한 wall-clock 시간 기준. CPU 전용 Tesseract는 비어 있음.
  • 분당 페이지 수: 모델 초기화를 포함한 wall-clock 처리량.
  • 지연 시간 p50/p95: 안정 상태의 페이지당 추론 시간.
  • CER/WER: ground-truth 문자/단어에 대한 편집 거리. 대소문자 및 형식 규칙에 민감함 — VLM 출력은 대소문자가 정규화되므로 CER이 VLM 오류를 과대평가함.
  • 필드 값 F1: 추출된 필드 값에 대한 정밀도/재현율 조화 평균, 각 후처리기 기준.

출처 목록

  1. summary_metrics.csv (GitHub raw). 16개 행 = 8개 엔진 × 2개 영수증 데이터셋 (sroie_2019, cord_v2). 열: model, compute_type, dataset, cer, wer, field_f1_regex, field_acc_regex, latency_p50_ms, latency_p95_ms, cost_per_1000_pages, pages_per_minute, error_rate. 이 페이지의 모든 비용, 처리량, 지연 시간, CER 수치는 여기의 행에서 비롯됨.
  2. field_method_comparison.csv (GitHub raw). 16개 행; 열: model, dataset, llm_model (= deepseek-v4-flash), regex/LLM 필드 값 정확도 및 F1, document-fields-exact, llm_median_latency_ms, llm_prompt_tokens, llm_completion_tokens. 모든 토큰 수 및 LLM 필드 F1 수치는 여기의 행에서 비롯됨.
  3. ImageToTableai/benchmark-ocr 저장소. 결과 CSV, 편집된 실행 매니페스트, 고정 프로토콜, 재현을 위한 데이터셋 샘플 목록을 호스팅하는 공개 저장소.
  4. results/manifests/ (GitHub). 게시된 각 실행에 대한 편집된 manifest.json 1개씩. 환경 지문, 모델 버전, 비용 메타데이터(gpu_hourly_usd, price_recorded_at_utc), wall-clock 시간, 아티팩트 해시 포함.
  5. Huang et al., "ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction" (2019). SROIE 2019 데이터셋 정의, 작업 구조, 라이선스(CC-BY-4.0).
  6. Park et al., "CORD: A Consolidated Receipt Dataset for Post-OCR Parsing" (2020). CORD v2 데이터셋 정의, 중첩 필드 스키마, 라이선스(CC-BY-4.0).

제한 사항

  • 단일 GPU 티어 및 단일 가격 시점: 모든 GPU 수치는 $0.76/hr의 RTX 4090 하나에서 측정되었으며, 가격은 2026년 8월 기준입니다. GPU 스팟/온디맨드 가격은 변동되므로 현재 요금으로 재산출해야 하며, 다른 GPU, 멀티 GPU 서빙, 배치 스케줄링은 처리량과 비용을 변화시킵니다.
  • 영수증만 해당: SROIE 및 CORD 영수증만 포함됩니다. 인보이스, 양식, 계약서 또는 장문 문서에 대한 비용, 처리량, 정확도는 측정되지 않았으며, 위 순위는 영수증 범위를 벗어나 일반화할 수 없습니다.
  • 비용에 모델 초기화 포함 — 배치 크기에 따라 달라짐: 수치는 벤치마크 실행 패턴을 반영합니다. 작은 배치는 초기화를 반복적으로 수행하여 1,000페이지당 비용이 더 높아지고, 큰 배치는 정상 상태 최저치에 근접합니다.
  • CPU/GPU 비대칭성: Tesseract(CPU)는 GPU 가속 엔진과 비교됩니다. 그 비용 우위는 GPU 청구가 없다는 것을 반영할 뿐, 비용이 없다는 의미는 아닙니다 — CPU 인프라, 전력, 인력 시간은 정량화되지 않았으며, 필드 복원 상한은 후처리 비용을 증가시킬 수 있습니다.
  • 클라우드/API 모델 미포함: AWS Textract, Google Document AI, Azure AI Document Intelligence 및 호스팅 OCR/VLM API는 포함되지 않았습니다. 이들의 호출당 기능별 과금 구조는 임대 GPU의 벽시계 시간 청구와 근본적으로 다르며, 어떤 비교도 암시되지 않습니다.
  • 가동률 및 유휴 시간 미모델링: 수치는 GPU가 실행의 벽시계 시간 동안만 청구되고 그 외에는 사용되지 않는다고 가정합니다. 유휴, 멀티 테넌트 또는 저활용 GPU를 사용하는 실제 배포 환경에서는 실효 비용이 다릅니다.
  • LLM 후처리 비용은 달러로 환산되지 않음: 토큰 수(field_method_comparison.csv)가 기준이며, LLM 가격은 제공업체와 요금제에 따라 다르므로 의도적으로 독자의 판단에 맡깁니다.
  • 파생 시나리오는 측정되지 않음: 월간 볼륨 표는 SROIE 비용 기준의 단순 산술이며, 추가 벤치마크 실행이 아닌 파생 추정치로 표시됩니다.
  • 표본 크기 및 버전 고정: 361 + 100개 샘플입니다. 결과는 위에 나열된 2026년 8월 모델 버전에 해당합니다. 새로운 엔진 릴리스는 비용/처리량을 변화시킬 수 있으며, 한 자릿수 퍼센트 차이는 노이즈로 간주해야 합니다.

관련 참고 자료: Traditional OCR vs Document Parsing VLMs · docTR vs Surya2: CER 동률, 비용 격차 · Tesseract vs PaddleOCR: CPU 비용 프로필 · 정규식과 LLM이 필드를 추출하는 방식 · 문서 처리 비용 분석

관련 읽을거리: AI 문서 추출 가격(2026) · AI OCR과 기존 OCR의 필드 수준 정확도 · AI 비전 추출이 OCR과 다른 방식으로 이미지를 읽는 방법

📮 contact email: [email protected]