1,000페이지당 OCR 비용
8개 오픈소스 엔진, 벤치마크 결과 (2026)
마지막 검토: 2026-08-18 · 실행 등급: 공식 · 1차 벤치마크 · 8개 엔진 × 2개 영수증 데이터셋
이 페이지의 범위 밖: 영수증 이외의 모든 문서 유형 — 청구서, 양식, 계약서 또는 긴 문서는 포함되지 않습니다. 클라우드/API OCR 서비스, 미세 조정 모델, GPU 조달/상각, 저장 및 전송, 그리고 LLM 필드 추출 비용은 범위 밖입니다. 전체 8엔진 정확도/지연 시간 요약은 기존 OCR vs 문서 파싱 VLM에 있습니다.
범위 설명: 이 페이지의 모든 달러 수치는 하나의 GPU 등급 (RTX 4090)과 하나의 가격 타임스탬프에 해당합니다. 예산 편성 전 현재 요금으로 다시 계산하십시오. 영수증 데이터셋만 해당 (SROIE 2019, CORD v2). 비용 = 벽시계 실행 시간 × 시간당 요금.
동일한 GPU, 동일한 영수증, 동일한 $0.76/hr 과금 기준에서, 8개 오픈소스 엔진의 1,000페이지당 OCR 비용은 22.2배 차이를 보입니다 — SROIE 2019 기준으로 $0.0479 (docTR)부터 $1.0609 (Surya2)까지입니다. 엔진 선택만으로 오픈소스 OCR 비용이 한 자릿수 이상 변하며, 순위는 정확도가 아닌 벽시계 시간을 따릅니다: 가장 저렴한 엔진 (docTR)은 두 번째로 낮은 문자 오류율을, 가장 비싼 엔진 (Surya2)은 가장 낮은 문자 오류율을 보입니다.
작가들이 가장 자주 필요로 하는 두 가지 수치: 측정된 가장 저렴한 엔진의 1,000페이지당 $0.048 vs 가장 비싼 엔진의 1,000페이지당 $1.061 — 동일한 테스트 분할, 동일한 GPU 등급, 동일한 가격 타임스탬프. Tesseract는 CPU 전용입니다: 과금되는 GPU 시간을 소비하지 않으며, 소스 CSV의 비용 셀은 설계상 비어 있습니다 — 0이 아니며 무료도 아닙니다.
1,000페이지당 비용은 기록된 시간당 요금으로 1,000페이지를 처리하는 데 청구된 GPU 시간입니다 — 실제 경과 시간 × $0.76/hour, 여기서 경과 시간에는 모델 초기화가 포함됩니다. 이 페이지의 전체 비용 순위는 정확히 이 방식으로 계산됩니다. 계산 과정은 비용 추정 방법 섹션과 각 테이블의 소스 라인에서 확인할 수 있습니다.
청구가 시간 단위로 측정되므로, 비용은 정확도가 아닌 시간에 비례합니다: 동일한 요금으로 페이지를 109ms에 읽는 엔진은 2,668ms에 읽는 엔진보다 약 25배 저렴합니다. 모든 엔진의 비용은 배치 크기가 커질수록 더 낮아지는데, 이는 일회성 모델 초기화 비용이 더 많은 페이지에 분산되기 때문입니다 — 아래의 $ 수치는 벤치마크의 실행 패턴을 반영하며, 귀하의 자체 실행 비용과는 다를 수 있습니다.
SROIE 2019: 1,000페이지당 비용 순위
361개의 영어 영수증에서 전통적인 2단계 OCR 엔진은 저렴한 쪽에, 문서 파싱 VLM은 비싼 쪽에 위치하지만, 각 그룹 내부의 차이가 놀라운 점입니다: 소형 0.9B VLM인 PaddleOCR-VL은 $0.2048로, 가장 저렴한 엔진과 4.3배 차이를 보이며, 그 VLM 형제인 Surya2는 가장 저렴한 엔진의 22.2배 비용이 듭니다 — VLM 그룹 내부에서만 5.2배의 차이가 발생합니다.
출처: summary_metrics.csv — cost_per_1000_pages 열, sroie_2019 행. docTR 0.0479, EasyOCR 0.1098, PaddleOCR-VL 0.2048, PaddleOCR 0.2214, Unlimited-OCR 0.3879, Docling 0.3978, Surya2 1.0609. Tesseract CPU 전용: CSV에서 셀 비어 있음. 비용 = 실제 경과 시간 × $0.76/hr, 모델 초기화 포함.
| 순위 | 모델 | 유형 | 비용 / 1K 페이지 | 페이지/분 | 출처 |
|---|---|---|---|---|---|
| 1 | docTR | 전통적 OCR (GPU) | $0.0479 | 449.3 | summary_metrics.csv · doctr/sroie_2019 행 |
| 2 | EasyOCR | 전통적 OCR (GPU) | $0.1098 | 124.5 | summary_metrics.csv · easyocr/sroie_2019 행 |
| 3 | PaddleOCR-VL | 문서 파싱 VLM | $0.2048 | 68.2 | summary_metrics.csv · paddleocr_vl_vllm/sroie_2019 행 |
| 4 | PaddleOCR | 전통적 OCR (GPU) | $0.2214 | 79.7 | summary_metrics.csv · paddleocr/sroie_2019 행 |
| 5 | Unlimited-OCR | 문서 파싱 VLM | $0.3879 | 34.4 | summary_metrics.csv · unlimited_ocr/sroie_2019 행 |
| 6 | Docling | 파이프라인 파서 | $0.3978 | 56.7 | summary_metrics.csv · docling/sroie_2019 행 |
| 7 | Surya2 | 문서 파싱 VLM | $1.0609 | 12.1 | summary_metrics.csv · surya2/sroie_2019 행 |
| — | Tesseract | 전통적 OCR (CPU) | n/a (CPU 전용, GPU 과금 없음) | 78.6 | summary_metrics.csv · tesseract/sroie_2019 행 |
표: summary_metrics.csv — cost_per_1000_pages / pages_per_minute, sroie_2019 행. GPU 실행 시 $0.76/hr; Tesseract는 CPU 전용 실행. 비용에는 모델 초기화가 포함되어 있어, 배치가 커지면 페이지당 비용이 낮아집니다.
비용은 처리량을 따르지, 정확도를 따르지 않습니다
엔진을 비용과 문자 정확도로 순위를 매기면 두 순위는 거의 일치하지 않습니다. SROIE에서 가장 뛰어난 원본 텍스트 품질은 Surya2(CER 0.1915)에 있으며, 이는 $1.0609로 가장 비싼 엔진입니다. 반면 두 번째로 좋은 품질은 docTR(CER 0.1971)에 있으며, 이는 $0.0479로 가장 저렴합니다. 비용은 시간에 대한 청구서입니다: Surya2의 12.1페이지/분은 동일한 시간당 요금으로 docTR의 449.3페이지/분보다 약 37배 적은 처리량을 제공합니다.
아키텍처-가중치 상관관계는 실재하지만 느슨합니다. 문서 파싱 VLM(Surya2, Unlimited-OCR, PaddleOCR-VL)은 기존 2단계 OCR 엔진(docTR, EasyOCR, PaddleOCR)보다 전반적으로 비용이 높고, 파이프라인 파서 Docling은 그 사이에 위치합니다. 그러나 각 클래스 내부에서는 분포가 넓습니다. VLM 클러스터는 5.2배($0.2048~$1.0609), 기존 클러스터는 4.6배($0.0479~$0.2214)의 범위를 보이며, 이번 테스트에서 가장 작은 VLM인 0.9B 파라미터의 PaddleOCR-VL은 가장 저렴한 엔진과 4.3배 이내의 비용 차이를 보이는 반면, Surya2는 22.2배입니다. 실질적인 결론은 다음과 같습니다: "더 정확할수록 더 비싸다"는 가정은 자신의 문서로 측정해볼 때까지 거짓이라고 가정하세요. 이번 벤치마크에서 비용 순위와 정확도 순위의 관계는 사실상 분리되어 있습니다.
출처: summary_metrics.csv — pages_per_minute 열, sroie_2019 행. 모델 초기화를 포함한 실시간 페이지/분. Tesseract는 CPU 전용으로 실행됨.
| 모델 | 유형 | CER | 지연 시간 p50 (ms) | 페이지/분 | 비용 / 1K 페이지 | docTR 대비 비용 | 출처 |
|---|---|---|---|---|---|---|---|
| docTR | Traditional OCR | 0.1971 | 108.7 | 449.3 | $0.0479 | 1.00× | summary_metrics.csv · doctr/sroie_2019 행 |
| EasyOCR | Traditional OCR | 0.2833 | 413.6 | 124.5 | $0.1098 | 2.29× | summary_metrics.csv · easyocr/sroie_2019 행 |
| PaddleOCR | Traditional OCR | 0.2045 | 297.0 | 79.7 | $0.2214 | 4.62× | summary_metrics.csv · paddleocr/sroie_2019 행 |
| Tesseract | Traditional OCR (CPU) | 0.3347 | 670.9 | 78.6 | n/a (CPU) | n/a | summary_metrics.csv · tesseract/sroie_2019 행 |
| PaddleOCR-VL | Document-parsing VLM | 0.3370 | 694.3 | 68.2 | $0.2048 | 4.28× | summary_metrics.csv · paddleocr_vl_vllm/sroie_2019 행 |
| Docling | Pipeline parser | 0.5909 | 732.0 | 56.7 | $0.3978 | 8.31× | summary_metrics.csv · docling/sroie_2019 행 |
| Unlimited-OCR | Document-parsing VLM | 0.6552 | 1,600.7 | 34.4 | $0.3879 | 8.10× | summary_metrics.csv · unlimited_ocr/sroie_2019 행 |
| Surya2 | Document-parsing VLM | 0.1915 | 2,668.0 | 12.1 | $1.0609 | 22.16× | summary_metrics.csv · surya2/sroie_2019 행 |
표: summary_metrics.csv — cer / latency_p50_ms / pages_per_minute / cost_per_1000_pages, sroie_2019 행. 비용 비율은 docTR의 0.0479를 기준으로 단순 나눗셈으로 계산됨. Surya2의 CER은 방법론의 대소문자 통합 주의사항을 참고해야 함. Tesseract의 지연 시간은 CPU 하드웨어 기준이며, 비용 셀은 의도적으로 비어 있음.
지연 시간 열은 대화형 워크로드 관점을 더합니다: 볼당 비용과 페이지당 지연 시간은 동일한 벽시계 사실의 두 가지 관점입니다. docTR의 p50 108.7 ms는 1,000페이지당 가장 저렴하면서 대화형 응답에 가장 가까운 엔진이 되게 하며, Surya2의 2,668 ms p50은 가장 비싸면서 영수증 처리에 배치 전용 워크로드가 되게 합니다. 지연 시간 세부 사항은 관련 8엔진 비교에서 분석됩니다.
CORD: 비용은 데이터셋에 따라 달라집니다
문서 세트를 교체하면 비용 순위가 바뀝니다 — 이는 1,000페이지당 비용이 엔진 상수가 아님을 증명합니다. CORD v2에서는 EasyOCR이 가장 저렴한 엔진($0.0863)이 되고 docTR은 2위로 내려앉으며($0.0939), 양 끝의 기준은 유지됩니다: docTR은 하위권에 머물고 Surya2는 가장 비싼($1.1616) 상태를 유지합니다. CORD의 범위는 13.5×로 좁아집니다.
메커니즘은 실제 문서 세트에서의 처리량입니다: CORD의 인도네시아 영수증은 SROIE의 영어 영수증보다 짧고 텍스트 밀도가 낮아, 모든 엔진의 페이지/분이 변하고 1,000페이지당 비용도 따라 변합니다. 이 벤치마크에서는 두 데이터셋을 의도적으로 분리했습니다 — CORD는 기준 데이터의 주석 구조 팽창도 포함하고 있어 CER 측정값을 신뢰할 수 없습니다 — 따라서 SROIE와 CORD 열을 하나의 순위가 아닌 두 개의 독립적인 데이터 포인트로 취급하십시오.
출처: summary_metrics.csv — cost_per_1000_pages 열, cord_v2 행. EasyOCR 0.0863, docTR 0.0939, Unlimited-OCR 0.2063, PaddleOCR-VL 0.2409, PaddleOCR 0.3419, Docling 0.5382, Surya2 1.1616. Tesseract CPU 전용. 동일한 RTX 4090 @ $0.76/hr, 비용은 모델 초기화 포함.
| 순위 | 모델 | 유형 | 비용 / 1K 페이지 | 출처 |
|---|---|---|---|---|
| 1 | EasyOCR | 전통적 OCR (GPU) | $0.0863 | summary_metrics.csv · easyocr/cord_v2 행 |
| 2 | docTR | 전통적 OCR (GPU) | $0.0939 | summary_metrics.csv · doctr/cord_v2 행 |
| 3 | Unlimited-OCR | 문서 파싱 VLM | $0.2063 | summary_metrics.csv · unlimited_ocr/cord_v2 행 |
| 4 | PaddleOCR-VL | 문서 파싱 VLM | $0.2409 | summary_metrics.csv · paddleocr_vl_vllm/cord_v2 행 |
| 5 | PaddleOCR | 전통적 OCR (GPU) | $0.3419 | summary_metrics.csv · paddleocr/cord_v2 행 |
| 6 | Docling | 파이프라인 파서 | $0.5382 | summary_metrics.csv · docling/cord_v2 행 |
| 7 | Surya2 | 문서 파싱 VLM | $1.1616 | summary_metrics.csv · surya2/cord_v2 행 |
| — | Tesseract | 전통적 OCR (CPU) | n/a (CPU 전용, GPU 과금 없음) | summary_metrics.csv · tesseract/cord_v2 행 |
표: summary_metrics.csv — cost_per_1000_pages, cord_v2 행. CORD는 SROIE 순위와 별도로 유지됨; 비교의 요점은 1,000페이지당 비용이 문서 세트에 따라 변한다는 것이지, 특정 순위가 "우위"를 점하는 것이 아님.
월간 처리량 시나리오
1,000페이지당 비용은 예산 담당자가 필요한 처리량 계산에 직접 적용됩니다. SROIE 비용 기준으로 월 100,000페이지 처리 시, docTR의 GPU 시간은 월 $4.79, Surya2는 월 $106.09입니다 — 차이는 약 월 $101이며, 100만 페이지에서는 약 월 $1,013으로 벌어집니다. 이는 측정된 1,000페이지당 비용의 산술적 확장이지, 추가 실행 결과가 아닙니다.
| 월간 처리량 | docTR GPU 시간 | Surya2 GPU 시간 | 차이 | 기준 |
|---|---|---|---|---|
| 10,000페이지 | $0.48 (10 × $0.0479) | $10.61 (10 × $1.0609) | $10.13 | summary_metrics.csv cost_per_1000_pages, doctr / surya2 sroie_2019 행; 단순 곱셈으로 산출 — 실제 측정 실행 아님 |
| 100,000페이지 | $4.79 (100 × $0.0479) | $106.09 (100 × $1.0609) | $101.30 | |
| 1,000,000페이지 | $47.88 (1,000 × $0.0479) | $1,060.85 (1,000 × $1.0609) | $1,012.97 |
표: SROIE 2019 비용 기준 추정치 — 실제 측정 실행 아님. 각 셀은 측정된 cost_per_1000_pages에 처리량을 곱한 단순 계산이며, 동일한 $0.76/hr RTX 4090 요율을 적용했고, 가격은 2026년 8월 기준입니다. GPU 시간만 해당 — CPU, 스토리지, 전송, 오케스트레이션, 또는 LLM 후처리는 포함되지 않습니다. 월 1,000만 페이지 처리 시, 이 기준으로 Surya2만 약 월 $10,609에 달합니다 (10,000 × $1.0609).
Tesseract의 실제 비용 프로필: GPU 요금은 없지만 무료는 아닙니다
Tesseract는 벤치마크에서 유일한 CPU 전용 엔진이며, 비용 셀은 설계상 비어 있습니다 — 과금된 GPU 시간을 소비하지 않았으므로 $0.76/hr에 과금할 항목이 없습니다. 이는 비용이 없다는 것과는 다릅니다: Tesseract가 실행되는 CPU 인프라는 이 벤치마크가 정량화하지 않는 실제 비용이며, 필드 복구 한도는 비용을 후속 단계로 전가할 수 있습니다.
SROIE에서 Tesseract는 CPU로 여전히 78.6페이지/분을 유지했습니다 — 이는 7개 GPU 엔진 중 4개보다 높은 수치입니다(PaddleOCR-VL 68.2, Docling 56.7, Unlimited-OCR 34.4, Surya2 12.1). 이미 구축된 CPU 인프라에서 저용량으로 사용할 경우, 이는 실제로 비용 효율적입니다: GPU 대여 비용이 전혀 들지 않습니다. 단점은 텍스트뿐만 아니라 필드가 산출물일 때 나타납니다: Tesseract의 낮은 기본 텍스트 품질은 후속 LLM이 복구할 수 있는 범위를 제한합니다 — CORD LLM 필드 F1은 CORD CER 0.9523에서 0.163입니다 — 따라서 GPU 비용 절감은 다른 곳의 후처리 및 수정 비용으로 상쇄될 수 있습니다. CPU 대 GPU 트레이드오프는 전용 Tesseract vs PaddleOCR 대결의 주제이며, 후처리기 한도는 Regex vs LLM Field Extraction에서 다룹니다.
파이프라인 비용 ≠ 엔진 비용: LLM 후처리기 경계
이 페이지의 모든 숫자는 OCR 엔진의 GPU 요금일 뿐입니다. 프로덕션 추출 파이프라인은 일반적으로 OCR 텍스트 위에 LLM 필드 추출 단계를 추가합니다 — 벤치마크는 16번의 실행 모두에서 하나(deepseek-v4-flash)를 실행했습니다 — 그리고 해당 단계는 여기 어떤 엔진 수치에도 나타나지 않는 별도의 토큰당 API 비용입니다.
비교 CSV는 SROIE에서 후처리 단계의 토큰 수를 기록합니다 — 예를 들어, docTR의 OCR 텍스트는 네 개의 영수증 필드를 추출하는 데 151,131 프롬프트 + 25,377 완료 토큰이 소요되었습니다 — 그리고 해당 토큰 수는 추가 비용 추정의 기초가 됩니다. 이 페이지는 의도적으로 토큰을 달러로 변환하지 않습니다: LLM 가격은 제공자, 요금제 및 모델에 따라 다르며, 어떤 달러 수치든 즉시 구식이 됩니다. 엔진 비용과 파이프라인 비용은 예산의 두 라인이며, LLM 라인은 OCR 엔진이 아닌 프롬프트 설계와 제공자의 함수입니다.
| 엔진 | LLM 프롬프트 토큰 (SROIE) | LLM 완성 토큰 (SROIE) | 출처 |
|---|---|---|---|
| Tesseract | 128,285 | 24,561 | field_method_comparison.csv · tesseract/sroie_2019 행 |
| PaddleOCR | 134,746 | 26,059 | field_method_comparison.csv · paddleocr/sroie_2019 행 |
| EasyOCR | 138,689 | 25,607 | field_method_comparison.csv · easyocr/sroie_2019 행 |
| docTR | 151,131 | 25,377 | field_method_comparison.csv · doctr/sroie_2019 행 |
| Surya2 | 130,262 | 26,372 | field_method_comparison.csv · surya2/sroie_2019 행 |
| Docling | 157,191 | 26,087 | field_method_comparison.csv · docling/sroie_2019 행 |
| Unlimited-OCR | 185,705 | 25,876 | field_method_comparison.csv · unlimited_ocr/sroie_2019 행 |
| PaddleOCR-VL | 148,973 | 26,301 | field_method_comparison.csv · paddleocr_vl_vllm/sroie_2019 행 |
표: field_method_comparison.csv — llm_prompt_tokens / llm_completion_tokens, sroie_2019 행; llm_model = deepseek-v4-flash. 토큰 수는 361페이지짜리 SROIE 테스트 분할에서 영수증 4개 필드를 추출하는 한 번의 패스를 기준으로 합니다. 이는 LLM 후처리 비용 추정의 기반이 되며, LLM 가격은 제공자 및 요금제에 따라 다르므로 달러 환산은 제공하지 않습니다.
비용 추정 방법
자신의 워크로드에 대한 신뢰할 수 있는 비용 추정을 얻기 위해 8개 엔진 벤치마크를 다시 실행할 필요가 없습니다. 벤치마크의 방법 — 벽시계 시간 × 시간당 요금 — 은 네 단계와 하나의 계산 예시로 재현할 수 있습니다.
- 엔진과 측정된 처리량을 선택합니다. 동일한 문서 유형의 대리값으로 분당 페이지 수 열을 사용합니다. 자신의 문서 혼합에 대해서는 소규모 샘플에서 자체적으로 처리량을 측정하세요 — 위의 순위는 1,000페이지당 비용이 데이터셋에 따라 달라짐을 보여줍니다.
- 처리량을 벽시계 시간으로 변환합니다. N페이지의 경우
hours = (model init + N / pages_per_minute) / 60입니다. 모델 초기화는 프로세스/배치당 한 번만 지불되므로 분자에 포함되어야 합니다. - 시간당 요금을 곱합니다.
cost = hours × rate. 벤치마크의 요금은 $0.76/hr였습니다. 벤치마크 자체의 계산 예시: docTR SROIE 실행은 361페이지에 대해 벽시계 81,867ms가 소요되었습니다 → 0.0227hr × $0.76 = $0.0173(실행 비용) → × 1,000 / 361 = $0.0479/1,000페이지, CSV 행과 정확히 일치합니다. - 초기화 비용 분산 및 배치 크기를 고려합니다. 위의 81,867ms는 361페이지 배치의 초기화를 포함합니다. 1,000,000페이지에서는 동일한 초기화가 약 2,770배 희석되어 페이지당 비용이 순수한 정상 처리량에 접근합니다. 소규모 배치는 초기화 비용을 반복적으로 지불합니다 — 10페이지 배치는 10,000페이지 실행과 동일한 초기화 비용을 지불하므로 1,000페이지당 비용이 소규모 배치에서 급격히 증가합니다. 워크로드가 불규칙하면 배치를 크게 하거나 초기화 비용이 높은 경제성을 수용해야 합니다.
- 파이프라인 비용은 별도로 추가합니다. LLM 필드 추출은 토큰당 과금, 저장 및 전송은 바이트당 과금, Tesseract 스타일 CPU 전용 스택은 CPU 시간에 대해 과금됩니다 — 이 페이지의 1,000페이지당 수치에는 포함되어 있지 않습니다.
이것은 벤치마크 자체의 비용 기반에서 도출된 개략적인 방법입니다; 재정 조언이 아니며 정확한 수치는 하드웨어, 문서 혼합, 배치 크기, 활용도에 따라 달라집니다. $0.76/hr 요금은 2026년 8월 시간 스탬프가 찍힌 온디맨드 가격입니다 — 현재 요금으로 다시 계산하세요.
자주 묻는 질문
1,000페이지당 OCR 비용은 얼마인가요?
SROIE 2019 기준으로 1,000페이지당 $0.048(docTR)에서 $1.061(Surya2) 사이입니다. RTX 4090에서 시간당 $0.76로 측정했으며, 가격은 2026년 8월 기준입니다. 비용에는 모델 초기화 비용이 포함되어 있어 배치 크기가 커지면 페이지당 비용이 줄어듭니다. CORD v2에서는 동일 엔진이 $0.086(EasyOCR)에서 $1.162(Surya2)까지 나타납니다.
가장 저렴한 오픈소스 OCR 엔진은 무엇인가요?
docTR이 SROIE에서 1,000페이지당 $0.0479로 가장 저렴한 GPU 엔진으로 측정되었습니다. 데이터셋 의존성 주의사항이 중요합니다: CORD v2에서는 EasyOCR($0.0863)이 docTR($0.0939)을 약간 앞섰습니다. "가장 저렴한" 답변은 문서 세트에 따라 달라지며, 기준선은 두 데이터셋 모두에서 유지되었습니다.
가장 빠른 엔진이 가장 저렴한 이유는 무엇인가요?
비용이 시간당 $0.76로 벽시계 시간 기반이기 때문입니다: 페이지를 109ms에 처리하는 엔진(docTR)은 2,668ms 엔진(Surya2)이 페이지당 지불하는 시간의 약 1/25만 지불합니다. 측정형 GPU 과금 체제에서는 처리량이 곧 비용입니다. 이것이 비용 순위와 처리량 순위가 거의 거울 이미지처럼 나타나는 이유입니다.
Tesseract OCR는 무료인가요?
아니요 — Tesseract는 CPU 전용이므로 과금되는 GPU 시간을 소비하지 않아 벤치마크 CSV의 비용 셀이 의도적으로 비어 있습니다. 하지만 이는 제로 비용이 아닙니다: 실행되는 CPU 인프라에는 실제 비용이 발생하며, 필드 복구 한계로 인해 후속 후처리 비용이 발생할 수 있습니다. 이미 구축된 CPU 하드웨어에서 저용량으로 사용하면 실제로 비용 효율적일 수 있습니다 — SROIE에서 78.6페이지/분으로, 7개 GPU 엔진 중 4개보다 빠릅니다 — 하지만 "GPU 비용 없음"과 "무료"는 다른 개념입니다.
Surya2는 왜 1,000페이지당 비용이 그렇게 비싼가요?
벤치마크에서 가장 느린 엔진이기 때문입니다: SROIE에서 12.1페이지/분은 동일한 $0.76/hr 요율로 1,000페이지당 가장 많은 벽시계 시간을 의미합니다. 특히 가장 높은 문자 정확도(CER 0.1915)를 가지고 있는데, 이는 비용이 정확도가 아닌 시간을 따름을 보여주는 벤치마크의 가장 명확한 예시입니다.
페이지 수가 증가하면 OCR 페이지당 비용이 줄어들나요?
네, 일정 수준까지는 그렇습니다. 여기서 비용은 모델 초기화 비용을 포함하며, 이는 프로세스/배치당 한 번만 지불됩니다. 벤치마크의 docTR 실행은 361페이지에 대해 81,867ms 내에 초기화를 완료했으므로(manifest performance.run_wall_time_ms), 100만 페이지에서는 초기화 비용이 거의 0으로 희석되어 비용이 순수한 정상 상태 처리량에 접근합니다. 그 바닥은 정상 상태 비용 자체입니다. SROIE에서 docTR의 $0.0479/1K는 이미 바닥에 가깝고, Surya2의 $1.0609는 단순한 초기화 오버헤드가 아닌 진정으로 느린 정상 상태 추론을 반영합니다.
이 1,000페이지당 수치에 포함되지 않은 것은 무엇인가요?
LLM 후처리, Tesseract 스택용 CPU/인프라, 저장 및 전송, 오케스트레이션, GPU 활용률 격차, 그리고 클라우드/API OCR 서비스가 포함되지 않습니다. 이 수치들이 나타내는 엔진 GPU 청구서에는 이 모든 것이 포함되어 있지 않습니다. 클라우드 API는 기능에 따라 가격이 달라지는 호출당 과금 방식을 사용하며, 이는 임대 GPU 벽시계 시간과는 다른 비용 모델입니다. 이 페이지에서는 벤치마크되지 않았습니다.
이 숫자들은 어디서 왔나요?
모든 수치는 1차 벤치마크의 공개 CSV 파일의 한 행입니다. results/summary_metrics.csv와 results/field_method_comparison.csv가 ImageToTableai/benchmark-ocr에 호스팅되어 있으며, 각 실행에 대한 $0.76/hr 요율, 2026년 8월 가격 타임스탬프, 모델 버전 및 환경 해시가 기록된 manifest.json이 하나씩 있습니다.
방법론 및 출처
프로토콜
이 페이지는 제3자 주장을 조사한 것이 아니라, 독립적이고 재현 가능한 벤치마크 실행의 비용 차원을 보고합니다. 고정된 테스트 분할만 사용합니다: SROIE 2019 테스트와 CORD v2 테스트; 학습 분할은 평가하지 않았습니다. 모든 쌍은 동일한 이미지, 동일한 정답, 동일한 측정 프로토콜을 재사용했습니다. 모든 16회 실행이 error_rate 0.0으로 완료되었습니다.
런타임 환경 및 비용 기준
- 하드웨어: 모든 GPU 실행은 NVIDIA RTX 4090(24 GB)에서 수행; GPU 비용은 RunPod 온디맨드 요금인 $0.76/hr로 계산되며, 가격 타임스탬프(
price_recorded_at_utc 2026-08-13T08:00:00Z)는 각 실행의 마니페스트에 기록됩니다. Tesseract는 CPU 전용으로 실행되어 GPU 비용이 없습니다. - 비용 공식: 1,000페이지당 비용 = 벽시계 런타임 × $0.76/hr ×, 모델 초기화 포함. 비용 추정 방법 섹션의 docTR 예시(81,867 ms → $0.0479/1K)로 검증됨.
- 엔진: 모든 모델은 파인튜닝 없이 기본 상태로 실행. 실행 마니페스트에 따라 버전 고정(Tesseract 5.3.4, PaddleOCR 3.7.0, EasyOCR 1.7.2, docTR v1.0.1, Docling 2.119.0, Surya2 0.22.1, Unlimited-OCR vLLM-served, PaddleOCR-VL 1.6).
- LLM 후처리기: temperature 0의 API를 통한 deepseek-v4-flash; 토큰 수는 별도 파이프라인 비용의 기준으로 보고되며, OCR 엔진 비용에는 포함되지 않습니다.
- 필드 후처리: SROIE 필드 지표는
postprocessed_sroie_receipt_regex_*/ LLM 변형 — OCR 텍스트에서 추출된 필드이며, 네이티브 구조화된 출력이 아닙니다. - CORD 참고사항: CORD 정답 텍스트는 주석 구조를 포함하고 있어 모든 엔진의 원시 CER을 부풀리므로, CORD 행은 SROIE 순위와 별도로 유지됩니다. 비용 수치는 CER 참고사항의 영향을 받지 않지만, 두 데이터셋 모두 영수증에만 해당됩니다.
지표 정의
- 1,000페이지당 비용: 기록된 $0.76/hr 요금으로 1,000페이지를 처리하는 데 청구된 GPU 시간. CPU 전용 Tesseract의 경우 비어 있음.
- 분당 페이지 수: 모델 초기화 포함 벽시계 처리량.
- 지연 시간 p50/p95: 안정 상태의 페이지당 추론 시간.
- CER/WER: 정답 문자/단어에 대한 편집 거리. 대소문자 및 형식 규칙에 민감 — VLM 출력은 대소문자가 정규화되어 있어 CER이 VLM 오류를 과대 평가합니다.
- 필드값 F1: 추출된 필드값에 대한 정밀도/재현율 조화 평균.
출처 목록
- summary_metrics.csv (GitHub raw). 16행 = 8엔진 × 2영수증 데이터셋(sroie_2019, cord_v2). 열: model, compute_type, dataset, cer, wer, field_f1_regex, field_acc_regex, latency_p50_ms, latency_p95_ms, cost_per_1000_pages, pages_per_minute, error_rate. 이 페이지의 모든 비용, 처리량, 지연 시간, CER 수치는 이 파일의 행에서 추적됩니다.
- field_method_comparison.csv (GitHub raw). 16행; 열 model, dataset, llm_model (= deepseek-v4-flash), regex/LLM 필드값 정확도 및 F1, document-fields-exact, llm_median_latency_ms, llm_prompt_tokens, llm_completion_tokens. 모든 토큰 수와 LLM 필드-F1 수치는 이 파일의 행에서 추적됩니다.
- ImageToTableai/benchmark-ocr 저장소. 결과 CSV, 비식별화된 실행 매니페스트, 고정된 프로토콜, 재현을 위한 데이터셋 샘플 목록을 호스팅하는 공개 저장소.
- results/manifests/ (GitHub). 각 게시된 실행에 대한 비식별화된 manifest.json 파일로, 환경 지문, 모델 버전, 비용 메타데이터(
gpu_hourly_usd,price_recorded_at_utc), 벽시계 시간, 아티팩트 해시를 포함. - Huang et al., "ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction" (2019). SROIE 2019 데이터셋 정의, 작업 구조, 라이선스(CC-BY-4.0).
- Park et al., "CORD: A Consolidated Receipt Dataset for Post-OCR Parsing" (2020). CORD v2 데이터셋 정의, 중첩 필드 스키마, 라이선스(CC-BY-4.0).
한계점
- 단일 GPU 등급 및 단일 가격 시점: 모든 GPU 수치는 RTX 4090 1대, 시간당 $0.76 기준이며, 가격은 2026년 8월 기록입니다. GPU 스팟/온디맨드 가격은 변동됩니다 — 현재 요금으로 재계산하세요. 다른 GPU, 다중 GPU 서버, 배치 스케줄링은 처리량과 비용을 변화시킵니다.
- 영수증만 해당: SROIE 및 CORD 영수증입니다. 청구서, 양식, 계약서 또는 긴 문서의 비용, 처리량 및 정확도는 측정되지 않았으며, 위 순위는 영수증 외에는 일반화할 수 없습니다.
- 비용에 모델 초기화 포함 — 배치 크기 의존적: 수치는 벤치마크 실행 패턴을 반영합니다. 더 작은 배치는 초기화를 반복적으로 수행하므로 1,000페이지당 비용이 더 높고, 더 큰 배치는 안정 상태 하한에 접근합니다.
- CPU/GPU 비대칭: Tesseract(CPU)는 GPU 가속 엔진과 비교됩니다. 비용 이점은 GPU 과금이 제로이기 때문이지, 비용이 제로라는 의미가 아닙니다 — CPU 인프라, 전력 및 인건비는 정량화되지 않았으며, 현장 복구 한계는 후처리 비용을 증가시킬 수 있습니다.
- 클라우드/API 모델 미포함: AWS Textract, Google Document AI, Azure AI Document Intelligence 및 호스팅 OCR/VLM API는 포함되지 않았습니다. 호출당, 기능별 과금 방식은 렌트 GPU 벽시계 과금과 근본적으로 다르며, 비교를 의미하지 않습니다.
- 활용률 및 유휴 시간 미모델링: 수치는 GPU가 실행 벽시계 시간 동안 과금되고 그 외에는 사용되지 않는다고 가정합니다. 유휴, 다중 테넌트 또는 활용도가 낮은 GPU를 사용하는 실제 배포는 유효 비용이 다릅니다.
- LLM 후처리 비용은 달러로 환산되지 않음: 토큰 수(field_method_comparison.csv)가 기준입니다. LLM 가격은 제공자 및 요금제에 따라 다르며, 의도적으로 독자에게 맡깁니다.
- 파생 시나리오는 측정되지 않음: 월간 볼륨 표는 SROIE 비용 기준의 단순 산술이며, 파생 추정치로 레이블링되어 있습니다 — 추가 벤치마크 실행이 아닙니다.
- 표본 크기 및 버전 고정: 361 + 100개 표본; 결과는 위에 나열된 2026년 8월 모델 버전에 유효합니다. 최신 엔진 릴리스는 비용/처리량을 변화시킬 수 있으며, 한 자릿수 퍼센트 차이는 노이즈로 처리해야 합니다.
관련 참고 자료: Traditional OCR vs Document Parsing VLMs · docTR vs Surya2: CER Tie, Cost Gap · Tesseract vs PaddleOCR: CPU Cost Profile · Regex vs LLM Field Extraction · Document Processing Cost Breakdown
관련 읽을거리: AI Document Extraction Pricing (2026) · AI OCR vs Traditional OCR Accuracy · AI Image Data Extraction vs Traditional OCR