Custo de OCR por 1.000 páginas8 motores de código aberto, avaliados (2026)

Última revisão: 2026-08-18 · Nível de execução: oficial · Benchmark de primeira parte · 8 motores × 2 conjuntos de recibos

O que esta página cobre: Uma medição de primeira parte e reproduzível do custo por 1.000 páginas para 8 motores de OCR / análise de documentos de código aberto — Tesseract, PaddleOCR, EasyOCR, docTR, Docling, Surya2, Unlimited-OCR, PaddleOCR-VL — executados na mesma NVIDIA RTX 4090 (RunPod, $0,76/hora, preço registrado nos manifestos de execução) contra as mesmas divisões de teste fixas de SROIE 2019 (361 recibos em inglês) e CORD v2 (100 recibos em indonesio). Cada figura remonta a uma linha CSV publicada em o repositório público de benchmark de OCR (ImageToTableai/benchmark-ocr) — dados experimentais reproduzíveis, não uma agregação de relatos de terceiros.
O que esta página NÃO cobre: Qualquer tipo de documento que não seja recibos — nenhuna factura, formulário, contrato ou documento longo. Serviços de OCR por nube/API (AWS, Google, Azure e seus precios por llamada), modelos ajustados, compra/amortización de GPU (comprar hardware directamente vs alquilar por hora), almacenamiento y salida, y el costo en dólares de la extracción de campos por LLM (solo conteos de tokens) están fuera de alcance. El resumen completo de precisión/latencia de los 8 motores está en el benchmark de 8 motores de OCR vs VLM.

Declaración de rango: todas las cifras en dólares de esta página son para un nivel de GPU (RTX 4090) en una marca de tiempo de precio (agosto de 2026, $0,76/hora, registrada en los manifiestos de ejecución como price_recorded_at_utc 2026-08-13T08:00:00Z). Recalcule con las tarifas actuales antes de presupuestar. Solo conjuntos de recibos (SROIE 2019, CORD v2). Costo = tiempo de ejecución en tiempo real × la tarifa por hora, incluida la inicialización del modelo.

En la misma GPU, los mismos recibos y la misma base de facturación de $0,76/hora, el costo de OCR por 1.000 páginas en 8 motores de código abierto varía 22,2× — desde $0,0479 (docTR) hasta $1,0609 (Surya2) en SROIE 2019. Solo la elección del motor mueve el costo de OCR de código abierto en más de un orden de magnitud, y la clasificación sigue el tiempo de ejecución, no la precisión: el motor más barato (docTR) tiene la segunda mejor tasa de error de caracteres, mientras que el más caro (Surya2) tiene la mejor.

Los dos números que los escritores necesitan con más frecuencia: $0,048 por 1.000 páginas para el motor más barato medido (docTR, 449,3 páginas/min) vs $1,061 por 1.000 páginas para el más caro (Surya2, 12,1 páginas/min) — misma división de prueba, mismo nivel de GPU, misma marca de tiempo de precio. Tesseract es solo CPU: no consume horas de GPU facturadas y su celda de costo está vacía en el CSV fuente por diseño — no es cero, ni es gratis.

$0.0479
Motor de GPU mais barato medido: docTR em SROIE 2019, RTX 4090 @ $0.76/h, custo incl. inicialização do modelo (summary_metrics.csv, cost_per_1000_pages, linha doctr/sroie_2019)
22.2×
Variação de custo em SROIE entre os motores de GPU mais barato e mais caro ($0.0479 vs $1.0609) — mesma máquina, mesmos recibos, mesma base de cobrança (summary_metrics.csv, cost_per_1000_pages, linhas sroie_2019)
$1.0609
Motor de GPU mais caro medido: Surya2 em SROIE 2019 — também o de melhor precisão de caracteres (CER 0.1915), a dissociação entre custo e precisão em uma única linha (summary_metrics.csv, cost_per_1000_pages / cer, linha surya2/sroie_2019)

O custo por 1.000 páginas é o tempo de GPU faturado para processar 1.000 páginas à tarifa horária registrada — tempo de execução × $0.76/hora, em que o tempo de execução inclui a inicialização do modelo. Todo o ranking de custo desta página é calculado exatamente dessa forma; a aritmética detalhada é mostrada na seção Como Estimar Seu Próprio Custo e na linha de origem de cada tabela.

Como a cobrança é medida por hora, o custo acompanha o tempo, não a precisão: um mecanismo que lê uma página em 109 ms custa ~25× menos do que um que a lê em 2.668 ms à mesma tarifa. O custo de cada mecanismo diminui ainda mais à medida que o tamanho do lote aumenta, porque o custo único de inicialização do modelo é amortizado por mais páginas — os valores em $ abaixo refletem o padrão de execução do benchmark (divisão de teste fixa, medição warm_then_scored) e não serão os mesmos do custo da sua própria execução.

SROIE 2019: Ranking de Custo por 1.000 Páginas

Em 361 recibos em inglês, os mecanismos OCR tradicionais de dois estágios ocupam a extremidade barata e os VLMs de parsing de documentos, a extremidade cara — mas a variação dentro de cada família é o que surpreende: PaddleOCR-VL, um VLM compacto de 0,9B, chega a $0.2048, dentro de 4.3× do mecanismo mais barato, enquanto seu irmão VLM Surya2 custa 22.2× o mais barato — uma variação de 5.2× apenas dentro do cluster de VLMs.

Custo por 1.000 páginas no SROIE 2019 (RTX 4090 a $0.76/h, incl. init. do modelo): docTR $0.048, EasyOCR $0.110, PaddleOCR-VL $0.205, PaddleOCR $0.221, Unlimited-OCR $0.388, Docling $0.398, Surya2 $1.061. Tesseract é somente CPU (sem cobrança de GPU, excluído).

Fonte: summary_metrics.csv — coluna cost_per_1000_pages, linhas sroie_2019. docTR 0.0479, EasyOCR 0.1098, PaddleOCR-VL 0.2048, PaddleOCR 0.2214, Unlimited-OCR 0.3879, Docling 0.3978, Surya2 1.0609. Tesseract somente CPU: célula vazia no CSV (sem horas de GPU faturadas). Custo = tempo de execução × $0.76/h (RunPod RTX 4090, preço com registro de agosto de 2026), incluindo init. do modelo.

RankingModeloTipoCusto / 1K páginasPáginas/minFonte
1docTROCR tradicional (GPU)$0.0479449.3summary_metrics.csv · linha doctr/sroie_2019
2EasyOCROCR tradicional (GPU)$0.1098124.5summary_metrics.csv · linha easyocr/sroie_2019
3PaddleOCR-VLVLM de parsing de documentos$0.204868.2summary_metrics.csv · linha paddleocr_vl_vllm/sroie_2019
4PaddleOCROCR tradicional (GPU)$0.221479.7summary_metrics.csv · linha paddleocr/sroie_2019
5Unlimited-OCRVLM de parsing de documentos$0.387934.4summary_metrics.csv · linha unlimited_ocr/sroie_2019
6DoclingParser de pipeline$0.397856.7summary_metrics.csv · linha docling/sroie_2019
7Surya2VLM de parsing de documentos$1.060912.1summary_metrics.csv · linha surya2/sroie_2019
—TesseractOCR tradicional (CPU)n/d (só CPU, sem cobrança de GPU)78.6summary_metrics.csv · linha tesseract/sroie_2019

Tabela: summary_metrics.csv — cost_per_1000_pages / pages_per_minute, linhas sroie_2019 (361 samples cada, error_rate 0.0). GPU a $0.76/h (RTX 4090, preço com timestamp nos manifests); Tesseract rodou só em CPU (célula de custo vazia por design — sem horas de GPU cobradas, não custo zero). O custo incluye a inicialização do modelo, portanto o custo por página cae com lotes maiores.

O Custo Segue o Throughput, Não a Precisão

Classifique os motores por custo e por precisão de caracteres e as duas classificações quase não coincidem. A melhor qualidade de texto bruto no SROIE pertence ao Surya2 (CER 0,1915) — o motor mais caro, a $1,0609 — enquanto a segunda melhor pertence ao docTR (CER 0,1971) — o mais barato, a $0,0479. O custo é uma conta pelo tempo: os 12,1 páginas/min do Surya2 compram ~37× menos throughput que os 449,3 páginas/min do docTR à mesma tarifa horária.

A correlação peso-arquitectura é real, mas frouxa. Como classe, os VLMs de parsing de documentos (Surya2, Unlimited-OCR, PaddleOCR-VL) ficam acima dos motores OCR tradicionais de dois estágios (docTR, EasyOCR, PaddleOCR), com o parser de pipeline Docling entre eles. Mas dentro de cada classe, a dispersão é ampla — o cluster VLM abarca 5,2× ($0,2048 a $1,0609) e o cluster tradicional abarca 4,6× ($0,0479 a $0,2214) — e PaddleOCR-VL, o menor VLM da execução com 0,9B de parámetros, está a 4,3× do motor mais barato, enquanto Surya2 está a 22,2×. A conclusão prática: assuma que "mais preciso = mais caro" é falso até que você o mida em seus próprios documentos; neste benchmark, a relação entre a classificação de custo e a classificação de precisão está efetivamente desacoplada.

Páginas por minuto no SROIE 2019: docTR 449,3, EasyOCR 124,5, PaddleOCR 79,7, Tesseract 78,6 (CPU), PaddleOCR-VL 68,2, Docling 56,7, Unlimited-OCR 34,4, Surya2 12,1. O throughput é o motor do custo por 1.000 páginas em wall-clock.

Fonte: summary_metrics.csv — coluna pages_per_minute, linhas sroie_2019. Páginas/min em wall-clock, incluindo a inicialização do modelo. Tesseract foi executado apenas em CPU (78,6 páginas/min em hardware de CPU).

ModeloTipoCER (menor = melhor)Latência p50 (ms)Páginas/minCusto / 1K páginasCusto vs docTRFonte
docTROCR tradicional0.1971108.7449.3$0.04791.00×summary_metrics.csv · linha doctr/sroie_2019
EasyOCROCR tradicional0.2833413.6124.5$0.10982.29×summary_metrics.csv · linha easyocr/sroie_2019
PaddleOCROCR tradicional0.2045297.079.7$0.22144.62×summary_metrics.csv · linha paddleocr/sroie_2019
TesseractOCR tradicional (CPU)0.3347670.978.6n/d (CPU)n/dsummary_metrics.csv · linha tesseract/sroie_2019
PaddleOCR-VLVLM de análise de documentos0.3370694.368.2$0.20484.28×summary_metrics.csv · linha paddleocr_vl_vllm/sroie_2019
DoclingParser de pipeline0.5909732.056.7$0.39788.31×summary_metrics.csv · linha docling/sroie_2019
Unlimited-OCRVLM de análise de documentos0.65521.600,734.4$0.38798.10×summary_metrics.csv · linha unlimited_ocr/sroie_2019
Surya2VLM de análise de documentos0.19152.668,012.1$1.060922.16×summary_metrics.csv · linha surya2/sroie_2019

Tabela: summary_metrics.csv — cer / latency_p50_ms / pages_per_minute / cost_per_1000_pages, linhas sroie_2019. Os índices de custo são calculados por divisão simples em relação ao docTR’s 0.0479 (por exemplo, 1.0609 / 0.0479 = 22.16). O CER do Surya2 deve ser lido considerando a ressalva de normalização de maiúsculas/minúsculas descrita na metodologia (as saídas do VLM são normalizadas em maiúsculas/minúsculas; o CER sobrestima o erro do VLM). A latência do Tesseract é medida em hardware de CPU; sua célula de custo fica vazia por design (não há cobrança de GPU).

A coluna de latência adiciona a perspectiva de workloads interativos: custo por volume e latência por página são duas visões do mesmo fato de wall-clock. O p50 de 108,7 ms do docTR o torna tanto o mais barato por 1.000 páginas quanto o único motor próximo de resposta interativa; o p50 de 2.668 ms do Surya2 o torna tanto o mais caro quanto um workload somente em lote em recibos. Os detalhes de latência são analisados no comparativo de 8 motores.

CORD (Recibos Indonésios): O Custo Depende do Conjunto de Dados

Troque o conjunto de documentos e a classificação de custo muda — o que prova que o custo por 1.000 páginas não é uma constante do motor. No CORD v2, o EasyOCR se torna o motor mais barato ($0,0863) e o docTR cai para o segundo ($0,0939), enquanto os extremos se mantêm: o docTR continua perto do fundo e o Surya2 continua o mais caro ($1,1616). A variação no CORD se estreita para 13,5×.

O mecanismo é a taxa de transferência no conjunto de documentos real: os recibos indonésios do CORD são mais curtos e menos densos em texto do que os ingleses do SROIE, então as páginas por minuto de cada motor mudam, e o custo por 1.000 páginas acompanha. Os dois conjuntos de dados são mantidos deliberadamente separados neste benchmark — o CORD também carrega uma inflação de estrutura de anotação em seu ground truth que torna suas leituras de CER não confiáveis (ver metodologia) — então trate as colunas SROIE e CORD como dois pontos de dados independentes, não uma única classificação.

Custo por 1.000 páginas no CORD v2 (RTX 4090 a $0,76/h, incl. init do modelo): EasyOCR $0,086, docTR $0,094, Unlimited-OCR $0,206, PaddleOCR-VL $0,241, PaddleOCR $0,342, Docling $0,538, Surya2 $1,162. Tesseract somente CPU (excluído).

Fonte: summary_metrics.csv — coluna cost_per_1000_pages, linhas cord_v2. EasyOCR 0,0863, docTR 0,0939, Unlimited-OCR 0,2063, PaddleOCR-VL 0,2409, PaddleOCR 0,3419, Docling 0,5382, Surya2 1,1616. Tesseract somente CPU (célula vazia). Mesma RTX 4090 @ $0,76/h (preço com timestamp), custo incl. init do modelo.

RankModelTypeCost / 1K pagesSource
1EasyOCRTraditional OCR (GPU)$0.0863summary_metrics.csv · easyocr/cord_v2 row
2docTRTraditional OCR (GPU)$0.0939summary_metrics.csv · doctr/cord_v2 row
3Unlimited-OCRDocument-parsing VLM$0.2063summary_metrics.csv · unlimited_ocr/cord_v2 row
4PaddleOCR-VLDocument-parsing VLM$0.2409summary_metrics.csv · paddleocr_vl_vllm/cord_v2 row
5PaddleOCRTraditional OCR (GPU)$0.3419summary_metrics.csv · paddleocr/cord_v2 row
6DoclingPipeline parser$0.5382summary_metrics.csv · docling/cord_v2 row
7Surya2Document-parsing VLM$1.1616summary_metrics.csv · surya2/cord_v2 row
—TesseractTraditional OCR (CPU)n/a (CPU-only, no GPU billing)summary_metrics.csv · tesseract/cord_v2 row

Tabela: summary_metrics.csv — cost_per_1000_pages, linhas cord_v2 (100 amostras cada). O CORD é mantido separado do ranking SROIE (idioma diferente, estrutura de ground-truth diferente); o objetivo da comparação é mostrar que o custo por 1.000 páginas varia com o conjunto de documentos, não que um ranking "vence".

Cenários de Volume Mensal (Estimativas Derivadas)

Os valores por 1.000 páginas se multiplicam diretamente na matemática de volume que os responsáveis por orçamento precisam. Em 100.000 páginas/mês na base de custo SROIE, o tempo de GPU do docTR é de $4,79/mês e o do Surya2 é de $106,09/mês — uma diferença de aproximadamente $101/mês que se amplia para cerca de $1.013/mês em 1 milhão de páginas. Estas são extensões aritméticas dos valores medidos por 1.000 páginas, não execuções adicionais.

Volume mensalTempo de GPU do docTR (aritmético)Tempo de GPU do Surya2 (aritmético)DiferençaBase
10.000 páginas$0,48 (10 × $0,0479)$10,61 (10 × $1,0609)$10,13summary_metrics.csv cost_per_1000_pages, linhas doctr / surya2 sroie_2019; derivado por multiplicação simples — não é uma execução medida
100.000 páginas$4,79 (100 × $0,0479)$106,09 (100 × $1,0609)$101,30
1.000.000 páginas$47,88 (1.000 × $0,0479)$1.060,85 (1.000 × $1,0609)$1.012,97

Tabela: Estimativas derivadas na base de custo SROIE 2019 — não são execuções medidas. Cada célula é uma multiplicação simples do cost_per_1000_pages medido (docTR 0,0479, Surya2 1,0609; linhas sroie_2019 do summary_metrics.csv) pelo volume em milhares, à mesma taxa de $0,76/hora RTX 4090, preço com registro de agosto de 2026. Apenas tempo de GPU — sem CPU, armazenamento, egresso, orquestração ou pós-processamento LLM. Em 10 milhões de páginas/mês, só o Surya2 atinge aproximadamente $10.609/mês nessa base (10.000 × $1,0609).

Perfil de Custo Real do Tesseract: Sem Conta de GPU, Mas Não Grátis

O Tesseract é o único mecanismo somente CPU no benchmark, e sua célula de custo está vazia por design — ele não consumiu horas de GPU cobradas, então não há nada a cobrar a $0,76/hora. Isso não significa que não tenha custo: a infraestrutura de CPU em que ele roda (seu próprio hardware ou uma instância de CPU alugada) é um custo real que este benchmark não quantifica, e seu teto de recuperação de campos pode empurrar gastos adiante.

No SROIE, o Tesseract ainda sustentou 78,6 páginas/min na CPU — mais alto que quatro dos sete mecanismos GPU (PaddleOCR-VL 68,2, Docling 56,7, Unlimited-OCR 34,4, Surya2 12,1). Em baixo volume em infraestrutura de CPU já provisionada, isso o torna genuinamente econômico: nenhum aluguel de GPU. O problema aparece quando campos, não apenas texto, são o entregável: o texto base fraco do Tesseract limita o que um LLM downstream pode recuperar — seu F1 de campo LLM no CORD é 0,163 com um CER no CORD de 0,9523 (field_method_comparison.csv, linha tesseract/cord_v2) — então a economia de GPU pode ser compensada por gastos com pós-processamento e correção em outros lugares. A troca CPU-vs-GPU é o assunto do comparativo dedicado Tesseract vs PaddleOCR; o teto do pós-processador é coberto em a comparação de extração baseada em regras vs LLM.

Custo do Pipeline ≠ Custo do Mecanismo: A Fronteira do Pós-Processador LLM

Cada número nesta página é a conta de GPU do mecanismo OCR e nada mais. Pipelines de extração em produção comumente adicionam uma passada de extração de campos com LLM sobre o texto do OCR — o benchmark executou uma (deepseek-v4-flash) em todas as 16 execuções — e essa passada é um custo de API separado, por token que não aparece em nenhuma figura de mecanismo aqui.

O CSV de comparação registra as contagens de tokens para a passada de pós-processamento no SROIE — por exemplo, o texto OCR do docTR custou 151.131 tokens de prompt + 25.377 tokens de conclusão para extrair os quatro campos do recibo — e essas contagens de tokens são a base para estimar o gasto adicional. Esta página deliberadamente não converte tokens em dólares: o preço de LLM varia por provedor, plano e modelo, e qualquer valor em dólar ficaria desatualizado imediatamente. Custo do mecanismo e custo do pipeline são duas linhas no orçamento; a linha do LLM é uma função do design do seu prompt e do provedor, não do mecanismo OCR.

Mecanismo (fonte de texto OCR)Tokens de prompt do LLM (SROIE)Tokens de conclusão do LLM (SROIE)Fonte
Tesseract128,28524,561field_method_comparison.csv · linha tesseract/sroie_2019
PaddleOCR134,74626,059field_method_comparison.csv · linha paddleocr/sroie_2019
EasyOCR138,68925,607field_method_comparison.csv · linha easyocr/sroie_2019
docTR151,13125,377field_method_comparison.csv · linha doctr/sroie_2019
Surya2130,26226,372field_method_comparison.csv · linha surya2/sroie_2019
Docling157,19126,087field_method_comparison.csv · linha docling/sroie_2019
Unlimited-OCR185,70525,876field_method_comparison.csv · linha unlimited_ocr/sroie_2019
PaddleOCR-VL148,97326,301field_method_comparison.csv · linha paddleocr_vl_vllm/sroie_2019

Tabela: field_method_comparison.csv — llm_prompt_tokens / llm_completion_tokens, linhas sroie_2019; llm_model = deepseek-v4-flash. As contagens de tokens cobrem uma passagem de extração de campos (quatro campos de recibo) sobre a divisão de teste SROIE de 361 páginas. Esses são a base para estimar o gasto de pós-processamento do LLM; nenhuma conversão em dólar é fornecida porque o preço do LLM varia conforme o provedor e o plano.

Como Estimar Seu Próprio Custo

Você não precisa executar novamente um benchmark de 8 motores para obter uma estimação de custo defensável para sua própria carga de trabalho. O método do benchmark — tempo de reloj × sua tarifa horaria — se reproduz em quatro passos e um exemplo prático.

  1. Escolha seu motor e sua produtividade medida. Use a columna de páginas por minuto como proxy para um tipo de documento semelhante (por exemplo, docTR 449.3 ou Surya2 12.1 páginas/min em SROIE; linhas sroie_2019 em summary_metrics.csv). Para sua própria mistura de documentos, mida sua própria produtividade em uma pequena muestra — o ranking acima mostra que o custo por 1.000 páginas depende do conjunto de dados.
  2. Converta o volume em horas de reloj. horas = (inicialização do modelo + N / páginas_por_minuto) / 60 para N páginas. A inicialização do modelo é paga uma vez por processo/lote, portanto deve aparecer no numerador.
  3. Multiplique por sua tarifa horaria. costo = horas × tarifa. A tarifa do benchmark foi de $0.76/hr (RunPod RTX 4090, preço com timestamp de agosto de 2026). Exemplo prático do próprio benchmark: a execução de docTR em SROIE levou 81.867 ms de reloj para 361 páginas (performance.run_wall_time_ms em seu manifest redactado) → 0.0227 hr × $0.76 = $0.0173 para a execução → × 1.000 / 361 = $0.0479 por 1.000 páginas, coincidendo exatamente com a linha do CSV.
  4. Considere a amortização da inicialização e o tamanho do lote. Os 81.867 ms acima incluem a inicialização para um lote de 361 páginas; a 1.000.000 de páginas, a mesma inicialização se diluye ~2.770× e o custo por página se aproxima ao estado estacionario puro. Lotes pequenos pagam a inicialização repetidamente — um lote de 10 páginas paga a mesma inicialização que uma execução de 10.000 páginas, portanto o custo por 1.000 páginas aumenta bruscamente em tamanhos de lote pequenos. Se sua carga de trabalho é intermitente, aumente o tamanho dos lotes ou aceite uma economia dominada pela inicialização.
  5. Adicione custos de pipeline em linhas separadas. A extração de campos por LLM cobra por token (contagens de tokens no CSV de comparação), o almacenamiento e a transferência de dados cobran por byte, e as pilas de CPU-only estilo Tesseract cobran por tempo de CPU — nenhum desses está incluido nas cifras por 1.000 páginas desta página.

Este é um método de cálculo aproximado derivado da base de custo do próprio benchmark (reloj × tarifa, incl. inicialização do modelo); não é aconsejo financeiro e seus números exatos variam com hardware, mistura de documentos, tamanhos de lote e utilização. A tarifa de $0.76/hr é um preço on-demand com timestamp de agosto de 2026 — recalcule com tarifas atuais.

Perguntas Frequentes

Quanto custa o OCR por 1.000 páginas?

Entre $0.048 (docTR) e $1.061 (Surya2) por 1.000 páginas no SROIE 2019, medido em uma RTX 4090 a $0.76/hora com o preço datado de agosto de 2026 (summary_metrics.csv cost_per_1000_pages, linhas sroie_2019). O custo inclui a inicialização do modelo, então o custo por página diminui à medida que o tamanho do lote aumenta. No CORD v2, os mesmos motores variam de $0.086 (EasyOCR) a $1.162 (Surya2).

Qual motor de OCR de código aberto é o mais barato para executar?

docTR foi o motor de GPU mais barato medido, a $0.0479 por 1.000 páginas no SROIE (449,3 páginas/min, linha doctr/sroie_2019 do summary_metrics.csv) — e a ressalva de dependência do conjunto de dados importa: no CORD v2, o EasyOCR ($0.0863) superou o docTR ($0.0939). A resposta para "mais barato" depende do seu conjunto de documentos; as âncoras (docTR próximo do menor, Surya2 alto) se mantiveram em ambos.

Por que o motor mais rápido também é o mais barato?

Porque a conta é baseada em horas de relógio a $0.76/hora: o motor que termina uma página em 109 ms (docTR) paga ~1/25 das horas que um motor de 2.668 ms (Surya2) paga por página (summary_metrics.csv latency_p50_ms / cost_per_1000_pages, linhas sroie_2019). Sob cobrança de GPU por uso, a taxa de transferência é o custo — por isso a classificação de custo e a classificação de taxa de transferência são quase imagens espelhadas.

O Tesseract OCR é gratuito?

Não — o Tesseract é apenas CPU, então não consome horas de GPU cobradas e sua célula de custo está vazia no CSV de benchmark por design, mas isso não é um zero: a infraestrutura de CPU em que ele roda é um custo real, e seu teto de recuperação de campos (F1 de campo LLM do CORD 0.163, linha tesseract/cord_v2 do field_method_comparison.csv) pode empurrar gastos para o pós-processamento downstream. Em baixo volume em hardware de CPU já provisionado, ele pode ser genuinamente econômico — 78,6 páginas/min no SROIE, mais rápido que quatro dos sete motores de GPU — mas "sem conta de GPU" e "gratuito" são afirmações diferentes.

Por que o Surya2 é tão caro por 1.000 páginas?

Porque é o motor mais lento do benchmark: 12,1 páginas/min no SROIE significa mais horas de wall-clock por 1.000 páginas à mesma taxa de $0,76/hora (summary_metrics.csv pages_per_minute / cost_per_1000_pages, linha surya2/sroie_2019). Notavelmente, também tem a melhor precisão de caracteres (CER 0,1915) — o exemplo mais claro do benchmark de que o custo segue o tempo, não a precisão.

O custo de OCR por página cai conforme o volume cresce?

Sim, até um piso. O custo aqui inclui a inicialização do modelo, paga uma vez por processo/lote; a execução do docTR no benchmark pagou a inicialização dentro de 81.867 ms para 361 páginas (manifest performance.run_wall_time_ms), então em 1 milhão de páginas essa inicialização é diluída para quase zero e o custo se aproxima da vazão pura em estado estacionário. O piso é o próprio custo em estado estacionário — os $0,0479/1K do docTR no SROIE já estão perto do piso; os $1,0609 do Surya2 refletem inferência genuinamente lenta em estado estacionário, não apenas sobrecarga de inicialização.

O que não está incluído nesses valores por 1.000 páginas?

Pós-processamento com LLM (um custo separado de API por token; contagens de tokens em field_method_comparison.csv), CPU/infraestrutura para stacks estilo Tesseract, armazenamento e egress, orquestração, lacunas de utilização de GPU e serviços de OCR em nuvem/API — nada disso está na conta de GPU do motor que esses valores representam. APIs em nuvem também cobram por chamada com preços dependentes de recursos, um modelo de custo diferente do tempo de wall-clock em GPU alugada; elas não são avaliadas nesta página.

De onde vêm esses números?

Cada valor é uma linha dos CSVs publicados do benchmark de primeira parte — results/summary_metrics.csv (custo por 1.000 páginas, vazão, latência, precisão) e results/field_method_comparison.csv (tokens do pós-processador LLM e F1 de campos) — hospedados em ImageToTableai/benchmark-ocr, com um manifest.json editado por execução registrando a taxa de $0,76/hora, o carimbo de data/hora do preço de agosto de 2026, versões de modelo e hashes de ambiente.

Metodologia e Fontes

Protocolo

Esta página relata a dimensão de custo de uma execução de benchmark independente e reproduzível (nível oficial) — não uma pesquisa de alegações de terceiros. Apenas divisões de teste fixas: teste SROIE 2019 (361 recibos em inglês, campos simples empresa/data/endereço/total) e teste CORD v2 (100 recibos em indonésio, campos aninhados menu/sub_total/total); divisões de treinamento nunca foram avaliadas. Cada par (motor × conjunto de dados) reutilizou as mesmas imagens, o mesmo ground truth e o mesmo protocolo de medição (warm_then_scored: uma passagem de aquecimento fixa precede a passagem pontuada). Todas as 16 execuções foram concluídas com error_rate 0.0 (coluna error_rate em summary_metrics.csv).

Ambiente de Execução e Base de Custo

  • Hardware: todas as execuções de GPU em uma NVIDIA RTX 4090 (24 GB); custo de GPU calculado na taxa on-demand da RunPod de $0.76/hora, com o timestamp do preço (price_recorded_at_utc 2026-08-13T08:00:00Z) registrado no manifesto editado de cada execução. O Tesseract foi executado somente em CPU e não tem custo de GPU (célula de custo vazia no CSV — por design, não um zero).
  • Fórmula de custo: custo por 1.000 páginas = tempo de execução wall-clock × $0.76/hora × (1.000 / páginas processadas), incluindo inicialização do modelo. Verificado pelo exemplo docTR detalhado na seção Como Estimar (81.867 ms → $0.0479/1K).
  • Motores: todos os modelos executados prontos para uso, sem fine-tuning. Versões fixadas conforme os manifestos de execução (Tesseract 5.3.4, PaddleOCR 3.7.0, EasyOCR 1.7.2, docTR v1.0.1, Docling 2.119.0, Surya2 0.22.1, Unlimited-OCR servido via vLLM, PaddleOCR-VL 1.6).
  • Pós-processador LLM: deepseek-v4-flash via API na temperatura 0 (coluna llm_model em field_method_comparison.csv); suas contagens de tokens são relatadas como base para custo de pipeline separado — os valores de custo do motor OCR nunca o incluem.
  • Pós-processamento de campos: métricas de campo SROIE são postprocessed_sroie_receipt_regex_* / variantes LLM — campos extraídos do texto do OCR, não da saída estruturada nativa.
  • Ressalva CORD: o texto ground truth do CORD incorpora estrutura de anotação, o que infla o CER bruto para todos os motores; linhas CORD são, portanto, mantidas separadas dos rankings SROIE. Os valores de custo (baseados em wall-clock) não são afetados pela ressalva do CER, mas ambos os conjuntos de dados ainda são apenas recibos.

Definições de Métricas

  • Custo por 1.000 páginas: horas de GPU cobradas para 1.000 páginas à taxa registrada de $0,76/hora, tempo real incluindo a inicialização do modelo. Vazio para Tesseract somente CPU.
  • Páginas por minuto: taxa de transferência em tempo real, incluindo a inicialização do modelo.
  • Latência p50/p95: tempo de inferência por página em estado estável (avaliado após aquecimento, excluindo o carregamento do modelo).
  • CER/WER: distância de edição (inserções + exclusões + substituições) sobre caracteres/palavras de referência. Sensível a maiúsculas/minúsculas e convenções de formatação — as saídas do VLM são normalizadas em relação a maiúsculas/minúsculas, então o CER superestima o erro do VLM (veja a página de resumo).
  • F1 de valor de campo: média harmônica de precisão/recall sobre os valores de campo extraídos, por pós-processador (regex ou LLM).

Lista de Fontes

  1. summary_metrics.csv (GitHub raw). 16 linhas = 8 mecanismos × 2 conjuntos de dados de recibos (sroie_2019, cord_v2). Colunas: model, compute_type, dataset, cer, wer, field_f1_regex, field_acc_regex, latency_p50_ms, latency_p95_ms, cost_per_1000_pages, pages_per_minute, error_rate. Todo custo, taxa de transferência, latência e figura de CER nesta página remonta a uma linha aqui.
  2. field_method_comparison.csv (GitHub raw). 16 linhas; colunas model, dataset, llm_model (= deepseek-v4-flash), precisão e F1 de valor de campo regex/LLM, document-fields-exact, llm_median_latency_ms, llm_prompt_tokens, llm_completion_tokens. Toda contagem de tokens e figura de F1 de campo LLM remonta a uma linha aqui.
  3. Repositório ImageToTableai/benchmark-ocr. Repositório público que hospeda os CSVs de resultados, manifestos de execução editados, protocolo congelado e listas de amostras de conjuntos de dados (divisões de teste fixas) para reprodução.
  4. results/manifests/ (GitHub). Um manifest.json editado por execução publicada (16 execuções) com a impressão digital do ambiente, versões do modelo, metadados de custo (gpu_hourly_usd, price_recorded_at_utc), tempo real e hashes de artefatos.
  5. Huang et al., "ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction" (2019). Definição do conjunto de dados SROIE 2019, estrutura da tarefa e licença (CC-BY-4.0).
  6. Park et al., "CORD: A Consolidated Receipt Dataset for Post-OCR Parsing" (2020). Definição do conjunto de dados CORD v2, esquema de campos aninhados e licença (CC-BY-4.0).

Limitações

  • Nível único de GPU e timestamp único de preço: todos os dados de GPU são de uma RTX 4090 a US$ 0,76/hora, preço registrado em agosto de 2026. Os preços de GPU spot/on-demand mudam — recalcule com as taxas atuais; outras GPUs, servidores multi-GPU e agendamento em lote alteram a taxa de transferência e o custo.
  • Apenas recibos: recibos SROIE (inglês) e CORD (indonésio). Custo, taxa de transferência e precisão em faturas, formulários, contratos ou documentos longos não foram medidos; as classificações acima não são generalizáveis além de recibos.
  • O custo inclui a inicialização do modelo — depende do tamanho do lote: os valores refletem o padrão de execução do benchmark (divisões fixas de 361/100 páginas, pré-aquecimento e pontuação). Lotes menores pagam a inicialização repetidamente e custam mais por 1.000 páginas; lotes maiores se aproximam do piso de estado estacionário.
  • Assimetria CPU/GPU: o Tesseract (CPU) é comparado a mecanismos acelerados por GPU. Sua vantagem de custo reflete a ausência de cobrança de GPU, não custo zero — infraestrutura de CPU, energia e tempo de equipe não são quantificados, e seu teto de recuperação de campos (F1 de campos LLM CORD 0,163) pode transferir gastos para o pós-processamento.
  • Sem modelos em nuvem/API: AWS Textract, Google Document AI, Azure AI Document Intelligence e APIs OCR/VLM hospedadas não estão incluídos; seus preços por chamada e por recurso diferem fundamentalmente da cobrança por tempo de uso de GPU alugada, e nenhuma comparação é implícita.
  • Utilização e tempo ocioso não modelados: os valores assumem que a GPU é cobrada pelo tempo de execução e não é usada para mais nada; implantações reais com GPUs ociosas, multilocatárias ou subutilizadas têm custos efetivos diferentes.
  • O custo do pós-processamento LLM não é convertido em dólares: as contagens de tokens (field_method_comparison.csv) são a base; o preço do LLM varia por provedor e plano e fica intencionalmente a critério do leitor.
  • Cenários derivados não são medidos: a tabela de volume mensal é aritmética simples baseada no custo do SROIE, rotulada como estimativas derivadas — não execuções adicionais do benchmark.
  • Tamanho da amostra e fixação de versão: 361 + 100 amostras; os resultados valem para as versões de modelo de agosto de 2026 listadas acima. Lançamentos de mecanismos mais recentes podem alterar custo/taxa de transferência; diferenças de porcentagem de um dígito devem ser tratadas como ruído.

Referências relacionadas: OCR tradicional vs VLMs de análise de documentos · docTR vs Surya2: Empate em CER, Diferença de Custo · Tesseract vs PaddleOCR: Perfil de Custo de CPU · como regex e LLMs extraem campos · Detalhamento de Custos de Processamento de Documentos

Leitura relacionada: Preços de Extração de Documentos com IA (2026) · precisão em nível de campo em OCR com IA vs OCR tradicional · como a extração por visão de IA lê imagens de forma diferente do OCR

📮 contact email: [email protected]