Referências

Referências de dados e definições de terminologia para IA documental. Cada página é verificada na fonte e projetada para ser citada.

Estatísticas

Estatística
docTR vs Docling em Recibos: Passagem Única vs Pipeline (2026)

Comparativa direta de primeira parte: docTR vs Docling em 361 recibos SROIE + 100 CORD — latência 6,7x, custo 8,3x, CER 3,0x, inversão de campo regex 2,9x. Metodologia.

Estatística
Benchmark de OCR de Recibos: docTR vs Surya2 — Empate em CER, Diferença de Custo (2026)

Comparativo direto: docTR vs Surya2 em 361 recibos SROIE + 100 CORD — empate em CER, inversão de 4,2x no F1 de campo, diferença de custo de 22x, metodologia.

Estatística
EasyOCR vs docTR em Recibos: Campeão de Velocidade vs Extrator de Campos (2026)

Benchmark de primeira parte: EasyOCR vs docTR em 361 recibos SROIE + 100 CORD — docTR com CER 30% menor, F1 de campo LLM 1,66x; EasyOCR com F1 regex 1,93x.

Estatística
Custo de OCR por 1.000 páginas: 8 mecanismos de código aberto avaliados (2026)

Benchmark próprio: custo de OCR por 1.000 páginas para 8 mecanismos de código aberto em RTX 4090 — US$ 0,048 (docTR) a US$ 1,061 (Surya2). SROIE + CORD, metodologia.

Estatística
Benchmark de Latência de OCR: p50/p95, Throughput e Picos de Cauda (2026)

Latência por página para 8 mecanismos de OCR de código aberto em RTX 4090 — 108,7 ms (docTR) a 2.668 ms (Surya2) p50. Caudas p95, throughput, metodologia.

Estatística
PaddleOCR vs EasyOCR em Recibos: Benchmark de Precisão vs Custo (2026)

Comparativo direto: PaddleOCR vs EasyOCR em recibos — CER 0,204 vs 0,283, 2,2x F1 de regex, 2x diferença de custo, paradoxo de LLM. Metodologia.

Estatística
Surya2 vs Unlimited-OCR vs PaddleOCR-VL: Benchmark de VLM para Recibos (2026)

Benchmark de primeira parte: Surya2 vs Unlimited-OCR vs PaddleOCR-VL em 361 recibos SROIE + 100 CORD — F1 de campos, justiça de CER, custo, latência.

Estatística
Tesseract vs PaddleOCR em Recibos: CPU Legado vs GPU Moderna (2026)

Comparativo direto de primeira parte: Tesseract (CPU) vs PaddleOCR (GPU) em 361 recibos SROIE + 100 CORD — CER, F1 de campos, paridade de throughput, custo. Metodologia.

Estatística
OCR tradicional vs VLMs de análise de documentos: Benchmark de recibos (2026)

Benchmark de primeira parte: 8 mecanismos de OCR de código aberto vs VLMs de análise de documentos em 361 recibos SROIE + 100 CORD — CER, F1 de campo, latência, custo. Metodologia incluída.

Estatística
Por que o CER engana para VLMs de análise de documentos: quantificado (2026)

Por que o CER de VLM é inflado: a normalização de caixa e a estrutura do texto de referência adicionan erros fantasma. Dados próprios de SROIE + CORD — o F1 de campo é a métrica justa entre famílias.

Estatística
regex vs LLM Field Extraction for Receipts: Benchmark Data (2026)

Benchmark próprio: o pós-processamento com LLM supera o regex na extração de campos de recibos, F1 de campo para 8 modelos de OCR em SROIE + CORD, metodologia incluida.

Estatística
Resultados do Benchmark de OCR de Recibos: Precisão, Latência e Custo (2026)

Benchmark próprio de 5 modelos de OCR de código aberto em 461 recibos (SROIE + CORD): CER, WER, F1 de campo, latência, custo por 1.000 páginas.

Estatística
Taxas de Exceções na Automação de Documentos: Fila, Custo, Limite (2026)

Taxas de exceções na automação de documentos: 9% para os melhores da categoria vs. 22% para a média, causas raiz, custos de revisão e trade-offs de limites com todas as fontes citadas.

Estatística
Custo de Processamento de Documentos por Registro: Manual, Modelo, IA (2026)

Benchmarks independentes sobre custo de processamento de documentos por registro: manual $8-16, modelo $2-5, IA a partir de $0,02/página. Por tipo de documento, tamanho e região.

Estatística
Precisão do Reconhecimento de Manuscritos: Escrita, Modelo e Tipo de Documento (2026)

Dados de precisão de OCR de manuscritos: IAM CER 1,2-1,7%, árabe 8,9-16%, histórico 71-82%. Detalhado por escrita, modelo e tipo de documento. 15 fontes citáveis.

Estatística
Referências de Tempo de Processamento de Faturas: Manual, OCR e IA (2026)

Referências sobre tempo de processamento de faturas: 12,5 min de manuseio manual vs. ciclo de 9,2 dias, por método, complexidade e etapa — com fontes completas para citação.

Estatística
ROI da Entrada de Dados Manual vs. Automatizada: Retorno e Ahorros no Primeiro Ano (2026)

Benchmarks independentes sobre o ROI da automatização da entrada de dados: retorno em 3-12 meses, ahorros de 60-80%, volume de equilíbrio, além de uma fórmula para modelar seu retorno.

Estatística
Precisão do OCR por Tipo de Documento: PDF, Digitalização, Manuscrito, Tabelas (2026)

Benchmarks independentes sobre a precisão do OCR por tipo de documento: 99,2-99,8% PDFs digitais, 98-99% digitalizações, 46-95% manuscrito, TEDS de tabelas. 15 fontes citáveis.

Estatística
Precisão de OCR em Recibos: Térmico, Amassado, Desbotado, Multimoeda (2026)

Precisão de OCR em recibos por condição e campo: 90%+ em digitalizações limpas, 55-73% em papel térmico desbotado, 67-69% em fotos de celular. Totais 95-99%, estabelecimentos 73-88%. 14 fontes.

Estatística
Taxas de Erro na Entrada Manual de Dados: 1-4% por Tipo, Setor e Função (2026)

Referências independentes sobre taxas de erro na entrada manual de dados: 1-4% em nível de campo, até 40% em nível de registro, por tipo de documento, setor e função.

Definições

Definição
O que é Data Capture no Processamento de Documentos?

A captura de dados transforma papel, digitalizações, PDFs e fotos em dados legíveis por máquina. Como funciona, seus tipos e equívocos.

Definição
O que é o Reconhecimento Inteligente de Caracteres (ICR)?

ICR é o reconhecimento de caracteres por machine learning para texto escrito à mão em letra de forma. Como evoluiu do OCR, as diferenças entre ICR vs OCR vs IWR e onde é usado.

Definição
O que é Extração de Informações-Chave (KIE) em IA de Documentos?

A Extração de Informações-Chave (KIE) extrai campos como números de fatura e datas de documentos para dados estruturados. Como funciona, limites e equívocos.

Definição
O que é um PDF pesquisável?

Um PDF pesquisável é um documento digitalizado com uma camada de texto OCR invisível — você pode selecionar, copiar e usar Ctrl+F no texto. Como funciona, regras de PDF/A e armadilhas comuns.

Definição
Precisão em nível de campo vs. precisão em nível de caractere: qual é a diferença?

A precisão em nível de campo conta campos extraídos corretamente; a precisão em nível de caractere conta caracteres lidos corretamente. 99% de precisão de caracteres não significa 99% de dados precisos.

Definição
O que é Processamento Inteligente de Documentos (IDP)?

IDP é um software de IA que captura, classifica, extrai e valida dados de documentos. Como funciona, evolução do OCR para LLMs e equívocos comuns.

Definição
O que é a Taxa de Straight-Through Processing (STP) na Automação de Documentos?

A taxa de STP mede a parcela de documentos processados sem intervenção humana — média do setor de 32%, melhor da categoria 49%, IA 60-80%. Fórmula e equívocos.

Definição
O que é o Reconhecimento Óptico de Caracteres (OCR)?

O OCR converte imagens de texto impresso, manuscrito ou digitado em dados legíveis por máquina. Como funciona, os 4 tipos de OCR, sua história e casos de uso.

📮 contact email: [email protected]