Referências
Referências de dados e definições de terminologia para IA documental. Cada página é verificada na fonte e projetada para ser citada.
Estatísticas
Comparativa direta de primeira parte: docTR vs Docling em 361 recibos SROIE + 100 CORD — latência 6,7x, custo 8,3x, CER 3,0x, inversão de campo regex 2,9x. Metodologia.
Comparativo direto: docTR vs Surya2 em 361 recibos SROIE + 100 CORD — empate em CER, inversão de 4,2x no F1 de campo, diferença de custo de 22x, metodologia.
Benchmark de primeira parte: EasyOCR vs docTR em 361 recibos SROIE + 100 CORD — docTR com CER 30% menor, F1 de campo LLM 1,66x; EasyOCR com F1 regex 1,93x.
Benchmark próprio: custo de OCR por 1.000 páginas para 8 mecanismos de código aberto em RTX 4090 — US$ 0,048 (docTR) a US$ 1,061 (Surya2). SROIE + CORD, metodologia.
Latência por página para 8 mecanismos de OCR de código aberto em RTX 4090 — 108,7 ms (docTR) a 2.668 ms (Surya2) p50. Caudas p95, throughput, metodologia.
Comparativo direto: PaddleOCR vs EasyOCR em recibos — CER 0,204 vs 0,283, 2,2x F1 de regex, 2x diferença de custo, paradoxo de LLM. Metodologia.
Benchmark de primeira parte: Surya2 vs Unlimited-OCR vs PaddleOCR-VL em 361 recibos SROIE + 100 CORD — F1 de campos, justiça de CER, custo, latência.
Comparativo direto de primeira parte: Tesseract (CPU) vs PaddleOCR (GPU) em 361 recibos SROIE + 100 CORD — CER, F1 de campos, paridade de throughput, custo. Metodologia.
Benchmark de primeira parte: 8 mecanismos de OCR de código aberto vs VLMs de análise de documentos em 361 recibos SROIE + 100 CORD — CER, F1 de campo, latência, custo. Metodologia incluída.
Por que o CER de VLM é inflado: a normalização de caixa e a estrutura do texto de referência adicionan erros fantasma. Dados próprios de SROIE + CORD — o F1 de campo é a métrica justa entre famílias.
Benchmark próprio: o pós-processamento com LLM supera o regex na extração de campos de recibos, F1 de campo para 8 modelos de OCR em SROIE + CORD, metodologia incluida.
Benchmark próprio de 5 modelos de OCR de código aberto em 461 recibos (SROIE + CORD): CER, WER, F1 de campo, latência, custo por 1.000 páginas.
Taxas de exceções na automação de documentos: 9% para os melhores da categoria vs. 22% para a média, causas raiz, custos de revisão e trade-offs de limites com todas as fontes citadas.
Benchmarks independentes sobre custo de processamento de documentos por registro: manual $8-16, modelo $2-5, IA a partir de $0,02/página. Por tipo de documento, tamanho e região.
Dados de precisão de OCR de manuscritos: IAM CER 1,2-1,7%, árabe 8,9-16%, histórico 71-82%. Detalhado por escrita, modelo e tipo de documento. 15 fontes citáveis.
Referências sobre tempo de processamento de faturas: 12,5 min de manuseio manual vs. ciclo de 9,2 dias, por método, complexidade e etapa — com fontes completas para citação.
Benchmarks independentes sobre o ROI da automatização da entrada de dados: retorno em 3-12 meses, ahorros de 60-80%, volume de equilíbrio, além de uma fórmula para modelar seu retorno.
Benchmarks independentes sobre a precisão do OCR por tipo de documento: 99,2-99,8% PDFs digitais, 98-99% digitalizações, 46-95% manuscrito, TEDS de tabelas. 15 fontes citáveis.
Precisão de OCR em recibos por condição e campo: 90%+ em digitalizações limpas, 55-73% em papel térmico desbotado, 67-69% em fotos de celular. Totais 95-99%, estabelecimentos 73-88%. 14 fontes.
Referências independentes sobre taxas de erro na entrada manual de dados: 1-4% em nível de campo, até 40% em nível de registro, por tipo de documento, setor e função.
Definições
A captura de dados transforma papel, digitalizações, PDFs e fotos em dados legíveis por máquina. Como funciona, seus tipos e equívocos.
ICR é o reconhecimento de caracteres por machine learning para texto escrito à mão em letra de forma. Como evoluiu do OCR, as diferenças entre ICR vs OCR vs IWR e onde é usado.
A Extração de Informações-Chave (KIE) extrai campos como números de fatura e datas de documentos para dados estruturados. Como funciona, limites e equívocos.
Um PDF pesquisável é um documento digitalizado com uma camada de texto OCR invisível — você pode selecionar, copiar e usar Ctrl+F no texto. Como funciona, regras de PDF/A e armadilhas comuns.
A precisão em nível de campo conta campos extraídos corretamente; a precisão em nível de caractere conta caracteres lidos corretamente. 99% de precisão de caracteres não significa 99% de dados precisos.
IDP é um software de IA que captura, classifica, extrai e valida dados de documentos. Como funciona, evolução do OCR para LLMs e equívocos comuns.
A taxa de STP mede a parcela de documentos processados sem intervenção humana — média do setor de 32%, melhor da categoria 49%, IA 60-80%. Fórmula e equívocos.
O OCR converte imagens de texto impresso, manuscrito ou digitado em dados legíveis por máquina. Como funciona, os 4 tipos de OCR, sua história e casos de uso.