Precisão de OCR em Recibos: Papel Térmico, Amassado, Desbotado,e Benchmarks Multimoeda (2026)

Última revisão: 2026-08-10 · Cobertura de dados: Parcial · Fontes: 14 estudos independentes

O que esta página cobre: Benchmarks de precisão de OCR e extração de informações-chave específicos para recibos, agregados de artigos revisados por pares e competições (ICDAR SROIE, CORD, KORIE, ReceiptSense, IJSAT), estudos de engenharia de fornecedores do mundo real (AWS Textract em recibos capturados por celular) e benchmarks da indústria com metodologia transparente (BusinessWareTech, Google Developer Forum, Doubleword). Divididos por condição física do recibo, tipo de campo, nível do mecanismo e idioma — com a distinção de métrica de caractere/palavra/campo rotulada em cada figura. Todas as fontes são de terceiros e verificáveis de forma independente.
O que esta página NÃO cobre: Precisão geral de OCR por tipo de documento (veja Precisão de OCR por Tipo de Documento), precisão de reconhecimento de escrita manual (veja Precisão de Reconhecimento de Escrita Manual) ou alegações específicas de fornecedores além dos números de benchmark citados abaixo.

Todos os números abaixo são baseados em estudos de terceiros publicamente disponíveis e relatórios da indústria citados na seção de metodologia. Onde as fontes divergem, são usados intervalos conservadores (valores mais baixos–mais altos relatados). Os níveis de métrica (caractere / palavra / campo) são rotulados por figura e nunca combinados em um único número. Esta página é um benchmark direcional, não uma previsão precisa para qualquer mecanismo ou organização individual.

A história do OCR em recibos começa com um teto, não com uma linha de base. No único benchmark padronizado de recibos — o SROIE do ICDAR 2019 — o melhor sistema de extração de informações-chave obteve 90,49% de F1 em recibos digitalizados limpos, e mais da metade das 18 equipes participantes obteve menos de 80% (Huang et al., 2019). Fluxos de trabalho de despesas reais então descem uma escada de degradação física a partir desse teto: papel térmico desbotado reduz a precisão de palavra de código aberto para 55–73% (KORIE, 2026), e recibos do mundo real fotografados por celular entregam 66,7–68,7% de precisão no nome do estabelecimento (Estudo RMIT Textract, 2025). Alegações de fornecedores de "99% de precisão em recibos" descrevem uma condição que os recibos raramente sobrevivem.

90,49%
Melhor F1 em nível de campo no benchmark de recibos SROIE do ICDAR 2019 (recibos digitalizados limpos, métodos de 2019) — e o único time entre 18 acima de 90% (Huang et al., 2019)
55–73%
Precisão de palavra de mecanismos de código aberto em recibos térmicos reais desbotados e amassados — PaddleOCR melhor com 73,3%, Tesseract 64,7% (KORIE, 2026, 748 recibos térmicos coreanos)
66,7–68,7%
Precisão de correspondência exata para nome do estabelecimento em 118 recibos reais, ~65% fotografados por celular, ~50% dobrados ou amassados (estudo RMIT Textract, 2025)

Análise por Condição do Recibo: A Escada de Degradação

A precisão do OCR de recibos é determinada menos pelo mecanismo e mais pelo estado físico do papel e pela forma como foi capturado. O mesmo recibo desce na escada — novo e plano, desbotado, amassado, fotografado por celular — e cada degrau custa de 5 a 30 pontos de precisão.

Os recibos diferem das faturas de uma forma que importa mais do que o layout: o próprio meio é instável. A maioria dos recibos é impressa em papel térmico, um revestimento sensível ao calor que desbota progressivamente com a exposição à luz, ao calor e ao tempo — um recibo legível no dia da compra pode ter valores de impostos, datas e itens de linha parcialmente ilegíveis semanas depois, e nenhum mecanismo de OCR consegue recuperar texto que desapareceu fisicamente do papel. Os organizadores do SROIE listam explicitamente "má qualidade do papel, má qualidade da tinta e da impressão, scanner de baixa resolução e distorção de digitalização, recibos dobrados" entre os desafios centrais do benchmark (Huang et al., 2019). O gráfico abaixo mostra a faixa de precisão publicada para cada degrau da escada; a métrica usada por cada estudo está rotulada na linha, porque números de nível de caractere, palavra e campo não são intercambiáveis. Os valores do SROIE são pontuações F1 — a média harmônica de precisão e recall (Hmean), que exige tanto que a maioria das palavras detectadas esteja correta quanto que a maioria das palavras do ground truth seja encontrada.

Precisão de OCR de recibos por condição: original plano e limpo 94,7% de precisão de caractere, original amassado 86,9%, recibos térmicos desbotados 64,7–73,3% de precisão de palavra em mecanismos de código aberto, recibos reais capturados por celular 66,7–68,7% de precisão de campo do nome do estabelecimento.

Fontes: IJSAT (2026) — EasyOCR a 300 DPI em documentos impressos, precisão de caractere (plano 94,7%, amassado 86,9%; o mesmo estudo mediu sujo 80,9% e molhado 72,7%); KORIE (2026) — precisão de palavra em 748 recibos térmicos coreanos degradados, 17.587 recortes, mecanismos de código aberto (Tesseract 64,7%, EasyOCR 68,6%, PaddleOCR 73,3%); Estudo RMIT Textract (2025) — precisão de campo de correspondência exata do nome do estabelecimento em 118 recibos reais (65% fotos de celular, 50% dobrados/amassados, 44% inclinados). Valores de nível de caractere não são diretamente comparáveis a valores de nível de palavra ou campo — veja Por que as Métricas Importam.

Condição do ReciboFaixa de PrecisãoMétrica (por estudo)FonteAnoAmostra
Recibos digitalizados limpos (teto do benchmark)>90% (7 de 24 equipes); melhor <99%F1 em nível de palavra (Hmean)SROIE / Huang et al.20191.000 recibos digitalizados, 24 equipes
Original plano e limpo (documento impresso)94,7%Precisão de caractereIJSAT2026EasyOCR, 300 DPI
Original amassado86,9% (−7,8 pts vs. plano)Precisão de caractereIJSAT2026EasyOCR, 300 DPI
Recibo térmico desbotado / com vincos55–73% (PaddleOCR 73,3% melhor)Precisão de palavraKORIE2026748 recibos térmicos coreanos, 17.587 recortes, 4 mecanismos
Captura por celular no mundo real (campo do estabelecimento)66,7–68,7%Correspondência exata em nível de campoEstudo RMIT Textract2025118 recibos australianos, ~65% fotos de celular

Fontes listadas na tabela acima. As linhas do KORIE são o único benchmark publicado que preserva artefatos reais de papel térmico (desbotamento de tinta, bandas do cabeçote de impressão, desgaste por atrito, vincos) em vez de degradação sintética; suas digitalizações em mesa a 300 DPI significam que até o melhor caso "digitalizado" incorpora a deterioração do próprio papel. A linha do teto do SROIE é tecnologia da era 2019 — mecanismos LLM modernos no mesmo conjunto de dados alcançam 84,3–93,0% de precisão geral de campo (Doubleword, 2026; veja a tabela de níveis de mecanismo).

Detalhamento por Tipo de Campo: Total é Fácil, Estabelecimento é Difícil

O tipo de campo é o segundo maior fator de variação, e é notavelmente consistente em todos os estudos que o relatam: campos numéricos de resumo — especialmente o total — são extraídos com muito mais confiabilidade do que campos de identidade textual, como nome do estabelecimento ou do fornecedor. O gráfico abaixo mostra cinco mecanismos LLM modernos no conjunto de testes completo de 626 recibos SROIE, todos medidos com o mesmo protocolo de correspondência exata em nível de campo (Doubleword, 2026).

Precisão de correspondência exata em nível de campo no conjunto de testes SROIE em 5 mecanismos LLM: valor total 94,9–98,9%, data 84,3–92,5%, nome do estabelecimento 73,1–87,7%.

Fontes: Doubleword (2026) — 626 recibos de teste SROIE, correspondência exata em nível de campo, 5 mecanismos (Qwen3-VL-235B/30B, GPT-5-mini/5.2/5-nano). Benchmark de fornecedor nível D com metodologia totalmente divulgada; corroborado em direção por ReceiptSense (2024), que descobriu que campos numéricos de #Unidades atingem 93,42 F1 enquanto campos textuais de Marca caem para 62,30 F1 em recibos árabe–inglês.

O padrão se mantém em condições e idiomas radicalmente diferentes. O estudo RMIT Textract — recibos reais capturados por celular, não um corpus limpo — descobriu que o total era "consistentemente detectado" enquanto nomes de estabelecimento falhavam (texto próximo classificado incorretamente, ou "Desconhecido" quando ausente), correspondendo exatamente à classificação da Doubleword (2025). A implicação prática é que um título de "precisão de OCR de recibos" calcula a média dos campos mais fáceis e mais difíceis em um único número — e fluxos de trabalho de despesas que só precisam do total estão lidando com uma tarefa fundamentalmente mais fácil do que fluxos que precisam do estabelecimento mais itens de linha.

Detalhamento por Nível de Mecanismo

A escolha do mecanismo importa menos que a condição e o tipo de campo, mas define o teto que cada condição pode alcançar. A tabela abaixo separa quatro níveis com contextos de medição incompatíveis: modelos de pesquisa ajustados em corpora de recibos (F1 em nível de campo nos benchmarks CORD/SROIE), LLMs de propósito geral sem ajuste, APIs de nuvem em documentos do mundo real e mecanismos legados/tradicionais.

Nível do MecanismoPrecisãoMétrica / ContextoFonteAno
IA documental ajustada (SOTA em CORD)91,3–97,5% F1 de campoDonut 91,3%, LayoutLMv2 96,0%, LayoutLMv3 97,5% — recibos indonésios limpos, treinados na tarefaDonut; LayoutLMv2; pesquisa MDPI2021–2022
IA documental ajustada (SROIE)97,8% F1 de campo (LayoutLMv2); ~0,95 média entre artigosRecibos ingleses digitalizados limpos; revisão sistemática com F1 médio de 0,95LayoutLMv2; KIE SLR2021 / 2024
LLM geral, sem ajuste (three-shot)80,9% CORD / 83,9% SROIE F1 de campoApenas aprendizado em contexto, sem treinamento na tarefa — a base honesta de "zero configuração"LLM-TKIE2025
Mecanismos LLM modernos em SROIE (2026)84,3–93,0% de precisão geral de campoQwen3-VL-235B 93,0%, GPT-5-mini 87,7%, GPT-5-nano 84,3% — conjunto de teste completo de 626Doubleword2026
API de nuvem em documentos reais diversosF1 0,75–0,85Google Invoice/Expense Parser, ~1.500 layouts diversos (relatado por usuários)Google Developer Forum2024
APIs de nuvem em recibos reais capturados por celular66,7–68,7% campo do estabelecimentoAWS Textract AnalyzeExpense em 118 recibos australianos reaisestudo RMIT Textract2025
APIs de nuvem — contexto de fatura (referência mais fácil)78–98% de precisão de campoGPT-4o+OCR 98%, Azure 93%, Google 82%, Textract 78% — faturas, não recibos; mostrado como o limite superior mais fácilBusinessWareTech2025
OCR tradicional / legado em recibos~64% (piso relatado pelo setor)Alegação de white paper de fornecedor; usada apenas como referência de piso de nota DDATABASICS2024

Fontes listadas na tabela acima. Os números de CORD e SROIE são F1 em nível de campo em corpora de benchmark limpos, onde o modelo foi ajustado para a tarefa — eles são o teto otimista, não a expectativa do mundo real. As linhas do mundo real (Google forum, RMIT Textract) medem populações de documentos diferentes e não são diretamente comparáveis; ambas estão rotuladas com suas condições. O número da DATABASICS é uma alegação de nível de um único fornecedor e aparece apenas como referência mínima.

Recibos Multimoeda e Multilíngues

Fluxos de trabalho globais de despesas adicionam uma terceira dimensão: todo conjunto de dados de benchmark nesta página é monolíngue ou bilíngue, e o único estudo multilíngue publicado com números por campo mostra a mesma lacuna entre total e texto, além de uma penalidade extra de script. Em 20.000 recibos mistos de árabe e inglês, LLMs gerais sem ajuste fino alcançaram apenas 32,07–42,98 F1 zero-shot, subindo para 60,60–80,26 F1 com três exemplos por campo — enquanto os campos numéricos de #Unidades atingiram 93,42 F1 contra 62,30 F1 para campos de texto de Marca (ReceiptSense, 2024). O estudo da RMIT observou o mesmo efeito de script em produção: recibos com nomes de produtos não ingleses foram "parcialmente analisados", com dados de itens silenciosamente descartados (2025).

Idioma / CorpusPrecisãoMétricaFonteAno
Inglês (SROIE, varejistas da Malásia/Singapura)90,49% melhor F1 KIE (2019); 84,3–93,0% LLM geral (2026)F1 em nível de campo / correspondência exataSROIE; Doubleword2019 / 2026
Indonésio (CORD)91,3–97,5% F1 de campo (ajustado)F1 em nível de campoDonut; LayoutLMv22021–2022
Coreano (KORIE, papel térmico degradado)55–73% precisão de palavra (código aberto)Precisão de palavraKORIE2026
Árabe–inglês misto (ReceiptSense)F1 zero-shot 32–43%; 3-shot 61–80%; campos numéricos 93,4 vs campos de texto 62,3F1 em nível de campoReceiptSense2024
Nomes de produtos não ingleses (mundo real)Itens parcial ou totalmente descartadosQualitativo (sem métrica de precisão)Estudo RMIT Textract2025

Fontes listadas na tabela acima. Nenhum estudo revisado por pares isola o efeito da moeda (símbolo, convenção decimal, códigos de três letras) mantendo o script constante — a lacuna de "multimoedas" em fluxos de trabalho reais é impulsionada principalmente pela variação de script e layout, com o próprio valor numérico sendo extraído bem uma vez reconhecido. Isso é sinalizado como uma lacuna de dados em Limitações, em vez de preenchido com números de fornecedores.

Por que as Métricas Importam: Caractere, Palavra e Campo São Três Respostas Diferentes

As faixas largas nesta página não são ruído de medição — são três perguntas diferentes usando a mesma palavra "precisão". Um recibo pode obter 98% de precisão de caractere, ~85% de precisão de palavra e ~75% de precisão de campo ao mesmo tempo, e os três números são verdadeiros.

Precisão de caractere conta caracteres individuais: uma taxa de erro de 1% significa um caractere errado por cem. Precisão de palavra falha uma palavra inteira em qualquer caractere lido incorretamente — medida como Taxa de Erro de Palavra (WER), que é por isso que o melhor mecanismo do KORIE mostra apenas 15,84% de erro de caractere (CER), mas 26,73% de WER, quase o dobro do erro no nível da palavra (KORIE, 2026). Precisão de campo falha um campo inteiro — nome do estabelecimento, data, total — em qualquer caractere ou token errado nele, que é por isso que os organizadores do SROIE concluíram que "o OCR de recibos tem requisitos de precisão muito maiores do que as tarefas gerais de OCR" e por que o F1 no nível de campo é a métrica que os fluxos de trabalho de despesas realmente consomem (Huang et al., 2019). Cada número nesta página é rotulado com seu nível; misturá-los em um único número de "precisão de OCR de recibos" é exatamente como a alegação de 99% é fabricada.

Como Usar Estes Dados

Você não precisa de um projeto-piloto para estimar o que o OCR de recibos vai entregar no seu fluxo de despesas. Um cálculo rápido de quatro etapas usando as faixas acima transforma "os fornecedores dizem 99%" em uma contagem de erros esperada e defensável — e geralmente revela que as condições dos seus recibos, não o mecanismo, definem o resultado.

  1. Classifique sua mistura de recibos por condição. Organize seu volume mensal na escada acima. Um fluxo típico de despesas de vendas de campo é: 40% capturas novas por celular (~70% equivalente de palavra), 30% dobrados/amassados (~87% equivalente de caractere), 20% papel térmico desbotado (55–73% palavra), 10% multilíngues ou com anotações manuscritas (pior caso).
  2. Escolha o campo que você realmente precisa. Se seu fluxo só precisa de valor total + data, use as faixas 94,9–98,9% e 84,3–92,5% (Doubleword 2026). Se precisar de nomes de estabelecimentos — para verificações de política ou análise de fornecedores — use a faixa 73,1–87,7% e espere um piso no mundo real perto de 67% (estudo RMIT Textract 2025).
  3. Multiplique para erros esperados por mês. Com 80% de precisão média de campo em 6 campos por recibo e 1.000 recibos/mês, você obtém aproximadamente 1.200 campos errados por mês (1.000 × 6 × 20%) antes da revisão. Encaminhe apenas campos de baixa confiança para revisão humana em vez de recibos inteiros — os escores de confiança por campo que a maioria dos mecanismos expõe transformam um fluxo de redigitação completa em uma pequena fila de exceções.
  4. Defina a expectativa antes de comprar. Compare essa contagem de erros com sua taxa atual de erro de entrada manual (normalmente 1–4% dos campos) e com o custo de revisão de cada campo errado. Qualquer cotação de fornecedor acima das faixas desta página para sua mistura específica de condições deve vir com um benchmark em nível de campo nos seus próprios recibos.

Estas são fórmulas de estimativa aproximada, não um substituto para benchmarking dos seus próprios documentos. Cada faixa publicada nesta página foi medida no corpus de outra pessoa — o único número de precisão que se aplica ao seu fluxo de recibos é aquele que você mede nele. O valor desta página é definir a expectativa antes de medir e saber qual métrica pedir.

Perguntas Frequentes

Qual é a precisão do OCR de recibos?

A resposta honesta é uma escada, não um número: 90%+ de precisão de palavra em recibos digitalizados limpos (melhor equipe SROIE 2019, Huang et al.), 55–73% de precisão de palavra em recibos térmicos reais desbotados (KORIE 2026) e 66.7–68.7% de precisão de campo em nomes de estabelecimentos de recibos reais capturados por celular (estudo RMIT Textract 2025). Alegações de fornecedores de 97–99% descrevem capturas frescas, planas e bem iluminadas de campos fáceis — o topo da escada, não o meio.

O OCR consegue ler recibos de papel térmico desbotados?

Parcialmente — e a perda é física: o texto térmico desbotado desapareceu permanentemente do papel, então nenhum mecanismo pode recuperá-lo. Em recibos térmicos coreanos com desbotamento e vincos reais, mecanismos de código aberto alcançaram apenas 55–73% de precisão de palavra (KORIE 2026) — o melhor (PaddleOCR, 73.3%) ainda falha em cerca de uma palavra em cada quatro. A única solução confiável é capturar os recibos antes que desbotem.

Amassar um recibo afeta a precisão do OCR?

Sim — de forma mensurável. Em um teste controlado de 300 DPI, amassar reduziu a precisão de caractere de 94.7% para 86.9%, cerca de 8 pontos percentuais; sujeira e danos por água reduzem ainda mais para 80.9% e 72.7% (IJSAT 2026). Os recibos do mundo real do estudo RMIT estavam ~50% dobrados ou amassados, consistente com seu resultado de ~67% no campo do estabelecimento.

Qual campo de recibo é o mais difícil para o OCR extrair?

O nome do estabelecimento (fornecedor) é consistentemente o mais difícil, com 73.1–87.7% de precisão de campo em cinco mecanismos LLM, enquanto o total é o mais fácil, com 94.9–98.9%, e a data fica entre os dois, com 84.3–92.5% (Doubleword 2026, 626 recibos SROIE). A mesma classificação aparece em recibos reais capturados por celular (RMIT 2025) e em recibos árabe–inglês (ReceiptSense 2024: campos numéricos 93.4 vs campos de texto 62.3 F1).

O OCR de recibos é menos preciso que o OCR de faturas?

Sim, na prática. Faturas chegam como PDFs controlados ou digitalizações em mesa com layouts padronizados; recibos são papel térmico, fotografados por celular, amassados e sem layout. A diferença aparece em mecanismos de nuvem comparáveis: em faturas, a precisão de campo varia de 78–98% por mecanismo (BusinessWareTech 2025), enquanto a mesma classe de mecanismo em recibos reais capturados por celular obteve 66,7–68,7% para o campo do nome do estabelecimento (estudo RMIT Textract 2025).

Quanto a captura por celular prejudica a precisão do OCR de recibos em comparação com a digitalização?

Não existe uma comparação controlada revisada por pares em recibos idênticos — uma lacuna real de dados (veja Limitações). As evidências existentes: os recibos do estudo RMIT eram ~65% fotos de celular, com 44% inclinados e 12,7% borrados, resultando em 66,7–68,7% de precisão no campo do estabelecimento, enquanto os benchmarks SROIE e KORIE que pontuam mais alto usaram digitalização em mesa. Direcionalmente, a captura por celular adiciona inclinação, sombras e desfoque, cada um empurrando a precisão para baixo na escada, mas a penalidade exata não é medida na literatura publicada.

O que é SROIE e por que isso importa?

SROIE (Scanned Receipt OCR and Information Extraction) é a competição ICDAR 2019 que criou o primeiro benchmark padronizado de OCR de recibos: 1.000 recibos digitalizados reais com tarefas de localização de texto, OCR e campos-chave (empresa, endereço, data, total) (Huang et al., 2019). Isso importa porque é o único benchmark de recibos com resultados publicados entre equipes: até o melhor método de 2019 ficou aquém da precisão de 99% que os aplicativos de recibos exigem. LLMs modernos no mesmo conjunto de dados pontuam 84,3–93,0% no geral (Doubleword 2026).

Metodologia & Fontes

Como Esta Página Foi Construída

Esta página agrega dados de 14 estudos independentes abrangendo 2019–2026. As fontes foram selecionadas com base em três critérios: (1) metodologia publicamente documentada com tamanho de amostra declarado, (2) dados coletados nos últimos 3 anos quando disponíveis, com fontes mais antigas identificadas pelo ano no texto, e (3) relevância para OCR e extração específicos de recibos, em vez de alegações genéricas sobre documentos. Quando múltiplas fontes relatam a mesma dimensão, são usados intervalos conservadores (menor–maior valor relatado) — preferimos subestimar. Quando as fontes divergem significativamente, a divergência é explicada por nível de métrica, condição do documento ou corpus, em vez de ser diluída em uma média.

A distinção de métricas é a espinha dorsal desta página: números em nível de caractere, palavra e campo nunca são misturados em um único valor, e cada gráfico e linha de tabela rotula sua métrica. Números autorrelatados por fornecedores (piso de ~64% da DATABASICS) são rotulados como grau D e usados apenas como referências corroboradas. Os resultados do benchmark SROIE são tecnologia da era 2019 e são rotulados por ano; os resultados modernos de LLM no mesmo conjunto de dados (Doubleword 2026) são exibidos ao lado para atualidade.

Lista de Fontes

  1. Huang, Z. et al. — "ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction" (2019). Relatório de competição revisado por pares; 1.000 recibos digitalizados, 29/24/18 submissões válidas em três tarefas. Fornece o melhor F1 de 90,49% na Tarefa 3, os achados de "apenas um dos 18 times acima de 90%"/"mais da metade abaixo de 80%" e a declaração da Tarefa 2 de que "mesmo o melhor método não consegue atingir o requisito de 99%".
  2. Park, S. et al. — "CORD: A Consolidated Receipt Dataset for Post-OCR Parsing" (2019). Artigo acadêmico de dataset; mais de 11.000 recibos indonésios, 30 campos sob 4 superclasses; subconjunto público 800/100/100. Fornece a definição do corpus e o protocolo de avaliação de F1 por campo usado nas linhas dos modelos de pesquisa.
  3. Xu, Y. et al. — "LayoutLMv2" (ACL 2021). Artigo revisado por pares. Fornece F1 de campo CORD de 96,01% (parâmetros de 426M) e F1 de campo SROIE de 97,81%.
  4. Kim, G. et al. — "Donut: OCR-free Document Understanding Transformer" (ECCV 2022). Artigo revisado por pares e repositório oficial do modelo. Fornece F1 de campo CORD de 91,3% (donut-base-finetuned-cord-v2).
  5. "KORIE: A Multi-Task Benchmark for Detection, OCR, and Information Extraction on Korean Retail Receipts" — MDPI Mathematics (2026). Revista revisada por pares; 748 recibos térmicos coreanos com artefatos reais de desbotamento/bandas/vinco; 17.587 recortes de OCR. Fornece os únicos números de palavra com degradação real: PaddleOCR WER 26,73% (precisão de palavra de 73,3%), EasyOCR 31,43%, Tesseract 35,26%, BiGRU 44,47%.
  6. "Towards Analysing Invoices and Receipts with Amazon Textract" (RMIT, 2025). Estudo de caso acadêmico (pré-impressão); 118 recibos australianos, ~65% fotografados por celular, ~50% dobrados/amassados, 44% inclinados. Fornece correspondência exata do nome do estabelecimento de 68,7% (layouts de texto) / 66,7% (layouts de logo), o achado de "totais consistentemente detectados" e a observação sobre limitação de idioma.
  7. Abdallah, A. et al. — "ReceiptSense: Beyond Traditional OCR" (2024). Pré-impressão acadêmica; 20.000 recibos árabe–inglês, 30.000 imagens de OCR. Fornece F1 zero-shot de 32,07–42,98%, F1 three-shot de 60,60–80,26% e a lacuna entre campos numéricos e de texto (93,42 vs 62,30).
  8. "Optical Character Recognition Accuracy on Degraded Documents" — IJSAT 17(2) (2026). Revisado por pares; EasyOCR a 300 DPI em quatro condições físicas. Fornece a escada de precisão de caractere de 94,7% (plano) / 86,9% (amassado) / 80,9% (sujo) / 72,7% (molhado) usada nas linhas de danos físicos.
  9. "Deep Learning based Key Information Extraction from Business Documents: Systematic Literature Review" (2024). Revisão sistemática acadêmica. Fornece a média de F1 de campo entre artigos publicados: CORD 0,94, SROIE 0,95.
  10. "Large language model driven transferable key information extraction mechanism for nonstandardized tables" (2025). Revisado por pares; LLM-TKIE, sem ajuste fino, 3-shot. Fornece CORD F1 80,9 / SROIE F1 83,9 como a linha de base LLM sem configuração.
  11. Doubleword — "Structured Data Extraction" benchmark SROIE (2026). Benchmark do fornecedor com metodologia totalmente divulgada; conjunto de teste SROIE completo com 626 recibos, correspondência exata em nível de campo, 5 mecanismos de LLM. Fornece 84,3–93,0% no geral e as faixas por campo (total 94,9–98,9%, data 84,3–92,5%, estabelecimento 73,1–87,7%).
  12. Google Developer Forum — "Low F1 Score with Document AI on Diverse Invoice and Expense Layouts" (2024). Medição de usuário anedótica no fórum oficial do Google; ~1.500 documentos diversos. Fornece a faixa F1 0,75–0,85 do mundo real para API de nuvem.
  13. BusinessWareTech — "AWS Textract vs Google, Azure, and GPT-4o: Invoice Extraction Benchmark" (2025). Benchmark independente de terceiros (nota C, método transparente, faturas reais). Fornece a escada de mecanismos no contexto de faturas: GPT-4o+OCR 98%, Azure 93%, Google 82%, Textract 78% — o limite superior mais fácil para recibos.
  14. DATABASICS — "Receipt Capture & OCR for Expense Reports" white paper. White paper do fornecedor (nota D); usado apenas como referência mínima. Fornece o enquadramento em camadas de ~64% OCR tradicional / 85–95% aprimorado por IA / 97–99% LLM, com a ressalva de que a precisão varia com a qualidade da imagem, o layout e a caligrafia.

Limitações

  • Cobertura geográfica: As fontes se concentram na Ásia-Pacífico e no Oriente Médio (Malásia/Cingapura, Indonésia, Coreia, Egito/árabe, Austrália). Nenhum benchmark acadêmico específico para recibos foi encontrado na América do Norte, América Latina ou África — a precisão de OCR de recibos nos EUA/Reino Unido é atualmente documentada apenas por alegações de fornecedores e relatos anedóticos em fóruns, não por estudos revisados por pares.
  • Restrições metodológicas: Os níveis de métrica (caractere / palavra / campo) diferem entre os estudos e são rotulados por linha, em vez de combinados; vários números-chave dependem de estudos únicos (degradação térmica KORIE; campo de estabelecimento do Textract da RMIT; multilíngue ReceiptSense), e os números da Doubleword e do Google Forum são de grau D/C (de fornecedor ou anedóticos), usados com seu grau divulgado. Os números de amassado/desbotado do IJSAT vêm de documentos impressos, não de recibos — espera-se que recibos em papel térmico degradem pior, mas isso é uma inferência, declarada como tal.
  • Lacunas temporais: Os dados da competição SROIE são de 2019; seus números absolutos refletem métodos da era 2019 e são rotulados por ano, com resultados modernos de LLM no mesmo conjunto de dados (Doubleword 2026) fornecidos ao lado. Nenhuma competição padronizada mais recente de recibos com resultados publicados entre equipes foi encontrada após o SROIE 2019.
  • O que não conseguimos encontrar: (1) qualquer estudo controlado revisado por pares comparando captura por celular vs digitalização em mesa nos mesmos recibos — a variável mais citada no marketing de fornecedores; (2) um benchmark específico de extração de itens de linha para recibos (os únicos números de itens de linha são em contexto de fatura, 40–82% por mecanismo, BusinessWareTech 2025); (3) qualquer estudo isolando o efeito da moeda (símbolo, convenção decimal) mantendo o script constante; (4) benchmarks para anotações manuscritas em recibos (gorjetas, notas, correções); (5) benchmarks públicos para recibos eletrônicos/capturas de tela vs papel fotografado. Essas lacunas são declaradas em vez de preenchidas com números de fornecedores não verificáveis.

Referências relacionadas: Precisão de OCR por Tipo de Documento · Precisão no Reconhecimento de Escrita Manual · Detalhamento de Custos de Processamento de Documentos · Taxas de Erro na Digitação Manual de Dados

Leitura relacionada: O Custo da Digitação Manual de Dados de Recibos Manuscritos · Como a Precisão da Extração de Escrita Manual com IA Continua Melhorando

📮 contact email: [email protected]