Precisão de OCR em Recibos: Papel Térmico, Amassado, Desbotado,
e Benchmarks Multimoeda (2026)
Última revisão: 2026-08-10 · Cobertura de dados: Parcial · Fontes: 14 estudos independentes
O que esta página NÃO cobre: Precisão geral de OCR por tipo de documento (veja a divisão por tipo de documento), precisão de reconhecimento de escrita manual (veja Precisão de Reconhecimento de Escrita Manual) ou alegações específicas de fornecedores além dos números de benchmark citados abaixo.
Todos os números abaixo são baseados em estudos de terceiros publicamente disponíveis e relatórios da indústria citados na seção de metodologia. Onde as fontes divergem, faixas conservadoras (valores mínimos–máximos relatados) são usadas. Os níveis de métrica (caractere / palavra / campo) são rotulados por figura e nunca combinados em um único número. Esta página é um benchmark direcional, não uma previsão precisa para qualquer mecanismo ou organização.
A história do OCR de recibos começa com um teto, não com uma linha de base. No único benchmark padronizado de recibos — o SROIE do ICDAR 2019 — o melhor sistema de extração de informações-chave obteve 90,49% de F1 em recibos digitalizados limpos, e mais da metade das 18 equipes participantes obteve menos de 80% (Huang et al., 2019). Fluxos de trabalho de despesas reais então descem uma escada de degradação física a partir desse teto: papel térmico desbotado reduz a precisão de palavra de código aberto para 55–73% (KORIE, 2026), e recibos do mundo real fotografados por celular entregam 66,7–68,7% de precisão no nome do estabelecimento (estudo RMIT Textract, 2025). Alegações de fornecedores de "99% de precisão em recibos" descrevem uma condição que os recibos raramente sobrevivem.
Detalhamento por Condição do Recibo: A Escada de Degradação
A precisão do OCR de recibos é determinada menos pelo mecanismo e mais pelo estado físico do papel e pela forma como ele foi capturado. O mesmo recibo desce a escada — novo e plano, desbotado, amassado, fotografado por celular — e cada degrau custa de 5 a 30 pontos de precisão.
Os recibos diferem das faturas de uma forma que importa mais do que o layout: o próprio meio é instável. A maioria dos recibos é impressa em papel térmico, um revestimento sensível ao calor que desbota progressivamente com a exposição à luz, ao calor e ao tempo — um recibo legível no dia da compra pode ter valores de impostos, datas e itens de linha parcialmente ilegíveis semanas depois, e nenhum mecanismo de OCR consegue recuperar texto que desapareceu fisicamente do papel. Os organizadores do SROIE listam explicitamente "má qualidade do papel, má qualidade de tinta e impressão, scanner de baixa resolução e distorção de digitalização, faturas dobradas" entre os desafios centrais do benchmark (Huang et al., 2019). O gráfico abaixo mostra a faixa de precisão publicada para cada degrau da escada; a métrica usada por cada estudo está rotulada na linha, porque números de precisão de caractere, palavra e campo não são intercambiáveis. Os valores do SROIE são pontuações F1 — a média harmônica de precisão e recall (Hmean), que exige tanto que a maioria das palavras detectadas esteja correta quanto que a maioria das palavras do ground-truth seja encontrada.
Fontes: IJSAT (2026) — EasyOCR a 300 DPI em documentos impressos, precisão de caractere (plano 94,7%, amassado 86,9%; o mesmo estudo mediu sujo 80,9% e molhado 72,7%); KORIE (2026) — precisão de palavra em 748 recibos térmicos coreanos degradados, 17.587 recortes, mecanismos de código aberto (Tesseract 64,7%, EasyOCR 68,6%, PaddleOCR 73,3%); Estudo RMIT Textract (2025) — precisão de campo de correspondência exata do nome do estabelecimento em 118 recibos reais (65% fotos de celular, 50% dobrados/amassados, 44% inclinados). Valores de nível de caractere não são diretamente comparáveis a valores de nível de palavra ou campo — veja Por que as Métricas Importam.
| Condição do Recibo | Faixa de Precisão | Métrica (por estudo) | Fonte | Ano | Amostra |
|---|---|---|---|---|---|
| Recibos digitalizados limpos (teto do benchmark) | >90% (7 de 24 equipes); melhor <99% | F1 em nível de palavra (Hmean) | SROIE / Huang et al. | 2019 | 1.000 recibos digitalizados, 24 equipes |
| Original plano e limpo (documento impresso) | 94,7% | Precisão de caractere | IJSAT | 2026 | EasyOCR, 300 DPI |
| Original amassado | 86,9% (−7,8 pts vs. plano) | Precisão de caractere | IJSAT | 2026 | EasyOCR, 300 DPI |
| Recibo térmico desbotado / com vincos | 55–73% (PaddleOCR 73,3% melhor) | Precisão de palavra | KORIE | 2026 | 748 recibos térmicos coreanos, 17.587 recortes, 4 mecanismos |
| Captura por celular em cenário real (campo do estabelecimento) | 66,7–68,7% | Correspondência exata em nível de campo | Estudo RMIT Textract | 2025 | 118 recibos australianos, ~65% fotos de celular |
Fontes listadas na tabela acima. As linhas do KORIE são o único benchmark publicado que preserva artefatos reais de papel térmico (desbotamento de tinta, bandas do cabeçote de impressão, desgaste por atrito, vincos) em vez de degradação sintética; suas digitalizações em mesa a 300 DPI significam que até o melhor caso "digitalizado" já embute a deterioração do próprio papel. A linha do teto do SROIE é tecnologia de 2019 — mecanismos LLM modernos no mesmo conjunto de dados alcançam 84,3–93,0% de precisão geral de campo (Doubleword, 2026; veja a tabela de níveis de mecanismos).
Detalhamento por Tipo de Campo: Total é Fácil, Estabelecimento é Difícil
O tipo de campo é o segundo maior fator de variação, e é notavelmente consistente em todos os estudos que o relatam: campos numéricos de resumo — especialmente o total — são extraídos com muito mais confiabilidade do que campos de identidade de texto, como nome do estabelecimento ou do fornecedor. O gráfico abaixo mostra cinco mecanismos LLM modernos no conjunto completo de testes SROIE com 626 recibos, todos medidos com o mesmo protocolo de correspondência exata em nível de campo (Doubleword, 2026).
Fontes: Doubleword (2026) — 626 recibos de teste SROIE, correspondência exata em nível de campo, 5 mecanismos (Qwen3-VL-235B/30B, GPT-5-mini/5.2/5-nano). Benchmark de fornecedor grau D com metodologia totalmente divulgada; corroborado em direção por ReceiptSense (2024), que descobriu que campos numéricos de #Unidades atingem 93,42 F1 enquanto campos de texto de Marca caem para 62,30 F1 em recibos árabe–inglês.
O padrão se mantém em condições e idiomas radicalmente diferentes. O estudo RMIT Textract — recibos reais capturados por celular, não um corpus limpo — descobriu que o total era "consistentemente detectado" enquanto nomes de estabelecimento falhavam (texto próximo classificado incorretamente, ou "Desconhecido" quando ausente), correspondendo exatamente à classificação do Doubleword (2025). A implicação prática é que um título de "precisão de OCR de recibos" calcula a média dos campos mais fáceis e mais difíceis em um único número — e fluxos de trabalho de despesas que só precisam do total estão lidando com uma tarefa fundamentalmente mais fácil do que fluxos que precisam do estabelecimento mais itens de linha.
Detalhamento por Nível de Mecanismo
A escolha do mecanismo importa menos que a condição e o tipo de campo, mas define o teto que cada condição pode alcançar. A tabela abaixo separa quatro níveis com contextos de medição incompatíveis: modelos de pesquisa ajustados em corpora de recibos (F1 em nível de campo nos benchmarks CORD/SROIE), LLMs de propósito geral sem ajuste, APIs de nuvem em documentos do mundo real e mecanismos legados/tradicionais.
| Nível do Mecanismo | Precisão | Métrica / Contexto | Fonte | Ano |
|---|---|---|---|---|
| IA documental ajustada (SOTA no CORD) | 91,3–97,5% F1 de campo | Donut 91,3%, LayoutLMv2 96,0%, LayoutLMv3 97,5% — recibos indonésios limpos, treinados na tarefa | Donut; LayoutLMv2; pesquisa MDPI | 2021–2022 |
| IA documental ajustada (SROIE) | 97,8% F1 de campo (LayoutLMv2); ~0,95 de média entre artigos | Recibos ingleses digitalizados limpos; média de F1 0,95 na revisão sistemática | LayoutLMv2; KIE SLR | 2021 / 2024 |
| LLM geral, sem ajuste (three-shot) | 80,9% CORD / 83,9% F1 de campo SROIE | Apenas aprendizado em contexto, sem treinamento na tarefa — a linha de base honesta de "zero configuração" | LLM-TKIE | 2025 |
| Mecanismos LLM modernos no SROIE (2026) | 84,3–93,0% de precisão geral de campo | Qwen3-VL-235B 93,0%, GPT-5-mini 87,7%, GPT-5-nano 84,3% — conjunto de teste completo de 626 | Doubleword | 2026 |
| API de nuvem em documentos reais diversos | F1 0,75–0,85 | Google Invoice/Expense Parser, ~1.500 layouts diversos (relatado por usuários) | Google Developer Forum | 2024 |
| APIs de nuvem em recibos reais capturados por celular | 66,7–68,7% campo do estabelecimento | AWS Textract AnalyzeExpense em 118 recibos australianos reais | estudo RMIT Textract | 2025 |
| APIs de nuvem — contexto de fatura (referência mais fácil) | 78–98% de precisão de campo | GPT-4o+OCR 98%, Azure 93%, Google 82%, Textract 78% — faturas, não recibos; mostrado como o limite superior mais fácil | BusinessWareTech | 2025 |
| OCR legado / tradicional em recibos | ~64% (piso relatado pelo setor) | Alegação de nível em white paper de fornecedor; usado apenas como referência de piso grau D | DATABASICS | 2024 |
Fontes listadas na tabela acima. Os valores de CORD e SROIE são F1 em nível de campo em corpora de benchmark limpos, onde o modelo foi ajustado para a tarefa — eles são o teto otimista, não a expectativa do mundo real. As linhas do mundo real (Google forum, RMIT Textract) medem populações de documentos diferentes e não são diretamente comparáveis; ambas estão rotuladas com suas condições. O valor da DATABASICS é uma alegação de nível de um único fornecedor e aparece apenas como referência mínima.
Recibos Multimoeda e Multilíngues
Fluxos de trabalho globais de despesas adicionam uma terceira dimensão: todo conjunto de dados de benchmark nesta página é monolíngue ou bilíngue, e o único estudo multilíngue publicado com números por campo mostra a mesma lacuna entre total e texto, além de uma penalidade extra de script. Em 20.000 recibos em árabe–inglês, LLMs gerais sem ajuste fino alcançaram apenas 32,07–42,98 F1 zero-shot, subindo para 60,60–80,26 F1 com três exemplos por campo — enquanto os campos numéricos #Units atingiram 93,42 F1 contra 62,30 F1 nos campos de texto Brand (ReceiptSense, 2024). O estudo da RMIT observou o mesmo efeito de script em produção: recibos com nomes de produtos não ingleses foram "parcialmente analisados", com dados de itens descartados silenciosamente (2025).
| Idioma / Corpus | Precisão | Métrica | Fonte | Ano |
|---|---|---|---|---|
| Inglês (SROIE, varejistas da Malásia/SG) | 90,49% melhor F1 KIE (2019); 84,3–93,0% LLM geral (2026) | F1 em nível de campo / correspondência exata | SROIE; Doubleword | 2019 / 2026 |
| Indonésio (CORD) | 91,3–97,5% F1 de campo (ajustado) | F1 em nível de campo | Donut; LayoutLMv2 | 2021–2022 |
| Coreano (KORIE, degradado termicamente) | 55–73% precisão de palavra (código aberto) | Precisão de palavra | KORIE | 2026 |
| Árabe–inglês misto (ReceiptSense) | F1 zero-shot 32–43%; 3-shot 61–80%; campos numéricos 93,4 vs campos de texto 62,3 | F1 em nível de campo | ReceiptSense | 2024 |
| Nomes de produtos não ingleses (mundo real) | Itens parcial ou totalmente descartados | Qualitativo (sem métrica de precisão) | Estudo RMIT Textract | 2025 |
Fontes listadas na tabela acima. Nenhum estudo revisado por pares isola o efeito da moeda (símbolo, convenção decimal, códigos de três letras) mantendo o script constante — a lacuna "multi-moeda" em fluxos de trabalho reais é impulsionada principalmente pela variação de script e layout, com o valor numérico em si extraindo bem uma vez reconhecido. Isso é sinalizado como uma lacuna de dados em Limitações em vez de preenchido com números de fornecedores.
Por que as Métricas Importam: Caractere, Palavra e Campo São Três Respostas Diferentes
As faixas amplas nesta página não são ruído de medição — são três perguntas diferentes usando a mesma palavra "precisão". Um recibo pode obter 98% de precisão de caractere, ~85% de precisão de palavra e ~75% de precisão de campo ao mesmo tempo, e os três números são verdadeiros.
Precisão de caractere conta caracteres individuais: uma taxa de erro de 1% significa um caractere errado por cem. Precisão de palavra falha uma palavra inteira em qualquer caractere lido incorretamente — medida como Word Error Rate (WER), que é por isso que o melhor mecanismo do KORIE mostra apenas 15,84% de erro de caractere (CER), mas um WER de 26,73%, quase o dobro do erro no nível de palavra (KORIE, 2026). Precisão de campo falha um campo inteiro — nome do estabelecimento, data, valor total — em qualquer caractere ou token errado nele, que é por isso que os organizadores do SROIE concluíram que "o OCR de recibos tem requisitos de precisão muito maiores do que as tarefas gerais de OCR" e por que o F1 em nível de campo é a métrica que os fluxos de trabalho de despesas realmente consomem (Huang et al., 2019). Cada figura nesta página é rotulada com seu nível; misturá-los em um único número de "precisão de OCR de recibos" é exatamente como a afirmação de 99% é fabricada.
Como Usar Estes Dados
Você não precisa de um projeto-piloto para estimar o que o OCR de recibos vai entregar no seu fluxo de despesas. Um cálculo rápido de quatro etapas usando as faixas acima transforma "os fornecedores dizem 99%" em uma contagem de erros esperada e defensável — e geralmente revela que as condições dos seus recibos, não o mecanismo, definem o resultado.
- Classifique sua mistura de recibos por condição. Separe seu volume mensal na escada acima. Um fluxo típico de despesas de vendas de campo é: 40% capturas novas por celular (~70% equivalente de palavra), 30% dobrados/amassados (~87% equivalente de caractere), 20% papel térmico desbotado (55–73% palavra), 10% multilíngues ou com anotações manuscritas (pior caso).
- Escolha o campo que você realmente precisa. Se seu fluxo só precisa de valor total + data, use as faixas 94,9–98,9% e 84,3–92,5% (Doubleword 2026). Se precisar de nomes de estabelecimentos — para verificações de política ou análise de fornecedores — use a faixa 73,1–87,7% e espere um piso no mundo real perto de 67% (estudo RMIT Textract 2025).
- Multiplique para erros esperados por mês. Com 80% de precisão média de campo em 6 campos por recibo e 1.000 recibos/mês, você obtém aproximadamente 1.200 campos errados por mês (1.000 × 6 × 20%) antes da revisão. Encaminhe apenas campos de baixa confiança para revisão humana em vez de recibos inteiros — os escores de confiança por campo que a maioria dos mecanismos expõe transformam um fluxo completo de redigitação em uma pequena fila de exceções.
- Defina a expectativa antes de comprar. Compare essa contagem de erros com sua taxa atual de erro de entrada manual (normalmente 1–4% dos campos) e com o custo de revisão de cada campo errado. Qualquer cotação de fornecedor acima das faixas desta página para sua mistura específica de condições deve vir com um benchmark em nível de campo nos seus próprios recibos.
Estas são fórmulas de estimativa aproximada, não um substituto para benchmarking dos seus próprios documentos. Cada faixa publicada nesta página foi medida no corpus de outra pessoa — o único número de precisão que se aplica ao seu fluxo de recibos é aquele que você medir nele. O valor desta página é definir a expectativa antes de medir e saber qual métrica pedir.
Perguntas Frequentes
Qual é a precisão do OCR de recibos?
A resposta honesta é uma escada, não um número: 90%+ em nível de palavra em recibos digitalizados limpos (melhor equipe SROIE 2019, Huang et al.), 55–73% de precisão de palavra em recibos térmicos reais desbotados (KORIE 2026), e 66.7–68.7% de precisão de campo em nomes de estabelecimentos de recibos reais capturados por celular (estudo RMIT Textract 2025). Alegações de fornecedores de 97–99% descrevem capturas novas, planas e bem iluminadas de campos fáceis — o topo da escada, não o meio.
O OCR consegue ler recibos de papel térmico desbotados?
Parcialmente — e a perda é física: o texto térmico desbotado desapareceu permanentemente do papel, então nenhum mecanismo pode recuperá-lo. Em recibos térmicos coreanos com artefatos reais de desbotamento e amassados, mecanismos de código aberto pontuaram apenas 55–73% de precisão de palavra (KORIE 2026) — o melhor (PaddleOCR, 73.3%) ainda falha em cerca de uma em cada quatro palavras. A única solução confiável é capturar os recibos antes que desbotem.
Amassar um recibo afeta a precisão do OCR?
Sim — de forma mensurável. Em um teste controlado de 300 DPI, amassar reduziu a precisão de caractere de 94.7% para 86.9%, cerca de 8 pontos percentuais; sujeira e danos por água reduzem ainda mais para 80.9% e 72.7% (IJSAT 2026). Os recibos do mundo real do estudo RMIT eram ~50% dobrados ou amassados, consistente com seu resultado de ~67% no campo do estabelecimento.
Qual campo do recibo é o mais difícil para o OCR extrair?
O nome do estabelecimento (comerciante) é consistentemente o mais difícil, com 73.1–87.7% de precisão de campo em cinco mecanismos LLM, enquanto o valor total é o mais fácil, com 94.9–98.9%, e a data fica no meio, entre 84.3–92.5% (Doubleword 2026, 626 recibos SROIE). A mesma classificação aparece em recibos reais capturados por celular (RMIT 2025) e em recibos árabe–inglês (ReceiptSense 2024: campos numéricos 93.4 vs. campos de texto 62.3 F1).
O OCR de recibos é menos preciso que o de faturas?
Sim, na prática. Faturas chegam como PDFs controlados ou digitalizações em mesa com layouts padronizados; recibos são papel térmico, fotografados por celular, amassados e sem layout. A diferença aparece em mecanismos de nuvem comparáveis: em faturas, a precisão de campo varia de 78–98% por mecanismo (BusinessWareTech 2025), enquanto a mesma classe de mecanismo em recibos reais capturados por celular obteve 66,7–68,7% para o campo do nome do estabelecimento (estudo RMIT Textract 2025).
Quanto a captura por celular prejudica a precisão do OCR de recibos em comparação à digitalização?
Não há comparação controlada revisada por pares em recibos idênticos — uma lacuna real de dados (ver Limitações). As evidências existentes: os recibos do estudo RMIT eram ~65% fotos de celular, com 44% inclinados e 12,7% borrados, resultando em 66,7–68,7% de precisão no campo do estabelecimento, enquanto os benchmarks SROIE e KORIE que pontuam mais alto usaram digitalização em mesa. Direcionalmente, a captura por celular adiciona inclinação, sombras e desfoque, cada um empurrando a precisão para baixo na escada, mas a penalidade exata não é medida na literatura publicada.
O que é SROIE e por que isso importa?
SROIE (Scanned Receipt OCR and Information Extraction) é a competição ICDAR 2019 que criou o primeiro benchmark padronizado de OCR de recibos: 1.000 recibos digitalizados reais com tarefas de localização de texto, OCR e campos-chave (empresa, endereço, data, total) (Huang et al., 2019). Isso importa porque é o único benchmark de recibos com resultados publicados entre equipes: até o melhor método de 2019 ficou aquém da precisão de 99% que os aplicativos de recibos exigem. LLMs modernos no mesmo conjunto de dados pontuam 84,3–93,0% no geral (Doubleword 2026).
Metodologia & Fontes
Como Esta Página Foi Construída
Esta página reúne dados de 14 estudos independentes entre 2019 e 2026. As fontes foram selecionadas com base em três critérios: (1) metodologia documentada publicamente com tamanho de amostra informado, (2) dados coletados nos últimos 3 anos quando disponíveis, com fontes mais antigas identificadas pelo ano no texto, e (3) relevância para OCR e extração específicos de recibos, em vez de afirmações genéricas sobre documentos. Quando múltiplas fontes relatam a mesma dimensão, são usados intervalos conservadores (menor–maior valor relatado) — preferimos subestimar. Quando as fontes divergem significativamente, a divergência é explicada por nível de métrica, condição do documento ou corpus, em vez de ser diluída em uma média.
A distinção de métricas é a espinha dorsal desta página: números em nível de caractere, palavra e campo nunca são misturados em um único valor, e cada gráfico e linha de tabela identifica sua métrica. Números autorrelatados por fornecedores (piso de ~64% da DATABASICS) são classificados como grau D e usados apenas como referências corroboradas. Os resultados do benchmark SROIE são de tecnologia da era 2019 e são identificados por ano; os resultados modernos de LLM no mesmo conjunto de dados (Doubleword 2026) são mostrados ao lado para fins de atualidade.
Lista de Fontes
- Huang, Z. et al. — "ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction" (2019). Relatório de competição revisado por pares; 1.000 recibos digitalizados, 29/24/18 submissões válidas em três tarefas. Fornece o melhor F1 de 90,49% na Tarefa 3, as descobertas de "apenas um dos 18 times acima de 90%"/"mais da metade abaixo de 80%" e a declaração da Tarefa 2 de que "nem o melhor método consegue atingir o requisito de 99%".
- Park, S. et al. — "CORD: A Consolidated Receipt Dataset for Post-OCR Parsing" (2019). Artigo acadêmico sobre dataset; mais de 11.000 recibos indonésios, 30 campos em 4 superclasses; subconjunto público 800/100/100. Fornece a definição do corpus e o protocolo de avaliação de F1 por campo usado nas linhas dos modelos de pesquisa.
- Xu, Y. et al. — "LayoutLMv2" (ACL 2021). Artigo revisado por pares. Fornece F1 de campo CORD de 96,01% (parâmetros de 426M) e F1 de campo SROIE de 97,81%.
- Kim, G. et al. — "Donut: OCR-free Document Understanding Transformer" (ECCV 2022). Artigo revisado por pares e repositório oficial do modelo. Fornece F1 de campo CORD de 91,3% (donut-base-finetuned-cord-v2).
- "KORIE: A Multi-Task Benchmark for Detection, OCR, and Information Extraction on Korean Retail Receipts" — MDPI Mathematics (2026). Periódico revisado por pares; 748 recibos térmicos coreanos com artefatos reais de desbotamento/bandas/vinco; 17.587 recortes de OCR. Fornece os únicos números reais de degradação de palavras: PaddleOCR WER 26,73% (precisão de palavra de 73,3%), EasyOCR 31,43%, Tesseract 35,26%, BiGRU 44,47%.
- "Towards Analysing Invoices and Receipts with Amazon Textract" (RMIT, 2025). Estudo de caso acadêmico (pré-impressão); 118 recibos australianos, ~65% fotografados por celular, ~50% dobrados/amassados, 44% inclinados. Fornece correspondência exata do nome do estabelecimento de 68,7% (layouts de texto) / 66,7% (layouts de logotipo), a descoberta de que "os totais são consistentemente detectados" e a observação sobre limitação de idioma.
- Abdallah, A. et al. — "ReceiptSense: Beyond Traditional OCR" (2024). Pré-impressão acadêmica; 20.000 recibos em árabe–inglês, 30.000 imagens de OCR. Fornece F1 zero-shot de 32,07–42,98%, F1 three-shot de 60,60–80,26% e a lacuna entre campos numéricos e de texto (93,42 vs 62,30).
- "Optical Character Recognition Accuracy on Degraded Documents" — IJSAT 17(2) (2026). Revisado por pares; EasyOCR a 300 DPI em quatro condições físicas. Fornece a escada de precisão de caractere de 94,7% (plano) / 86,9% (amassado) / 80,9% (sujo) / 72,7% (molhado) usada para as linhas de dano físico.
- "Deep Learning based Key Information Extraction from Business Documents: Systematic Literature Review" (2024). Revisão sistemática acadêmica. Fornece a média de F1 de campo entre artigos publicados: CORD 0,94, SROIE 0,95.
- "Large language model driven transferable key information extraction mechanism for nonstandardized tables" (2025). Revisado por pares; LLM-TKIE, sem ajuste fino, 3-shot. Fornece CORD F1 80,9 / SROIE F1 83,9 como a linha de base LLM sem configuração.
- Doubleword — benchmark SROIE de "Extração de Dados Estruturados" (2026). Benchmark do fornecedor com metodologia totalmente divulgada; conjunto de teste SROIE completo com 626 recibos, correspondência exata em nível de campo, 5 mecanismos de LLM. Fornece 84,3–93,0% no geral e as faixas por campo (valor total 94,9–98,9%, data 84,3–92,5%, nome do estabelecimento 73,1–87,7%).
- Google Developer Forum — "Pontuação F1 baixa com Document AI em layouts diversos de faturas e despesas" (2024). Medição de usuário anedótica no fórum oficial do Google; ~1.500 documentos diversos. Fornece a faixa real de API de nuvem com F1 0,75–0,85.
- BusinessWareTech — "AWS Textract vs Google, Azure e GPT-4o: Benchmark de Extração de Faturas" (2025). Benchmark independente de terceiros (grau C, método transparente, faturas reais). Fornece a escada de mecanismos no contexto de faturas: GPT-4o+OCR 98%, Azure 93%, Google 82%, Textract 78% — o limite superior mais fácil para recibos.
- DATABASICS — white paper "Captura de Recibos e OCR para Relatórios de Despesas". White paper do fornecedor (grau D); usado apenas como referência mínima. Fornece o enquadramento de níveis de ~64% OCR tradicional / 85–95% aprimorado por IA / 97–99% LLM, com a ressalva de que a precisão varia com a qualidade da imagem, o layout e a caligrafia.
Limitações
- Cobertura geográfica: As fontes se concentram na Ásia-Pacífico e no Oriente Médio (Malásia/Singapura, Indonésia, Coreia, Egito/árabe, Austrália). Nenhum benchmark acadêmico específico para recibos foi encontrado na América do Norte, América Latina ou África — a precisão de OCR de recibos nos EUA/Reino Unido atualmente só é documentada por afirmações de fornecedores e relatos anedóticos em fóruns, não por estudos revisados por pares.
- Restrições metodológicas: Os níveis de métrica (caractere / palavra / campo) diferem entre os estudos e são identificados por linha, em vez de misturados; vários números-chave dependem de estudos únicos (degradação térmica KORIE; campo de nome do estabelecimento do Textract da RMIT; multilíngue ReceiptSense), e os números da Doubleword e do Google-Forum são de grau D/C (de fornecedor ou anedóticos), usados com seu grau divulgado. Os números de amassado/desbotado do IJSAT vêm de documentos impressos, não de recibos — espera-se que recibos em papel térmico degradem pior, mas isso é uma inferência, declarada como tal.
- Lacunas temporais: Os dados da competição SROIE são de 2019; seus números absolutos refletem métodos da era 2019 e são identificados por ano, com resultados modernos de LLM no mesmo conjunto de dados (Doubleword 2026) fornecidos ao lado. Nenhuma competição padronizada mais recente de recibos com resultados publicados entre equipes foi encontrada após o SROIE 2019.
- O que não conseguimos encontrar: (1) qualquer estudo controlado revisado por pares comparando captura por celular vs digitalização em mesa nos mesmos recibos — a variável mais citada no marketing de fornecedores; (2) um benchmark específico de extração de itens de linha para recibos (os únicos números de itens de linha são em contexto de fatura, 40–82% por mecanismo, BusinessWareTech 2025); (3) qualquer estudo isolando o efeito da moeda (símbolo, convenção decimal) mantendo o script constante; (4) benchmarks para acréscimos manuscritos em recibos (gorjetas, notas, correções); (5) benchmarks públicos para recibos eletrônicos/capturas de tela vs papel fotografado. Essas lacunas são declaradas em vez de preenchidas com números não verificáveis de fornecedores.
Referências relacionadas: Precisão de OCR por Tipo de Documento · Precisão de Reconhecimento de Escrita Manual · Detalhamento de Custos de Processamento de Documentos · Taxas de Erro na Digitação Manual de Dados
Leitura relacionada: O Custo da Digitação Manual de Dados de Recibos Manuscritos · Como a Precisão da Extração de Escrita Manual com IA Continua Melhorando