Precisão em nível de campo vs. precisão em nível de caractere: qual é a diferença?
Última revisão: 2026-08-13 · Aplica-se a: extração de dados de documentos / avaliação de OCR / fluxos de trabalho de AP e entrada de dados
Também conhecido como: A precisão em nível de campo às vezes é chamada de "precisão de campo", "precisão de extração de campo" ou "precisão de extração em nível de campo". A precisão em nível de caractere geralmente é expressa pelo seu inverso, a taxa de erro de caracteres (CER).
A precisão em nível de campo mede se cada campo extraído está completamente correto; a precisão em nível de caractere mede se caracteres individuais são lidos corretamente. Um caractere lido incorretamente corrompe um campo inteiro, portanto as duas métricas descrevem coisas completamente diferentes.
Como Funcionam as Duas Métricas de Precisão
Ambas as métricas são proporções, mas contam coisas diferentes. A precisão em nível de caractere pergunta "quantos caracteres neste documento foram lidos corretamente?" A precisão em nível de campo pergunta "quantos dos campos de dados que eu realmente preciso foram extraídos sem um único erro?"
Precisão em nível de caractere = caracteres reconhecidos corretamente ÷ total de caracteres. A definição formal padrão vem da comunidade de avaliação de OCR: a taxa de erro de caracteres (CER) é a distância de edição de Levenshtein entre o texto reconhecido e a verdade fundamental — o número mínimo de substituições, exclusões e inserções necessárias para transformar um no outro — dividido pelo total de caracteres (especificação do projeto OCR-D). A precisão de caracteres é simplesmente 100% − CER. A própria estrutura de avaliação do NIST (TRAIT) define a precisão de caracteres da mesma forma, como 100 × (1 − distância de edição normalizada) sobre todas as anotações (NISTIR 8199, 2017).
Precisão em nível de campo = campos extraídos corretamente ÷ total de campos. Um campo — total da fatura, data, nome do fornecedor, número da conta — é pontuado como uma unidade binária: ou corresponde exatamente à verdade fundamental ou falha. A versão formal usada em benchmarks acadêmicos é o F1 em nível de campo, a média harmônica de precisão e recall: F1 = 2 × (Precisão × Recall) / (Precisão + Recall), onde precisão é a parcela de campos extraídos que estavam corretos e recall é a parcela de campos esperados que foram encontrados (glossário LlamaIndex, exemplo trabalhado com 10 campos). Um único dígito errado em um número de fatura torna esse campo errado — crédito parcial não se aplica.
É aqui que as duas métricas divergem. Um campo com N caracteres a C% de precisão de caractere tem aproximadamente C^N de probabilidade de estar totalmente correto — o efeito composto que torna a precisão de caractere inútil para prever a precisão de campo. Para um número de fatura de 9 dígitos com 99% de precisão de caractere: 0.99^9 ≈ 91.3% de precisão de campo para esse campo. O mesmo número com 99.9% de precisão de caractere sobe para 99.1%. Um campo de 20 caracteres com 95% de precisão de caractere cai para apenas 35.9% de precisão de campo. Esta é uma aproximação que assume que os erros são independentes e distribuídos uniformemente — sistemas reais concentram erros nos campos exatos que importam (números, códigos, identificadores), então a precisão de campo real costuma ser pior do que o modelo prevê. O próprio trabalho de OCR do NIST observou isso diretamente: reconhecer números de página produziu uma taxa de erro de campo de 12% mesmo quando o reconhecimento geral de caracteres parecia respeitável (NISTIR 6101).
A diferença não é teórica. No benchmark ICDAR 2019 SROIE — 1.000 recibos digitalizados em que as equipes foram avaliadas em ambos os níveis: OCR em nível de palavra (Tarea 2) e extração de informações-chave em nível de campo (Tarea 3) nas mesmas imagens — 7 de 24 métodos enviados superaram 90% de Hmean em nível de palavra, mas solo 1 de 18 superou 90% de F1 em nível de campo (90,49%), e mais da metade das propostas em nível de campo obteve menos de 80% (Huang et al., ICDAR 2019). Até o melhor método de OCR na Tarea 2 não alcanzó a estricta precisión de 99% que as aplicações de recibos exigem — e a extração em nível de campo foi ainda mais difícil. O F1 moderno em nível de campo no benchmark CORD de recibos se sitúa entre 78% e 97% dependendo do modelo (LayoutLM 78.4, LayoutLMv2 78.9, Donut 84.1, LayoutLMv3 cerca de 96.6), segundo os artículos originais dos modelos (Kim et al., Donut, 2022).
Por qué importa esta distinción
Los proveedores citan la precisión de caracteres porque es el número más alto y fácil de producir — mientras que las decisiones empresariales dependen de la precisión de campos, que siempre es menor.
La brecha entre marketing y realidad es sistemática. Las afirmaciones de precisión a nivel de carácter de 98–99,5% son habituales en documentos impresos limpios — e incluso las mejores propuestas de OCR al benchmark ICDAR 2019 SROIE no alcanzaron el 99% de precisión que exigen las aplicaciones de recibos (Huang et al., ICDAR 2019). Pero la precisión a nivel de campo, medida en las mismas imágenes, es mucho menor: solo 1 de 18 métodos a nivel de campo en SROIE superó el 90% de F1, mientras que 7 de 24 métodos de OCR a nivel de palabra superaron el 90% — los mismos documentos, dos puntuaciones muy diferentes (Huang et al., ICDAR 2019). El modelo C^N anterior explica la brecha: con un 95% de precisión de caracteres, un campo de 20 caracteres es completamente correcto solo el 35,9% de las veces. Ambos números pueden ser ciertos en el mismo recibo — alta precisión de caracteres y precisión de campo mucho menor — porque responden a preguntas diferentes.
La razón por la que la precisión de campo es el número que importa es que sus sistemas posteriores consumen campos, no caracteres. Un dígito incorrecto en un total de factura corrompe un pago; un número de cuenta incorrecto corrompe un asiento contable — independientemente de cuántos otros caracteres se hayan leído correctamente. La propia investigación de conversión de documentos del NIST demostró este punto: reconocer los números de página del Registro Federal produjo una tasa de error de campo del 12% incluso cuando el reconocimiento general de caracteres parecía respetable (NISTIR 6101).
La consecuencia operativa es el dimensionamiento de la cola de revisión. Cada error a nivel de campo es un documento que debe ser detectado y corregido. Los modelos modernos alcanzan un F1 a nivel de campo en los mediados de los 90 en recibos de referencia — LayoutLMv3 puntúa alrededor de 96,6% en CORD, frente al 78–84% de modelos anteriores (Kim et al., Donut, 2022) — pero la precisión en el mundo real depende del tipo de documento, la calidad de la imagen y el diseño de los campos, y cada documento por debajo del 100% de precisión de campo envía a alguien a una cola de revisión. Un equipo que evalúa una herramienta solo con la precisión de caracteres sobreestimará constantemente cuántos documentos pueden fluir sin intervención — que es exactamente por lo que los equipos de compras y cuentas por pagar deberían solicitar la precisión a nivel de campo en sus propios tipos de documento antes de comprometerse con cualquier pipeline.
A diferença não é teórica. No benchmark ICDAR 2019 SROIE — 1.000 recibos digitalizados em que as equipes foram avaliadas em ambos os níveis: OCR em nível de palavra (Tarea 2) e extração de informações-chave em nível de campo (Tarea 3) nas mesmas imagens — 7 de 24 métodos enviados superaram 90% de Hmean em nível de palavra, mas solo 1 de 18 superou 90% de F1 em nível de campo (90,49%), e mais da metade das propuestas em nível de campo obteve menos de 80% (Huang et al., ICDAR 2019). Até o melhor método de OCR na Tarea 2 não alcanzó a estricta precisión de 99% que as aplicações de recibos exigem — e a extração em nível de campo foi ainda mais difícil. O F1 moderno em nível de campo no benchmark CORD de recibos se sitúa entre 78% e 97% dependendo do modelo (LayoutLM 78.4, LayoutLMv2 78.9, Donut 84.1, LayoutLMv3 cerca de 96.6), segundo os artículos originais dos modelos (Kim et al., Donut, 2022).
Por qué importa esta distinción
Los proveedores citan la precisión de caracteres porque es el número más alto y fácil de producir — mientras que las decisiones empresariales dependen de la precisión de campos, que siempre es menor.
La brecha entre marketing y realidad es sistemática. Las afirmaciones de precisión a nivel de carácter de 98–99,5% son habituales en documentos impresos limpios — e incluso las mejores propuestas de OCR al benchmark ICDAR 2019 SROIE no alcanzaron el 99% de precisión que exigen las aplicaciones de recibos (Huang et al., ICDAR 2019). Pero la precisión a nivel de campo, medida en las mismas imágenes, es mucho menor: solo 1 de 18 métodos a nivel de campo en SROIE superó el 90% de F1, mientras que 7 de 24 métodos de OCR a nivel de palabra superaron el 90% — los mismos documentos, dos puntuaciones muy diferentes (Huang et al., ICDAR 2019). El modelo C^N anterior explica la brecha: con un 95% de precisión de caracteres, un campo de 20 caracteres es completamente correcto solo el 35,9% de las veces. Ambos números pueden ser ciertos en el mismo recibo — alta precisión de caracteres y precisión de campo mucho menor — porque responden a preguntas diferentes.
La razón por la que la precisión de campo es el número que importa es que sus sistemas posteriores consumen campos, no caracteres. Un dígito incorrecto en un total de factura corrompe un pago; un número de cuenta incorrecto corrompe un asiento contable — independientemente de cuántos otros caracteres se hayan leído correctamente. La propia investigación de conversión de documentos del NIST demostró este punto: reconocer los números de página del Registro Federal produjo una tasa de error de campo del 12% incluso cuando el reconocimiento general de caracteres parecía respetable (NISTIR 6101).
La consecuencia operativa es el dimensionamiento de la cola de revisión. Cada error a nivel de campo es un documento que debe ser detectado y corregido. Los modelos modernos alcanzan un F1 a nivel de campo en los mediados de los 90 en recibos de referencia — LayoutLMv3 puntúa alrededor de 96,6% en CORD, frente al 78–84% de modelos anteriores (Kim et al., Donut, 2022) — pero la precisión en el mundo real depende del tipo de documento, la calidad de la imagen y el diseño de los campos, y cada documento por debajo del 100% de precisión de campo envía a alguien a una cola de revisión. Un equipo que evalúa una herramienta solo con la precisión de caracteres sobreestimará constantemente cuántos documentos pueden fluir sin intervención — que es exactamente por lo que los equipos de compras y cuentas por pagar deberían solicitar la precisión a nivel de campo en sus propios tipos de documento antes de comprometerse con cualquier pipeline.
Equívocos Comuns
- Equívoco: "99% de precisão significa que 99% dos meus dados estão corretos."
- Realidade: Depende inteiramente do que foi medido. 99% de precisão em nível de caractere não significa 99% de precisão em nível de campo — um único caractere lido incorretamente corrompe o campo inteiro. Com 99% de precisão em nível de caractere, um número de fatura de 9 dígitos tem apenas 91,3% de chance de estar totalmente correto (0,99^9), e um campo de 20 caracteres está totalmente correto apenas 81,8% das vezes. O mesmo documento pode obter pontuação alta no nível de caractere enquanto uma parcela significativa de seus campos está errada — o benchmark SROIE documentou 7 de 24 métodos em nível de palavra acima de 90% contra apenas 1 de 18 métodos em nível de campo (Huang et al., ICDAR 2019).
- Equívoco: "A precisão em nível de caractere e a precisão em nível de campo são conversíveis — basta subtrair uma porcentagem fixa."
- Realidade: A conversão depende do comprimento do campo e da distribuição de erros, portanto não existe um mapeamento fixo. O modelo C^N mostra que a penalidade cresce com o comprimento do campo: um campo de 9 caracteres com 99% de precisão em nível de caractere mantém 91,3% de precisão em nível de campo, mas um campo de 20 caracteres com a mesma precisão em nível de caractere cai para 81,8%, e com 95% de precisão em nível de caractere, um campo de 20 caracteres cai para apenas 35,9%. Campos diferentes no mesmo documento têm comprimentos diferentes e taxas de erro diferentes — não existe um único fator de conversão.
- Equívoco: "Uma precisão em nível de caractere mais alta sempre significa uma ferramenta melhor."
- Realidade: O desempenho em nível de campo depende de mais do que a leitura bruta de caracteres — contexto, compreensão da estrutura e validação podem elevar a precisão em nível de campo acima do que a precisão em nível de caractere prevê, ou reduzi-la abaixo. Um sistema pode ler quase todos os caracteres corretamente e ainda assim atribuir um valor ao campo errado — um erro estrutural que a precisão em nível de caractere nem consegue medir, pois ela nunca verifica se o valor certo foi parar no lugar certo. O F1 em nível de campo captura isso: ele penaliza tanto valores errados quanto valores extraídos, mas rotulados incorretamente, e é por isso que os benchmarks pontuam F1 em vez de precisão bruta em nível de caractere (Glossário LlamaIndex). Avalie a precisão em nível de campo diretamente, em seus próprios documentos.
Perguntas Frequentes
Qual é a diferença entre precisão em nível de campo e precisão em nível de caractere?
A precisão em nível de caractere mede com que frequência caracteres individuais são lidos corretamente (como uma proporção de caracteres corretos em relação ao total de caracteres); a precisão em nível de campo mede com que frequência campos de dados completos — número da fatura, data, total, fornecedor — são extraídos corretamente como uma unidade. Um campo está errado se mesmo um de seus caracteres estiver errado, então a precisão em nível de campo é sempre menor que a precisão em nível de caractere no mesmo documento, e é a métrica que importa para fluxos de trabalho reais.
Precisão de 99% significa que 99% dos meus dados estão corretos?
Somente se os 99% foram medidos em nível de campo. "Precisão de 99%" no marketing de fornecedores geralmente é precisão em nível de caractere, porque é o número mais alto e mais fácil de produzir — e não é conversível em precisão de campo. Com 99% de precisão de caracteres, um número de fatura de 9 dígitos está totalmente correto apenas cerca de 91,3% das vezes (0,99^9), e o risco de erro por campo se acumula entre os campos de cada documento.
Qual métrica de precisão devo usar ao avaliar ferramentas de extração de documentos?
Peça precisão em nível de campo, medida nos seus próprios tipos de documento. A precisão de caracteres informa quão bem o mecanismo de OCR lê o texto; ela não informa nada sobre se o valor certo foi colocado no campo certo — que é o que seus sistemas downstream consomem. Quando você vir uma alegação de precisão em destaque, pergunte o que foi medido, em quais documentos e em quais campos. O F1 em nível de campo (precisão e recall juntos) é a métrica formal padrão porque também captura campos que foram extraídos, mas receberam o rótulo errado (glossário LlamaIndex).
Como você calcula a precisão em nível de campo?
Precisão em nível de campo = campos extraídos corretamente ÷ total de campos esperados × 100%. Um campo corresponde apenas se é exatamente igual à verdade fundamental — um caractere errado faz falhar o campo. O padrão acadêmico é o F1 em nível de campo: F1 = 2 × (Precision × Recall) / (Precision + Recall), onde precision é a proporção de campos extraídos que estavam corretos e recall é a proporção de campos esperados que foram encontrados (glossário LlamaIndex). Esta é a mesma pontuação usada pelos benchmarks SROIE e CORD.
Por que a precisão em nível de campo é sempre menor que a precisão em nível de caractere?
Porque um campo falha se qualquer um de seus caracteres falha, e campos longos falham rapidamente. O modelo composto C^N significa que um campo de 9 caracteres com 99% de precisão de caracteres mantiene apenas 91,3% de precisão de campo, e a penalidade cresce com o comprimento do campo (0,99^20 ≈ 81,8%). Sistemas reais também concentram erros em campos numéricos, onde um único dígito errado é fatal — NIST observou isso em seu próprio trabalho de OCR, que produjo uma taxa de erro de campo de 12% em números de página, apesar de um reconhecimento de caracteres respeitável (NISTIR 6101).
Quais são os benchmarks típicos de precisão em nível de campo?
Em benchmarks acadêmicos, o F1 em nível de campo varia de 78% a 97% dependendo do modelo: a competição ICDAR 2019 SROIE viu apenas 1 de 18 envios superar 90% de F1 em nível de campo (mais da metade obtuvo menos de 80%), enquanto os melhores modelos do benchmark CORD alcanzan aproximadamente 96–97% (Huang et al., 2019; Kim et al., 2022). Os números de produção variam mais que os benchmarks porque os documentos reais são mais desordenados — trate qualquer figura única como dependente do documento e do campo, e teste com seus próprios documentos.
Fontes
- Huang, Z., et al. — "ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction" (IEEE ICDAR, 2019). Benchmark de 1.000 recibos digitalizados com 24 submissões de OCR e 18 submissões de extração em nível de campo; 7 de 24 métodos de OCR superaram 90% de Hmean, enquanto apenas 1 de 18 métodos em nível de campo o fez (90,49%), com mais da metade abaixo de 80%. Fonte primária para a diferença entre caractere e campo em documentos idênticos.
- Kim, G., et al. — "OCR-free Document Understanding Transformer" (ECCV, 2022). F1 em nível de campo no benchmark de recibos CORD entre modelos: LayoutLM 78,4, LayoutLMv2 78,9, Donut 84,1, LayoutLMv3 (base) ~96,6. Fonte para a faixa de F1 em nível de campo de 78–97%.
- NIST — "The Text Recognition Algorithm Independent Evaluation (TRAIT)" (NISTIR 8199, 2017). Definição oficial do NIST de Precisão de Caracteres = 100(1 − distância de edição normalizada)/#anotações. Fonte para a definição formal de precisão de caracteres.
- NIST — "Impact of Image Quality on Machine Print OCR" (NISTIR 6101, 2001). O próprio OCR do NIST produziu uma taxa de erro em nível de campo de 12% nos números de página do Federal Register, apesar do reconhecimento em nível de caractere respeitável. Fonte para o exemplo de taxa de erro em nível de campo.
- OCR-D Project — Quality Assurance Specification. CER formal = (inserções + exclusões + substituições) / total de caracteres e o análogo WER. Fonte para a fórmula do CER.
- LlamaIndex — "What is F1 Score for Document Extraction?". F1 = 2·(P·R)/(P+R) com um exemplo prático de fatura com 10 campos; explica a pontuação em nível de campo versus em nível de documento. Fonte para a fórmula do F1 e o exemplo prático.
Termos Relacionados
- O que é reconhecimento óptico de caracteres (OCR)?: A tecnologia de leitura cuja precisão em nível de caractere é a fonte da confusão — o OCR transforma pixels em caracteres; por si só, não produz campos corretos.
- precisão de caracteres entre tipos de documento: Benchmarks de precisão em nível de caractere agrupados por tipo de documento — a camada que alimenta (mas nunca equivale a) a precisão em nível de campo.
- O que é a taxa de processamento direto (STP)?: A métrica de ponta a ponta que depende da precisão em nível de campo (e em nível de documento) — um sistema precisa de precisão de campo próxima de 100% antes que os documentos fluam sem intervenção humana.
Leitura relacionada: O guia de precisão em 4 níveis: caractere, campo, documento e STP · Por que "precisão de 99%" quase sempre se refere ao nível de caractere · Como medir a precisão em nível de campo na prática