Précision au niveau des champs vs au niveau des caractères : quelle différence ?

Dernière révision : 2026-08-13 · S'applique à : extraction de données documentaires / évaluation OCR / flux de travail AP et de saisie de données

Portée : Cette définition couvre les deux mesures de précision utilisées pour évaluer les systèmes d'extraction de données documentaires et d'OCR — la précision au niveau des caractères (la fréquence à laquelle les caractères individuels sont lus correctement) et la précision au niveau des champs (la fréquence à laquelle des champs de données complets, comme un total de facture ou une date, sont extraits correctement en tant qu'unité). Elle ne couvre PAS la précision au niveau des mots (WER) au-delà d'une brève comparaison, la précision au niveau du document (tous les champs d'un document corrects) ni le taux de traitement sans intervention (STP) — chacun étant défini dans sa propre page de référence.
Également appelé : La précision au niveau des champs est parfois appelée « précision des champs », « précision d'extraction des champs » ou « précision d'extraction au niveau des champs ». La précision au niveau des caractères est généralement exprimée par son inverse, le taux d'erreur sur les caractères (CER).

La précision au niveau des champs mesure si chaque champ extrait est entièrement correct ; la précision au niveau des caractères mesure si les caractères individuels sont lus correctement. Un caractère mal lu corrompt un champ entier, si bien que les deux métriques décrivent des choses totalement différentes.

Comment fonctionnent les deux métriques de précision

Les deux métriques sont des ratios, mais elles comptent des choses différentes. La précision au niveau des caractères demande « combien de caractères de ce document ont été lus correctement ? » La précision au niveau des champs demande « combien des champs de données dont j'ai réellement besoin ont été extraits sans une seule erreur ? »

Précision au niveau des caractères = caractères correctement reconnus ÷ nombre total de caractères. La définition formelle standard provient de la communauté d'évaluation OCR : le taux d'erreur sur les caractères (CER) est la distance d'édition de Levenshtein entre le texte reconnu et la vérité terrain — le nombre minimal de substitutions, suppressions et insertions nécessaires pour transformer l'un en l'autre — divisé par le nombre total de caractères (spécification du projet OCR-D). La précision des caractères est simplement 100 % − CER. Le cadre d'évaluation du NIST (TRAIT) définit la précision des caractères de la même manière, comme 100 × (1 − distance d'édition normalisée) sur toutes les annotations (NISTIR 8199, 2017).

Précision au niveau des champs = champs correctement extraits ÷ nombre total de champs. Un champ — total de facture, date, nom du fournisseur, numéro de compte — est évalué comme une unité binaire : soit il correspond exactement à la vérité terrain, soit il échoue. La version formelle utilisée dans les benchmarks académiques est le F1 au niveau des champs, la moyenne harmonique de la précision et du rappel : F1 = 2 × (Précision × Rappel) / (Précision + Rappel), où la précision est la part des champs extraits qui étaient corrects et le rappel est la part des champs attendus qui ont été trouvés (glossaire LlamaIndex, exemple détaillé de 10 champs). Un seul chiffre erroné dans un numéro de facture rend ce champ incorrect — aucun crédit partiel n'est accordé.

C'est là que les deux métriques divergent. Un champ de N caractères avec une précision au niveau des caractères de C % a une probabilité approximative de C^N d'être entièrement correct — l'effet de composition qui rend la précision au niveau des caractères inutile pour prédire la précision au niveau des champs. Pour un numéro de facture à 9 chiffres avec une précision au niveau des caractères de 99 % : 0,99^9 ≈ 91,3 % de précision au niveau des champs pour ce champ. Le même numéro avec une précision au niveau des caractères de 99,9 % passe à 99,1 %. Un champ de 20 caractères avec une précision au niveau des caractères de 95 % chute à seulement 35,9 % de précision au niveau des champs. Il s'agit d'une approximation qui suppose que les erreurs sont indépendantes et uniformément réparties — les systèmes réels concentrent les erreurs sur les champs qui comptent précisément (nombres, codes, identifiants), de sorte que la précision réelle au niveau des champs est généralement inférieure à ce que le modèle prédit. Les travaux OCR du NIST ont observé cela directement : la reconnaissance des numéros de page a produit un taux d'erreur au niveau des champs de 12 % même si la reconnaissance globale des caractères semblait respectable (NISTIR 6101).

L'écart n'est pas théorique. Sur le benchmark ICDAR 2019 SROIE — 1 000 reçus scannés où les équipes ont été évaluées sur à la fois l'OCR au niveau des mots (tâche 2) et l'extraction d'informations clés au niveau des champs (tâche 3) sur les mêmes images — 7 des 24 méthodes soumises ont dépassé 90 % de Hmean au niveau des mots, mais seulement 1 des 18 a dépassé 90 % de F1 au niveau des champs (90,49 %), et plus de la moitié des soumissions au niveau des champs ont obtenu un score inférieur à 80 % (Huang et al., ICDAR 2019). Même la meilleure méthode OCR de la tâche 2 n'a pas pu atteindre la précision stricte de 99 % exigée par les applications de reçus — et l'extraction au niveau des champs était encore plus difficile. Le F1 moderne au niveau des champs sur le benchmark de reçus CORD se situe entre 78 % et 97 % selon le modèle (LayoutLM 78,4, LayoutLMv2 78,9, Donut 84,1, LayoutLMv3 environ 96,6), selon les articles originaux des modèles (Kim et al., Donut, 2022).

Pourquoi la distinction est importante

Les fournisseurs citent la précision au niveau des caractères parce que c'est le chiffre le plus élevé et le plus facile à produire — alors que les décisions commerciales dépendent de la précision au niveau des champs, qui est toujours plus faible.

L'écart entre le marketing et la réalité est systématique. Des affirmations de précision au niveau des caractères de 98–99,5 % sont courantes pour les documents imprimés propres — et même les meilleures soumissions OCR au benchmark ICDAR 2019 SROIE n'ont pas atteint la précision de 99 % exigée par les applications de reçus (Huang et al., ICDAR 2019). Mais la précision au niveau des champs, mesurée sur les mêmes images, est bien plus faible : seulement 1 des 18 méthodes au niveau des champs sur SROIE a dépassé 90 % de F1, tandis que 7 des 24 méthodes OCR au niveau des mots ont dépassé 90 % — les mêmes documents, deux scores très différents (Huang et al., ICDAR 2019). Le modèle C^N ci-dessus explique l'écart : avec une précision au niveau des caractères de 95 %, un champ de 20 caractères est entièrement correct seulement 35,9 % du temps. Les deux chiffres peuvent être vrais sur le même reçu — une précision élevée au niveau des caractères et une précision bien plus faible au niveau des champs — parce qu'ils répondent à des questions différentes.

La raison pour laquelle la précision au niveau des champs est le chiffre qui compte est que vos systèmes en aval consomment des champs, pas des caractères. Un chiffre erroné dans un total de facture corrompt un paiement ; un numéro de compte erroné corrompt une écriture — quel que soit le nombre d'autres caractères lus correctement. La propre technologie OCR du NIST a démontré ce point dans ses recherches de conversion de documents : la reconnaissance des numéros de page du Federal Register a produit un taux d'erreur au niveau des champs de 12 % même si la reconnaissance globale des caractères semblait respectable (NISTIR 6101).

La conséquence opérationnelle est le dimensionnement de la file de révision. Chaque erreur au niveau des champs est un document qui doit être détecté et corrigé. Les modèles modernes atteignent un F1 au niveau des champs au milieu des années 90 sur les reçus de référence — LayoutLMv3 obtient environ 96,6 % sur CORD, contre 78–84 % pour les modèles plus anciens (Kim et al., Donut, 2022) — mais la précision dans le monde réel dépend du type de document, de la qualité de l'image et de la conception des champs, et chaque document en dessous de 100 % de précision au niveau des champs oriente quelqu'un vers une file de révision. Une équipe qui évalue un outil uniquement sur la précision au niveau des caractères surestimera systématiquement le nombre de documents pouvant passer sans intervention — c'est exactement pourquoi les équipes d'approvisionnement et de comptabilité fournisseurs devraient demander la précision au niveau des champs sur leurs propres types de documents avant de s'engager dans un pipeline.

Idées reçues courantes

  • Idée reçue : « Une précision de 99 % signifie que 99 % de mes données sont correctes. »
  • Réalité : Cela dépend entièrement de ce qui a été mesuré. Une précision de 99 % au niveau des caractères ne signifie pas une précision de 99 % au niveau des champs — un seul caractère mal lu corrompt tout le champ. Avec une précision de 99 % au niveau des caractères, un numéro de facture à 9 chiffres n'a que 91,3 % de chances d'être entièrement correct (0,99^9), et un champ de 20 caractères n'est entièrement correct que 81,8 % du temps. Le même document peut obtenir un score élevé au niveau des caractères tandis qu'une part significative de ses champs est erronée — le benchmark SROIE a documenté 7 méthodes sur 24 au niveau des mots au-dessus de 90 %, contre seulement 1 méthode sur 18 au niveau des champs (Huang et al., ICDAR 2019).
  • Idée reçue : « La précision au niveau des caractères et la précision au niveau des champs sont convertibles — il suffit de soustraire un pourcentage fixe. »
  • Réalité : La conversion dépend de la longueur du champ et de la distribution des erreurs, il n'existe donc pas de correspondance fixe. Le modèle C^N montre que la pénalité augmente avec la longueur du champ : un champ de 9 caractères avec une précision de 99 % au niveau des caractères conserve 91,3 % de précision au niveau des champs, mais un champ de 20 caractères avec la même précision au niveau des caractères tombe à 81,8 %, et avec une précision de 95 % au niveau des caractères, un champ de 20 caractères chute à seulement 35,9 %. Les différents champs d'un même document ont des longueurs et des taux d'erreur différents — aucun facteur de conversion unique n'existe.
  • Idée reçue : « Une précision au niveau des caractères plus élevée signifie toujours un meilleur outil. »
  • Réalité : La performance au niveau des champs dépend de plus que la simple lecture des caractères — le contexte, la compréhension de la structure et la validation peuvent élever la précision au niveau des champs au-dessus de ce que prédit la précision au niveau des caractères, ou la faire chuter en dessous. Un système peut lire presque tous les caractères correctement et pourtant attribuer une valeur au mauvais champ — une erreur structurelle que la précision au niveau des caractères ne peut même pas mesurer, puisqu'elle ne vérifie jamais si la bonne valeur a été placée au bon endroit. Le F1 au niveau des champs permet de détecter cela : il pénalise à la fois les valeurs incorrectes et les valeurs extraites mais mal étiquetées, c'est pourquoi les benchmarks évaluent le F1 plutôt que la précision brute au niveau des caractères (glossaire LlamaIndex). Évaluez directement la précision au niveau des champs, sur vos propres documents.

Questions fréquemment posées

Quelle est la différence entre la précision au niveau des champs et la précision au niveau des caractères ?

La précision au niveau des caractères mesure la fréquence à laquelle les caractères individuels sont lus correctement (sous forme de ratio entre les caractères corrects et le nombre total de caractères) ; la précision au niveau des champs mesure la fréquence à laquelle des champs de données complets — numéro de facture, date, total, fournisseur — sont extraits correctement comme une unité. Un champ est incorrect si un seul de ses caractères est incorrect, donc la précision au niveau des champs est toujours inférieure à la précision au niveau des caractères sur le même document, et c'est la métrique qui compte pour les flux de travail réels.

Une précision de 99 % signifie-t-elle que 99 % de mes données sont correctes ?

Seulement si les 99 % ont été mesurés au niveau des champs. « Précision de 99 % » dans le marketing des fournisseurs est généralement une précision au niveau des caractères, car c'est le chiffre le plus élevé et le plus facile à produire — et il n'est pas convertible en précision au niveau des champs. Avec une précision au niveau des caractères de 99 %, un numéro de facture à 9 chiffres est entièrement correct seulement environ 91,3 % du temps (0,99^9), et le risque d'erreur par champ s'accumule sur tous les champs de chaque document.

Quelle métrique de précision devrais-je utiliser pour évaluer les outils d'extraction de documents ?

Demandez la précision au niveau des champs, mesurée sur vos propres types de documents. La précision au niveau des caractères vous indique dans quelle mesure le moteur OCR lit le texte ; elle ne vous dit rien sur le fait que la bonne valeur a atterri dans le bon champ — ce que vos systèmes en aval consomment. Lorsque vous voyez une affirmation de précision en titre, demandez ce qui a été mesuré, sur quels documents et sur quels champs. Le F1 au niveau des champs (précision et rappel combinés) est la métrique formelle standard car elle détecte également les champs extraits mais étiquetés de manière incorrecte (glossaire LlamaIndex).

Comment calculez-vous la précision au niveau des champs ?

Précision au niveau des champs = champs correctement extraits ÷ nombre total de champs attendus × 100 %. Un champ n'est considéré comme correct que s'il correspond exactement à la vérité terrain — un seul caractère erroné fait échouer le champ. La norme académique est le F1 au niveau des champs : F1 = 2 × (Précision × Rappel) / (Précision + Rappel), où la précision est la part des champs extraits qui étaient corrects et le rappel est la part des champs attendus qui ont été trouvés (glossaire LlamaIndex). C'est la même méthode de notation que celle utilisée par les benchmarks SROIE et CORD.

Pourquoi la précision au niveau des champs est-elle toujours inférieure à la précision au niveau des caractères ?

Parce qu'un champ échoue si l'un de ses caractères échoue, et les champs longs échouent rapidement. Le modèle de composition C^N signifie qu'un champ de 9 caractères avec une précision au niveau des caractères de 99 % ne conserve que 91,3 % de précision au niveau des champs, et la pénalité augmente avec la longueur du champ (0,99^20 ≈ 81,8 %). Les systèmes réels concentrent également les erreurs dans les champs numériques, où un seul chiffre erroné est fatal — le NIST l'a observé dans ses propres travaux d'OCR, qui ont produit un taux d'erreur de 12 % au niveau des champs sur les numéros de page malgré une reconnaissance des caractères respectable (NISTIR 6101).

Quels sont les benchmarks typiques de précision au niveau des champs ?

Sur les benchmarks académiques, le F1 au niveau des champs varie de 78 % à 97 % selon le modèle : la compétition ICDAR 2019 SROIE n'a vu que 1 des 18 soumissions dépasser 90 % de F1 au niveau des champs (plus de la moitié ont obtenu moins de 80 %), tandis que les meilleurs modèles du benchmark CORD atteignent environ 96–97 % (Huang et al., 2019 ; Kim et al., 2022). Les chiffres en production varient plus que les benchmarks car les documents réels sont plus désordonnés — considérez tout chiffre unique comme dépendant du document et du champ, et testez sur vos propres documents.

Sources

  1. Huang, Z., et al. — « ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction » (IEEE ICDAR, 2019). Benchmark de 1 000 reçus scannés avec 24 soumissions OCR et 18 soumissions d'extraction au niveau des champs ; 7 des 24 méthodes OCR ont dépassé 90 % de Hmean tandis que seulement 1 des 18 méthodes au niveau des champs y est parvenue (90,49 %), plus de la moitié sous 80 %. Source principale pour l'écart entre les caractères et les champs sur des documents identiques.
  2. Kim, G., et al. — « OCR-free Document Understanding Transformer » (ECCV, 2022). F1 au niveau des champs sur le benchmark de reçus CORD selon les modèles : LayoutLM 78,4, LayoutLMv2 78,9, Donut 84,1, LayoutLMv3 (base) ~96,6. Source pour la plage de F1 au niveau des champs de 78 à 97 %.
  3. NIST — « The Text Recognition Algorithm Independent Evaluation (TRAIT) » (NISTIR 8199, 2017). Définition officielle du NIST de la précision des caractères = 100(1 − distance d'édition normalisée)/#annotations. Source pour la définition formelle de la précision des caractères.
  4. NIST — « Impact of Image Quality on Machine Print OCR » (NISTIR 6101, 2001). L'OCR propre du NIST a produit un taux d'erreur de 12 % au niveau des champs sur les numéros de page du Federal Register malgré une reconnaissance au niveau des caractères respectable. Source pour l'exemple du taux d'erreur au niveau des champs.
  5. Projet OCR-D — Spécification d'assurance qualité. CER formel = (insertions + suppressions + substitutions) / nombre total de caractères et l'analogue WER. Source pour la formule du CER.
  6. LlamaIndex — « What is F1 Score for Document Extraction? ». F1 = 2·(P·R)/(P+R) avec un exemple concret de facture à 10 champs ; explique la notation au niveau des champs par rapport à celle au niveau du document. Source pour la formule du F1 et l'exemple concret.

Lectures complémentaires : Le guide de précision en 4 niveaux : caractère, champ, document et STP · Pourquoi « précision de 99 % » est presque toujours au niveau des caractères · Comment mesurer la précision au niveau des champs en pratique

📮 contact email: [email protected]