Précision OCR par type de document : PDF numérique, numérisation,
benchmarks sur écriture manuscrite et tableaux (2026)
Dernière révision : 2026-08-10 · Couverture des données : partielle · Sources : 16 études indépendantes
Ce que cette page ne couvre PAS : les taux d'erreur de saisie manuelle des données (voir taux d'erreur de saisie manuelle des données), le mécanisme de l'OCR lui-même (voir Qu'est-ce que l'OCR ?), ni les affirmations spécifiques d'un fournisseur concernant un produit unique au-delà des chiffres de benchmark cités ci-dessous.
Tous les chiffres ci-dessous sont basés sur des études tierces et des rapports industriels publiquement disponibles, cités dans la section méthodologie. Lorsque les sources divergent, des fourchettes prudentes (valeurs les plus basses–les plus hautes rapportées) sont utilisées. Cette page est un benchmark directionnel, pas une prévision précise pour un moteur ou une organisation unique.
Chaque fournisseur d'OCR cite une version de la « précision de 99 % ». Sur 16 études indépendantes, ce chiffre est vrai pour exactement une condition de document — le texte propre natif numérique, où tous les moteurs principaux obtiennent un score supérieur à 99,2 % — et il devient progressivement moins vrai pour tout le reste : les numérisations propres chutent à 98–99 %, les numérisations historiques et dégradées à 71–98 %, l'écriture manuscrite à une fourchette de 46–95 % selon les solutions, et les originaux endommagés jusqu'à 72,7 %. Ce chiffre n'est pas un mensonge ; c'est une mesure spécifique au type de document présentée comme si elle était universelle.
D'où vient le chiffre de « 99 % » — et pourquoi il induit en erreur
Le chiffre de 99 % est une mesure au niveau des caractères sur du texte imprimé propre, et la précision au niveau des caractères est la lentille la plus favorable disponible. Comprendre cela — ainsi que les trois autres lentilles utilisées — explique pourquoi « 99 % de précision OCR » et « 78 % de précision au niveau des champs » peuvent être vrais tous les deux pour le même système.
Le taux d'erreur sur les caractères (CER) compte les caractères mal lus individuellement : un CER de 1 % signifie environ un caractère erroné sur cent. L'échelle de benchmark largement adoptée pour le texte imprimé, formalisée par le programme de numérisation de journaux de la Bibliothèque nationale d'Australie, définit une bonne OCR comme étant précise à 98–99 % (1–2 % de CER), une OCR moyenne comme étant précise à 90–98 % (2–10 % de CER), et une OCR médiocre comme étant en dessous de 90 % (Holley, 2009). Les recommandations OCR du Comité européen de la protection des données placent indépendamment les performances des documents imprimés courants à 95–99 % de précision au niveau des caractères, avec 98–99 % traités comme le niveau de garantie de qualité de production (EDPB, 2024).
Le problème est que la précision au niveau des caractères est la moins exigeante des mesures utilisées. Un document de 2 000 caractères avec une précision au niveau des caractères de 99 % contient encore ~20 caractères erronés. Au niveau des mots, ce même résultat pourrait obtenir un score de 96–98 % car un seul caractère mal lu fait échouer le mot entier. Au niveau des champs — la mesure qui compte pour extraire un numéro de facture ou une date — un seul chiffre erroné fait échouer le champ entier, donc un système avec 99 % de précision au niveau des caractères peut fournir seulement 78–98 % de précision au niveau des champs selon le moteur (benchmark BusinessWareTech, 2025). Pour les tableaux, une quatrième mesure s'applique : la similarité par distance d'édition d'arbre (TEDS), qui évalue si la structure du tableau extrait et le contenu des cellules correspondent à l'original — un axe entièrement différent de la précision au niveau des caractères.
Les archives historiques montrent à quel point le plafond du texte propre est difficile à atteindre. L'Institut de recherche en science de l'information de l'UNLV a mené des tests annuels de précision OCR de 1992 à 1995 sur des pages anglaises imprimées à la machine ; les meilleurs systèmes commerciaux sont passés d'environ 94 % à 98 %+ de précision au niveau des caractères et ont largement plafonné à ce niveau (Rice, Jenkins & Nartker, 1995). Le NIST est arrivé à la même conclusion dans son évaluation de 1998 : un taux d'erreur sur les caractères de 1 % n'est atteignable que lorsque la source est un original dactylographié propre, au format fixe (NIST IR 6101, 1998). Vingt-cinq ans d'apprentissage profond ont repoussé ce plafond, mais uniquement pour les entrées les plus propres.
Le type de document est le plus grand facteur de précision OCR — plus grand que le choix du moteur. Le graphique ci-dessous représente la fourchette publiée pour chaque classe de document ; l'écart entre la valeur la plus basse et la plus haute observée est la réponse honnête, pas une « moyenne » unique. Les documents dégradés ou manuscrits produisent des fourchettes si larges qu'une estimation ponctuelle serait activement trompeuse.
Répartition par type de document
Sources : IntuitionLabs (2025) — tous les moteurs >99,2 % sur texte dactylographié simple ; Holley (2009) — document propre 98–99 % benchmark « bon » ; dégradé 71–98,02 % de confiance brute sur les caractères pour les journaux australiens 1803–1954 ; AIMultiple (2026) — écriture manuscrite 46–95 % sur 12 solutions ; GatedLexiconNet (2024) — précision au niveau des mots IAM ~94,3 % ; IJSAT (2026) — originaux endommagés 72,7–94,7 % à 300 DPI. Plages prudentes utilisées lorsque les sources divergent.
| Type de document / Condition | Plage de précision | Point médian | Source | Année | Échantillon |
|---|---|---|---|---|---|
| PDF natif numérique (sortie ERP/typographique) | 99,2–99,8 % | 99,5 % | IntuitionLabs ; ABBYY (revendication du fournisseur) | 2025 | Tous les moteurs >99,2 % sur texte typographique simple |
| Document imprimé numérisé propre (300 DPI) | 98–99 % | 98,5 % | Holley ; EDPB | 2009 / 2024 | Benchmark « Bon OCR » ; collection numérisée NLA |
| Numérisé — dégradé ou historique | 71–98 % | ~85 % | Holley | 2009 | Plus de 30 titres de journaux, 1803–1954, confiance brute au niveau des caractères |
| Écriture manuscrite — meilleurs systèmes modernes (benchmarks) | 94–99 % au niveau des mots | 96 % | GatedLexiconNet ; Benchmark HTR LLM | 2024–2025 | IAM (657 scripteurs, 13 353 lignes) ; RIMES (lettres françaises) |
| Écriture manuscrite — plage multi-solutions | 46–95 % | ~70 % | AIMultiple | 2026 | 12 solutions, score de similarité SBERT |
| Photo d'un original endommagé | 72,7–94,7 % | ~84 % | IJSAT | 2026 | EasyOCR ; normal vs froissé/sale/mouillé, 300 DPI |
| Tableaux — structure (natif numérique) | TEDS 0,91–0,97 | 0,94 | Classement PubTabNet (MuTabNet 0,969) ; TrOCR-ctx (0,909) | 2024–2025 | Corpus PubTabNet, similarité structurelle TEDS |
| Tableaux — détection (archives / dessinés à la main) | wF1 0,49–0,53 | 0,51 | ICDAR 2019 cTDaR | 2019 | Piste archives, F1 pondéré à IoU 0,6–0,9 |
Sources listées dans le tableau ci-dessus. Les chiffres de précision au niveau des caractères et des mots proviennent d'études évaluées par les pairs et de gouvernements ; les chiffres annoncés par les fournisseurs sont identifiés comme tels. La similarité par distance d'édition d'arbre (TEDS) et le F1 pondéré (wF1) sont des métriques au niveau de la structure et ne sont pas directement comparables à la précision au niveau des caractères — voir Pourquoi les fourchettes de précision sont si larges. Pour la ligne de dégradation la plus sévère, le plancher de 71 % est une mesure de 2009 sur le titre de journal historique le moins performant (le chiffre brut publié le plus récent disponible) ; les moteurs modernes sur des documents similaires obtiennent des résultats nettement meilleurs (voir Méthodologie).
La résolution est le levier de précision le plus contrôlable, mais les preuves publiées sont plus minces que ne le suggèrent les blogs de fournisseurs. La seule étude gouvernementale rigoureuse — le test de l'US Government Publishing Office sur des documents anciens et décolorés — a révélé que la capture en couleur (RVB), et non une résolution plus élevée, était le facteur décisif : la numérisation RVB a satisfait à l'exigence de précision de 99 % au niveau des caractères du GPO, tandis que les numérisations bitonales (noir et blanc) des mêmes documents ont obtenu un score de ~77 %, et la réduction de 300 à 200 DPI n'a produit aucun gain de précision (livre blanc de l'US GPO).
Répartition par DPI et qualité de numérisation
| Résolution / mode de numérisation | Effet observé | Source | Année |
|---|---|---|---|
| 300 DPI et plus (standard) | Atteint une précision de 98 à 99 % au niveau des caractères sur un document imprimé propre ; 400 à 600 DPI recommandés pour les polices de moins de 10 pt | Guide OCR de l'Univ. de Pittsburgh ; US GPO | 2024 / ~2022 |
| 200 DPI | Adéquat sur un document imprimé propre ; la réduction de 300 DPI n'a pas modifié la reconnaissance lors des tests du GPO | US GPO | ~2022 |
| Moins de 150 DPI | Classé comme facteur de dégradation à fort impact ; les petites polices échouent et la précision tombe sous la fourchette propre de 98 à 99 % | Glossaire LlamaIndex ; plancher de dégradation selon IJSAT (2026) | 2026 |
| 72 DPI (capture d'écran) | Densité de pixels insuffisante pour une discrimination fiable des caractères ; classé comme ayant un « impact élevé » sur la précision | Glossaire LlamaIndex | 2026 |
| Numérisation couleur (RVB) vs bitonale de documents anciens | Le RVB a atteint 99 % contre ~77 % pour le bitonal sur des originaux anciens/décolorés | US GPO | ~2022 |
Sources indiquées dans le tableau ci-dessus. Mention de l'avertissement honnête : aucune étude évaluée par les pairs n'isole le DPI seul en maintenant tous les autres facteurs constants. La ligne « en dessous de 150 DPI » combine donc les recommandations explicites de faible DPI du glossaire de référence LlamaIndex avec le plancher de précision lié aux dommages physiques mesuré par IJSAT (2026) à 300 DPI — une approximation, indiquée comme telle.
Le type de champ détermine si une erreur de lecture a de l'importance. Un mot mal lu dans un paragraphe est invisible pour la plupart des flux de travail ; un chiffre mal lu dans un numéro de facture fait échouer tout le champ. Le seul benchmark publié qui isole les types de champs sur plusieurs moteurs est une étude d'extraction de factures de 2025, et son étendue — 40–98 % selon le type de champ et le moteur — est la preuve la plus claire disponible que la « précision OCR » n'est pas un chiffre unique (BusinessWareTech, 2025).
Répartition par type de champ
| Type de champ | Plage de précision | Contexte | Source | Année |
|---|---|---|---|---|
| Champs texte clé-valeur (en-têtes de facture) | 78–98 % selon le moteur | GPT-4o + OCR 98 %, Azure Document Intelligence 93 %, Google Document AI 82 %, AWS Textract 78 % | BusinessWareTech | 2025 |
| Lignes de détail / lignes de tableau | 40–82 % selon le moteur | Détection des lignes de détail : Textract 82 % contre Google Document AI 40 % dans le même test | BusinessWareTech | 2025 |
| Champs numériques (dates, totaux, identifiants) | 78–98 % (dans la plage des champs) | Le format contraint aide, mais un seul chiffre mal lu fait échouer le champ | BusinessWareTech ; benchmark de factures AIMultiple | 2025–2026 |
| Cases à cocher / reconnaissance de marques | Aucun benchmark public fiable | Absence de données — signalée dans Limitations ; la littérature héritée sur la reconnaissance de marques précède l'OCR par IA | — | — |
| Signatures | Aucun benchmark public de précision | Absence de données — les fournisseurs signalent la détection, pas la précision de reconnaissance | — | — |
Sources indiquées dans le tableau ci-dessus. Les chiffres de 78–98 % et 40–82 % proviennent d'un benchmark indépendant unique (BusinessWareTech, 2025, jeu de test sur factures réelles) — une source de niveau C, corroborée en tendance par le benchmark de facturation d'AIMultiple, qui a constaté une baisse marquée de la précision sur les documents de moindre qualité pour tous les outils (AIMultiple, 2026). Les lignes marquées « Absence de données » ne disposent d'aucune mesure tierce citable ; elles sont indiquées telles quelles plutôt que comblées par des chiffres de fournisseurs.
La langue est la dimension de précision la moins documentée, car presque aucun fournisseur ne publie de benchmarks par langue. La seule comparaison multilingue évaluée par les pairs — une étude de 2021 portant sur 18 568 images de documents en anglais et en arabe — a révélé que la précision en anglais était « considérablement plus élevée » qu'en arabe sur les mêmes moteurs, avec un écart de l'ordre de 10 à 25 points de pourcentage pour la reconnaissance en sortie de boîte (Hebert et al., 2021). Les benchmarks d'écriture manuscrite ajoutent un deuxième point de données : l'écriture manuscrite française (RIMES) et anglaise (IAM) atteint désormais une qualité quasi identique à l'impression dans les meilleurs systèmes, mais uniquement sur une écriture manuscrite de corpus propre et standardisée.
Répartition par langue et système d'écriture
| Langue / Système d'écriture | Précision | Preuves | Source | Année |
|---|---|---|---|---|
| Anglais — imprimé | 96–99,5 % | Référence de base pour tous les principaux moteurs sur texte propre | Hebert et al. ; EDPB | 2021 / 2024 |
| Arabe — imprimé | Environ 10 à 25 pts en dessous de l'anglais | Mêmes moteurs, corpus à police unique commune ; toujours considérablement plus faible | Hebert et al. | 2021 |
| Écriture manuscrite anglaise (benchmark IAM) | ~94,3 % de précision au niveau des mots SOTA | WER 5,73 % (GatedLexiconNet) ; 3,34 % WER avec GPT-4o-mini | GatedLexiconNet ; benchmark HTR LLM | 2024–2025 |
| Écriture manuscrite française (benchmark RIMES) | ~97–99 % de précision au niveau des caractères | CER 0,9–1,7 % sur lettres commerciales | GatedLexiconNet | 2024 |
| CJK, devanagari et autres systèmes d'écriture | Aucun benchmark public comparable | Absence de données — aucune comparaison inter-moteurs évaluée par les pairs trouvée | — | — |
Sources listées dans le tableau ci-dessus. IAM et RIMES sont des corpus d'écriture manuscrite standardisés — une écriture manuscrite réelle et désordonnée, particulièrement un mélange imprimé-cursif, obtient des scores inférieurs à ces chiffres de corpus propres (la fourchette de 46 à 95 % entre solutions dans le tableau des types de documents est la référence du monde réel). L'écart pour l'arabe est une interprétation prudente du résultat publié « la précision pour l'anglais était considérablement plus élevée que pour l'arabe » sur un corpus à police unique commune ; un corpus plus difficile élargirait probablement cet écart.
Pourquoi les fourchettes de précision sont si larges : quatre métriques, un seul mot
Les contradictions apparentes les plus marquées dans les données de précision OCR ne sont pas des erreurs de mesure — ce sont différentes métriques appliquées à différentes conditions de documents. « 99 % de précision au niveau des caractères » et « 78 % de précision au niveau des champs » décrivent le même système ; « wF1 0,49 pour la détection de tableaux » et « TEDS 0,96 pour la structure de tableaux » décrivent la même technologie sur des corpus différents.
Les quatre métriques utilisées forment une hiérarchie stricte de difficulté. La précision au niveau des caractères (99 % et plus) est la plus facile à gonfler. La précision au niveau des mots est plus faible car un seul mauvais caractère fait échouer un mot — l'étude australienne de correction de journaux a mesuré 81,7 % de précision au niveau des mots sur la sortie historique brute, passant à 97,6 % après correction manuelle (Cassidy, 2019, étude de l'Université Macquarie sur la même classe de corpus). La précision au niveau des champs est encore plus faible car un seul chiffre erroné fait échouer tout le champ — la fourchette de 78 à 98 % entre moteurs ci-dessus. Les métriques structurelles (TEDS pour les tableaux, wF1 pour la détection) constituent un axe entièrement distinct : un tableau peut être lu avec des caractères parfaits et obtenir quand même un mauvais score si la structure des lignes et des colonnes est mal reconstruite, c'est pourquoi la détection de tableaux d'archives plafonne à wF1 0,49–0,53 alors même que la reconnaissance moderne de structure de tableaux atteint TEDS 0,91–0,97 (TrOCR-ctx, 2025 ; classement PubTabNet).
Le bruit amplifie l'étalement. Dans l'étude évaluée par les pairs de Hebert et al., l'ajout d'une seule couche de bruit artificiel à des numérisations de livres propres a fait chuter la précision au niveau des mots d'environ 96 % à 82,5 % pour le meilleur moteur, et à 58,4 % pour Tesseract open source ; deux couches de bruit ont fait baisser encore davantage (Hebert et al., 2021). C'est pourquoi la réponse honnête à « quelle est la précision de l'OCR ? » est toujours une fourchette conditionnée par le type de document — et pourquoi toute affirmation à chiffre unique doit être traitée comme une mesure sur texte propre déguisée en vérité universelle.
Comment utiliser ces données
Pas besoin d'un audit complet pour transformer « on nous a dit que l'OCR est précis à 99 % » — l'affirmation que chaque fournisseur répète, et que cette page met à l'épreuve — en une attente défendable pour vos propres documents. Un calcul approximatif en trois étapes à partir des fourchettes ci-dessus suffit, et il révèle généralement que le chiffre principal ne s'applique pas aux documents que vous traitez réellement.
- Classez votre mix de documents. Répartissez votre volume dans les fourchettes ci-dessus — par exemple, pour un flux typique de comptes fournisseurs de 1 000 factures/mois : 70 % de PDF natifs numériques (99,2–99,8 %), 20 % de numérisations propres (98–99 %), 10 % de numérisations dégradées ou de fichiers avec annotations manuscrites (~85 % en point médian).
- Convertissez la précision au niveau des caractères en précision au niveau des champs. Les chiffres au niveau des caractères flattent les flux d'extraction. Utilisez plutôt la fourchette mesurée au niveau des champs pour votre catégorie de moteur : 93 % pour un processeur cloud de milieu de gamme, 98 % pour un pipeline assisté par LLM, 78–82 % pour les moteurs d'entrée de gamme (BusinessWareTech 2025).
- Estimez le nombre mensuel d'erreurs. Avec une précision au niveau des champs de 93 % et 12 champs par facture, 1 000 factures produisent environ 840 champs erronés par mois (1 000 × 12 × 7 %) avant toute relecture. Si 10 % de votre volume est dégradé ou manuscrit, ce nombre d'erreurs augmente de l'écart de fourchette — généralement 15 à 30 points de pourcentage de précision au niveau des champs.
- Décidez si ce nombre est acceptable. Si 840 champs erronés/mois dépasse ce que vos systèmes en aval peuvent absorber, les leviers publiés sont : améliorer la qualité de numérisation vers la fourchette 300 DPI/RVB (le GPO a constaté que cela suffit à combler l'écart de 77 % → 99 % sur les documents anciens), orienter les champs à faible confiance vers une relecture humaine, ou appliquer l'étape de correction qui a fait passer la précision historique au niveau des mots de 81,7 % à 97,6 % (Cassidy, 2019).
Ce sont des formules d'estimation approximatives, pas un substitut à l'évaluation de vos propres documents. Chaque fourchette publiée sur cette page a été mesurée sur le corpus de quelqu'un d'autre — le seul chiffre de précision qui s'applique à votre flux de travail est celui que vous mesurez sur celui-ci. La valeur de cette page est de définir les attentes avant de mesurer.
Questions fréquemment posées
Quel est le taux de précision OCR moyen ?
La moyenne dépend entièrement du type de document. Parmi les sources de cette page, le texte numérique propre atteint en moyenne 99,2–99,8 % de précision au niveau des caractères (IntuitionLabs 2025 ; ABBYY), les documents imprimés numérisés propres 98–99 % (Holley 2009 ; EDPB 2024), les numérisations dégradées ou historiques 71–98 % (Holley 2009), et l'écriture manuscrite 46–95 % selon les solutions (AIMultiple 2026). Un seul chiffre de « précision OCR moyenne » n'a pas de sens — c'est la fourchette qui constitue la réponse.
Quel est un bon taux de précision OCR ?
L'échelle largement adoptée par la Bibliothèque nationale d'Australie définit une bonne précision OCR pour le texte imprimé à 98–99 % au niveau des caractères (1–2 % de CER), une précision moyenne à 90–98 %, et une précision faible en dessous de 90 % (Holley, 2009). Pour l'extraction au niveau des champs — la mesure qui compte pour les données métier — un « bon » résultat plus réaliste se situe à 93–98 %, un niveau que seuls les moteurs de premier plan du benchmark de factures 2025 ont atteint.
Quelle est la précision de l'OCR sur les documents numérisés par rapport aux PDF numériques ?
Les numérisations propres de texte imprimé atteignent 98–99 % de précision au niveau des caractères — proche des 99,2–99,8 % du texte natif numérique, mais pas équivalente. L'écart se creuse nettement dès que les numérisations se dégradent : les numérisations historiques de journaux ont mesuré 71–98 % de précision brute (Holley 2009), et les originaux endommagés sont tombés à 72,7–94,7 % même à 300 DPI (IJSAT 2026). Un faible DPI, une capture bitonale (noir et blanc) et un papier vieillissant font chacun descendre les numérisations dans la fourchette basse.
Quelle est la précision de l'OCR pour l'écriture manuscrite ?
Les systèmes de pointe atteignent ~94–99 % de précision au niveau des mots sur des corpus de benchmark propres comme IAM et RIMES (GatedLexiconNet 2024 ; benchmark LLM HTR 2025), mais toutes solutions confondues, la fourchette est de 46–95 % (AIMultiple 2026) — les moteurs hérités se situent près du bas de l'échelle, et l'écriture manuscrite réelle et désordonnée, l'écriture mixte imprimée-cursive ou les scripts historiques obtiennent des scores bien inférieurs aux chiffres des corpus propres.
Quel DPI est idéal pour la précision OCR ?
300 DPI est la recommandation standard — elle permet d'atteindre la plage de précision au niveau des caractères de 98–99 % sur un document imprimé propre, avec 400–600 DPI conseillés pour les polices de moins de 10 pt (guide OCR de l'Université de Pittsburgh). Notamment, l'étude du GPO a révélé que le mode de couleur de numérisation importait plus que la résolution pour les documents anciens : la capture RVB a atteint 99 % tandis que le bitonal (noir et blanc) a obtenu environ 77 %, et la réduction de 300 à 200 DPI n'a rien changé.
Pourquoi la précision OCR est-elle plus faible sur les tableaux ?
Les tableaux ajoutent une étape de reconnaissance de la structure en plus de la reconnaissance des caractères : le moteur doit reconstruire les lignes, les colonnes et les cellules fusionnées avant que le contenu ne puisse être utilisé. Les systèmes modernes obtiennent un score de similarité par distance d'édition d'arbre (TEDS) de 0,91 à 0,97 sur les corpus de tableaux natifs numériques (classement PubTabNet ; TrOCR-ctx 2025), mais les tableaux d'archives ou dessinés à la main chutent à une détection de F1 pondéré (wF1) de 0,49 à 0,53 (ICDAR 2019 cTDaR), et l'extraction des lignes de détail dans des tests réels sur factures variait de 40 à 82 % selon le moteur (BusinessWareTech 2025).
La précision OCR diffère-t-elle selon la langue ?
Oui — de manière significative. La seule comparaison interlinguistique évaluée par les pairs a constaté que la précision en anglais était supérieure de 10 à 25 points de pourcentage à celle en arabe sur les mêmes moteurs et corpus (Hebert et al. 2021). Les benchmarks sur l'écriture manuscrite montrent que les corpus français et anglais atteignent désormais une qualité proche de l'impression dans les meilleurs systèmes, mais aucun benchmark public comparable n'existe pour les écritures CJK, devanagari ou autres — une véritable absence de données (voir Limites).
Méthodologie & Sources
Comment cette page a été construite
Cette page agrège des données issues de 16 études indépendantes couvrant la période 1995–2026. Les sources ont été sélectionnées selon trois critères : (1) méthodologie documentée publiquement avec taille d'échantillon indiquée, (2) données collectées au cours des 3 dernières années lorsque disponibles, les sources plus anciennes étant datées dans le texte, et (3) pertinence pour le traitement de documents plutôt que revendications marketing. Lorsque plusieurs sources rapportent la même dimension, des fourchettes prudentes (valeurs minimales–maximales rapportées) sont utilisées — nous préférons sous-annoncer. Lorsque les sources divergent significativement, le désaccord est expliqué par niveau de métrique ou corpus plutôt que moyenné.
La distinction des métriques est la colonne vertébrale de cette page : les chiffres au niveau des caractères, des mots, des champs et de la structure (TEDS/wF1) ne sont jamais mélangés en un seul nombre. Les chiffres auto-déclarés par les fournisseurs (99,8 % d'ABBYY) sont étiquetés comme revendications du fournisseur et utilisés uniquement comme références de borne supérieure, conformément à la règle de citation de grade D exigeant une corroboration — dans ce cas, par la mesure indépendante d'IntuitionLabs montrant que tous les moteurs dépassent 99,2 % sur du texte tapé simple.
Liste des sources
- Holley, R. — « How Good Can It Get? » D-Lib Magazine 15(3/4) (2009). Programme de numérisation de journaux de la Bibliothèque nationale d'Australie ; mesures brutes de confiance au niveau des caractères sur plus de 30 titres de journaux historiques, 1803–1954. Fournit la plage de 71–98,02 % pour les numérisations dégradées, l'échelle bon/moyen/mauvais de 98–99 %/90–98 %/<90 %, et le benchmark « bon » de 1–2 % de CER.
- Hebert, J. et al. — « OCR with Tesseract, Amazon Textract, and Google Document AI: a benchmarking experiment », Journal of Computational Social Science (2021). Évalué par les pairs ; n=322 numérisations de livres en anglais + n=100 numérisations d'articles en arabe × 43 types de bruit = 18 568 documents, 51 304 requêtes. Fournit la baisse de précision au niveau des mots du propre au bruité (~96 %→82,5 %→58,4 %), l'écart anglais-vs-arabe, et les comparaisons serveur-vs-open-source.
- Rice, S.V., Jenkins, F.R. & Nartker, T.A. — « The Fourth Annual Test of OCR Accuracy », UNLV ISRI (1995). Évaluation annuelle indépendante de l'OCR commercial sur un échantillon DOE de 460 pages + un échantillon de magazine de 200 pages. Fournit la progression de la précision au niveau des caractères de 1992 à 1995 (~94 %→98 %+) qui ancre le plafond du texte propre.
- NIST IR 6101 — « Impact of image quality on machine print optical character recognition » (1998). Évaluation par l'Institut national des normes et de la technologie des États-Unis de trois produits OCR commerciaux sur des pages du Federal Register. Fournit la contrainte « un taux d'erreur de 1 % exige des originaux propres au format fixe ».
- Comité européen de la protection des données — « AI Possible Risks & Mitigations: OCR » (2024). Orientations techniques de l'organisme de réglementation de l'UE. Fournit la plage courante de 95–99 % pour les documents imprimés et le niveau de garantie de production de 98–99 %.
- US Government Publishing Office — livre blanc « Optimizing OCR Accuracy on Older Documents ». Tests officiels des modes de numérisation et des améliorations sur des documents anciens/décolorés par rapport à l'exigence de précision de 99 % du GPO. Fournit le résultat RVB 99 % vs bitonal ~77 % et le résultat du sous-échantillonnage de 300→200 DPI.
- « Optical Character Recognition Accuracy on Degraded Documents », IJSAT (2026). Évalué par les pairs ; EasyOCR sur quatre conditions physiques à 300 DPI. Fournit l'échelle de précision 94,7 % normal / 86,9 % froissé / 80,9 % sale / 72,7 % mouillé.
- AIMultiple — « OCR Benchmark: Text Extraction / Capture Accuracy » (2026). Benchmark d'analyste neutre vis-à-vis des fournisseurs utilisant la similarité cosinus Sentence-BERT ; plus de 12 solutions. Fournit la bande d'écriture manuscrite de 46–95 % et les leaders par solution (GPT-5 95 %, olmOCR-2-7B 94 %, Gemini 2.5 Pro 93 %).
- AIMultiple — « Invoice OCR Benchmark: Extraction Accuracy of LLMs vs OCRs » (2026). Benchmark neutre vis-à-vis des fournisseurs, plus de 400 paires clé-valeur provenant de 20 factures accessibles au public. Fournit le constat de la baisse de précision entre documents de faible et de haute qualité.
- Gao, L. et al. — « ICDAR 2019 Competition on Table Detection and Recognition (cTDaR) », ICDAR (2019). Compétition académique, 11 équipes, jeux de données modernes et d'archives avec des tableaux dessinés à la main et manuscrits. Fournit le plancher de détection de tableaux wF1 0,49 (0,53 pour les modèles ultérieurs) sur la piste archives.
- OpenCodePapers — « Table Recognition on PubTabNet » leaderboard (2024). Agrégateur de benchmarks techniques qui suit les résultats TEDS publiés sur le corpus PubTabNet. Fournit le plafond TEDS : MuTabNet 0,9687 (2024), TableMaster 0,9676, SLANet 0,963.
- « Tabular context-aware OCR and tabular data reconstruction for historical records » (2025). Évalué par les pairs ; TrOCR-ctx sur PubTabNet, SROIE, CORD et des corpus historiques. Fournit les scores de structure de tableaux TEDS 0,909 (PubTabNet), 0,967 (SROIE), 0,986 (CORD).
- « Enhancing handwritten text recognition accuracy with gated mechanisms » (2024). Évalué par les pairs ; GatedLexiconNet sur IAM, RIMES, READ-2016. Fournit les chiffres de pointe en écriture manuscrite : WER IAM 5,73 %/CER 2,27 % et CER RIMES 0,9 %.
- « Benchmarking Large Language Models for Handwritten Text Recognition » (2025, Journal of Documentation). Évalué par les pairs ; LLM propriétaires et open source vs Transkribus sur 7 corpus. Fournit GPT-4o-mini IAM 1,71 % CER/3,34 % WER, GPT-4o RIMES 1,69 % CER/3,66 % WER, et le cadre de qualité CER<5 % pour les documents modernes.
- BusinessWareTech — « AWS Textract vs Google, Azure, and GPT-4o: Invoice Extraction Benchmark » (2025). Benchmark indépendant sur de vraies factures ; note C (jeu de test unique, méthode transparente). Fournit la précision au niveau des champs de 78 à 98 % selon le moteur et la détection des lignes de détail de 40 à 82 % selon le moteur.
- IntuitionLabs — « Pharma Document AI & OCR Accuracy: A Benchmark Report » (2025-04). Recherche industrielle résumant un benchmark de documents mixtes ; note C. Fournit le constat de >99,2 % pour tous les moteurs sur texte dactylographié simple et ~98 % global pour Google Cloud Vision.
- ABBYY FineReader (déclaration du fournisseur). Chiffre auto-déclaré de note D, utilisé uniquement comme borne supérieure pour texte propre et identifié comme tel. « Jusqu'à 99,8 % de précision sur des numérisations propres » ; documente également l'amélioration revendiquée pour les fax et les faibles résolutions.
- LlamaIndex — « What is OCR Accuracy Rate? » glossaire (2026). Glossaire de référence avec tableau des facteurs d'impact. Fournit l'échelle DPI (72 vs 300 vs 600 DPI) et la recommandation d'un minimum de 300 DPI utilisée dans le tableau DPI.
- Université de Pittsburgh — « Best Practices: OCR » guide de bibliothèque. Recommandations universitaires pour la numérisation. Fournit la norme de 300 DPI et la recommandation de 400 à 600 DPI pour les polices <10 pt.
- Cassidy, S. — « L'impact de la qualité OCR sur l'utilisation de textes historiques numérisés » (Université Macquarie). Étude évaluée par les pairs sur la correction post-OCR de journaux historiques. Fournit l'effet de correction de précision au niveau des mots de 81,7 % → 97,6 %.
Limites
- Couverture géographique : Les sources se concentrent en Amérique du Nord, dans l'UE, en Australie et (pour l'écriture manuscrite) sur des corpus européens. Aucune donnée primaire fiable n'a été trouvée pour l'Amérique latine ou l'Afrique ; les comparaisons CJK/devanagari sont absentes de la littérature évaluée par les pairs que nous avons localisée.
- Contraintes méthodologiques : Les fournisseurs cloud (Google, Azure, Amazon) ne publient aucun benchmark de précision transparent sur le plan méthodologique par type de document — leurs chiffres « 99 %+ » relèvent du marketing, pas de la mesure, et sont exclus ici sauf lorsqu'une étude indépendante les a mesurés. Plusieurs chiffres clés reposent sur des points de données issus d'une seule étude (précision au niveau des champs de BusinessWareTech ; dégradation IJSAT) et sont étiquetés avec leur grade. Le 99,8 % d'ABBYY est une revendication du fournisseur utilisée uniquement comme borne supérieure corroborée.
- Lacunes temporelles : Les données UNLV ISRI (1995) et NIST (1998) ont plus de 27 ans mais restent les seuls enregistrements longitudinaux publics du plafond de précision sur texte propre ; elles sont datées par année et utilisées pour le contexte historique. Le plancher de numérisation dégradée de Holley (2009) est le chiffre brut publié le plus récent disponible pour les journaux historiques — les moteurs modernes obtiennent de meilleurs scores sur ces documents (Hebert et al. 2021), c'est pourquoi le tableau montre les deux.
- Ce que nous n'avons pas pu trouver : (1) aucun benchmark public fiable pour la reconnaissance des cases à cocher/reconnaissance de marques dans l'OCR IA moderne — la littérature relève de l'OMR hérité ; (2) la précision de reconnaissance des signatures — les fournisseurs rapportent la détection, pas la précision de reconnaissance ; (3) une étude contrôlée évaluée par les pairs isolant le DPI tout en maintenant les autres facteurs constants ; (4) des benchmarks standardisés pour l'OCR de captures d'écran ; (5) des documents à mise en page mixte (texte + tableaux + images sur une seule page) au-delà des chiffres de lignes de détail, qui sont le seul proxy publié. Ces absences de données sont déclarées plutôt que comblées par des chiffres de fournisseurs invérifiables.
Références associées : taux d'erreur de saisie manuelle par type et par rôle · Qu'est-ce que la reconnaissance optique de caractères (OCR) ?
Lectures complémentaires : Comment améliorer la précision OCR : 10 conseils pratiques · Quelle est la précision réelle de l'extraction de documents par IA ? · ABBYY FineReader vs OCR IA moderne