Références
Références de données et définitions de terminologie pour l'IA documentaire. Chaque page est vérifiée à la source et conçue pour être citée.
Statistiques
Comparatif interne : docTR vs Docling sur 361 reçus SROIE + 100 reçus CORD — 6,7x de latence, 8,3x de coût, 3,0x de CER, 2,9x d'inversion de champs regex. Méthodologie.
Comparatif interne : docTR vs Surya2 sur 361 reçus SROIE + 100 reçus CORD — égalité CER, inversion du F1 sur les champs (×4,2), écart de coût (×22), méthodologie.
Benchmark interne : EasyOCR vs docTR sur 361 reçus SROIE + 100 CORD — docTR 30 % de CER en moins, 1,66x F1 sur les champs LLM ; EasyOCR 1,93x F1 regex.
Benchmark interne : coût OCR pour 1 000 pages pour 8 moteurs open-source sur RTX 4090 — 0,048 $ (docTR) à 1,061 $ (Surya2). SROIE + CORD, méthodologie.
Latence par page pour 8 moteurs OCR open source sur RTX 4090 — 108,7 ms (docTR) à 2 668 ms (Surya2) en p50. Queues p95, débit, méthodologie.
Comparatif interne : PaddleOCR vs EasyOCR sur reçus — CER 0,204 vs 0,283, F1 regex 2,2x, écart de coût 2x, paradoxe LLM. Méthodologie.
Benchmark interne : Surya2 vs Unlimited-OCR vs PaddleOCR-VL sur 361 reçus SROIE + 100 reçus CORD — score F1 par champ, équité CER, coût, latence.
Comparatif interne : Tesseract (CPU) vs PaddleOCR (GPU) sur 361 reçus SROIE + 100 reçus CORD — CER, F1 des champs, parité de débit, coût. Méthodologie.
Benchmark interne : 8 moteurs OCR open-source vs VLM d'analyse de documents sur 361 reçus SROIE + 100 reçus CORD — CER, F1 champ, latence, coût. Méthodologie incluse.
Pourquoi le CER des VLM est gonflé : la normalisation de casse et la structure de référence ajoutent des erreurs fantômes. Données internes SROIE + CORD — le F1 champ est la métrique comparative équitable entre familles.
Benchmark interne : le post-traitement par LLM surpasse la regex pour l'extraction de champs sur les reçus, F1 de champ pour 8 modèles OCR sur SROIE + CORD, méthodologie incluse.
Benchmark interne de 5 modèles OCR open source sur 461 reçus (SROIE + CORD) : CER, WER, F1 de champ, latence, coût pour 1 000 pages.
Taux d'exceptions en automatisation documentaire : 9 % pour les meilleurs de leur catégorie contre 22 % en moyenne, causes racines, coûts de revue et compromis de seuil avec toutes les sources citées.
Benchmarks indépendants sur le coût de traitement des documents par enregistrement : manuel 8-16 $, modèle 2-5 $, IA à partir de 0,02 $/page. Par type de document, taille, zone géographique.
Données de précision OCR pour l'écriture manuscrite : IAM CER 1.2-1.7 %, arabe 8.9-16 %, historique 71-82 %. Réparties par écriture, modèle et type de document. 15 sources citables.
Références sur les délais de traitement des factures : 12,5 min de temps de traitement manuel contre 9,2 jours de délai de cycle, par méthode, complexité et étape — avec sources complètes pour citation.
Benchmarks indépendants sur le ROI de l'automatisation de la saisie de données : délai de récupération de 3 à 12 mois, économies de 60 à 80 %, volume de rentabilité, plus une formule pour modéliser votre retour.
Benchmarks indépendants sur la précision OCR par type de document : 99,2-99,8 % pour les PDF numériques, 98-99 % pour les scans, 46-95 % pour l'écriture manuscrite, TEDS pour les tableaux. 15 sources citables.
Précision OCR des reçus selon l'état et le champ : 90 %+ pour les scans propres, 55-73 % pour le thermique décoloré, 67-69 % pour les photos par téléphone. Totaux 95-99 %, commerçants 73-88 %. 14 sources.
Références indépendantes sur les taux d'erreur de saisie manuelle de données : 1 à 4 % au niveau du champ, jusqu'à 40 % au niveau de l'enregistrement, selon le type de document, le secteur et le rôle.
Définitions
La capture de données transforme le papier, les scans, les PDF et les photos en données exploitables par machine. Son fonctionnement, ses types et ses idées reçues.
L'ICR est une reconnaissance de caractères par apprentissage automatique pour le texte écrit en lettres détachées. Comment elle a évolué à partir de l'OCR, les différences entre ICR, OCR et IWR, et ses domaines d'utilisation.
L'extraction d'informations clés (KIE) extrait des champs tels que les numéros de facture et les dates des documents pour les convertir en données structurées. Fonctionnement, limites, idées reçues.
Un PDF Searchable est un scan doté d'une couche de texte OCR invisible — vous pouvez sélectionner, copier et rechercher le texte avec Ctrl+F. Son fonctionnement, les règles PDF/A et les pièges courants.
La précision au niveau des champs compte les champs correctement extraits ; la précision au niveau des caractères compte les caractères correctement lus. Une précision de 99 % sur les caractères ne signifie pas des données précises à 99 %.
L'IDP est un logiciel d'IA qui capture, classe, extrait et valide les données des documents. Son fonctionnement, son évolution de l'OCR aux LLM, et les idées reçues.
Le taux de STP mesure la part des documents traités sans aucune intervention humaine — moyenne du secteur 32 %, meilleur de sa catégorie 49 %, IA 60-80 %. Formule et idées reçues.
L'OCR convertit des images de texte imprimé, manuscrit ou dactylographié en données lisibles par machine. Son fonctionnement, les 4 types d'OCR, son histoire et ses cas d'usage.