Pourquoi votre outil d'extraction PDF donne 98 % sur un fichier
et des résultats médiocres sur un autre ? — 3 types de PDF expliqués
Vous avez traité deux PDF qui semblent identiques à l'écran. L'un est ressorti propre à 98 %. L'autre était un fouillis de colonnes désalignées et de champs manquants. La différence ? L'un était un PDF textuel, l'autre uniquement image — et votre outil d'extraction les a traités de manière complètement différente.

Points clés à retenir
- Deux PDF produisent 98 % et des résultats médiocres avec le même outil d'extraction — et ils semblent identiques à l'écran car le PDF n'est pas un format unique mais trois conteneurs structurellement différents.
- Un PDF hybride dissimule une couche de texte en page une et une image scannée en page trois, si bien que votre outil lit silencieusement la mauvaise source de données sur la moitié des pages et renvoie des chiffres qui semblent corrects mais ne le sont pas.
- Essayez de sélectionner le texte avec votre curseur — un test de dix secondes révèle lequel des trois types de PDF vous avez et exactement quelle stratégie d'extraction appliquer.
Les trois types de PDF qui déterminent la réussite de l'extraction

Si vous avez déjà ouvert deux PDF côte à côte, constaté qu'ils contiennent le même type d'informations, que vous les avez soumis au même outil d'extraction et obtenu des résultats radicalement différents — vous n'êtes pas seul. C'est la plainte la plus courante concernant les outils d'extraction de documents, et ce n'est presque jamais la faute de l'outil.
Le problème est que le PDF n'est pas un format unique. C'est un conteneur qui peut stocker du texte de trois manières fondamentalement différentes, et la plupart des outils d'extraction n'en gèrent correctement qu'un ou deux. La distinction qui importe n'est pas de savoir si le fichier se termine par .pdf — c'est de savoir si le fichier contient une couche de texte intégrée, une image plate de texte, ou les deux. Voici à quoi ressemble chaque type sous le capot :
Créé par un logiciel — un document Word enregistré en PDF, une exportation QuickBooks, un rapport généré par un ERP. Contient une couche de texte intégrée avec des données de caractères réelles, des informations de police et des coordonnées de position. Vous pouvez surligner, sélectionner et copier des mots individuels avec votre souris.
Précision avec l'extraction standard : >95%. Aucune OCR nécessaire.
Une photographie ou un scan d'un document papier enregistré en PDF. Aucune couche de texte n'existe — chaque caractère n'est que des pixels disposés selon un motif. Essayez de sélectionner du texte et votre curseur dessine un rectangle vide ; rien n'est surligné. Le document est essentiellement une photo dans un emballage PDF.
Nécessite une OCR ou une IA de vision. Précision : 85–99% selon la qualité du scan.
Un mélange des deux : une couche de texte et des images intégrées. Les exemples courants incluent un contrat avec des pages de signature scannées, ou un dossier de comptabilité fournisseurs où la page 1 est un récapitulatif généré par le système suivi de photos de reçus justificatifs.
Le type le plus dangereux. L'outil peut lire la mauvaise couche et produire des résultats incohérents qui semblent plausibles.
L'idée clé : vous ne pouvez pas juger un PDF par son apparence à l'écran. Deux fichiers qui s'affichent de manière identique peuvent être structurellement différents au niveau du format. Si votre outil d'extraction a parfaitement traité le premier et produit un résultat chaotique sur le second, l'explication la plus probable est qu'ils appartiennent à des types de PDF différents — et que l'outil a appliqué la mauvaise stratégie d'extraction.
Comment diagnostiquer votre PDF en 10 secondes — trois tests

Vous n'avez besoin ni d'un outil d'analyse PDF ni d'un développeur pour déterminer le type de votre PDF. Chaque système d'exploitation est livré avec l'outil qu'il vous faut : un lecteur PDF. Ces trois tests prennent moins de temps que le téléchargement d'un fichier vers un analyseur en ligne :
Test 1 : Le test de sélection de texte (le plus fiable)
Ouvrez le PDF dans n'importe quel lecteur — Adobe Acrobat, Chrome, Aperçu sur macOS ou une application PDF mobile. Cliquez sur l'outil de sélection de texte (généralement un curseur en I ou une icône T) et essayez de sélectionner par glisser-déposer une phrase ou un nombre.
- Si des mots individuels se surlignent et que vous pouvez les copier : le PDF possède une couche de texte exploitable. Il s'agit soit d'un PDF natif basé sur du texte, soit d'un PDF ayant subi une OCR. L'extraction standard devrait fonctionner.
- Si le curseur dessine un rectangle vide et que rien ne se surligne : le PDF est uniquement composé d'images. Il n'existe aucune couche de texte à extraire pour quelque outil que ce soit — uniquement des pixels. Une OCR ou une IA de vision est requise.
Ce test est concluant. Un document numérisé produit exactement zéro texte sélectionnable, quelle que soit la clarté du texte à vos yeux. Le système visuel humain interprète les motifs de pixels comme du texte. L'ordinateur, lui, voit une image.
Test 2 : Le test de recherche (vérification rapide)
Appuyez sur Ctrl+F (ou Cmd+F sur Mac) et saisissez un mot dont vous savez qu'il figure dans le document — par exemple, « Total » sur une facture ou « Date » sur un contrat.
- Si le mot est trouvé et surligné : le PDF contient du texte recherchable. L'extraction devrait réussir avec les méthodes standard.
- Si la recherche ne renvoie aucun résultat alors que le mot est visiblement présent sur la page : le document est uniquement composé d'images.
Test 3 : Le test des résultats mixtes (pour la détection hybride)
C'est le test que la plupart des gens sautent, et c'est la raison pour laquelle les PDF hybrides ne sont pas diagnostiqués. Effectuez le test 1 sur chaque page, pas seulement sur la première page. Sélectionnez le texte de la page 1, puis faites défiler jusqu'à la page 3, puis la page 5.
- Si certaines pages ont un texte sélectionnable et d'autres non : vous avez un PDF hybride. C'est le scénario qui produit les échecs d'extraction les plus déroutants — l'outil traite parfaitement les pages 1 et 2 (elles ont une couche de texte propre), puis produit des colonnes désalignées et des champs manquants sur la page 3 (qui est une image scannée dans le même fichier). Comme le nom du fichier est le même et que la mise en page visuelle semble cohérente, on a l'impression que l'outil a « planté » en cours de traitement.
Une fois que vous avez identifié le type de votre PDF, la solution devient simple. Chaque type a une cause racine et une solution différentes.
Cause 1 : PDF textuel qui produit quand même des résultats inutilisables
Symptômes : Le texte est sélectionnable, le PDF a été créé par un logiciel, mais la sortie extraite contient des colonnes désordonnées, des cellules de tableau fusionnées ou des caractères qui ne correspondent pas à ce qui est affiché à l'écran.
Pourquoi cela se produit : Un PDF ne stocke pas le texte comme un document Word. Au lieu d'un paragraphe linéaire avec un ordre de lecture défini, un PDF encode le texte comme une série d'instructions de dessin — placez le caractère « I » aux coordonnées (72, 540), placez « n » à (78, 540), et ainsi de suite. Il n'existe aucun concept inhérent de paragraphes, d'ordre de lecture ou de structure de tableau intégré au format. Le PDF sait où chaque caractère se trouve sur la page, mais il n'a aucune compréhension de ce que le texte signifie ni de la manière dont il doit être lu.
Les outils d'extraction doivent reconstruire la structure logique à partir de ces instructions positionnelles de bas niveau. Lorsqu'un PDF a été généré avec un encodage de police inhabituel, un mappage de caractères personnalisé (CMap) ou des producteurs PDF non standard, la reconstruction peut produire une sortie brouillée même si le fichier contient techniquement une couche de texte. Cela est plus courant avec :
- Les PDF générés par ERP : Certains systèmes d'entreprise utilisent des générateurs PDF personnalisés qui encodent le texte de manière non standard — les caractères semblent corrects à l'écran parce que votre lecteur PDF applique son propre rendu de texte, mais l'encodage sous-jacent est non standard et les outils d'extraction ne peuvent pas l'interpréter correctement.
- Les PDF avec des sous-ensembles de polices intégrés : Lorsqu'un seul sous-ensemble de caractères de police est intégré, l'outil d'extraction peut mapper les glyphes aux mauvais caractères Unicode, produisant un « texte » qui est alphabétiquement adjacent au contenu réel mais sémantiquement incorrect.
- Les mises en page multi-colonnes : Même les PDF textuels bien formés peuvent produire une sortie brouillée lorsque l'outil d'extraction lit de haut en bas sur deux colonnes. Les phrases passent de la fin de la colonne de gauche à la fin de la colonne de droite — complètement illisibles.
Comment le corriger : Pour les PDF textuels qui s'extraient mal en raison de problèmes d'encodage ou de mise en page, aplatissez le PDF en images et utilisez un outil d'IA visuelle. En convertissant les pages du PDF en images haute résolution (300 DPI ou plus) et en les fournissant à un modèle de vision-langage — qui traite la page comme une scène visuelle plutôt qu'un flux de texte — vous contournez tout le problème d'encodage et d'ordre de lecture. L'IA lit le document de la même manière qu'un humain : en regardant la page et en comprenant sa structure visuelle.
ImageToTable.ai gère cela automatiquement : lorsque vous téléversez un PDF, son modèle de vision lit la page rendue comme une image, et non la couche de texte. Cela signifie que même les PDF textuels mal encodés sont traités correctement, car l'extraction ne dépend pas du flux de texte interne du PDF.
Cause 2 : PDF uniquement image — aucune couche de texte
Symptômes : Vous ne pouvez sélectionner aucun texte sur aucune page. Le fichier semble correct à la visualisation, mais chaque outil d'extraction renvoie des résultats vides ou du charabia OCR. Le document est en réalité un ensemble de photos collées dans une enveloppe PDF.
Pourquoi cela se produit : C'est le scénario PDF le plus courant dans le monde professionnel réel. Un fournisseur imprime une facture, la signe, la tamponne, puis la numérise dans un fichier numérique. Ou un inspecteur de terrain remplit un formulaire papier, le photographie avec un téléphone, et envoie l'image enregistrée au format PDF. La structure interne du PDF contient exactement un objet par page : une seule image aplatie. Il n'y a aucun objet caractère, aucune référence de police, et aucune instruction de rendu de texte.
Les outils d'extraction traditionnels — y compris les bibliothèques Python comme pdfplumber et le mode d'extraction de texte de PyMuPDF, ainsi que l'import PDF intégré d'Excel — ne lisent que la couche de texte. Lorsqu'ils ouvrent un PDF uniquement image, ils ne trouvent rien à extraire et renvoient des résultats vides. Ce n'est ni un bug ni une limitation de l'outil. L'outil fonctionne correctement. Le document ne contient tout simplement pas ce dont l'outil a besoin.
Comment résoudre le problème : Les PDF uniquement image nécessitent une OCR (reconnaissance optique de caractères) ou une IA de vision. L'outil d'extraction doit être capable de lire la page comme une image, de reconnaître les motifs de pixels comme des caractères, et de reconstruire le texte. C'est là que la qualité de la numérisation détermine directement la précision du résultat.
Une numérisation haute résolution (300 DPI ou plus) avec un bon contraste, sans ombres, et un inclinaison minimale produira une précision d'extraction supérieure à 95 % avec les outils modernes. Une numérisation basse résolution — pensez à une photo de téléphone d'un reçu froissé sous un mauvais éclairage — peut faire chuter la précision sous 70 %. L'extraction IA de PDF numérisés gère généralement cette plage, car les modèles de vision sont entraînés à lire des documents dans des conditions réelles, pas seulement des numérisations impeccables.
La distinction clé : les PDF uniquement image sont résolubles de manière cohérente — chaque page nécessite la même approche (lecture visuelle), et la qualité du résultat est prévisible en fonction de la qualité de la source. Le vrai piège est le type qui se comporte de manière incohérente.Cause n°3 : Le hybride caché qui fait tout planter
Symptômes : Certaines pages s’extraient parfaitement. D’autres produisent un résultat brouillé, des colonnes décalées ou des champs manquants. Les pages qui échouent ressemblent pourtant à celles qui réussissent. L’outil d’extraction semble « aléatoirement » dysfonctionner en cours de lot.
Pourquoi : Les PDF hybrides sont la cause la plus sous-diagnostiquée d’échecs d’extraction, car ils ressemblent exactement à des PDF normaux. Un PDF hybride contient à la fois une couche texte et des images intégrées, souvent sur des pages différentes. Voici le scénario typique :
- Un entrepreneur en construction soumet un état d’avancement AIA G702. La page 1 est générée par son logiciel comptable. Les pages 2 à 5 sont des copies scannées d’ordres de modification signés (images uniquement). L’ensemble est fusionné en un seul fichier PDF.
- Un courtier d’assurance envoie une attestation d’assurance. La première page est un export numérique de son système. La seconde est une copie scannée de l’avenant original.
- Un fournisseur joint par e-mail un « dossier de facture complet » — la facture elle-même est un PDF numérique, mais le bordereau de colisage et l’accusé de livraison sont des photos scannées intégrées au même document.
Quand un outil traditionnel traite un PDF hybride, il applique une seule stratégie d’extraction à l’ensemble du fichier. S’il lit la couche texte, les pages 2 à 5 ne renvoient rien (pas de couche texte). S’il applique l’OCR partout, il peut extraire deux fois le texte des pages qui avaient déjà une couche texte propre — produisant des données dupliquées ou fusionnées. Certains outils tentent de lire les deux couches simultanément et génèrent un résultat mélangé, où les colonnes de la couche texte et celles de l’OCR sont entrelacées aléatoirement.
C’est le mode de défaillance le plus dangereux car le résultat ressemble à des données réelles. Les cellules contiennent des chiffres, des dates cohérentes, des noms corrects — mais les totaux sont faux, les lignes sont décalées, et l’extraction n’est pas fiable sans une vérification manuelle complète qui annule l’intérêt de l’automatisation.
Comment corriger — deux options :
Convertissez chaque page du PDF hybride en image haute résolution (avec un outil comme Export All Images d’Adobe Acrobat ou un convertisseur gratuit), puis recomposez les images en un seul PDF image. Désormais, chaque page est uniformément une image — plus de couches mélangées pour tromper l’outil d’extraction.
Idéal pour : Les utilisateurs travaillant avec des outils qui gèrent bien les PDF basés sur images mais sont perturbés par les couches mixtes.
Certains outils d’extraction IA, dont ImageToTable.ai, traitent tous les PDF en lisant la page rendue comme une image par défaut — ignorant ainsi la couche texte et traitant le document visuellement. Cela contourne totalement le problème hybride, car l’outil n’essaie jamais de concilier deux sources de données différentes.
Idéal pour : Les utilisateurs qui traitent un volume élevé de documents fournisseurs et ne peuvent pas inspecter chaque fichier avant traitement.
Quand aplatir, quand changer d’outil — un cadre de décision pratique

Voici une référence rapide pour diagnostiquer et résoudre tout problème d’extraction PDF selon le type identifié :
| Votre diagnostic | Votre solution | Précision attendue |
|---|---|---|
| Basé sur le texte, extraction propre | Aucune action requise — votre outil et votre fichier sont compatibles | >95% |
| Basé sur le texte, colonnes brouillées | Aplatir en images et utiliser un outil d’IA visuelle | >95% après aplatissement |
| Image uniquement, bonne qualité de scan | Utiliser tout outil avec OCR ou IA visuelle | 90–99% |
| Image uniquement, mauvaise qualité de scan | Améliorer d’abord le document source, puis utiliser l’IA visuelle | 70–90% (selon la source) |
| Hybride (pages mélangées) | Aplatir tout le fichier, ou utiliser le mode image uniquement | Correspond au taux image uniquement après correction |
L’approche d’aplatissement — convertir chaque page en image nette — est la solution universelle qui fonctionne pour les trois types de PDF. Ce n’est pas un contournement. C’est une stratégie délibérée pour éliminer l’ambiguïté de format du processus d’extraction. Une fois chaque page uniformément convertie en image, l’outil d’extraction applique une méthode unique et cohérente, et le résultat devient prévisible.
Ce cadre de décision couvre les problèmes liés au type de PDF. Si vos colonnes sont correctement structurées et que le type de PDF est adapté, mais que les chiffres extraits sont systématiquement erronés — un total qui ressort comme sous-total, ou une date échangée avec une autre — le problème peut venir de la définition de vos colonnes d’extraction. Les noms de colonnes ambigus sont l’une des causes les plus courantes de chiffres extraits incorrects, et la solution est généralement aussi simple que de renommer « Total » en « Total Amount Due ».
FAQ
« J’ai vérifié et toutes mes pages ont du texte sélectionnable. Pourquoi l’extraction produit-elle encore un résultat illisible ? »
Le texte sélectionnable confirme qu’une couche de texte existe, mais ne garantit pas qu’elle soit bien formée. Certains générateurs de PDF créent des couches de texte avec un encodage de caractères ou des tables CMap non standard qui s’affichent correctement à l’écran (votre lecteur PDF applique son propre rendu de police) mais sont difficiles à analyser pour les outils d’extraction. Dans ce cas, traitez le fichier comme s’il était uniquement image : aplatissez-le en images et utilisez un outil qui lit la page visuellement.
« Un même outil peut-il gérer les trois types de PDF ? »
Oui, s’il lit le document visuellement plutôt que de se fier à la couche de texte. Les outils qui dépendent uniquement de l’extraction de la couche de texte (la plupart des bibliothèques PDF vers texte, l’import PDF intégré d’Excel) ne peuvent traiter que les PDF textuels. Les outils dotés d’IA visuelle — comme ImageToTable.ai — traitent tous les types de PDF de manière uniforme car ils rendent chaque page sous forme d’image et la lisent comme le ferait un humain.
« Mon outil ne précise pas quel type il prend en charge. Comment le savoir ? »
Effectuez le test de sélection de texte sur un PDF que vous savez être uniquement image (un document scanné où rien ne se surligne). Si votre outil en extrait des données, il utilise une forme de lecture visuelle ou d’OCR. S’il renvoie des résultats vides, il repose sur la couche de texte. La plupart des analyseurs PDF simples entrent dans la deuxième catégorie.
« Si je numérise tous mes documents papier à une résolution plus élevée, cela résoudra-t-il le problème ? »
Une résolution plus élevée améliore la précision de l’OCR sur les PDF uniquement image, mais ne change pas le problème fondamental : un PDF uniquement image n’a toujours pas de couche de texte pour les outils traditionnels. Si votre outil d’extraction ne prend pas en charge la lecture visuelle, même une numérisation à 600 DPI ne renverra rien. Améliorez l’outil, pas seulement la qualité de numérisation.
« Et si un PDF a été OCRisé par quelqu’un d’autre avant que je ne le reçoive ? Cela change-t-il quelque chose ? »
Un PDF OCRisé possède une couche de texte invisible ajoutée par-dessus l’image scannée. Le test de sélection de texte fonctionnera (le texte se surligne) et la plupart des outils d’extraction réussiront. Cependant, la qualité de l’image sous-jacente compte toujours — si la numérisation originale était de mauvaise qualité, la couche de texte OCR peut contenir des erreurs de caractères que votre outil d’extraction héritera. Certains outils d’IA visuelle peuvent être configurés pour ré-OCRiser l’image directement plutôt que de se fier à la couche de texte intégrée, ce qui peut améliorer la précision sur les documents mal OCRisés.
Vous ne savez pas quel type de PDF vous traitez ? Téléversez un échantillon et voyez comment un outil basé sur la vision le gère — aucune inscription requise.
Tester l'extraction PDF sur votre fichier