Comment OCR un PDF scanné vers Excel :Un guide complet étape par étape

Après ce guide, vous obtiendrez un fichier Excel propre à partir d'un PDF scanné — pas du texte dispersé collé dans des cellules, mais des données structurées où chaque colonne contient les bonnes valeurs. La différence entre ces deux résultats ne tient pas seulement à l'outil choisi. Il s'agit de savoir quel type de PDF vous traitez, de choisir la méthode d'extraction adaptée et de comprendre exactement quel type de nettoyage le résultat nécessitera avant d'être utilisable. Si vous n'êtes pas tout à fait sûr de ce qu'est l'OCR ou de son fonctionnement, nos articles sur ce qu'est l'OCR et comment fonctionne réellement l'OCR couvrent les bases. Ce guide part du principe que vous êtes prêt à commencer la conversion.

Arrêtez la saisie manuelle — laissez l'IA lire vos documents
Image ou PDF — données structurées en 10 secondes
Essayer maintenant →
Image de couverture du blog intitulée Comment OCR un PDF scanné vers Excel, montrant trois icônes : vérifier si le texte se sélectionne, nommer vos colonnes et vérifier 10 % des lignes.

Points clés à retenir

  1. Si votre conversion PDF vers Excel n'a jamais rien produit, vous avez probablement utilisé un outil conçu pour les PDF natifs sur un fichier scanné — deux problèmes fondamentalement différents déguisés en un seul format de fichier.
  2. L'OCR traditionnel lit les caractères, mais il ne sait pas que 1 250 $ est le total de la facture, et non une ligne de détail ou un numéro de page — et c'est précisément là que se trouve tout votre travail manuel sur tableur.
  3. Aucun outil ne produit un Excel parfait à partir d'un PDF scanné — le critère honnête est de moins de 5 % de cellules nécessitant des corrections avec l'extraction par IA, contre plus de 50 % avec l'OCR de base, et cette seule différence détermine si le processus est rentable.

Avant de commencer — pourquoi le type de votre PDF est crucial

La raison la plus fréquente d’un échec de conversion « PDF vers Excel » n’est pas l’outil. C’est que la personne qui tente la conversion ignore que tous les PDF ne se valent pas. Il existe deux types fondamentalement différents, qui exigent des méthodes de conversion totalement distinctes :

CaractéristiquePDF natif (numérique)PDF scanné (image)
CréationEnregistré depuis Word, Excel ou un logiciel comptableImprimé puis scanné, ou enregistré comme image
Contient du texte ?Oui — texte sélectionnable et recherchableNon — simple photo de la page
Copie de texte possible ?Oui — sélectionner le texte et Ctrl+CNon — la sélection donne un cadre, pas des mots
Taille de fichier (typique)50–200 Ko par page500–2 000 Ko par page
Meilleure méthode de conversionAnalyseur direct (pas d’OCR nécessaire)Extraction par OCR ou IA

Si vous utilisez un outil conçu uniquement pour les PDF natifs sur un document scanné — ou pire, si vous essayez de copier-coller depuis un fichier scanné — vous n’obtenez rien et pensez que l’outil est défectueux. En réalité, vous avez sauté l’étape de diagnostic. La suite de ce guide vous propose un processus qui fonctionne quel que soit le type de votre PDF.

Étape 1 — Vérifiez votre PDF : scanné ou natif ?

Carte de comparaison côte à côte : un PDF natif dont le texte se sélectionne et se copie à 50-200 Ko par page, versus un PDF scanné où la sélection donne un cadre, pas des mots, à 500-2 000 Ko par page.
1

Essayez de sélectionner du texte avec votre souris

Ouvrez le PDF et faites glisser votre curseur sur une ligne de texte. Si le texte se surligne (comme sur une page web), vous avez un PDF natif. Si vous ne pouvez tracer qu'un cadre rectangulaire, le PDF est scanné — ce que vous voyez est une image, pas du texte.

2

Appuyez sur Ctrl+F et recherchez un mot courant

Essayez de rechercher « the », « facture » ou même simplement « a ». Si la recherche trouve des résultats, le PDF contient du texte sélectionnable. Si la recherche ne renvoie rien, le PDF est une image scannée — aucune couche de texte n'existe.

3

Vérifiez la taille du fichier

Faites un clic droit sur le fichier et examinez sa taille. Un PDF natif de 5 pages avec du texte fait généralement moins de 300 Ko. Un PDF scanné de 5 pages avec des images de ces mêmes pages pèsera 3 à 10 Mo. Les fichiers scannés sont 10 à 50 fois plus volumineux car chaque page est une image compressée plutôt que des données textuelles.

Si votre PDF s'avère être un PDF texte natif, la bonne nouvelle est qu'Excel peut l'importer directement sans OCR. Allez dans Données > Obtenir des données > À partir d'un fichier > À partir d'un PDF dans Excel (365 ou 2021+), sélectionnez votre fichier, choisissez le tableau souhaité, puis cliquez sur Charger. Cela fonctionne bien pour les PDF basés sur du texte créés par des systèmes comptables ou des traitements de texte.

Si votre PDF est une image scannée — et si vous lisez ce guide, c'est presque certainement le cas — vous avez besoin d'un OCR PDF (reconnaissance optique de caractères) ou d'une extraction par IA. C'est ce que couvre le reste de ce guide.

Étape 2 — Choisissez votre approche : OCR traditionnel ou extraction par IA ?

Une fois que vous avez confirmé que vous travaillez avec un PDF scanné, la question suivante est de savoir quelle méthode utiliser. Il existe trois grandes voies, et la bonne dépend de ce à quoi vous voulez que le résultat ressemble.

Si vous avez juste besoin du texte dans n'importe quel format — pour le lire, le rechercher ou le copier dans un document — un outil OCR en ligne gratuit comme Google Drive OCR ou PDF24 fait l'affaire. Ces outils extraient les mots de l'image et les renvoient sous forme de texte brut ou de PDF consultable.

Si vous avez besoin des données dans des colonnes structurées — les numéros de facture dans une colonne, les montants dans une autre, les dates dans une troisième — vous avez besoin d'un outil d'extraction qui comprend la structure du document. C'est la différence clé entre l'OCR et l'extraction par IA. Le flux de travail de scan vers Excel conçu autour de la dénomination de ces colonnes est le chemin le plus court vers ce résultat.

L'OCR traditionnel lit les caractères. Il peut vous dire que la chaîne « 1 250,00 » apparaît sur une page. Mais il ne sait pas si cette chaîne est le total de la facture, le prix d'une ligne de détail ou un numéro de page. Un outil d'extraction par IA, en revanche, comprend ce que chaque donnée signifie dans son contexte. Vous lui dites quelles colonnes vous voulez — « Numéro de facture », « Date », « Total » — et il trouve ces valeurs sur toutes les pages.

Pour une comparaison détaillée des outils OCR gratuits dans toutes les catégories, y compris les options open source comme Tesseract et les offres gratuites des plateformes commerciales, notre guide des meilleurs logiciels OCR gratuits 2026 couvre onze options avec des évaluations d'exactitude honnêtes et des limites pratiques.

Comparaison rapide des outils

MéthodeIdéale pourQualité de sortieConfiguration
Adobe Acrobat OCRPDF consultables, modifications de fichiers uniquesBonne reconnaissance de texte, structure de tableau mixteApplication de bureau requise (19,99 $/mois)
Google Drive OCRExtraction rapide de texte, multilingueTexte uniquement, mise en page perdueGratuit, nécessite un compte Google
Tesseract + PythonDéveloppeurs ayant besoin d'un traitement localBon texte, aucune structure de tableauLigne de commande, configuration technique
Extraction par IAChamps structurés vers colonnes ExcelSortie de tableau propre, compréhension sémantiqueBasé sur le web, aucune installation

Étape 3 — OCR du PDF scanné avec l'extraction par IA

Pour ce guide, nous utiliserons une approche d'extraction par IA car elle produit la sortie Excel la plus exploitable à partir de PDF scannés — surtout lorsque le PDF contient des données structurées comme des factures, des bons de commande ou des relevés bancaires. La différence clé avec l'OCR traditionnel est que l'IA lit le document de manière sémantique plutôt que caractère par caractère. Elle ne se contente pas de reconnaître le texte « 15 mars 2026 » ; elle comprend que ce texte est une date et le place dans la colonne Date.

Diagramme de flux en trois étapes avec flèches : téléversez le PDF scanné (PDF, JPG ou PNG), nommez vos colonnes telles que Numéro de facture et Date, puis vérifiez et exportez vers Excel.

Vous pouvez essayer le processus ici même avec un document d'exemple. La démo ci-dessous est préconfigurée pour l'extraction de factures. Téléversez un PDF de facture scanné ou une image et voyez ce que l'IA renvoie en temps réel :

JPG/PNG/PDF Extraction IA

Les fichiers sont traités en toute sécurité et ne sont pas stockés.

Le flux de travail d'extraction IA

1

Téléchargez votre PDF scanné

Glissez-déposez le fichier dans la zone de téléchargement. La plupart des outils IA acceptent les formats PDF, JPG et PNG. Une facture scannée de 2 à 5 pages prend à peu près le même temps de traitement qu'une page unique.

2

Définissez vos colonnes de sortie

Saisissez les noms de colonnes souhaités dans votre sortie Excel — « Numéro de facture », « Date », « Nom du fournisseur », « Total », « Taxe ». L'IA lit chaque page et extrait les données correspondantes dans ces colonnes. Vous pouvez aussi laisser l'outil détecter automatiquement les colonnes si vous préférez.

3

Vérifiez et exportez

L'outil traite toutes les pages et renvoie les données dans un tableau structuré. Vérifiez le résultat, apportez de petites corrections si nécessaire, puis exportez vers Excel. L'ensemble du processus prend 5 à 10 secondes pour une facture type, contre environ 3 minutes par page en saisie manuelle.

Comparé à l'OCR traditionnel, cette approche présente un avantage décisif : elle préserve les types de données. Vos dates restent des dates, vos nombres restent des nombres, et chaque champ atterrit dans sa colonne désignée. L'OCR traditionnel génère tout sous forme d'un bloc de texte unique que vous devez ensuite séparer manuellement en cellules.

Étape 4 — Exporter vers Excel

Une fois que l'IA a traité votre PDF scanné, l'export vers Excel est simple. La plupart des outils d'extraction proposent un téléchargement direct au format Excel (XLSX). Voici à quoi vous attendre selon les différentes approches :

MéthodeChemin d'exportQualité Excel
Outil d'extraction IACliquez sur « Exporter vers Excel » ou téléchargez le XLSXÉlevée — données en colonnes, en-têtes conservés, une ligne par document
Adobe Acrobat OCROutils > Exporter le PDF > Tableur > ExcelMoyenne — tableaux reconnus mais décalages fréquents
Google Drive OCROuvrir dans Google Docs > copier > coller dans ExcelFaible — tout le formatage est perdu, le texte s'écoule dans une seule colonne
Service OCR en ligneTélécharger le XLSX (si pris en charge)Variable — la précision et la préservation de la mise en page diffèrent selon le service

Un point commun à la plupart des méthodes d'export : le résultat nécessite une relecture avant d'être vraiment utilisable. Aucun outil — y compris l'extraction par IA — ne donne des résultats parfaits à 100 % sur tous les documents scannés. La question n'est pas de savoir si un nettoyage est nécessaire, mais à quel point.

Étape 5 — Nettoyage post-traitement (section honnête)

C'est l'étape que la plupart des guides omettent. Voici la réalité : la sortie OCR des PDF scannés — même avec de bons outils — nécessitera un nettoyage. L'ampleur dépend de la qualité du scan, de la complexité du document et de l'outil utilisé. Sur un scan clair et bien aligné d'une facture simple traitée par extraction par IA, vous devrez peut-être corriger moins de 5 % des cellules. Sur un scan basse résolution d'un bon de commande dense traité avec un outil OCR basique, vous pourriez en corriger la moitié.

Checklist deux par deux de quatre problèmes de nettoyage OCR avec leurs solutions : nombres stockés sous forme de texte, espaces et sauts de ligne superflus, cellules fusionnées ou scindées, et incohérences de format de date.

Les problèmes les plus courants et comment les résoudre :

1

Nombres stockés sous forme de texte

Excel affiche un triangle vert dans le coin et les formules ne calculent pas. Sélectionnez la colonne, utilisez Données > Convertir, puis cliquez sur Terminer. Ou multipliez toutes les cellules par 1 à l'aide d'une colonne d'assistance : saisissez =A1*1 et copiez vers le bas.

2

Espaces et sauts de ligne superflus

L'OCR insère souvent des espaces entre les caractères ou conserve des sauts de ligne inutiles issus du scan. Utilisez =TRIM(A1) pour supprimer les espaces superflus et =CLEAN(A1) pour éliminer les caractères non imprimables. Copiez la colonne nettoyée et collez-la en tant que valeurs sur la colonne d'origine.

3

Cellules fusionnées ou scindées suite à une mauvaise détection du tableau

Si les données d'une ligne ont débordé sur plusieurs lignes ou si les colonnes sont désalignées, vérifiez si le scan d'origine a été recadré ou incliné. La fonction Convertir d'Excel (avec délimiteur virgule, espace ou caractère personnalisé) peut séparer les données qui ont atterri dans la mauvaise cellule.

4

Incohérences de format de date

Une colonne peut contenir « 03/15/2026 », « 15 mars 2026 » et « 15-mars-26 » provenant de différentes pages. Utilisez la fonction DATEVALUE d'Excel ou appliquez un format de date cohérent sur toute la colonne : clic droit > Format de cellule > Date > choisissez votre format préféré.

L'effort de nettoyage est directement proportionnel au niveau de structure dont vous avez besoin. Si vous avez simplement besoin d'une colonne de montants totaux provenant de 50 factures, une vérification rapide des erreurs évidentes prend 5 minutes. Si vous avez besoin que chaque ligne de détail de chaque facture corresponde parfaitement à un modèle standardisé, prévoyez 15 à 30 minutes par lot jusqu'à ce que vous ayez confiance dans le modèle de sortie de votre outil.

Dépannage des problèmes courants

« Données Excel > À partir d'un PDF : aucun tableau trouvé »

Cela se produit lorsque le PDF est scanné. L'importateur PDF natif d'Excel ne fonctionne qu'avec les PDF numériques dotés d'une couche de texte sélectionnable. Revenez à l'étape 1 pour confirmer le type de votre PDF, puis utilisez plutôt un outil d'OCR ou d'extraction par IA.

« Le texte de sortie contient des caractères aléatoires (O au lieu de 0, l au lieu de 1) »

La confusion de caractères OCR est courante dans les scans en basse résolution. Utilisez Rechercher et remplacer dans Excel pour corriger les erreurs connues. Si vous traitez régulièrement des documents similaires, notez les erreurs fréquentes — la plupart des outils d'extraction par IA s'améliorent avec les retours, et vous pouvez créer une macro de nettoyage pour les schémas récurrents.

« Le PDF est dans une langue autre que l'anglais »

Vérifiez que votre outil d'OCR ou d'IA prend en charge la langue concernée. La plupart des outils utilisent l'anglais par défaut et produiront un résultat illisible sur les écritures non latines. L'OCR de Google Drive gère correctement plus de 200 langues. Les outils d'extraction par IA basés sur des modèles de vision gèrent généralement toutes les langues présentes dans le document, car ils lisent visuellement plutôt que par reconnaissance de caractères spécifique à une langue.

« La qualité du scan est trop faible — le texte est flou ou incliné »

Scannez à nouveau à 300 DPI ou plus si vous avez encore le document papier. Pour les fichiers que vous ne pouvez pas rescanner, essayez un outil d'amélioration par IA capable de redresser et de netteté les images avant l'OCR. Certains services d'OCR en ligne incluent un pré-traitement d'image qui peut partiellement compenser une mauvaise qualité de scan.

« Je dois traiter plus de 50 PDF scannés — existe-t-il une option par lots ? »

Oui. La plupart des plateformes OCR commerciales et des outils d'extraction par IA prennent en charge le traitement par lots. Vous téléversez tous les fichiers en une fois, et l'outil les traite ensemble, produisant un seul fichier Excel avec une ligne par document. C'est un domaine où les outils d'extraction par IA présentent un avantage significatif sur l'OCR traditionnel, qui traite généralement les fichiers un par un.

Questions fréquentes

Excel dispose-t-il d'une fonction OCR intégrée pour les PDF scannés ?

Non. La fonction Données > Obtenir des données > À partir d'un fichier > À partir d'un PDF d'Excel fonctionne uniquement avec les PDF natifs qui contiennent déjà du texte sélectionnable. Pour les PDF scannés (à base d'images), vous avez besoin d'un outil OCR externe ou d'une plateforme d'extraction par IA.

Google Drive peut-il convertir un PDF scanné en Excel ?

L'OCR de Google Drive extrait le texte de l'image et le place dans un Google Doc, mais le résultat est un texte brut sans structure de tableau préservée. Vous pouvez copier ce texte dans Excel, mais vous devrez séparer manuellement les données en colonnes. Google Drive ne propose pas de conversion directe de PDF scanné vers Excel.

La précision de l'OCR est-elle suffisante pour les données comptables ?

Cela dépend de l'outil et de la qualité de numérisation. L'OCR traditionnel sur un scan propre d'une facture standard peut atteindre une précision de 95 à 97 % au niveau des caractères. Les outils d'extraction par IA qui comprennent le contexte du document ont tendance à être plus fiables pour les champs structurés, car ils recherchent le sens plutôt que des caractères individuels. La règle d'or : vérifiez toujours au moins 10 % des lignes de tout ensemble de données financières critiques, quel que soit l'outil utilisé.

Quel est le meilleur outil gratuit pour convertir un PDF scanné en Excel par OCR ?

Il n'y a pas de réponse unique, car « gratuit » signifie des limites différentes selon les outils. L'OCR de Google Drive est gratuit mais ne fournit qu'un résultat textuel. Adobe Acrobat Online OCR offre un fichier gratuit par jour. OCR.space offre aux développeurs 25 000 requêtes API gratuites par mois. Pour une comparaison détaillée avec les limites spécifiques et les compromis de précision, consultez notre guide des meilleurs logiciels OCR gratuits 2026.

En quoi l'extraction par IA diffère-t-elle de l'OCR traditionnel pour les PDF scannés ?

L'OCR traditionnel lit chaque caractère de la page et renvoie un bloc de texte — il vous indique quels mots existent, mais pas ce qu'ils signifient. L'extraction par IA utilise des modèles de vision par ordinateur pour comprendre la structure du document : elle peut distinguer un numéro de facture d'une référence client, une date d'un numéro de page, et un total d'un sous-total. Elle place ensuite automatiquement chaque donnée dans la colonne de sortie correcte. Cette compréhension sémantique est ce qui rend la sortie Excel utilisable sans des heures de réorganisation manuelle.

Les outils d'IA peuvent-ils traiter les PDF scannés manuscrits ?

Certains outils d'extraction par IA peuvent traiter l'écriture manuscrite, mais la précision est inférieure à celle du texte imprimé — environ 70 à 85 % sur une écriture claire contre 95 à 99 % sur des caractères imprimés. L'OCR de l'écriture manuscrite s'améliore rapidement grâce aux modèles de vision, mais pour les données critiques, prévoyez une passe de vérification manuelle. Si le document manuscrit est un formulaire structuré (comme un rapport d'inspection de terrain ou une feuille de temps), l'IA peut toujours identifier quel champ est lequel, même si certains caractères sont incertains.

L'écart entre un PDF scanné et un fichier Excel exploitable est réel, mais il n'est pas aussi large que la saisie manuelle le laisse paraître. Le bon outil réduit le parcours de plusieurs heures à quelques secondes, et le nettoyage de fastidieux à gérable. La première analyse que vous exécutez avec un extracteur par IA prendra plus de temps — car vous apprenez le format de sortie et construisez votre liste de vérification. Dès la dixième analyse, vous maîtriserez le processus en moins d'une minute par document.

Essayez-le sur un PDF scanné sur lequel vous travaillez en ce moment. Téléchargez le fichier, définissez les colonnes dont vous avez besoin, et observez le résultat — celui-ci vous en apprendra plus sur votre cas d'usage spécifique que n'importe quelle statistique de précision générique.

Arrêtez la saisie manuelle — laissez l'IA lire vos documents
Image ou PDF — données structurées en 10 secondes
Essayer maintenant →
📮 contact email: [email protected]