L'import PDF divise Excel en feuilles.Comment obtenir un tableau unique

L'import PDF d'Excel n'échoue pas bruyamment. Il reformate votre fichier en quelque chose qui semble analysé et ne l'est pas. Dans le fil r/excel demandant quelle fonctionnalité les utilisateurs ajouteraient à Excel, un commentaire en tête nomme le symptôme exact : importer des données de PDF « sans ... éparpiller chaque page dans une feuille de calcul séparée. » Lancez Données > Obtenir des données > À partir d'un fichier > À partir d'un PDF sur un relevé multipage et vous obtenez une requête par page, une nouvelle série d'en-têtes Column1 et Column2 après la première page, et des lignes coupées au saut de page. Vous avez demandé une feuille de calcul. Excel a renvoyé un empilement de fragments.

Arrêtez la saisie manuelle — laissez l'IA lire vos documents
Image ou PDF — données structurées en 10 secondes
Essayer maintenant →
Une icône centrale d'une loupe sur un document, avec trois nœuds rayonnants : PDF multipage, tableau continu unique et lecture au niveau de la page, sur un fond en dégradé épuré avec des décorations de lignes dessinées à la main.

Points clés à retenir

  1. Votre relevé de cinq pages n'est pas endommagé : le PDF n'a jamais contenu un tableau unique, donc Power Query signale un tableau par page.
  2. Seul le premier fragment conserve les véritables titres, donc les pages 2 et 3 retombent sur Column1, Column2 et Column3 et Append Queries refuse de les aligner.
  3. Arrêtez de lire page par page et nommez les colonnes souhaitées, puis ImageToTable.ai lit le document comme un seul enregistrement et quarante relevés deviennent quarante lignes.

Ce que vous obtenez réellement d’une importation PDF multipage

Comparaison sur deux colonnes : à gauche, une pile de documents étiquetée « Ce que vous obtenez » avec « Plusieurs feuilles, une par page » en rouge ; à droite, un tableau propre étiqueté « Ce que vous voulez » avec « Un tableau continu » en vert, sur un fond en dégradé avec des décorations en lignes.

L’importation ne génère presque jamais d’erreur. Elle renvoie une structure incorrecte, et tous les symptômes ultérieurs découlent de cette structure. Lorsque Power Query se connecte à votre fichier, la fenêtre Navigator répertorie deux types d’objets différents : les tableaux individuels en haut et les pages entières en bas. Si vous en cochez plus d’un, Power Query crée une requête distincte pour chaque élément. Choisissez Load et Excel écrit chaque requête dans sa propre feuille : un relevé de cinq pages devient donc plusieurs feuilles de calcul, et le tableau souhaité se retrouve réparti sur toutes ces feuilles.

C’est de là que vient le « un PDF est devenu plusieurs feuilles ». Ce n’est pas un dommage causé à votre fichier. C’est le connecteur qui rapporte ce qu’il pense avoir trouvé, page par page. Les lignes et les colonnes semblent ensuite cassées, car chacune de ces feuilles par page a été lue séparément et a reçu ses propres noms de colonnes.

Un PDF multipage n’arrive pas sous la forme d’un tableau endommagé. Il arrive sous la forme de plusieurs petits tableaux qui n’ont jamais été fusionnés, c’est pourquoi aucun reformatage ne peut le corriger.

Pourquoi Power Query voit un tableau par page

Une icône d’engrenage centrale représentant Pdf.Tables, avec trois nœuds rayonnants : Format à mise en page fixe, MultiPageTables par défaut : True, et Changement de mise en page détecté (ambre), sur un fond en dégradé avec des décorations en lignes.

Power Query ne lit pas mal votre PDF. Le format PDF ne contient pas de tableau à lire. Le PDF a été spécifié comme un format à mise en page fixe, normalisé sous la référence ISO 32000, où chaque page est un canevas de texte et de graphiques ancrés à des coordonnées. L’idée que ces coordonnées forment un tableau à trois colonnes avec une ligne d’en-tête est une interprétation, et le format ne porte cette interprétation que lorsque le fichier est un PDF balisé avec une structure logique (clause 14.8 de l’ISO 32000). La plupart des PDF exportés depuis les systèmes comptables et bancaires ne sont pas balisés.

Le connecteur de Microsoft doit donc deviner, et cette devinette est exposée dans une seule fonction. Pdf.Tables est le moteur derrière Get Data > From PDF. Il renvoie un tableau à trois colonnes, Name, Kind et Data, et Kind est soit Table, soit Page. L’une de ses options détermine l’agressivité de la devinette : MultiPageTables, que la référence Pdf.Tables de Microsoft décrit comme contrôlant « si des tableaux similaires sur des pages consécutives seront automatiquement combinés en un seul tableau ». Sa valeur par défaut est true.

Ce comportement par défaut explique précisément la division. Lorsque des pages consécutives partagent la même structure, le détecteur les traite comme un seul tableau et les combine. Lorsque la mise en page change d'une page à l'autre — un bandeau d'en-tête répété, un nombre de colonnes différent, un bloc récapitulatif présent sur une seule page — le détecteur voit des tableaux différents et en signale un par page. Plus la structure de votre document varie d'une page à l'autre, plus vous risquez d'obtenir des fragments.

C'est la partie que la plupart des tutoriels omettent. Ils vous disent de cliquer sur Append et de passer à la suite, sans expliquer que le fichier lui-même n'a jamais contenu un seul tableau, et que le connecteur n'avait donc rien à regrouper. Il est utile de comprendre ce qu'un PDF peut et ne peut pas contenir avant de blâmer l'exportation ; voir comment les PDF deviennent des données structurées pour la version complète de cette histoire.

Pourquoi les en-têtes de la page 2 deviennent des lignes de données

Comparaison sur deux colonnes : à gauche, un document avec une flèche vers le haut étiquetée 'Page 1' et 'En-têtes : Date, Description, Montant' en vert ; à droite, un document avec un point d'interrogation étiqueté 'Page 2' et 'En-têtes : Column1, Column2, Column3' en rouge, sur un fond dégradé avec des décorations en lignes.

Les titres de colonnes n'existent qu'une seule fois, sur le premier fragment. Après cette page, les mêmes mots ne sont que des valeurs de cellules. Un utilisateur sur Microsoft Q&A décrit exactement l'échec que cela produit : un tableau PDF s'étendant sur trois pages est « identifié comme trois tableaux distincts », et « seul le premier tableau contient les titres de colonnes d'origine ; les deux autres affichent Column1, Column2, etc. » Comme les noms de colonnes ne correspondent plus, les tableaux ne peuvent pas être ajoutés sans modification. Vous pouvez lire le fil complet dans le post Microsoft Q&A.

Le mécanisme est simple une fois que vous voyez la forme de la sortie. Chaque tableau par page est détecté indépendamment, donc chacun reçoit sa propre étape de promotion d'en-tête. Sur la page un, « Utiliser la première ligne comme en-têtes » transforme correctement Date, Description et Montant en noms de colonnes. Sur la page deux, il n'y a pas de ligne d'en-tête à promouvoir, car les titres répétés sont simplement la première ligne de données. Power Query retombe sur Column1, Column2 et Column3. Append Queries, qui empile les tableaux en faisant correspondre les noms de colonnes, refuse alors de les aligner.

Où les lignes sont coupées en deux au saut de page

Les sauts de page tombent là où le papier se termine, donc une description sur plusieurs lignes ou une cellule multiligne peut arriver sous forme de deux lignes. La documentation du connecteur PDF de Microsoft liste cela comme une limitation connue sous « Handling multi-line rows » et recommande Table.FillDown pour copier les valeurs décalées dans la ligne au-dessus, ou Table.Group pour combiner les lignes adjacentes. Aucune de ces options ne s'exécute automatiquement. La même page note que EnforceBorderLines contrôle « whether border lines are always enforced as cell boundaries » et est désactivé par défaut, donc un tableau dessiné sans bordures complètes peut être analysé avec de mauvaises limites de cellules.

Deux modes de défaillance se cumulent désormais. Un enregistrement coupé à un saut de page devient deux lignes, et le problème d'en-tête de la section précédente fait que vous ne le remarquez peut-être même pas, car la deuxième ligne perd souvent l'étiquette qui permettrait de l'identifier. Des bordures de cellules fusionnées ou lâches aggravent le mappage des colonnes, un problème d'extraction distinct traité dans pourquoi les cellules fusionnées cassent l'extraction de tableaux.

Corriger dans Excel : Append Queries et la danse des en-têtes

La réparation s'effectue dans Excel, et c'est une procédure en quatre étapes à répéter pour chaque fichier dont la mise en page diffère. Cela fonctionne, mais c'est manuel. L'astuce consiste à faire ressembler chaque fragment aux autres avant de les empiler, puis à restaurer les vrais en-têtes une seule fois à la fin.

1

Sélectionner les fragments

Dans Navigator, cochez Select multiple items et choisissez les tableaux dont vous avez besoin. Si la liste est chargée, vous pouvez charger le fichier entier et filtrer la requête sur Kind pour ne garder que les lignes Table.

2

Rétrograder les en-têtes du premier tableau

Sur le premier fragment, utilisez Transform > Use Headers as First Row. Les vrais titres de colonnes descendent dans les données, et le tableau utilise désormais Column1, Column2 et Column3 comme les pages suivantes.

3

Ajouter le reste

Utilisez Home > Append Queries > Append as New et ajoutez chaque fragment restant. Comme ils partagent tous les mêmes noms d'espaces réservés, les colonnes s'alignent sans avoir à les renommer une par une.

4

Rétablir les en-têtes

Dans la requête combinée, cliquez sur Use First Row as Headers. Les titres d'origine reviennent en première ligne, et les pages empilées deviennent un tableau continu.

Deux mises en garde pour rester honnête. Les étapes sont enregistrées dans la requête, donc actualiser le même fichier est rapide, mais un relevé dont la mise en page change le mois prochain peut casser la détection et vous obliger à refaire la promotion des en-têtes. Et si le PDF est un scan sans couche de texte, il n'y a rien à structurer, car le connecteur n'exécute pas d'OCR. Ce cas relève de l'OCR d'un PDF scanné vers Excel à la place.

Arrêtez la saisie manuelle — laissez l'IA lire vos documents
Image ou PDF — données structurées en 10 secondes
Essayer maintenant →

Une approche qui ne modélise jamais le PDF comme des pages

Le résultat « une feuille par page » est un symptôme de la lecture orientée page. L'alternative consiste donc à cesser de lire page par page. Lorsque l'objectif est un tableau plutôt qu'une copie de la page, vous pouvez définir la sortie en premier et laisser le document être l'unité de travail. C'est la différence entre la lecture au niveau de la page et la compréhension au niveau du document, et c'est là qu'un outil d'extraction commence à se distinguer d'un importateur de pages.

Avec l'Extraction de colonnes personnalisées, vous saisissez les noms de colonnes souhaités, tels que Numéro de facture, Date du relevé et Montant, et ces noms deviennent les en-têtes du tableau final. L'outil lit le document pour trouver chaque valeur plutôt que de lire une position fixe. Ainsi, une bande d'en-tête qui se répète en haut de chaque page est traitée comme un élément de mise en page, et non comme une ligne de données. La sortie est une ligne par enregistrement, et non une feuille de calcul par page. Comme l'unité est le document, il n'y a pas de seconde page dont les noms de colonnes pourraient se désaligner par rapport à la première.

Pour un dossier plutôt qu'un fichier unique, la même conception s'applique en lot. Le Traitement par lots en priorité signifie que vous déposez plusieurs PDF à la fois et qu'ils fusionnent en une seule feuille de calcul avec les mêmes en-têtes. Ainsi, quarante relevés mensuels deviennent quarante lignes dans un seul tableau, plutôt que quarante feuilles à assembler manuellement. Les mécanismes pour y parvenir sans éditeur de requêtes sont décrits dans le traitement par lots de documents sans code. Si vous souhaitez voir la forme de la sortie sur votre propre fichier avant de vous engager, la démo intégrée ci-dessous s'exécute sur un échantillon.

PDF/JPG/PNG Extraction IA

Les fichiers sont traités en toute sécurité et ne sont pas stockés.

Lorsque chaque page est réellement son propre document

Un tableau continu est la bonne réponse uniquement lorsque les pages appartiennent au même enregistrement. Parfois, ce n'est pas le cas. Un PDF peut être une série de documents d'une page sans rapport entre eux, un relevé client différent par page, un scan de dizaines de factures distinctes, auquel cas les regrouper dans un seul tableau d'ensemble fusionnerait des enregistrements qui devraient rester séparés. La bonne décision n'est pas une meilleure importation ; c'est une règle de regroupement.

C'est à cela que sert Multi-Page Merge. C'est un paramètre de modèle qui détermine quels résultats extraits appartiennent au même document logique, et vous configurez son regroupement : démarrer un nouveau groupe lorsque la valeur d'une colonne suivie change, faire correspondre les lignes qui partagent un numéro de référence sur tout le lot, ou regrouper un nombre fixe de téléversements. Lorsque le même champ apparaît sur plusieurs pages d'un groupe, vous choisissez comment résoudre le chevauchement : conserver la première valeur, conserver la dernière, les concaténer ou les diviser en lignes séparées. L'important, c'est le sens du contrôle. L'outil ne devine pas silencieusement quelles pages vont ensemble ; vous fournissez la règle, et il l'applique de manière cohérente.

L'exactitude sur les pages qui vont bien ensemble mérite tout de même une vérification, c'est ce que fournit Review Mode with Bbox-Assisted Verification. Survolez ou cliquez sur n'importe quelle cellule extraite et l'image d'origine met en évidence d'où vient cette valeur, et l'inverse fonctionne aussi : cliquez sur une région du document et il revient à la cellule correspondante. Vous pouvez déclencher la mise en évidence à la demande pour un seul fichier ou la configurer pour qu'elle s'exécute automatiquement après le traitement. Pour les relevés où un seul chiffre mal lu compte, cette vérification visuelle croisée est plus rapide que de relire la page.

FAQ

L'importation Depuis PDF d'Excel place-t-elle parfois automatiquement un tableau multipage sur une seule feuille ?

Parfois. Lorsque des pages consécutives partagent la même structure de tableau, l'option MultiPageTables, qui est activée par défaut, les combine en un seul tableau. Lorsque la mise en page change d'une page à l'autre, elles sont détectées comme des tableaux séparés et atterrissent dans des feuilles de calcul distinctes. Il n'existe aucun paramètre qui force des pages arbitraires dans un seul tableau.

Pourquoi les pages 2 et 3 affichent-elles Column1 et Column2 au lieu de mes en-têtes ?

Le tableau de chaque page est détecté indépendamment, donc la promotion d'en-tête appliquée à la page 1 ne se reporte pas. Seul le premier fragment possède une véritable ligne d'en-tête ; les fragments suivants utilisent des noms d'espace réservé, ce qui explique aussi pourquoi Append Queries échoue tant que les noms ne correspondent pas.

Google Sheets peut-il importer un PDF multipage comme un seul tableau ?

Google Sheets ne dispose pas de connecteur natif capable de détecter les tableaux dans un PDF comme le fait Power Query. La solution courante consiste à convertir le PDF dans un format intermédiaire puis à l'importer, ou à utiliser un outil d'extraction dédié qui renvoie directement une feuille de calcul. Les deux approches évitent les feuilles par page, mais seule l'extraction vous épargne le nettoyage.

Et si mon PDF est un scan sans couche de texte ?

Le connecteur PDF de Power Query n'exécute pas d'OCR, donc un scan purement image ne contient aucun texte à structurer. Vous devez d'abord effectuer une étape d'OCR, ou utiliser un outil qui lit l'image directement. Les compromis sont détaillés dans le guide de conversion de PDF scanné en Excel.

Existe-t-il un réglage en un clic pour empêcher la division des feuilles ?

Non. Ce comportement découle de la façon dont un PDF stocke le contenu, pas d'une case à cocher. Les leviers intégrés les plus proches sont MultiPageTables pour les structures qui correspondent par hasard, et les étapes Append Queries plus en-têtes pour tout le reste. Si les fichiers sont très volumineux, les PDF énormes créent leurs propres problèmes avant même que la division des pages ne compte. Et si vous espériez que Copilot absorbe le nettoyage, cette attente a ses propres raisons, expliquées dans pourquoi Copilot peine avec la conversion PDF vers Excel.

Puis-je simplement convertir le PDF en Excel plutôt que de l'importer ?

Oui, et c'est un choix raisonnable lorsque le document est un tableau unique et propre et que vous n'avez besoin des chiffres qu'une seule fois. Lorsque l'entrée est un dossier de documents aux formats variés et que la sortie doit conserver des colonnes cohérentes, une conversion PDF vers Excel basée sur les colonnes est la voie la plus stable, car les en-têtes sont définis par vous plutôt que détectés page par page.

Le résultat d'une feuille par page n'est pas un défaut de votre fichier. C'est ce qui se produit lorsqu'un lecteur orienté page est invité à reconstruire un tableau orienté enregistrement, et la solution consiste soit à joindre délibérément les fragments, soit à définir le tableau avant de lire quoi que ce soit.

Une fois que vous considérez la division comme un choix de modélisation plutôt qu'un dommage, la décision devient plus facile. Si vous avez quelques fichiers et le temps de maintenir une requête, la séquence d'ajout et de promotion dans Excel suffit. Si le tableau est l'essentiel et que les pages ne sont qu'un emballage, nommez les colonnes dont vous avez besoin et laissez le document être l'unité de travail. Vous pouvez tester cela sur votre propre relevé sans rien configurer, et voir si votre prochain PDF multipage arrive comme un seul tableau ou comme une pile de feuilles.

Arrêtez la saisie manuelle — laissez l'IA lire vos documents
Image ou PDF — données structurées en 10 secondes
Essayer maintenant →
📮 contact email: [email protected]