Pourquoi l'extraction de tableaux à cellules fusionnées
échoue-t-elle ? 4 causes courantes et solutions
Vous n'êtes pas seul — c'est le problème d'extraction le plus courant. Votre outil lit le texte, mais le résultat revient avec des cellules vides là où les données devraient être, des en-têtes de colonnes dispersés dans les mauvaises colonnes, ou des lignes qui ont simplement disparu. Les cellules fusionnées dans le document source sont presque toujours la cause, et la solution dépend de la compréhension du type de modèle de cellule fusionnée qui pose problème.

Points clés à retenir
- Votre extraction s'est terminée sans erreur, mais des colonnes entières sont revenues vides parce que chaque cellule fusionnée dans la source a forcé votre outil à faire une supposition silencieuse.
- Ces cellules vides ne sont pas aléatoires — quatre modèles spécifiques de cellules fusionnées les provoquent, et chacun a une cause racine nommée que vous pouvez diagnostiquer en 30 secondes.
- Une seule vérification post-extraction — défusionner les cellules restantes, remplir vers le bas pour propager les valeurs, et vérifier votre nombre de lignes par rapport à la source — détecte la corruption silencieuse à laquelle tout outil est vulnérable.
Cela vous semble familier ?
Si vous êtes ici, l'un de ces scénarios correspond probablement à ce que vous regardez en ce moment :
- Des cellules vides dans des colonnes qui devraient contenir des données. Une étiquette de catégorie fusionnée (« Q1 Revenue ») qui s'étend sur trois lignes — la première ligne contient le texte, les deux suivantes sont vides.
- Des données qui ont dérivé dans la mauvaise colonne. Des valeurs qui devraient être sous « Amount » se retrouvent sous « Description » parce que l'en-tête fusionné a perturbé la détection des limites de colonnes.
- Des en-têtes de colonnes manquants ou mélangés. Un bloc d'en-tête sur deux lignes où « Product Details » s'étend sur cinq colonnes — l'extraction l'a réduit à une seule colonne.
- Des lignes qui ne correspondent pas. La source contient 14 lignes de données mais le résultat en affiche 9, ou l'inverse, parce que les limites des lignes fusionnées ont été mal comptées.
Chacun de ces symptômes pointe vers une cause racine différente. La bonne nouvelle : une fois que vous savez quel schéma est en jeu, la correction est simple.
Vue d'ensemble : pourquoi les cellules fusionnées cassent l'extraction

Un tableau est une grille — des lignes et des colonnes formant des cellules, chacune contenant une valeur. Une cellule fusionnée combine des cellules adjacentes en une seule unité visuelle. Elle ressemble à une grande cellule à l'écran, mais la structure sous-jacente les traite toujours comme des cellules séparées — dont une seule contient réellement des données.
Cet écart entre l'apparence visuelle et la réalité structurelle est l'endroit où les outils d'extraction trébuchent. Que vous utilisiez l'OCR traditionnel ou un modèle d'IA vision, le moteur d'extraction doit décider : « Comment mapper cette étendue visuelle sur une grille propre ? » C'est cette décision qui fait dérailler les choses.
Les cellules fusionnées forcent les outils d'extraction à deviner. Les deux approches échouent lorsque la supposition est fausse — et avec les cellules fusionnées, c'est souvent le cas.
Cause racine 1 : L'OCR ligne par ligne ne gère pas la structure 2D

Symptômes
Le texte est bien là, mais le mappage ligne-colonne est cassé. Une ligne qui devrait être « Pièce A | 12,50 $ | 3 | 37,50 $ » ressort comme « Pièce A | 12,50 $ | » avec les valeurs restantes poussées à la ligne suivante. Les cellules fusionnées qui s'étendent sur plusieurs lignes produisent des lignes vides dans le résultat.
Cause racine : Fracture des coordonnées
Les moteurs OCR traditionnels traitent les documents séquentiellement — les lignes de haut en bas, les mots de gauche à droite. Cela fonctionne pour les paragraphes. Pour les tableaux, chaque bloc de texte est traité comme une ligne autonome, sans comprendre l'alignement vertical qui définit une colonne.
Voici un exemple concret. Imaginez un bon de commande avec une cellule fusionnée « Fournitures de bureau » qui s'étend sur trois lignes :
| Catégorie | Article | Qté | Prix unitaire |
|---|---|---|---|
| Fournitures de bureau | Cahiers | 10 | 3,50 $ |
| Stylos (boîte) | 5 | 8,00 $ | |
| Agrafeuse | 2 | 12,00 $ |
Un moteur OCR basé sur les lignes lit ceci comme :
Ligne 1 : « Fournitures de bureau » | « Cahiers » | « 10 » | « 3,50 $ »
Ligne 2 : « Stylos (boîte) » | « 5 » | « 8,00 $ »
Ligne 3 : « Agrafeuse » | « 2 » | « 12,00 $ »Remarquez ce qui s'est passé : « Fournitures de bureau » a été lu sur la ligne 1 avec les données réelles de cette ligne, car l'OCR l'a trouvé à la même position verticale. Sur les lignes 2 et 3, le moteur OCR ne sait pas que « Fournitures de bureau » s'applique toujours à ces lignes — le texte n'y est physiquement pas. Le résultat est une extraction où la colonne Catégorie est vide pour les lignes 2 et 3, ce qui casse toute analyse en aval qui regroupe par catégorie.
La solution
Prétraitement : détecter les limites des cellules fusionnées avant l'extraction. Certains outils (dont ImageToTable.ai) analysent d'abord la mise en page du document — en identifiant la grille du tableau, y compris les plages fusionnées — avant de lire le texte. En comprenant la structure 2D complète en amont, le moteur d'extraction sait que « Fournitures de bureau » occupe les lignes 1 à 3 et peut propager cette valeur sur les trois lignes dans la sortie. Si votre outil actuel ne fait pas cela, cherchez-en un qui effectue une analyse de mise en page comme phase distincte avant l'OCR ou l'extraction de texte — c'est la plus grande amélioration par rapport à l'extraction basée sur les lignes.
Cause racine 2 : ambiguïté de la plage — la cellule qui appartient partout
Symptômes
Un en-tête de colonne fusionné fait que les données apparaissent sous le mauvais en-tête. Par exemple, un tableau avec les en-têtes « Détails du produit | T1 | T2 | T3 | T4 » où « Détails du produit » s'étend sur deux sous-colonnes (« Article » et « SKU ») — la sortie extraite fusionne les deux sous-colonnes en une seule, ou duplique les valeurs entre elles.
Cause racine : ambiguïté de la plage
Lorsqu'une cellule fusionnée s'étend sur plusieurs colonnes, l'outil d'extraction doit répondre : « Cette cellule appartient-elle à la colonne 1, à la colonne 2, ou à toutes ? » La réponse semble évidente à l'œil humain, mais pour un algorithme, elle est ambiguë.
C'est particulièrement délicat pour les modèles d'IA de vision qui utilisent une analyse par patchs. Ces modèles divisent l'image en petites tuiles et analysent chacune indépendamment. Une cellule fusionnée qui s'étend sur cinq colonnes est fragmentée sur plusieurs tuiles. Chaque tuile ne voit qu'une partie de la cellule fusionnée, et le modèle doit les recoudre — une tâche qui introduit des erreurs à chaque jointure. Une analyse de Medium sur les échecs pratiques de la reconstruction de tableaux a documenté ce problème exact : les modèles de vision qui divisent les images en patchs « performent mal pour les objets qui dépendent de la continuité globale — les tableaux en étant un exemple. »
La solution
Concevez votre extraction avec une structure attendue. Si vous savez que votre document source a un en-tête comme « Product Details (Item | SKU) », définissez vos noms de colonnes en conséquence — « Item » et « SKU » — plutôt que de compter sur l'outil pour deviner la hiérarchie. Des outils comme ImageToTable.ai qui utilisent l'Extraction de colonnes personnalisées vous permettent de spécifier exactement les colonnes souhaitées. L'IA fait ensuite correspondre chaque colonne à la bonne sous-colonne du document en comprenant la signification de chaque champ, et non en devinant les limites des plages. Cela contourne entièrement le problème d'ambiguïté : au lieu de demander à l'outil « quelle est la largeur de cette cellule fusionnée ? », vous lui dites « voici les colonnes dont j'ai besoin — trouvez-les dans le document ».
Cause racine 3 : des hauteurs de lignes irrégulières brisent le rythme
Symptômes
Le tableau extrait contient trop ou trop peu de lignes. Une ligne de sous-total de section qui s'étend sur toute la largeur du tableau est comptée comme une nouvelle ligne (élargissant la grille) ou complètement ignorée (la réduisant). Le nombre total de lignes du tableau extrait ne correspond pas à la source.
Cause racine : variation de la hauteur des lignes
La plupart des algorithmes d'extraction de tableaux reposent sur la détection de lignes horizontales ou d'espaces blancs pour identifier les limites des lignes. Une cellule fusionnée qui s'étend sur plusieurs lignes modifie le motif de hauteur visuelle — soit plus haut (le contenu fusionné nécessite plus d'espace), soit plus bas (zone fusionnée vide). Dans les deux cas, l'heuristique de l'algorithme pour les limites de lignes est perturbée.
C'est particulièrement courant avec les motifs en escalier, où les cellules fusionnées créent une limite diagonale. L'algorithme voit des hauteurs incohérentes et ne peut pas déterminer s'il doit traiter tout le bloc comme une seule grande ligne ou le diviser.
La solution
Post-traitement : recoupez le nombre de lignes avec la structure attendue. Après l'extraction, effectuez une vérification rapide : le nombre de lignes de données correspond-il à ce que vous attendez ? Si vous savez que chaque facture comporte une section d'articles avec 3 à 12 lignes, signalez toute sortie en dehors de cette plage. Dans Excel, vous pouvez utiliser une simple vérification COUNTA ou un tableau croisé dynamique pour vérifier les nombres de lignes sur plusieurs lots. Des outils plus avancés offrent une validation intégrée qui compare automatiquement la structure extraite aux nombres de lignes et de colonnes attendus et met en évidence les écarts pour examen manuel.
Cause racine n°4 : aucune validation après traitement
Symptômes
L'extraction semble réussir — aucune erreur, aucun délai dépassé — mais lorsque vous utilisez les données, vous découvrez que des valeurs se trouvent dans les mauvaises lignes ou colonnes. L'erreur est silencieuse, ce qui la rend plus dangereuse qu'une extraction ayant échoué.
Cause racine : effondrement après traitement
De nombreux outils d'extraction disposent d'une étape d'assemblage finale où les blocs de texte détectés sont remappés sur une grille. Si les cellules fusionnées ont causé des problèmes en amont (fracture de coordonnées, ambiguïté de portée ou confusion de hauteur de ligne), l'étape de post-traitement tente souvent de masquer ces problèmes en réduisant ou en remplissant les cellules pour s'adapter à une grille rectangulaire. C'est là que se produit la corruption silencieuse des données : l'outil remplit les cellules vides avec les valeurs voisines, décale des colonnes entières vers la gauche ou la droite, ou supprime des lignes qui ne correspondent pas à la forme de grille qu'il a choisie.
Le mécanisme précis : le post-processeur a une forme de grille cible (par exemple, 4 colonnes × 15 lignes) déduite du nombre de cellules détectées. Lorsqu'une cellule fusionnée crée une anomalie — disons, 63 cellules détectées pour une grille qui devrait être de 4×16=64 — le moteur doit gérer l'écart. Certains outils remplissent avec des espaces vides (créant le symptôme de « cellule vide »). D'autres compressent : ils redistribuent les 63 cellules dans 64 emplacements, poussant une valeur de données dans la mauvaise colonne.
La solution
Imposez une validation après extraction. Que vous le fassiez manuellement ou que vous l'automatisiez, chaque lot d'extractions provenant de documents avec cellules fusionnées doit inclure une étape de vérification croisée. L'approche la plus pratique : exportez votre tableau extrait, supprimez les cellules fusionnées restantes dans Excel ou Google Sheets à l'aide de la fonction intégrée « Dissocier les cellules », puis utilisez « Recopier vers le bas » pour propager les valeurs dans les cellules nouvellement vides. Cela vous donne une grille rectangulaire propre que vous pouvez valider par rapport à votre source d'origine.
Trois correctifs qui fonctionnent vraiment

Sur la base des quatre causes racines ci-dessus, voici la voie de correction pratique — de la plus simple à la plus approfondie.
Si votre outil le permet, activez l'analyse de mise en page ou la détection de structure de tableau comme étape de prétraitement. Cela indique au moteur d'extraction d'identifier la grille complète — y compris les plages fusionnées — avant de lire le texte. Pour les outils qui ne proposent pas cette option, envisagez de pré-découper le document. Pour les PDF, des outils comme « Préparer le formulaire » d'Adobe Acrobat peuvent vous aider à définir manuellement les limites. Pour les images, recherchez un outil qui effectue la détection de tableau comme première étape distincte.
Ne comptez pas sur l'outil pour deviner vos colonnes. Spécifiez-les explicitement. Avec l'Extraction de colonnes personnalisées d'ImageToTable.ai, vous définissez les noms de colonnes souhaités — et l'IA associe chacun aux données correctes du document par compréhension sémantique, et non par position. Cela signifie que même si un en-tête fusionné perturbe la détection de mise en page, le mappage des colonnes reste correct car l'IA sait ce que signifie « SKU », pas seulement où il se trouve.
Après l'extraction, effectuez une validation simple dans Excel ou Google Sheets : dissociez les cellules restées fusionnées, utilisez Recopier vers le bas pour propager les valeurs, et vérifiez que votre nombre de lignes correspond au document source. Pour le traitement par lots, configurez une formule COUNTA par colonne pour signaler toute colonne contenant moins d'entrées que prévu. Si vous traitez régulièrement le même type de document, enregistrez cette validation comme modèle — elle prend 30 secondes à exécuter et détecte presque toutes les corruptions silencieuses.
Quand passer à l'étape supérieure : toutes les cellules fusionnées ne peuvent pas être corrigées automatiquement
Certains schémas de cellules fusionnées sont réellement difficiles — même pour une IA avancée. Voici quand vous devriez envisager de prétraiter le document source manuellement plutôt que d'essayer de corriger l'extraction :
- Fusions imbriquées (rowspan + colspan dans la même cellule) : Une cellule qui s'étend sur 3 lignes ET 2 colonnes crée un trou dans la grille qu'aucun outil ne remplit parfaitement. Pré-découper le document en tableaux plus simples avant l'extraction donne souvent de meilleurs résultats.
- Schémas de fusion en escalier : Les limites diagonales où la ligne 1 fusionne les colonnes A-B, la ligne 2 fusionne B-C, la ligne 3 fusionne C-D — cette structure en cascade casse presque tous les moteurs d'extraction. La solution la plus efficace est souvent d'exporter le document sous forme de tableau plat depuis l'application source avant l'extraction.
- Tableaux multi-pages avec cellules fusionnées traversant les sauts de page : Même les meilleurs outils peinent ici. Envisagez de traiter chaque page indépendamment et d'assembler les résultats manuellement.
La réponse honnête : si votre document contient des fusions imbriquées ou en escalier complexes et que vous traitez plus de 50 documents de ce type par mois, le ROI d'un changement d'outil (vers quelque chose qui gère ces schémas nativement) vaut la peine d'être calculé. Pour des documents occasionnels, le prétraitement manuel avant l'extraction est moins coûteux que de lutter contre une sortie de mauvaise qualité.
Questions fréquemment posées
L'extraction par IA gère-t-elle mieux les cellules fusionnées que l'OCR traditionnel ?
Oui — mais pas parfaitement. Les modèles d'IA vision analysent le document dans son ensemble plutôt que ligne par ligne, ils identifient donc les limites des cellules fusionnées plus précisément que l'OCR basé sur les lignes. Cependant, l'ambiguïté des étendues reste un défi pour les modèles d'IA car l'analyse par patchs peut fragmenter les cellules fusionnées entre les tuiles. Des outils comme ImageToTable.ai qui combinent l'analyse de mise en page avec la correspondance sémantique des champs gèrent les cellules fusionnées nettement mieux que l'OCR traditionnel mais ne sont pas immunisés à 100 %, surtout avec les schémas imbriqués ou en escalier.
Puis-je corriger les erreurs d'extraction de cellules fusionnées dans Excel sans retraiter ?
Oui, pour la plupart des motifs de fusion de lignes. Sélectionnez la colonne, allez dans Accueil → Fusionner et centrer → Dissocier les cellules, puis sélectionnez les cellules vides et appuyez sur Ctrl+D (Recopier vers le bas) pour propager la valeur. Pour les motifs de fusion de colonnes, utilisez Convertir ou Flash Fill. Cela fonctionne comme solution temporaire, mais pour le traitement par lots, corrigez l'extraction en amont.
Les cellules fusionnées dans les PDF sont-elles le même problème que dans Excel ?
Structurellement, oui. Mais les PDF sont plus difficiles à corriger car on ne peut pas simplement les « dissocier ». Une cellule fusionnée dans un PDF est intégrée à la mise en page, donc la correction doit se faire au moment de l'extraction plutôt qu'à la source.
Et si mon document source a des bordures qui ressemblent à des cellules fusionnées sans l'être ?
C'est courant. Des bordures de tableau faibles ou brisées peuvent donner l'impression que des cellules séparées sont fusionnées, surtout dans les scans. Essayez de prétraiter l'image pour améliorer le contraste — cela peut rendre les bordures faibles détectables. Consultez notre guide sur le prétraitement d'image pour une meilleure détection pour des techniques spécifiques.
Mon outil indique « extraction de tableau terminée » mais les données sont fausses — que s'est-il passé ?
C'est la cause racine 4. Le post-processeur a assemblé le texte détecté dans une grille, mais les cellules fusionnées ont causé des erreurs en amont qui n'ont pas été signalées. « Succès » signifiait qu'une grille rectangulaire avait été produite — pas que la grille était correcte. Validez toujours un échantillon de sortie. Pour en savoir plus sur la mise en place d'un workflow de validation, lisez notre guide complet de dépannage pour l'extraction de tableaux.
Les cellules fusionnées sont la source la plus courante d'erreurs d'extraction — mais une fois que vous comprenez quel modèle cause le problème, la solution est généralement simple.
Testez votre propre document avec un outil qui gère l'analyse de mise en page en premier. De nombreux problèmes de cellules fusionnées disparaissent lorsque le moteur d'extraction voit la grille complète avant de lire un seul mot.