Comment fonctionne le traitement de documents par lot ?
De l'upload au fichier Excel fusionné
Imaginez le traitement de documents par lot comme le tri du courrier dans un bureau de poste. Le tri un par un consiste à ouvrir chaque enveloppe, lire l'adresse et l'acheminer à la main. Le tri par lot consiste à déverser tout le sac dans une machine qui lit toutes les adresses simultanément et les trie dans les bonnes cases en une seule passe. C'est ce qui se passe lorsque vous uploadez 50 factures d'un coup : l'IA lit chacune d'elles, extrait les données et fusionne le tout dans un seul tableau.
Points clés à retenir
- Traiter 50 documents un par un prend 150 minutes, et l'extraction elle-même ne représente que 20 de ces minutes. Le reste consiste à ouvrir les fichiers individuellement, à copier-coller les résultats dans une feuille maîtresse et à réaligner les colonnes entre les sorties distinctes.
- Le vrai goulot d'étranglement n'a jamais été la vitesse d'extraction. C'était le travail d'assemblage invisible après l'extraction. Chaque feuille de calcul fusionnée manuellement comporte des désalignements de colonnes et des erreurs de collage qui s'accumulent à chaque fichier combiné.
- Le traitement par lot fusionne automatiquement tout dans une seule feuille de calcul : chaque document devient une ligne, chaque champ une colonne, et la couche d'assemblage post-extraction disparaît tout simplement.
Ce que fait réellement le traitement par lots
Le point clé qui distingue le traitement par lots n'est pas la vitesse, mais l'architecture. Lorsque vous traitez des documents un par un, le système suit un parcours linéaire : téléverser un fichier, attendre qu'il soit terminé, télécharger le résultat, téléverser le suivant. Chaque document attend celui qui le précède. Avec le traitement par lots, le système ouvre plusieurs voies à la fois. Les 50 fichiers sont téléversés ensemble. Ils sont analysés en parallèle. Et le résultat arrive sous forme d'un résultat unifié, et non de 50 feuilles de calcul séparées à assembler manuellement.
Cette différence compte car les documents ne prennent pas tous le même temps. Une facture PDF d'une page peut être traitée en 8 secondes. Un contrat scanné de 30 pages avec écriture manuscrite peut prendre 25 secondes. Dans un flux de travail un par un, chaque document attend derrière le plus lent qui le précède. Dans un flux de travail par lots, un système de file d'attente à trois niveaux gère cela : téléversement (tous les fichiers arrivent simultanément), file d'attente (les fichiers sont dispatchés vers les créneaux de traitement disponibles aussi vite que les ressources le permettent, afin que les documents rapides se terminent et libèrent des créneaux pour les suivants), et fusion (chaque résultat terminé est collecté et assemblé dans un tableau unique). Un document lent en position 12 ne bloque pas la position 13 qui peut se terminer en premier.
C'est du côté de la sortie que le traitement par lots porte bien son nom. Au lieu de recevoir des fichiers Excel séparés, un par document, vous obtenez une feuille de calcul unique où chaque ligne correspond aux données extraites d'un document, et chaque colonne à un champ demandé. Téléversez 40 bons de commande, spécifiez des colonnes comme « Numéro de PO », « Fournisseur », « Total de ligne » et « Date de livraison », et la sortie est un tableau de 40 lignes, une ligne par bon de commande, tous les champs alignés sur les colonnes. Pas de copier-coller entre fichiers. Pas de fusion manuelle.
Étape par étape : ce qui se passe pendant un lot
Voici ce qui se passe entre le moment où vous glissez 30 fichiers dans la zone de téléversement et celui où vous téléchargez une feuille de calcul fusionnée.
Tous les fichiers sélectionnés sont téléversés en une fois. Le système enregistre chaque fichier, en notant son type (PDF, JPG, PNG), sa taille et son nombre de pages, puis le place dans une file de traitement. Un PDF de 200 pages est divisé en images de pages individuelles avant la mise en file, afin que la page 1 puisse être traitée pendant que la page 50 est encore en cours de téléversement. Cette analyse pré-file est ce qui permet au système d'allouer les ressources intelligemment plutôt que de traiter un document géant qui priverait les plus petits.
C'est ici que l'avantage du lot devient réel. Au lieu d'un fichier à la fois, plusieurs documents sont traités simultanément, chacun étant assigné à un créneau de traitement disponible. L'IA lit chaque document en comprenant ce qu'il dit, et non où se trouvent les champs. Si vous demandez « Numéro de facture » et « Total », l'IA trouve ces champs par leur sens, qu'ils apparaissent en haut d'un PDF d'un fournisseur ou intégrés dans un tableau d'un autre. Une différence clé avec les outils plus anciens : comme l'extraction est sans modèle, le système n'a pas besoin de configuration par fichier. La même logique d'extraction fonctionne sur chaque document du lot sans configuration par document.
Dès qu'un document est terminé, ses données extraites sont collectées. Même si les documents se terminent dans un ordre différent (le reçu d'une page, rapide, se termine avant le contrat de 30 pages), l'étape de fusion remet tout dans le bon ordre. Les résultats sont assemblés ligne par ligne : chaque document devient une ligne, et chaque champ de données devient une colonne. Si vous avez nommé trois colonnes, chaque ligne contient ces trois colonnes renseignées, ou laissées vides si un document particulier ne contient réellement pas ce champ.
Le résultat fusionné est écrit dans un seul fichier Excel (XLSX), une feuille de calcul par lot, les données de chaque document étant alignées dans les mêmes colonnes. Vous pouvez également exporter en CSV ou en JSON. La sortie est suffisamment propre pour être importée directement dans votre logiciel de comptabilité ou votre ERP, sans reformatage. Si vous utilisez le module complémentaire Google Sheets, les données fusionnées arrivent directement dans votre feuille de calcul, sans étape de téléchargement ni d'importation.
L'ancienne méthode vs la méthode par lots
La différence entre le traitement des documents un par un et le traitement par lots ne réside pas seulement dans la vitesse ; elle réside aussi dans le type de travail que vous effectuez entre les téléversements. Voici comment les deux approches se comparent selon les dimensions qui comptent réellement lorsque vous travaillez avec de vrais documents.
| Dimension | Un par un | Traitement par lots |
|---|---|---|
| Téléversement | Choisir un fichier, téléverser, attendre le résultat, répéter × N | Sélectionner les N fichiers une seule fois ; téléversés simultanément |
| Simultanéité | Un seul emplacement de traitement ; chaque fichier attend que le précédent soit terminé | Plusieurs emplacements parallèles ; les fichiers rapides se terminent et libèrent des emplacements pour les suivants |
| Variation de format | Configurations différentes par fichier si les formats des fournisseurs diffèrent (outils à modèle) | Une seule définition de colonne s'applique à tous les fichiers, indépendant du format |
| Sortie | N fichiers séparés ; doivent être fusionnés manuellement en un seul | Un seul fichier fusionné : chaque document est une ligne, chaque champ est une colonne |
| Cohérence | Risque de dérive des champs entre les exécutions individuelles | La même logique d'extraction est appliquée uniformément à tous les documents |
La ligne de variation de format mérite une attention particulière. Avec les outils OCR traditionnels qui reposent sur des modèles, le traitement par lots n'est aussi performant que la couverture de vos modèles. Si le fournisseur 7 utilise une mise en page de facture différente de celle des fournisseurs 1 à 6, vous devez soit créer un nouveau modèle pour le fournisseur 7, soit accepter que le lot manque certains champs. Avec l'IA qui extrait par sens plutôt que par position, une seule définition de colonne (« Numéro de facture », « Date », « Total ») fonctionne avec toutes les mises en page des fournisseurs, car l'IA comprend que « Our Ref: » sur une facture et « Facture n° » sur une autre renvoient tous deux à la même chose. C'est ce qui rend l'extraction basée sur l'IA fondamentalement mieux adaptée aux flux de travail par lots que les anciennes approches basées sur des modèles.
Pourquoi le traitement par lots est important
Le gain de temps est l'avantage évident, mais ce n'est pas le plus important. Trois conséquences moins évidentes rendent le traitement par lots transformateur pour les flux de travail réels.
Cohérence entre documents. Lorsque vous traitez les documents un par un, chaque opération est une extraction indépendante. Si vous modifiez un nom de colonne entre le fichier 3 et le fichier 4, par exemple en changeant « Montant » en « Total de la facture », vous obtenez alors deux schémas de colonnes différents dans vos résultats. Le traitement par lots applique la même logique d'extraction à chaque fichier en une seule opération, garantissant une cohérence au niveau des colonnes. Chaque ligne comporte les mêmes colonnes dans le même ordre, remplies selon les mêmes règles d'extraction. Cela importe énormément lorsque vous préparez des données pour un rapprochement de fin de mois ou un audit, car des colonnes incohérentes sont la première chose qui casse une importation en aval.
La sortie fusionnée élimine le vrai goulot d'étranglement. La plupart des gens pensent que le goulot d'étranglement dans la saisie de données de documents est l'extraction elle-même. Ce n'est pas le cas. Le vrai goulot d'étranglement est ce qui se passe après l'extraction : ouvrir des fichiers séparés, copier les données dans un tableur principal, aligner les colonnes, vérifier les erreurs introduites lors du copier-coller. Le traitement par lots élimine toute cette couche post-extraction, car la sortie est le tableur principal. Aucun assemblage requis.
Le temps ne s'échelonne pas linéairement. Si un document prend 10 secondes à traiter, 50 documents ne prennent pas 500 secondes. Ils peuvent prendre 90 secondes. L'architecture de traitement concurrente signifie que la plupart des documents se terminent en parallèle, pas séquentiellement. Le temps total du lot est dominé par le document le plus lent du lot, pas par la somme de tous les temps de traitement. Pour une équipe qui traite 200 factures par mois, c'est la différence entre une tâche de 30 minutes et une tâche qui se termine pendant que vous allez chercher un café.
Ce qu’il faut savoir avant votre premier lot
Le traitement par lots est simple, mais quelques conseils pratiques font la différence entre un premier essai fluide et une expérience frustrante.
Le nombre et la taille des fichiers comptent ensemble. Le nombre de fichiers importe moins que la répartition des tailles de fichiers. Un lot de 100 PDF d’une page se traite différemment d’un lot contenant 10 PDF d’une page et un PDF de 200 pages. Ce fichier volumineux peut dominer le temps total du lot, car l’étape de fusion ne peut pas se terminer complètement tant que chaque fichier, même le plus lent, n’est pas terminé. Si vous avez un mélange de tailles, envisagez de regrouper par nombre approximatif de pages pour garder un temps de traitement prévisible.
Un long document arrive sous forme de nombreuses pages distinctes. Les grands PDF sont divisés en images de pages avant la mise en file d’attente, donc un relevé de 200 pages est traité comme 200 unités individuelles et apparaîtrait comme 200 lignes dans la feuille de calcul fusionnée. Activez la fusion multipage dans les paramètres de votre modèle, indiquez comment les pages sont liées (une valeur changeante, un numéro de référence partagé ou une taille de groupe fixe), et les pages du même document se regroupent automatiquement en une seule ligne, avec des champs récurrents comme le numéro de compte reportés sur chaque ligne. Pour un long relevé, c’est la différence entre un enregistrement rapproché et 200 fragments à assembler à la main. Notre guide sur l’extraction de PDF multipages explique comment l’IA lit à travers les sauts de page.
Les noms de colonnes sont votre interface avec l’IA. Les noms que vous choisissez pour vos colonnes sont les instructions que l’IA suit. « Total » convient pour la plupart des factures, mais si vous extrayez des bons de commande qui comportent à la fois un total de ligne et un total de commande, vous voudrez « Total de commande » et « Total de ligne » comme colonnes distinctes pour éviter toute ambiguïté. L’IA ne peut pas lire dans vos pensées, mais elle peut lire des noms de colonnes précis. Si vous souhaitez que l’IA effectue des calculs pendant l’extraction, comme calculer les totaux de ligne à partir de la quantité et du prix unitaire, vous pouvez utiliser des colonnes calculées pour obtenir des réponses, pas seulement des données brutes.
Les formats mixtes sont acceptés. Un lot peut contenir des PDF, des JPG, des PNG et des captures d’écran mélangés. Comme l’IA lit en comprenant le contenu plutôt qu’en analysant une mise en page fixe, la variété des formats ne casse rien. Une photo de reçu prise avec un téléphone et un PDF numérique net d’une facture provenant du système ERP d’un fournisseur produisent tous deux la même sortie structurée, dans le même lot, dans la même feuille de calcul fusionnée.
Si un champ manque réellement dans un document, la cellule reste vide. Tous les documents ne contiennent pas tous les champs demandés. Une facture sans numéro de bon de commande affichera simplement une cellule vide dans la colonne Numéro de bon de commande pour cette ligne, et le lot ne s’arrête pas et ne génère pas d’erreur. C’est voulu : l’IA extrait ce qui existe et laisse des blancs là où il n’y en a pas, afin que vous puissiez examiner la feuille de calcul et décider si une cellule vide est attendue ou nécessite un suivi.
Vérifier un grand lot ne nécessite pas de rouvrir chaque original. La feuille de calcul fusionnée n’est que la moitié du travail ; vous voulez aussi savoir que l’IA a lu chaque valeur correctement. Au lieu de faire des allers-retours entre les lignes et un dossier de fichiers sources, vous pouvez activer le mode de révision et cliquer sur n’importe quelle cellule extraite pour voir exactement d’où vient cette valeur, mise en évidence sur le document original. Activez l’auto-annotation avant le traitement et cette vérification visuelle est déjà générée et prête lorsque chaque document se termine. Pour un grand lot, cela transforme « relire chaque document » en « cliquer sur les cellules dont vous n’êtes pas sûr ». Si vous mettez en place une routine de contrôle par échantillonnage autour des résultats du lot, notre guide sur comment vérifier les résultats d’extraction présente une méthode d’échantillonnage qui s’y associe bien.
Questions fréquemment posées
Combien de documents puis-je traiter par lot en une seule fois ?
Cela dépend de l'outil, mais un système de traitement par lots bien conçu gère confortablement 50 à 100 documents en une seule exécution. La limite réelle n'est généralement pas le moteur de traitement, mais la contrainte pratique de la vérification des résultats ensuite : parcourir 200 lignes pour contrôler la précision est plus efficace que de faire défiler 500. Commencez par des lots plus petits (10 à 20) pour vous familiariser avec la précision avant de passer à l'échelle supérieure.
Le traitement par lots fonctionne-t-il avec les documents manuscrits ?
Oui. L'IA moderne lit les documents en comprenant la scène visuelle plutôt qu'en faisant correspondre des caractères imprimés, la écriture manuscrite n'est donc qu'un autre motif visuel. Une écriture manuscrite propre est extraite avec une précision comparable à celle du texte imprimé. Une cursive très illisible (le genre que même une personne aurait du mal à déchiffrer) aura une précision moindre. Si votre lot contient un mélange de documents imprimés et manuscrits, ils sont tous traités dans le même lot, sans configuration particulière nécessaire pour les documents manuscrits.
Que se passe-t-il si un fichier du lot échoue ?
Un système de traitement par lots bien conçu ne laisse pas un fichier en échec compromettre tout le lot. Les fichiers traités avec succès produisent leurs résultats. Les fichiers qui rencontrent une erreur (un PDF corrompu, une image illisible, un type de fichier non pris en charge) sont signalés avec un statut d'erreur pendant que le reste du lot continue. Vous pouvez réessayer individuellement les fichiers en échec sans avoir à relancer tout le lot.
Puis-je traiter par lot des documents provenant de différentes sources (PDF, photos, captures d'écran) dans la même exécution ?
Oui. Un seul lot peut contenir des PDF, des photos JPG, des captures d'écran PNG et des images WebP, le tout mélangé. L'IA lit chaque fichier indépendamment en fonction de son contenu visuel, de sorte que la variété des formats n'affecte pas l'extraction. C'est particulièrement utile pour les flux de travail concrets comme la note de frais, où vous pourriez avoir des factures PDF de fournisseurs, des photos de reçus papier et des captures d'écran de confirmations de paiement numériques, le tout intégré dans le même rapport mensuel.
En quoi le traitement par lots diffère-t-il du simple téléchargement de fichiers un par un ?
Télécharger un fichier à la fois vous donne un résultat à la fois, ce qui signifie des sorties séparées que vous devez combiner manuellement. Le système les traite séquentiellement, donc chaque fichier attend que le précédent soit terminé. Le traitement par lots télécharge tous les fichiers ensemble, les traite en parallèle et les fusionne en une seule sortie. La différence de sortie à elle seule, une feuille de calcul fusionnée contre N fichiers séparés, change tout le flux de travail post-traitement.
Le traitement par lots coûte-t-il plus cher que le traitement individuel des fichiers ?
Dans la plupart des outils, le traitement par lots utilise la même tarification par fichier ou la même consommation de Credits que le traitement individuel, donc il n'y a pas de supplément pour le traitement par lots. Le coût par fichier est le même ; les économies de temps proviennent du traitement en parallèle et de la sortie fusionnée. Certains outils offrent des remises sur volume ou des niveaux de tarification dédiés au traitement par lots. Consultez la page de tarification de votre outil spécifique pour confirmer.
Puis-je appliquer des règles ou des calculs pendant le traitement par lots ?
Oui. Si votre outil prend en charge les colonnes calculées ou inférées, vous pouvez intégrer la logique de calcul directement dans vos définitions de colonnes et elle s'exécutera pendant l'extraction par lots. Par exemple, une colonne nommée « Line Total (Qty × Unit Price) » calculera les valeurs à la volée pour chaque document du lot, donc la sortie fusionnée inclut des résultats calculés, pas seulement des nombres extraits bruts. Cela signifie qu'une seule exécution par lots peut gérer l'extraction, le calcul et la classification en une seule passe.
D'un à la fois à tout en même temps
Le traitement par lots n'est pas une version plus rapide du traitement un à la fois. C'est une architecture différente, qui traite une collection de documents comme une seule tâche, les traite en parallèle et fournit un résultat unifié. La différence se manifeste à trois endroits : le temps que vous passez à attendre (la plupart des documents se terminent en parallèle, pas séquentiellement), le travail que vous n'effectuez pas après l'extraction (pas de fusion manuelle, pas de copier-coller entre les fichiers), et la cohérence que vous obtenez sur chaque ligne (mêmes colonnes, mêmes règles, une seule exécution).
Ce qui rend cette architecture pratique aujourd'hui, alors qu'il y a cinq ans elle était fragile ou impossible, c'est le passage de l'extraction basée sur des modèles à l'extraction basée sur le sens. Lorsque l'extraction dépend de modèles par document, le traitement par lots n'est aussi rapide que la configuration de vos modèles. Lorsque l'extraction fonctionne en comprenant ce que chaque champ signifie indépendamment de la mise en page, la même définition de colonne s'applique à chaque fichier du lot sans configuration par document. C'est l'élément qui transforme le traitement par lots de « plus rapide si tous vos documents se ressemblent » à « fonctionne sur n'importe quel mélange de documents que vous recevez réellement ».
Si vous souhaitez approfondir la façon dont l'IA comprend le contenu des documents, y compris le processus SEE → UNDERSTAND → FETCH qui rend possible l'extraction par lots sans modèle, lisez comment l'IA lit vos documents. Et si vous cherchez des instructions étape par étape spécifiques pour le traitement par lots de factures, notre guide sur comment extraire par lots des données de factures vers Excel présente un exemple complet.
Essayez le traitement par lots sur vos propres documents. Téléchargez 10 factures, nommez trois colonnes, et regardez-les toutes fusionner en une seule feuille de calcul, sans modèles, sans configuration par fichier, et sans assemblage manuel ensuite.