Batch OCR

Un Batch OCR qui survit à un vrai dossier : Chaque fichier mis en file, suivi et livré

La plupart des outils de Batch OCR traitent un dossier comme un lot uniforme, si bien qu'un seul fichier défectueux bloque tout le traitement. Ici, chaque fichier effectue son propre passage en 5 à 10 secondes par page et conserve son propre statut : 3 échecs sur 200 ne coûtent que 3 nouvelles tentatives, rien de plus.

5-10 s par page · PDF/JPG/PNG/WebP dans une seule file · Statut par fichier · Jusqu'à 99 % de précision sur texte imprimé

Dossier entier
Formats mixtes
Statut par fichier
Sans ligne de commande

Ce qu'un traitement Batch OCR vous apporte pour chaque fichier

Batch OCR consiste à pointer un seul moteur vers un dossier entier plutôt que vers un document unique, et l'intérêt est de savoir ce qui est arrivé à chaque fichier pendant le traitement. Vous pouvez lancer un Batch OCR sur des PDF provenant d'un scanner partagé et un Batch OCR sur des images directement depuis un téléphone dans la même exécution, car la file d'attente traite tous les formats de la même manière.

Texte intégral par page
Nom de fichier et lot
Nombre de pages
Statut par fichier
Format source
Date de détection
Écriture manuscrite détectée
Tampons et signatures
Cases à cocher (cochées / entourées)
Type de document (inféré par IA)
Lot d'export (XLSX / CSV)
Colonnes nommées (facultatif)

Le statut, le texte et les métadonnées sont suivis pour chaque fichier. Si vous ne voulez que la lecture brute, vous l'obtenez. Si vous souhaitez ensuite des colonnes plutôt que le texte intégral, la même exécution peut alimenter une extraction structurée sans rien réuploader.

Le Batch OCR ressemble à une seule tâche. Un vrai dossier, c'est deux cents petites tâches.

Cherchez un Batch OCR en ligne et vous tomberez sur deux types d'outils : les suites desktop où le mode batch est caché dans un assistant, et les convertisseurs en ligne qui mettent une pile d'images en file d'attente. Les deux vantent le lancement, et le lancement est facile. Lire des caractères n'a jamais été la partie difficile de l'OCR à l'échelle d'un dossier. La partie difficile, ce sont les opérations : ce qui arrive à deux cents fichiers dans l'heure qui suit le clic sur « démarrer », comment savoir lesquels ont échoué, et où le texte atterrit à la fin du traitement. Chaque comparaison ci-dessous repose sur cette distinction.

Trois opérations qu'un traitement classique vous laisse faire

01

Il vous pose la même question 200 fois. Les outils de bureau s'arrêtent souvent pour vous demander quelque chose à chaque document. Les utilisateurs du forum de la communauté Adobe ont décrit la routine : « le processus exige encore que je confirme les paramètres de qualité pour chaque document, puis que je confirme l'enregistrement du fichier dans son état optimisé après l'OCR, ce qui reste très frustrant. » Un dossier de 200 fichiers se transforme en 200 confirmations, sauf si vous trouvez une solution de contournement.

02

Les échecs restent invisibles, vous ne savez donc pas quoi refaire. La page d'aide de Kofax Power PDF le dit clairement : « Le jaune ou le rouge signifie que l'OCR a échoué. Si un cercle jaune ou rouge apparaît à côté du nom du fichier, réessayez ou envoyez le document à notre équipe d'assistance. » Après le cercle, vous êtes livré à vous-même : le traitement ne vous dit jamais si un mauvais fax a compromis votre sortie, quels fichiers ont été affectés, ni quoi refaire.

03

Une seule machine paie pour tout le dossier, à ses propres heures. Les logiciels de Batch OCR de bureau classiques fonctionnent en séquence sur du matériel local. Lorsqu'un administrateur système a posé une question sur l'OCR d'environ 5000 fichiers PDF, l'estimation réaliste était « environ 8 à 11 heures », et le même commentateur a admis : « J'ai constaté que les lecteurs OCR plus rapides compromettaient la qualité. » Vitesse ou précision, c'est l'horloge de votre bureau qui tranche.

Ce qu'un traitement géré vous évite

01

Une seule file, aucune étape de pré-tri. Si votre tâche consiste à traiter par lots des PDF en OCR depuis un scanner partagé et que votre collègue ajoute des photos d'une visite sur site, les deux arrivent dans le même lot. PDF, JPG, PNG, WebP, et même Word ou les fichiers texte partagent un seul pipeline, sans étape de « réglages PDF » par rapport aux « réglages image » et sans traitements séparés à fusionner ensuite.

02

Un fichier défectueux coûte une reprise, pas tout le traitement. Le modèle de vision lit chaque document indépendamment et rapporte un statut par fichier : en file, en cours, terminé ou échoué. Une photo de téléphone de travers qui ressort peu lisible ne fait pas échouer le dossier ; elle se termine, elle est signalée, et vous décidez. Trois fichiers défectueux sur 200 coûtent trois reprises, et le modèle de vision lit par le sens, donc les scans propres et les fax peu lisibles n'ont jamais eu besoin de réglages de qualité séparés.

03

Le résultat a une forme connue : une ligne par fichier. Le traitement prend 5 à 10 secondes par page, et le résultat est un seul tableur : une ligne par fichier, le texte extrait dans une cellule, le nom du fichier et le statut à côté. Aucune étape de script pour rassembler 200 fichiers .txt éparpillés, et aucun bloc anonyme où vous ne pouvez pas dire quels mots viennent de quel document. Quand un traitement se termine, vous savez exactement ce que vous avez et quelles lignes méritent un second regard.

Le fil conducteur de ces six cartes : lancer le traitement n'a jamais été le problème. Ce qui décide si l'OCR à l'échelle d'un dossier fonctionne, c'est la façon dont chaque fichier est traité après son entrée dans la file — aucune interrogation fichier par fichier, des échecs qui s'identifient d'eux-mêmes, et un texte qui atterrit dans un endroit vérifiable. La section suivante suit un vrai traitement, du téléversement à l'export, pour vous montrer ces trois points dans l'ordre.

D'un arriéré de 200 fichiers à un texte triable, sans terminal

Si vous traitez un arriéré de numérisation, voici à quoi ressemble réellement un traitement par lot, du début à l'exportation.

1

Déposez le dossier, sans tri

Votre arriéré compte 200 fichiers : 140 numérisations propres du MFP du bureau, 40 photos de formulaires papier prises au téléphone, 15 PDF nés numériques et 5 relevés chiffrés. Glissez-les ensemble. PDF, JPG, PNG et WebP vont dans la même file d'attente, les PDF protégés par mot de passe se déverrouillent avec le mot de passe que vous fournissez, et rien ne vous demande de confirmer les paramètres fichier par fichier.

2

Regardez la file avancer

À raison de 5 à 10 secondes par page, un dossier de 200 pages se termine en 17 à 33 minutes environ ; saisir le même contenu à la main à ~3 minutes par page représente environ 10 heures. Le statut de chaque fichier est mis à jour au fur et à mesure, donc dès qu'un fax revient trop léger, vous le voyez signalé pendant que les fichiers restants continuent, au lieu d'un indicateur de progression qui masque tout derrière une seule barre.

3

Exportez une fois, refaites-en trois

Exportez le lot en un seul XLSX : 200 lignes, une par fichier, texte extrait dans une cellule, statut à côté. Triez par statut, repérez les 3 échecs, réimportez uniquement ceux-là et relancez-les seuls. Si l'étape suivante exige des champs structurés plutôt que le texte complet, le même dossier peut alimenter l'extraction de données par lot ou le lot document vers Excel avec des colonnes nommées, sans rien importer deux fois.

Où cette exécution s'inscrit, et où un outil en ligne de commande convient mieux

Batch OCR signifie ici lire un dossier et fournir le texte. Savoir ce qu'il ne fait pas vous évite de choisir le mauvais type d'outil pour la tâche.

Où c'est le plus efficace

Dossiers mixtes de papier imprimé et manuscrit. Numérisations, photos et PDF déjà numériques passent dans une seule file avec une précision allant jusqu'à 99 % sur le texte imprimé, tandis que l'écriture manuscrite et les cases à cocher sont lues en une seule passe.

Extraire le texte pour la recherche, le tri et la réutilisation. Le livrable est un texte exploitable : le texte intégral de chaque fichier dans un tableur, ou des colonnes nommées lorsque vous voulez de la structure plutôt que de la prose.

Fonctionne depuis n'importe quelle machine, sans installation. Entièrement basé sur le navigateur, sans serveur de licence ni réglages par fichier. Un arriéré ponctuel peut ainsi être traité depuis un ordinateur portable en un après-midi.

Où être prudent

Ce n'est pas un générateur de PDF consultables. Le texte sort dans des cellules de tableur et des documents, pas en tant que couche de texte invisible à l'intérieur de vos fichiers PDF d'origine. La conversion en PDF consultables de qualité archivistique pour des milliers de fichiers est une tâche différente, mieux servie par un outil en ligne de commande de la famille OCRmyPDF.

Pas de dossier surveillé, les lots sont lancés manuellement. Un lot contient environ 30 fichiers ; une archive de plusieurs milliers de fichiers implique donc une série de téléversements que vous démarrez vous-même. Les pipelines automatisés (dossiers actifs, tâches planifiées) relèvent d'une autre catégorie d'outils.

Les sources fortement dégradées restent difficiles. Les télécopies floues, les numérisations en dessous de 200 DPI et les reçus thermiques restent le goulot d'étranglement de la précision pour tous les moteurs ; prévoyez de consacrer du temps de relecture aux pires fichiers, sans pouvoir l'éliminer. Et si un fichier contient déjà un texte sélectionnable, le relancer en OCR est un effort perdu : sautez ces fichiers et traitez uniquement ceux basés sur des images.

Questions fréquentes

Dois-je trier mon dossier avant de lancer un Batch OCR, par exemple les PDF dans un lot et les photos de téléphone dans un autre ?

Aucun tri n'est nécessaire. Un seul lot accepte les PDF, JPG, PNG et WebP ensemble, y compris les PDF protégés par mot de passe. Le modèle de vision lit chaque fichier de la même manière : il examine les pixels et lit le contenu, donc un PDF natif, un scan à 300 DPI et une photo de téléphone de travers passent tous par une seule file d'attente, sans pipelines de format ni réglages par fichier. Le format source est enregistré sur chaque ligne de la sortie si vous souhaitez filtrer par la suite.

Que se passe-t-il si 3 fichiers sur 200 échouent pendant un Batch OCR ?

Les 197 autres continuent de s'exécuter et rien ne s'arrête. Chaque fichier est traité indépendamment, et son statut est suivi par fichier dans la vue du lot : en file, en cours, terminé ou échoué. Les 3 fichiers échoués restent marqués, vous pouvez donc ouvrir uniquement ceux-là, voir lesquels sont revenus illisibles, les corriger ou les re-téléverser séparément, et relancer uniquement ces fichiers au lieu de tout le dossier. Un échec vous coûte une nouvelle tentative d'un seul fichier, pas du lot entier.

Chaque fichier a-t-il sa propre sortie, ou l'ensemble du traitement fusionne-t-il en un seul fichier ?

Un seul tableur, avec une ligne par fichier. Exportez le lot et vous obtenez un seul XLSX ou CSV où chaque document occupe une ligne : son nom de fichier, son nombre de pages, son statut par fichier et le texte extrait dans une cellule. Vous ne recevez jamais 200 fichiers .txt éparpillés à fusionner à la main, ni un bloc de texte anonyme où vous ne pouvez pas distinguer quels mots proviennent de quel document. Les décisions de tri, de filtrage et d'archivage se prennent dans le tableur.

Le Batch OCR me donnera-t-il des PDF consultables ?

Non, et il vaut mieux être direct à ce sujet. Cet outil lit vos documents et restitue le texte sous forme de données : dans des cellules de tableur, dans des colonnes structurées ou dans un fichier Word modifiable. Il n'écrit pas de couche de texte invisible dans vos fichiers PDF d'origine. Si votre objectif est d'obtenir des PDF consultables de qualité archive sur des milliers de fichiers, un outil en ligne de commande de la famille OCRmyPDF est la solution adaptée. Si votre objectif est d'extraire le texte pour le rechercher, le trier ou le modifier ailleurs, c'est la voie la plus légère.

Combien de fichiers peuvent tenir dans un Batch OCR, et qu'en est-il d'un dossier contenant des milliers de fichiers ?

Un lot accepte environ 30 fichiers à la fois, chacun jusqu'à 10 Mo. Les dossiers plus volumineux se traitent par vagues : téléversez 30 fichiers, exportez, téléversez les 30 suivants, et chaque vague produit son propre tableur. Il n'y a pas d'automatisation de dossier surveillé, donc une archive de 5 000 fichiers se traite par une série d'exécutions délibérées plutôt que par une seule tâche sans surveillance, ce qui vous permet aussi de corriger le tir entre les vagues au lieu de découvrir les problèmes après la neuvième heure.

📮 contact email: [email protected]