実際のフォルダに耐えるバッチOCR:すべてのファイルをキューに入れ、追跡し、納品する
ほとんどのバッチOCRツールはフォルダを1つの均一なジョブとして扱うため、1つの不良ファイルで実行が止まります。ここでは各ファイルが1ページ5〜10秒で個別に処理され、それぞれ独自のステータスを保持するため、200件中3件の失敗は3件のやり直しだけで済みます。
1ページ5〜10秒・PDF/JPG/PNG/WebPを1つのキューに・ファイルごとのステータス・印刷テキストで最大99%の精度
バッチOCR実行で各ファイルに得られる成果
バッチOCRとは、1つのドキュメントではなくフォルダ全体に1つのエンジンを向けることであり、重要なのは実行中に各ファイルで何が起こったかを把握できることです。共有スキャナから取り込んだPDFのバッチOCRと、スマートフォンで撮影した画像のバッチOCRを同じ実行で行えます。キューがすべての形式を同じように扱うためです。
ステータス、テキスト、メタデータはファイルごとに追跡されます。生の読み取り結果だけが必要なら、そのまま取得できます。後で全文の代わりに列が必要になった場合も、同じ実行で構造化抽出に利用できるため、再アップロードは不要です。
バッチOCRは1つのジョブに見える。実際のフォルダは200の小さなジョブだ。
バッチOCRを検索すると、2つのタイプのツールにたどり着く。バッチモードがウィザードの中に隠れているデスクトップスイートと、画像のスタックをキューに入れるオンラインコンバーターだ。どちらも開始を売りにしており、開始自体は簡単だ。文字の読み取りは、フォルダ規模のOCRで難しい部分では決してなかった。難しいのは運用面だ。開始をクリックしてから1時間の間に200のファイルに何が起こるか、どの3つが失敗したかをどう知るか、実行終了時にテキストがどこに出力されるか。以下のすべての比較は、その1つの違いに基づいている。
従来の実行があなたに委ねる3つの操作
同じ質問を200回繰り返す。 デスクトップツールは、ドキュメントごとに何かを尋ねて停止することがよくあります。Adobeコミュニティフォーラムのユーザーは、その手順を次のように説明しています:「このプロセスでは、各ドキュメントの品質設定を順番に確認し、OCR後に最適化された状態でファイルを保存することを確認する必要があり、これらはすべて依然として煩わしいものです。」200ファイルのフォルダは、回避策を見つけない限り、200回の確認になります。
失敗は見えないため、何をやり直すべきかわからない。 Kofax Power PDFヘルプページには、次のように明確に記載されています:「黄色または赤はOCRが失敗したことを意味します。ファイル名の横に黄色または赤の円が表示された場合は、再試行するか、ドキュメントをサポートチームに送信してください。」円が表示された後は、自己責任です。実行によって、不良ファックスが出力を汚染したかどうか、どのファイルが影響を受けたか、何をやり直すべきかが通知されることはありません。
1台のマシンがフォルダ全体を自らの時間で処理する。 従来のデスクトップバッチOCRソフトウェアは、ローカルハードウェア上で順次実行されます。システム管理者が約5000のPDFファイルのOCRについて尋ねたところ、現実的な見積もりは「約8〜11時間」であり、同じコメンテーターは「高速なOCRリーダーは品質を犠牲にしていることがわかった」と認めました。速度か精度か、机の上の時計がそれを決定します。
マネージド実行で手間が省けること
1つのキュー、事前仕分け不要。 共有スキャナの保存先からPDFのバッチOCRが仕事で、同僚が現場訪問の写真を追加する場合も、両方とも同じバッチに入ります。PDF、JPG、PNG、WebP、さらにはWordやテキストファイルも1つのパイプラインで処理され、「PDF設定」と「画像設定」を分ける手順も、後でマージするための別々の実行も不要です。
悪いファイルは1回のやり直しで済み、実行全体が台無しになることはありません。 ビジョンモデルは各ドキュメントを個別に読み取り、ファイルごとのステータス(待機中、処理中、完了、失敗)を報告します。傾いたスマホ写真で文字が薄く返ってきても、フォルダ全体が失敗することはありません。処理は完了し、フラグが付けられ、判断はあなたに委ねられます。200件中3件の不良ファイルなら、やり直しは3回だけです。ビジョンモデルは意味で読み取るため、きれいなスキャンと見づらいFAXで最初から品質設定を分ける必要はありません。
出力形式は明確:ファイルごとに1行。 処理は1ページあたり5〜10秒かかり、結果は1つのスプレッドシートになります。ファイルごとに1行、抽出されたテキストはセル内に、ファイル名とステータスはその隣に表示されます。散在する200個の.txtファイルを収集するスクリプト手順も、どの言葉がどのドキュメント由来か分からない匿名の塊もありません。1回の実行が終われば、何が得られたか、どの行を再確認すべきかが正確に分かります。
6つのカードすべてに通じるテーマ:実行の開始は決して問題ではなかった。フォルダ規模のOCRが機能するかどうかを決めるのは、各ファイルがキューに入った後にどう扱われるかだ。ファイルごとの確認なし、失敗が自らを名乗ること、そして確認できる場所にテキストが出力されること。次のセクションでは、アップロードからエクスポートまでの実際の実行を順に追って、この3つすべてを確認できる。
200ファイルのバックログを、ターミナルなしで並べ替え可能なテキストに
スキャンのバックログを解消する場合、1回のバッチ実行が開始からエクスポートまでどのように進むかをご紹介します。
未整理のままフォルダーをドロップ
バックログは200ファイル: オフィスの複合機からのクリーンなスキャン140件、紙のフォームのスマホ写真40件、デジタル生成のPDF 15件、暗号化された明細書5件です。これらをまとめてドラッグします。PDF、JPG、PNG、WebPは同じキューに入り、パスワード保護されたPDFは指定したパスワードでロックが解除され、ファイルごとに設定を確認するよう求められることはありません。
キューが進むのを確認
1ページあたり5〜10秒なので、200ページのフォルダーは約17〜33分で完了します。同じ内容を手入力すると1ページあたり約3分で、合計約10時間かかります。ファイルごとにステータスが更新されるため、FAXが薄く返ってきた瞬間にそれがフラグ表示され、残りのファイルは処理が継続され、1つのプログレスバーの背後にすべてが隠れてしまうスピナー状態にはなりません。
一度エクスポート、3件を再実行
バッチを1つのXLSXとしてエクスポート: 200行、ファイルごとに1行、抽出されたテキストがセルに入り、ステータスが隣に表示されます。ステータスで並べ替え、3件の失敗を確認し、それらのみを再アップロードして単独で再実行します。次のステップが全文ではなく構造化フィールドである場合、同じフォルダーをバッチデータ抽出またはバッチドキュメントからExcelへに渡して、名前付き列で処理でき、2回アップロードする必要はありません。
この実行が適している場面と、コマンドラインツールがより適している場面
ここでのバッチOCRは、フォルダを読み取ってテキストを提供することを意味します。何ができないかを知ることで、作業に合わないツールを選ぶことを防げます。
最適な用途
印刷物と手書きの紙が混在するフォルダ。 スキャン、写真、および元からデジタルのPDFを1つのキューで処理し、印刷テキストは最大99%の精度で、手書きとチェックボックスも同じパスで読み取ります。
検索、並べ替え、再利用のためのテキスト抽出。 成果物はすぐに使えるテキストです。ファイルごとの全文をスプレッドシートに出力するか、散文ではなく構造化が必要な場合は名前付きの列として出力します。
どのマシンからでも実行可能、インストール不要。 ブラウザベースで、ライセンスサーバーもファイルごとの設定も不要なため、一度きりのバックログもラップトップで午後には片付けられます。
注意が必要な用途
検索可能なPDF作成ツールではありません。 テキストはスプレッドシートのセルやドキュメントとして出力され、元のPDFファイル内に不可視のテキストレイヤーとして埋め込まれるわけではありません。数千ファイルにわたるアーカイブ用の検索可能PDF変換は別の作業であり、OCRMYPDF系のコマンドラインツールの方が適しています。
フォルダ監視はなく、バッチは手動です。 1回のバッチで約30ファイルを処理するため、数千ファイルのアーカイブは、ご自身で開始するアップロードの連続になります。自動化ファーストのパイプライン(ホットフォルダ、スケジュールジョブ)は、別のカテゴリのツールです。
著しく劣化したソースは依然として困難です。 ぼやけたファックス、200 DPI未満のスキャン、サーマルレシートは、どのエンジンにとっても精度のボトルネックであり続けます。最悪のファイルにはレビュー時間を費やすことを想定し、それを排除することは想定しないでください。また、ファイルにすでに選択可能なテキストがある場合、再度OCRを実行するのは無駄な作業なので、それらはスキップして画像ベースのものだけをバッチ処理してください。
よくある質問
バッチOCRを実行する前にファイルを分類する必要がありますか?たとえばPDFを1つのバッチ、スマホ写真を別のバッチにするなど?
分類は不要です。1つのバッチにPDF、JPG、PNG、WebPファイルをまとめて入れることができ、パスワード保護されたPDFも対応しています。ビジョンモデルはすべてのファイルを同じ方法で読み取ります。ピクセルを見て内容を読み取るため、ネイティブPDF、300 DPIのスキャン、傾いたスマホ写真もすべて1つのキューを通ります。フォーマット用パイプラインやファイルごとの設定は不要です。出力の各行にソースフォーマットが記録されるため、後でフィルタリングしたい場合に便利です。
バッチOCR実行中に200ファイル中3ファイルが失敗した場合はどうなりますか?
残りの197ファイルは実行を続け、処理が停止することはありません。各ファイルは独立して処理され、状態はバッチビューでファイルごとに追跡されます:待機中、処理中、完了、失敗。失敗した3ファイルはマークされたままになるため、そのファイルだけを開いて、どのファイルが文字化けしたかを確認し、修正または再アップロードして、フォルダ全体ではなくそのファイルだけを再実行できます。失敗によるコストは1ファイルのやり直しだけで、バッチ全体には及びません。
各ファイルに個別の出力が生成されますか、それとも実行全体が1つのファイルにマージされますか?
1つのスプレッドシートに、ファイルごとに1行が生成されます。バッチをエクスポートすると、各ドキュメントが1行になった単一のXLSXまたはCSVが得られます。ファイル名、ページ数、ファイルごとのステータス、抽出されたテキストがセルに含まれます。手動でマージする必要がある200個の散らばった.txtファイルが届くことも、どのドキュメントからの単語かを判別できない匿名のテキストブロックが届くこともありません。並べ替え、フィルタリング、アーカイブの決定はスプレッドシート上で行います。
バッチOCRで検索可能なPDFを作成できますか?
いいえ、それについては率直に述べておく価値があります。このツールはドキュメントを読み取り、テキストをデータとして返します。スプレッドシートのセル、構造化された列、または編集可能なWordファイルとして返します。元のPDFファイルに不可視のテキストレイヤーを書き戻すことはしません。何千ものファイルにわたるアーカイブ品質の検索可能なPDFが目的の場合、OCRmyPDFファミリーのコマンドラインツールがその作業に適しています。テキストを取り出して、他の場所で検索、並べ替え、編集したい場合は、こちらがより軽量な選択肢です。
1回のバッチOCR実行に何ファイル入りますか?何千ものファイルがあるフォルダではどうなりますか?
1回のバッチで約30ファイルを処理でき、各ファイルは最大10 MBです。大きなフォルダは波のように実行します。30ファイルをアップロードしてエクスポートし、次の30ファイルをアップロードします。各波ごとに独自のスプレッドシートが生成されます。監視フォルダの自動化はないため、5,000ファイルのアーカイブは1回の無人ジョブではなく、計画的に実行する一連の処理になります。これにより、9時間後に問題を発見するのではなく、波の間で軌道修正が可能になります。