低品質スキャンからミルテストレポートを読み取る
実際に生き残るもの
低品質スキャンで最初に失敗するミルテストレポートの部分は、フィールドラベルではありません。化学成分表の形状です。証明書が行ごとにきれいに読めても、元素の列がずれた瞬間に崩れてしまいます。EN 10204テストレポートでは、パーセンテージはその上の元素ヘッダーに結び付けられて初めて意味を持つからです。また、スキャンはこのチェーンの中で誰も制御できない唯一の変数です。ミルがクリーンなデジタル証明書を発行し、販売代理店が印刷してファックスし、サービスセンターがそのファックスを受入フォルダに撮影し、入荷デスクに届く頃には原本から3世代離れています。

重要なポイント
- スキャンがミルテストレポートのすべての単語を読み取れても、値がラベルに結び付けられるまで意味を持たないため、間違った材料にリンクする行が生成される可能性があります。
- 低品質スキャンで2つの列ルールが結合すると、パーセンテージは読み取れますが、間違った元素ラベルが継承されます。これは空白よりも悪質です。レコードが完全に見えるからです。
- 有用な質問は、8つのフィールドグループのうちどれがクリーンに戻ってきたかです。そのため、ImageToTable.aiでは列に名前を付け、ページ上の位置ではなく意味によって各値を検索できます。
ミルテストレポートから実際に抽出できる項目

ミルテストレポートは単一の文書ではなく、記載されたEN 10204証明書タイプによって、どの項目が実際の測定値で、どの項目が単なる保証であるかが決まります。この規格は4つのタイプを定義しており、タイプによってページの内容が変わります。タイプ2.1は試験結果を一切伴わない適合宣言です。タイプ2.2は特定ではない検査に基づく試験レポートであり、数値が納入されたヒートとは異なるヒート由来である可能性があります。タイプ3.1は、実際に納入されたヒートの特定試験結果を、生産部門から独立した製造業者の検査責任者が検証したものです。タイプ3.2は、3.1に独立した第三者立会いを追加したものです。構造用および圧力機器用鋼材のほとんどは3.1で出荷されるため、受入チームが日常的に目にする証明書はこれが最も多いでしょう。
この証明書の項目レイアウトも恣意的なものではありません。EN 10168は、鋼材検査文書で使用されるコード化されたセクションを定義しています。グループAは商業データ、Bは製品説明、Cは検査(化学成分および機械的性質)、Dはその他の試験、Zは検証です。降伏強度はセクションC11、引張強度はC12、伸びはC13、ノッチ付き衝撃試験はC40からC43、化学成分分析はC71以降にあり、各元素は固定スロットではなく個別に指定されます。実際に抽出する項目はすべてこれらのセクション内にあります。ヒート番号または鋳造番号、鋼種、寸法、熱処理条件、炭素からモリブデンまでの元素含有率、降伏強度、引張強度、伸び、衝撃エネルギー、証明書タイプ自体、そして検査担当者の署名です。証明書タイプの完全なリストと各タイプに必要な要件は、EN 10204リファレンスに記載されています。
このコード化された構造こそが、ミルテストレポートを自動抽出の有力な候補にしており、同時に低品質スキャンが最初に破壊するものでもあります。抽出の目的はほとんど変わりません。2015年のMTRデータベースソフトウェアに関するr/manufacturingスレッドで、あるチームは「スキャンしたMTRをインポートして保存し、品目/形状/継手/国別にインデックスし、使用した場所にタグ付けしたい」と説明していました。これは受入チームが今日でも必要とするトレーサビリティ記録であり、項目がページから正確に抽出されて初めて機能します。
低品質スキャンが実際にコストを生む場面

スキャン品質はミルテストレポートを均等に劣化させるわけではありません。最もトレーサビリティの重みを持つフィールドを集中的に攻撃します。
解像度。 プロのアーカイブ作業に使用されるデジタル化ガイドラインでは、テキスト取り込みを3つ星品質で300 ppi、4つ星で400 ppiと定めています(FADGI技術ガイドライン第3版による)。FAXページはモノクロで約200 dpi、スマホの写真は撮影者の腕前次第です。これらの数値の間には、ある元素列と次の列を隔てる極細の罫線や、取鍋分析と製品分析を記録する小さなフォントの上付き文字が存在します。罫線が消えれば、列構造も一緒に崩れます。
傾きと回転。 2024年のマルチモーダル文書モデルの研究では、キーと値の抽出は、あるモデルでは約25度、別のモデルでは35度の回転まで安定し、その後は明確なエラーではなく幻覚的な値に崩壊することが判明しました(傾いた文書の抽出に関する研究で報告)。これらの限界は単独では寛容に見えます。しかし、12列もある化学成分表では、制約となるのはページの回転ではなく縦罫線の整列です。わずかな傾きとスキャナーのノイズが、ページ自体が傾いて見えるずっと前に隣接する罫線を融合させてしまいます。FADGIは4つ星の取り込みを、ソフトウェアによるデスキューを許可しないプラスマイナス1度の許容差として扱っており、これはFAXや手持ち写真ではほぼ到達できない整列精度です。
コントラストと背景ノイズ。 FAXのコピーは、灰色の紙、斑点のある背景、そして線が太くなったり細くなったりした文字形状という、両方の問題を同時に引き継ぎます。ここで、視覚的に類似した文字を持つヒート番号が最も一般的な誤読の対象になります。なぜなら、0とO、1とI、8とBの違いは、低解像度では1ピクセルだけだからです。トレーサビリティキーの数字の誤りは、誰も出力で見抜けないタイプミスではありません。それは、間違った材料にリンクする行なのです。
スタンプ、注釈、結合セル。 ヒート番号の上に重なるゴム印、印刷された値の上への手書き修正、ヘッダーが結合セルにまたがる化学成分表は、すべて値とラベルのペアリングを壊します。線形読み取りは単語を報告するだけで、その結びつきを失います。数字はページ上にありますが、それがどの元素に属するのかがわからなくなります。これは空白よりも悪い状態です。なぜなら、完全に見えるからです。
マルチヒート表。 1枚の証明書が複数のヒートをカバーし、1ヒートにつき1行でレイアウトされることがよくあります。行構造が圧縮や折り目で失われると、異なるヒートの値が1つのレコードに混ざり合い、結果として得られる化学成分はもっともらしく見えるものの、実際にはどの実在のヒートにも属さないものになります。
化学成分表は低品質スキャンの最初の犠牲者であり、元素列が1つ欠落しても、欠番が1つ生じるだけではありません。その右側のすべての値が誤ったラベルを引き継ぐことになります。
フィールドごとに何が残るか

ヒート番号と証明書タイプは、化学成分表のラベルよりも低品質スキャンに強く、署名は最も弱いです。この違いは偶然ではありません。各フィールドの印刷方法と、ドキュメントがそのフィールドに与える冗長性の量によって決まります。
| フィールド | 低品質スキャンでの挙動 | 対処法 |
|---|---|---|
| 証明書タイプ(2.1 / 2.2 / 3.1 / 3.2) | ヘッダーに大きく印刷され、繰り返されることが多い | 最初のパスで読み取れます |
| ヒート番号または鋳造番号 | 短くコントラストが高いが、0/O、1/I、8/Bが紛らわしい | 材料マーキングと照合してください |
| 鋼種と規格 | 英数字で、ヘッダーと製品セクションに繰り返し記載 | 版または改訂を確認してください |
| 化学成分のパーセンテージ | 数字は残るが、元素ラベルはヘッダーに依存 | 列の整列を確認してください |
| 降伏強度、引張強度、伸び | 通常、特性名の横に印刷される | 印刷された証明書では信頼できます |
| 衝撃エネルギーと硬さ | 試験温度とインラインで記載されることが多い | 単位と温度を確認してください |
| 熱処理とNDT注記 | 散文と略語で、スタンプされることもある | かすかなコピーでは欠落を想定してください |
| 検査官の署名とスタンプ | 印刷物の上にインク、本質的にかすんでいる | 人間による確認が必要で、盲目的に信頼しないでください |
このパターンはどのミルでも一貫しています。冗長性と大きな文字があるフィールドは生き残り、物理的な位置やインクの品質に依存するフィールドは生き残りません。だからこそ、有用な質問は「ツールが証明書を読み取ったか」ではなく、「この8つのフィールドグループのうちどれがクリーンに戻り、どれを確認する必要があるか」なのです。
解決策:列を指定すれば、ツールが値を見つけます
フィールド名ベースの抽出が低品質の証明書でも機能する理由は、テーブルの規則が完全である必要がなく、要素名とその値がページのどこかで読み取れることだけが必要だからです。ImageToTable.ai は カスタム列抽出 を通じてこの方法で動作します。抽出したい列名を入力すると、ビジョンモデルが証明書を読み取り、座標ではなくフィールドの意味に基づいて各値の位置を特定します。ミル証明書では、「Heat Number」という列は、ミルが「Heat No.」「Cast No.」または外国語の同等表現で印刷している場合でも見つかり、「Yield Strength (MPa)」という列は、それが単独の行にあるかテストブロック内にあるかに関係なく見つかります。
出力を品質記録に入力できるほど信頼できるものにするには、2つの機能があります。バッチ処理を使用すると、1週間分の証明書をドロップして、証明書またはヒートごとに行がある1つのスプレッドシートを取得できます。レビュー層は、抽出された各セルを元のスキャン上の位置にマッピングします。Bbox検証は、ホバーしたときに値がどこから来たのかを正確に強調表示するため、異常に見える降伏強度を、ページ全体を目で確認する代わりに、1クリックでソースと照合できます。
モデルティアは、低品質スキャンに対する答えの残り半分です。ImageToTable.ai アカウントは、Standard、Advanced、または Premium の処理ティアで実行され、上位ティアは、密度の高いテーブル、かすれたファックス、手書き文字に対して、より強力な基盤となるビジョンモデルを使用します。主要なミルからの鮮明なデジタル証明書は Standard ジョブです。地域のミルからの写真撮影、スタンプ押印、マルチヒートの証明書は、Advanced または Premium のケースです。バッチが送信されたときにアクティブなティアがそのバッチの請求対象となるため、難しい山は上位ティアで送信し、簡単な山は経済的に保つことができます。より密度の高い化学成分表で計算チェックも必要な場合は、計算列を使用して、すでに抽出されたフィールドから派生値を出力できます(比率や差など)。Excel で何かを再入力する必要はありません。
ファイルは安全に処理され、保存されません。
できないこと
抽出はページから数値を取得するところまでで、そこで止まります。その数値が許容範囲かどうかの判断を必要とするすべてのことは、QAチームに委ねられます。この線引きは明確にしておく価値があります。なぜなら、静かにこの線を越えるツールは、越えないツールよりも危険だからです。
- 化学成分や機械的性質を鋼種の規格値に対して検証しません。 炭素含有量をASME Section II、EN 10025、またはお客様のプロジェクト仕様書と照合することは、お客様の品質システムが抽出データに適用するルールです。抽出は値を提供するだけで、その値が合格かどうかを判断するものではありません。
- 本当に読み取れないヒート番号を復元することはできません。 スタンプで潰れた数字や、ぼやけて失われた数字は、推測せずにレビュー対象としてフラグ付けする必要があります。誤ったヒート番号は空白のものよりもコストがかかります。なぜなら、トレーサビリティを誤ったバッチに向け、下流のチェックではそれを検出できないからです。
- 行構造が読み取れない限り、マルチヒート証明書を複数のレコードとして扱いません。 証明書が複数のヒートをカバーする場合は、インポート前に1ヒートにつき1行であることを確認してください。
- トラック上の鋼材が証明書と一致することを証明するものではありません。 証明書同士を比較しても、書類が自分自身と一致することを証明するだけです。受入検査はそのギャップの一部を埋め、重要用途では、ポジティブマテリアルアイデンティフィケーション(PMI)が残りを埋めます。
- 署名を認証したり、タイプ3.2の第三者カウンター署名が存在することを確認したりしません。 それは証明書適合性レビューであり、人が必要です。
堅牢な入荷ワークフロー
トレーサビリティ要件と低品質スキャンの現実の両方を尊重するワークフローは次のようになります。各ステップは、一般的な約束ではなく、特定の設定に対応しています。
EN 10168セクションから列を定義する
実際に追跡するフィールドに名前を付けます:Heat Number、Grade、Certificate Type、C、Mn、Si、P、S、Yield Strength (MPa)、Tensile Strength (MPa)、Elongation (%)、Impact Energy (J)、Heat Treatment。入力した列名が出力シートのヘッダーになるため、サプライヤーごとにフォーマットを作り直すのではなく、全ミルで一度決めておきましょう。
スキャン品質で山を分ける
今週の証明書を、きれいなデジタルPDFと劣化した紙(FAX、コピー、写真)に分類します。きれいな山はStandardティアで、劣化した山はAdvancedまたはPremiumで処理します。ティアはアカウントごとに設定され、提出バッチごとに請求されるため、この分割でドキュメントに必要な以上のコストはかかりません。
各山を1つのバッチとしてアップロードする
バッチ処理は多数の証明書を一度に受け取り、それらを1つのスプレッドシートに統合します。証明書ごとまたはヒートごとに1行になります。証明書を1枚ずつ処理するのではなく、共有の列セットで山全体をアップロードしましょう。
Bboxを使用してスキャンが脅かすフィールドをレビューする
ヒート番号、化学成分の列の整列、スタンプの下にあるものすべてをレビューセットとして扱います。疑わしいセルにホバーすると、元のドキュメントのどこから値が来たのかが正確に表示されるため、必要に応じて修正し、元が正しかった場合はAI値に戻せます。鋼種や証明書タイプのような冗長性のあるフィールドは、通常、ひと目見るだけで十分です。
エクスポートして、それを必要とするシステムにインポートする
Excel、CSV、またはJSONにエクスポートし、通常のインポートパスを通じてファイルをERPまたは品質システムに取り込みます:Epicor Kinetic、Infor、SAP Business One、Microsoft Dynamics 365、SYSPROはすべて、列マッピングによるファイルベースのインポートを受け入れます。抽出はデータ層を生成し、ERPがレコードを保持します。
同じデータ問題の受入検査側の実例については、品質検査レポートデータ抽出ガイドで寸法測定と処分フィールドを説明しています。劣化したドキュメントが証明書ではなくフォームの場合は、低品質スキャンフォームのワークフローが別の出発点から同じ仕組みを扱い、検査レポート抽出ハブが全レポートタイプをマッピングします。複数のドキュメントタイプを扱う工場向けにツールを選んでいる場合は、製造抽出ツール比較でMTRを発注書、納品書、検査フォームの文脈に位置付け、フィールドおよび産業用ツール比較でドックとヤード側をカバーしています。
FAQ
FAXやコピーされたミルテストレポートを読み取れますか?
多くの場合、読めます。正直なところ、そのページが何世代のコピーを経ているかによります。約200 dpiの初代FAXであれば、通常はヘッダーフィールドと印刷された化学成分の数字を読み取れますが、FAXのコピーでは細い罫線とともに元素ラベルも失われます。このような書類には上位のモデルティアを使用し、値が返ってきた場合でも化学成分の整列をレビューすることをお勧めします。工場を出た時点で鮮明なスキャンであれば、このような対応は不要です。
EN 10204の証明書タイプ(3.1や2.2など)を理解できますか?
証明書タイプをフィールドとして抽出するため、記録に保存してフィルタリングできます。タイプは通常ヘッダーに大きく印刷されており、低品質なコピーでも確実に読み取れます。ただし、お客様の受入ルールを強制するものではありません。例えば、発注書で3.1を指定しているのに2.2を拒否するといったことは行いません。これは抽出された値に基づいて、お客様の品質システムで行う下流のチェックです。
化学成分を材料の鋼種に対して検証しますか?
いいえ、これは意図的な設計です。検証とは、抽出した値をASME Section II、EN 10025、またはお客様自身の仕様書ライブラリにおける鋼種の許容範囲と比較し、範囲外の結果を振り分けることを意味します。これは、鋼種、板厚、規格の版によって限度が変わるため、品質チームが所有・管理するルールです。抽出により値が型付きの列で得られるため、そのチェックは数式やルールになり、すべての証明書を手作業で読む必要がなくなります。
対応しているファイル形式と、一度に処理できる件数は?
PDF、JPG、PNG、WebP、AVIFに対応しており、パスワード保護されたPDFも含まれます。バッチ処理では、1回の送信で多数のファイルを受け付け、それらを1つのスプレッドシートに統合するため、1週間分の証明書が、証明書ごとまたはヒートごとに1行の1つのデータセットとしてまとまります。紙の証明書の写真も、画像が十分に鮮明で均一な照明であれば処理できます。
複数のヒートをカバーする証明書を処理できますか?
ヒート行が読み取れる場合、1つの証明書から複数の行を返すことができます。これは、複数のヒートをカバーする鉄筋や厚板の納品に必要な機能です。圧縮や折り目で行構造が損なわれると行が混ざることがあるため、マルチヒートの証明書はレビュー対象に含め、データが在庫に反映される前にヒートごとに1行であることを確認してください。
証明書の手書き文字は問題になりますか?
手書きの値や注記は印刷されたものより難しく、上位のモデルティアがその価値を発揮するまさにその部分です。明瞭なブロック体の大文字と標準的な略語は問題なく抽出できます。密集した筆記体、にじんだ修正、印刷された数字の上に書かれた値は、特にヒート番号やコンプライアンス上重要な測定値である場合は、レビュー項目として扱ってください。
有用な考え方のモデルは役割分担です。抽出はページを担当し、お客様の品質システムが判断を担当します。低品質スキャンは情報を失わせ、スタンプが重なった数字やファックスで消えた列を、どのモデルも復元することはできません。フィールド名付き抽出が行うのは、どのフィールドがきれいに取得でき、どのフィールドが損傷した領域にあるかを正確に示すことで、レビュー時間を、すべての証明書で同じ場所に印刷される鋼種ではなく、スタンプの下のヒート番号に費やすことができるようにすることです。
最もきれいなPDFではなく、最も悪い証明書でテストしてください。ヒート番号にスタンプが重なった、撮影されたマルチヒート証明書を用意し、どの列が取得でき、どの列がレビュー対象としてフラグが立つかを確認してください。いくつかアップロードして、ご自身で整列を確認してください。