AIはNF-e XMLからデータを抽出できる?はい — スマートな解析、OCRではありません

はい。AIはブラジルのNF-e(Nota Fiscal Eletrônica)XMLファイルからデータを抽出できます — 仕入先のCNPJ、製品のNCMコード、ICMS/IPI税額、明細項目を読み取ります。 ただしNF-eは特別なケースです。データはすでにXMLで構造化されています。ここでの抽出とは、XMLスキーマをインテリジェントに解析し、フィールドを読みやすいスプレッドシートの列にマッピングすることを意味し、OCRではありません。各仕入先のNF-eは同じ政府スキーマに従っていますが、オプションのフィールド、税設定、バージョン固有の要素が異なるため、数十社の仕入先からのデータを手動で統合するのは毎回の頭痛の種となっています。

手入力をやめよう — AIに読み取らせるだけ
画像やPDFをアップロード — 10秒で構造化データに
今すぐ試す →
AIがブラジルのNF-e XML税務文書からデータを抽出し、構造化されたスプレッドシートに変換

重要なポイント

  1. 政府標準のNF-e XMLデータは機械的に読み取れるはず — しかし、ほとんどのブラジルの経理チームは、それぞれ異なるERPを使う30社の仕入先からのフィールドを手動で統合するために、いまだに月2日を費やしています。
  2. バージョン4.0で完璧に動作するNF-e解析スクリプトは、バージョン2.0では同じフィールドが存在しないため、静かに壊れます — XML自体は有効ですがフィールドが欠落しており、スクリプトは見つからないものを報告する手段がありません。
  3. 意味ベースの抽出は、フィールドをXMLツリー内の位置ではなく、その意味(仕入先CNPJやICMS値など)で読み取るため、1セットの列定義で、どの仕入先が送信したか、どのバージョンを使用したかに関係なく、すべてのNF-eから同じデータを抽出できます。

NF-e XML抽出の仕組み — なぜ「抽出」が必要なのか

NF-eデータがすでにXML形式なら、XSLTスタイルシートを作成すれば済むのでは? そうはいきません。受け取るNF-eの形式は決して一つではないからです。

ブラジルのNF-e制度は、Ajuste SINIEF 07/05によって創設され、現在では事実上すべてのB2B取引で義務付けられています。政府標準のXMLスキーマ(現行バージョン4.0)に従い、すべての電子インボイスは同じ基本構造を持ちます。発行者のCNPJと会社名、受取人データ、NCM分類とCFOPコードを含む明細行、そしてICMS(州付加価値税)、IPI(連邦物品税)、PIS、COFINSの4つの独立した税ブロックです。

問題は、1か月に30のサプライヤーからXMLを受け取る場合に発生します。各社は異なるERP — TOTVS、Sankhya、Omie、SAP Business One — を使用しており、それぞれ異なるオプションフィールドを設定しています。ある会社は運送詳細を含めますが、別の会社は省略します。ある会社は拡張集計機能を持つNF-e 4.0を使用し、別の会社は依然として3.10で運用しています。

従来のXML解析手法(XSLT、Pythonスクリプト、Power Queryインポート)は、フィールドが欠落していたり名前空間が変わると機能しません。AIはXMLを意味的に読み取り、ツリー上の位置ではなく、フィールドが何を表すかによって識別します。これは構造化データに適用されるカスタム列抽出です。必要な出力列(「サプライヤーCNPJ」「NCMコード」「ICMS額」)を定義すれば、AIはオプションフィールドやバージョンの違いに関係なく、一致するデータを見つけ出します。

AIがNF-e XMLで正しく処理できること

NF-e XMLの構造化された性質により、AIの抽出精度は画像ベースのドキュメントよりも高く、コアとなる標準化フィールドでは99%を超えることがよくあります。形式上の制約が、以下の3つの点でAIに有利に働きます。

CNPJおよびCPF税務ID

すべてのNF-e XMLには、発行者のCNPJ(Cadastro Nacional da Pessoa Jurídica — 14桁の連邦税務ID)が<emit>ブロック内の固定位置に含まれています。厳格なXX.XXX.XXX/XXXX-XX形式と予測可能なXMLパスにより、抽出は事実上エラーがありません。NF-e 3.10および4.0 XMLにおけるCNPJ抽出精度は99.5%を超えます。構造化形式により、スキャンされた紙のインボイスに付きまとう文字認識の曖昧さが排除されます。

NCMコード

NCM(メルコスール共通名称)コードは、メルコスール加盟国で使用される8桁の製品分類で、各明細行内の専用の<NCM>タグに格納されています。SPED Fiscal(ブラジルのデジタル税務帳簿システム)を提出する企業にとって、仕入NF-eからの正確なNCM抽出は極めて重要です。コードを誤ると税務調査の対象となります。AIは、専用XMLタグ内の厳格な8桁の数字パターンに従うため、98~99%の精度を達成します。

税額(ICMS、IPI、PIS、COFINS)

1枚のNF-eには4つの異なる税金が含まれ、それぞれに独自の計算基準、税率、最終額があります。これは他国の請求書と比較して異例に税項目が多いです。税セクションは明確に分離されたXMLブロックであり、AIは各項目を出力列に高信頼性でマッピングします。すべての税セクションが入力されたNF-eでは、ICMS値の精度は99%以上に達します。これは転記ミスが発生する手動データ入力よりも高い精度です。

AIがNF-e XMLで苦手とする点

NF-e抽出を正確にする構造は、同時にエッジケースも生み出します。信頼性を低下させる3つのシナリオがあります。

バージョン間のスキーマ差異

NF-eは複数のバージョン(1.0、2.0、3.10、現在の4.0)を経て進化してきました。各改訂でXMLタグの追加、削除、名称変更が行われました。AIが古いNF-e 2.0 XMLを処理する際、フィールドが単に存在しない場合、正しくセルを空欄にします。しかし、その空欄が値の入力を想定する下流のスプレッドシート数式を壊す可能性があります。 対策:古いバージョンのXMLは別途バッチ処理し、抽出後の検証を適用して欠落フィールドをフラグ付けします。

オプションフィールドとサービス専用NF-e

多くのNF-eフィールドはオプションです。サービス請求書は製品関連フィールド(NCMコード、IPIなど)を完全に省略します。AIが混在バッチを処理する際、該当しない列は正しく空欄になりますが、スプレッドシートですべての行にNCMコードがあると想定している場合、サービス行が不完全に見えます。「NCMコード(製品NF-eのみ)」のように両方のシナリオをカバーする列を定義し、期待値を明確に設定してください。

XML + DANFE の混在ワークフロー

DANFE(NF-e の補助文書)は、印刷用の付属 PDF です。多くの中小ブラジル人サプライヤーは、基となる XML ではなく DANFE のみを送信します。DANFE PDF は画像ベースの AI 抽出が必要で、精度は 90〜95% と、直接の XML 解析による 99% 以上よりも低くなります。 ベストプラクティスは、すべてのサプライヤーに XML を要求し、DANFE のみのファイルは別の低信頼度バッチとして扱うことです。

NF-e XML 抽出で最良の結果を得る方法

ブラジルの電子請求書を扱う際に、測定可能な違いを生む 5 つのステップをご紹介します。

1
XML パスではなく、意味のある列名を定義します。 「Supplier CNPJ」「NCM Code」「ICMS Value」などを使い、/nfeProc/NFe/infNFe/emit/CNPJ のような XPath 文字列は使わないでください。AI はこれらを意味的に解決し、NF-e 4.0 の位置でも、わずかに異なる NF-e 3.10 の場所でも CNPJ を見つけ出します。これは構造化データに適用されるカスタム列抽出です。
2
DANFE PDF ではなく XML を要求します。 この習慣を変えるだけで、精度が 5〜10 ポイント向上します。ブラジルの法律では、サプライヤーに XML の提供が義務付けられています。新しいサプライヤーには、「Por favor, enviar o arquivo XML da NF-e juntamente com o DANFE」と送信してください。
3
バッチ処理時には NF-e をバージョンごとにグループ化します。 NF-e 4.0 XML を、古い 3.10 や 2.0 のファイルから分離します。現在のスキーマバージョンはより多くのフィールドを入力するため、それらを一緒に処理すると、古いバージョンの行には空のセルが多くなり、抽出の失敗のように見えることがあります。バージョンごとにグループ化することで、各バッチを適切な期待値でレビューできます。
4
税務検証には計算列を使用します。 ブラジルの税金には、組み込みの監査チェックがあります。ICMS 値 ≈ ICMS ベース × ICMS 率を検証する計算列を定義すると、AI は抽出中に不一致をフラグし、後で会計システムで発見する手間を省きます。
5
合計ブロックをスポットチェックします。 <total> セクションには、確定した合計値が含まれています。抽出後、明細行の合計が XML の宣言された合計と一致することを確認してください。不一致があれば、すべてのフィールドをレビューするよりも早くエラーを特定できます。クリーンな XML では、NF-e の 2% 未満がこのチェックに失敗します。

実際のシナリオ

SPED Fiscal向け複数仕入先NF-eの統合

サンパウロ州の中規模メーカーは、原材料サプライヤーから毎月30〜50件のNF-e XMLを受け取ります。鉄鋼はGerdau、電気部品はWEG、包装材は地元の業者からです。各NF-eには異なるICMS税率(発行州により7%〜18%)と、項目の記入状況のばらつきがあります。手入力では経理担当者が毎月まる2日かかっていました。

AI抽出を使えば、すべてのXMLファイルをバッチにアップロードするだけで、統合スプレッドシートが生成されます。列は、サプライヤーCNPJ、NF-e番号、発行日、NCMコード、製品説明、数量、単価、ICMS課税ベース、ICMS金額、NF-e合計 — そのまま会社のTOTVS ERPにインポートできます。2日間の作業が3分になり、ICMS金額はXMLの合計ブロックと相互検証され、SPEDに到達する前にエラーを検出します。フィールドレベルのワークフローと3つの方法の詳細な比較については、NF-e XMLからExcelへの抽出ガイドをご覧ください。

輸入関税のためのNCM抽出

輸入を扱う物流会社は、輸入関税を計算するためにサプライヤーのNF-eからNCMコードと製品価格を必要としています。各NF-eには5〜20の明細行があり、それぞれ異なる分類があります。AIは数秒で明細行ごとに1行を抽出し、通関業者の申告テンプレートに合わせて整形します。

FAQ

AIは同じNF-e上のICMS、IPI、PIS、COFINSを区別できますか?

はい。各税には独自のXMLブロックと固有の子要素があります。ICMSには<orig>と<CST>、IPIには<clEnq>があります。XML構造がそれらを明確に区別するため、AIは各税を別々の出力列にきれいにマッピングします。これは、税が区別されていない数字の行として表示される画像ベースの抽出よりもAIにとって簡単です。

AIは異なるICMS税率を持つブラジルの異なる州のNF-eでも機能しますか?

はい。ICMS税率(alíquota)は各NF-eの<ICMS>ブロック内に記載されています。サンパウロ州の18%でもリオデジャネイロ州の19%でも、AIはXMLから直接税率を読み取ります。州をまたぐICMS-ST(Substituição Tributária)のシナリオも、XMLがICMS-ST金額を明示的にタグ付けしているため、正しく取得されます。

AIはポルトガル語のNF-e XMLから英語の列を持つスプレッドシートにデータを抽出できますか?

はい、可能です。出力列を英語で定義します(例:「Supplier CNPJ」「Invoice Total」)。AIがポルトガル語のXMLフィールドを英語のヘッダーにマッピングします。XMLタグは言語に依存せず、意味的マッピングは言語をまたいで機能します。詳細はAIによる多言語抽出の仕組みをご覧ください。

NFS-e(自治体向けサービス請求書)はどうですか?

NFS-e(Nota Fiscal de Serviços Eletrônica)は、自治体レベルの別の文書です。各市(prefeitura)が独自のスキーマを持っています。NF-eの連邦標準化とは異なり、NFS-eの形式は自治体ごとに異なります。AIはNFS-e XMLからも抽出できますが、自治体ごとのスキーマの違いにより、より多くの検証が必要です。NF-e(物品向けの連邦)は信頼性が高く、NFS-e(サービス向けの自治体)は変数が多くなります。サービス側については、NFS-e抽出ガイドをご覧ください。

NF-e XMLからのAI抽出は、ブラジルの税務記録保存要件に準拠していますか?

抽出はデータ変換のステップであり、原本のXMLを変更するものではありません。XMLは法的な税務記録として残ります。ブラジルの税務当局は、デジタル署名付きNF-e XMLを5年間(除斥期間、CTN Art. 173)保持することを義務付けています。AI抽出は派生スプレッドシートを作成しますが、原本のデジタル署名付きXMLはそのまま保持されます。

NF-e XMLとDANFE PDF抽出の精度の違いは何ですか?

まったく別のカテゴリです。NF-e XML抽出は、データが明確なXMLタグに存在するため、主要フィールドで99%以上の精度を達成します。DANFE PDF抽出(印刷表現を読み取る)は、画像理解の問題になるため90〜95%に低下します。フォントのバリエーション、印刷品質、列の配置により、スキャン文書と同じエラーが発生します。両方が利用可能な場合は、常にDANFEよりもXMLを優先してください。

まとめ

NF-e XML抽出はAIの能力の問題ではなく、ワークフローの決定です。構造化された形式により、画像ベースの文書よりも正確な抽出が可能ですが、その構造は誤解を招く可能性があります。「ただのXMLだ」という認識が、統合の問題を実際よりも単純に見せてしまうのです。実際の作業(30社のサプライヤー、4つのNF-eバージョン、複数の税設定にわたる一貫性のないフィールドのマッピング)は、反復的なパターンマッチングであり、AIはXSLTスクリプトやExcelマクロよりも自動化に優れています。

問題はAIがNF-e XMLを抽出できるかどうかではありません。200ファイルを調べて<ICMS><ICMSSN102><orig>パスを追跡する午後を過ごすか、それともAIにCNPJ、NCMコード、ICMS値を1分以内でスプレッドシートにマッピングさせるかです。

NF-e XMLファイルで試す →

📮 contact email: [email protected]