AI가 NF-e XML에서 데이터를 추출할 수 있나요?네 — 스마트 파싱, OCR이 아닙니다

네. AI는 브라질 NF-e XML 파일에서 데이터를 추출할 수 있습니다 — 공급업체 CNPJ, 제품 NCM 코드, ICMS/IPI 세금 값, 품목 내역까지 읽어냅니다. 하지만 NF-e는 특별한 경우입니다. 데이터는 이미 XML에 구조화되어 있습니다. 여기서 추출이란 OCR이 아니라 XML 스키마를 지능적으로 파싱하고 필드를 읽기 쉬운 스프레드시트 열에 매핑하는 것을 의미합니다. 각 공급업체의 NF-e는 동일한 정부 스키마를 따르지만 서로 다른 선택 필드, 세금 구성, 버전별 요소를 포함하고 있어 수십 개 공급업체의 데이터를 수동으로 통합하는 것은 반복적인 골칫거리가 됩니다.

수작업 입력은 그만 — AI가 대신 읽어드립니다
이미지나 PDF를 업로드하세요 — 10초 만에 정형 데이터로
지금 체험하기
회원가입 불필요 · 카드 불필요 · 10초 내 결과
AI가 브라질 NF-e XML 세금 문서에서 데이터를 추출하여 구조화된 스프레드시트로 변환

핵심 요점

  1. 정부 표준화된 NF-e XML 데이터는 기계가 쉽게 읽을 수 있어야 하지만, 대부분의 브라질 재무 팀은 서로 다른 ERP를 사용하는 30개 공급업체의 필드를 수동으로 통합하는 데 매달 이틀을 소비합니다.
  2. 버전 4.0에서 완벽하게 작동하는 NF-e 파싱 스크립트는 동일한 필드가 존재하지 않기 때문에 버전 2.0에서 조용히 실패합니다 — XML은 유효하지만 필드가 없으며, 스크립트는 찾을 수 없는 것을 보고할 방법이 없습니다.
  3. 의미 기반 추출은 필드가 XML 트리의 어디에 있는지가 아니라 의미를 기준으로 읽으므로, 한 세트의 열 정의로 공급업체나 버전에 관계없이 모든 NF-e에서 동일한 데이터를 추출할 수 있습니다.

NF-e XML 추출 작동 방식 — 그리고 여전히 "추출"이 필요한 이유

NF-e 데이터가 이미 XML에 있다면, XSLT 스타일시트를 작성해서 끝내면 되지 않을까요? 그 이유는 단 한 가지 형식의 NF-e만 받는 경우가 없기 때문입니다.

브라질의 NF-e 시스템은 Ajuste SINIEF 07/05에 의해 만들어졌으며 현재 사실상 모든 B2B 거래에 필수입니다. 이 시스템은 정부 표준 XML 스키마를 정의합니다. 모든 전자 송장은 동일한 기본 구조를 갖습니다: 발행자 CNPJ 및 회사명, 수취인 데이터, NCM 분류 및 CFOP 코드가 포함된 품목, 그리고 ICMS, IPI(연방 소비세), PIS, COFINS의 네 가지 개별 세금 블록입니다.

문제는 한 달에 30개 공급업체로부터 XML을 받을 때 발생합니다. 각 업체는 TOTVS, Sankhya, Omie, SAP Business One 등 서로 다른 ERP를 사용하며, 각각 다른 선택 필드를 채웁니다. 한 곳은 운송 세부 정보를 포함하지만 다른 곳은 생략합니다. 한 곳은 확장된 합계 기능이 있는 NF-e 4.0을 사용하는 반면, 다른 곳은 여전히 3.10을 운영합니다.

기존 XML 파싱 방식은 필드가 없거나 네임스페이스가 변경되면 작동이 중단됩니다. AI는 XML을 의미적으로 읽어 트리 내 위치가 아닌 표현하는 내용을 기준으로 필드를 식별합니다. 이는 구조화된 데이터에 적용된 사용자 정의 열 추출입니다. 원하는 출력 열을 정의하면 AI가 선택 필드나 버전 차이에 관계없이 일치하는 데이터를 찾습니다.

AI가 NF-e XML에서 잘하는 점

NF-e XML의 구조화된 특성 덕분에 AI 추출 정확도는 이미지 기반 문서보다 높으며, 핵심 표준화 필드의 경우 종종 99%를 초과합니다. 형식 제약 조건은 세 가지 방식으로 AI에 유리하게 작용합니다.

CNPJ 및 CPF 세금 ID

모든 NF-e XML에는 <emit> 블록 내 고정 위치에 발행자의 CNPJ가 포함됩니다. 엄격한 XX.XXX.XXX/XXXX-XX 형식과 예측 가능한 XML 경로 덕분에 추출이 사실상 오류 없이 이루어집니다. NF-e 3.10 및 4.0 XML의 CNPJ 추출 정확도는 99.5%를 초과합니다. 구조화된 형식은 스캔된 종이 송장을 괴롭히는 문자 인식 모호성을 제거합니다.

NCM 코드

NCM(Nomenclatura Comum do Mercosul) 코드는 메르코수르 회원국에서 사용하는 8자리 제품 분류 코드로, 각 라인 항목 내 자체 <NCM> 태그에 위치합니다. SPED Fiscal을 신고하는 기업의 경우, 매입 NF-e에서 정확한 NCM을 추출하는 것이 매우 중요합니다. 잘못된 코드는 세무 감사를 유발합니다. AI는 전용 XML 태그 내 엄격한 8자리 숫자 패턴을 따르기 때문에 98-99%의 정확도를 달성합니다.

세금 값(ICMS, IPI, PIS, COFINS)

단일 NF-e에는 각각 고유한 계산 기준, 세율 및 최종 값을 가진 4개의 개별 세금이 포함될 수 있으며, 이는 다른 국가의 인보이스에 비해 비정상적으로 세금 항목이 많습니다. 세금 섹션은 깔끔하게 분리된 XML 블록이며, AI는 이를 높은 신뢰도로 출력 열에 매핑합니다. 모든 세금 섹션이 채워진 NF-e의 경우 ICMS 값 정확도는 99% 이상에 도달하며, 이는 전위 오류가 발생하는 수동 데이터 입력보다 높습니다.

AI가 NF-e XML에서 어려움을 겪는 부분

NF-e 추출을 정확하게 만드는 구조는 동시에 예외 사례도 만듭니다. 세 가지 시나리오에서 신뢰도가 낮아집니다.

버전 간 스키마 차이

NF-e는 여러 버전(1.0, 2.0, 3.10, 4.0(현행))을 거쳐 발전했습니다. 각 개정판에서 XML 태그가 추가, 제거 또는 이름이 변경되었습니다. AI가 필드가 존재하지 않는 이전 버전 NF-e 2.0 XML을 처리할 때는 셀을 올바르게 비워두지만, 값이 있을 것으로 예상하는 다운스트림 스프레드시트 수식이 깨질 수 있습니다. 해결 방법: 이전 버전 XML을 별도로 일괄 처리하고 추출 후 검증을 적용하여 누락된 필드를 표시합니다.

선택 필드 및 서비스 전용 NF-e

많은 NF-e 필드는 선택 사항입니다. 서비스 인보이스는 제품 관련 필드를 완전히 생략합니다. AI가 혼합 배치를 처리할 때는 적용 불가능한 열을 올바르게 비워두지만, 스프레드시트가 모든 행에 NCM 코드가 있다고 가정하면 서비스 행이 불완전하게 보입니다. 두 시나리오를 모두 포괄하는 열(예: "NCM 코드")을 정의하여 기대치를 설정하십시오.

XML + DANFE 혼합 워크플로우

DANFE(Documento Auxiliar da NF-e)는 NF-e의 인쇄용 보조 PDF입니다. 많은 중소 브라질 공급업체는 원본 XML이 아닌 DANFE만 보냅니다. DANFE PDF는 이미지 기반 AI 추출이 필요하며 정확도는 90-95%로, 직접 XML 파싱의 99%+보다 낮습니다. 모범 사례: 모든 공급업체에 XML을 요청하고 DANFE 전용 파일은 별도의 신뢰도가 낮은 배치로 처리하세요.

NF-e XML 추출에서 최상의 결과를 얻는 방법

브라질 전자 송장 작업 시 측정 가능한 차이를 만드는 다섯 가지 단계입니다.

1
XML 경로가 아닌 의미 있는 열 이름을 정의하세요. /nfeProc/NFe/infNFe/emit/CNPJ 같은 XPath 문자열 대신 "공급업체 CNPJ", "NCM 코드", "ICMS 값"을 사용하세요. AI는 이를 의미적으로 해석하여 CNPJ가 NF-e 4.0 위치에 있든 약간 다른 NF-e 3.10 위치에 있든 찾아냅니다. 이는 구조화된 데이터에 적용된 사용자 정의 열 추출입니다.
2
DANFE PDF가 아닌 XML을 요청하세요. 이 한 가지 습관 변화만으로 정확도가 5-10% 포인트 향상됩니다. 브라질 법률은 공급업체가 XML을 제공하도록 요구합니다. 새 공급업체에 보낼 문구: "Por favor, enviar o arquivo XML da NF-e juntamente com o DANFE."
3
일괄 처리 시 NF-e를 버전별로 그룹화하세요. NF-e 4.0 XML을 이전 버전인 3.10 또는 2.0 파일과 분리하세요. 최신 스키마 버전은 더 많은 필드를 채웁니다. 함께 처리하면 이전 버전 행에 빈 셀이 더 많아져 추출 실패처럼 보일 수 있습니다. 버전별로 그룹화하면 각 배치를 올바른 기대치로 검토할 수 있습니다.
4
세금 검증을 위해 계산된 열을 사용하세요. 브라질 세금은 내장된 감사 확인 기능을 제공합니다. ICMS 값 ≈ ICMS 과세표준 × ICMS 세율을 확인하는 계산된 열을 정의하세요. AI가 추출 중 불일치를 표시하므로 나중에 회계 시스템에서 발견할 필요가 없습니다.
5
합계 블록을 점검하세요. <total> 섹션에는 최종 합계 값이 포함됩니다. 추출 후 라인 항목 합계가 XML의 선언된 총액과 일치하는지 확인하세요. 불일치는 모든 필드를 검토하는 것보다 빠르게 오류를 알려줍니다. 깨끗한 XML의 경우 2% 미만의 NF-e만 이 검사에 실패합니다.

실제 시나리오

SPED Fiscal 대비 다중 공급업체 NF-e 통합

상파울루에 있는 중견 제조업체는 원자재 공급업체로부터 매월 30~50개의 NF-e XML을 받습니다. Gerdau의 철강, WEG의 전기 부품, 지역 공급업체의 포장재 등이 여기에 포함됩니다. 각 NF-e는 서로 다른 ICMS 세율과 다양한 필드 완성도를 지닙니다. 수작업 입력에는 AP 담당자가 매월 이틀의 전체 업무일이 소요되었습니다.

AI 추출을 사용하면 모든 XML 파일을 일괄 업로드하여 공급업체 CNPJ, NF-e 번호, 발행일, NCM 코드, 제품 설명, 수량, 단가, ICMS 과세 기준, ICMS 금액, NF-e 합계 열이 포함된 통합 스프레드시트를 생성할 수 있습니다. 이는 회사의 TOTVS ERP로 바로 가져올 수 있습니다. 이틀 분량의 작업이 3분으로 줄어들고, ICMS 금액은 XML 합계 블록과 교차 검증되어 SPED에 도달하기 전에 오류를 잡아냅니다. 필드 수준 워크플로와 세 가지 방법의 상세 비교는 NF-e XML to Excel 추출 가이드를 참조하세요.

수입 관세를 위한 NCM 추출

수입 물류를 처리하는 물류 회사는 수입 관세를 계산하기 위해 공급업체 NF-e에서 NCM 코드와 제품 가치가 필요합니다. 각 NF-e에는 서로 다른 분류의 5~20개 라인 항목이 포함되어 있습니다. AI는 관세사 신고 템플릿에 맞춰 각 라인 항목을 초 단위로 별도 행으로 추출합니다.

FAQ

AI가 동일한 NF-e에서 ICMS, IPI, PIS, COFINS를 구분할 수 있나요?

네. 각 세금은 고유한 하위 요소를 가진 별도의 XML 블록을 갖습니다. ICMS에는 <orig><CST>가 있고, IPI에는 <clEnq>가 있습니다. XML 구조가 이를 명확히 구분하므로 AI는 각 세금을 별도의 출력 열로 깔끔하게 매핑합니다. 이는 세금이 구분되지 않은 숫자 행으로 표시되는 이미지 기반 추출보다 AI에게 더 쉽습니다.

AI는 ICMS 세율이 다른 브라질 각 주의 NF-e에서도 작동하나요?

네. ICMS 세율은 각 NF-e의 <ICMS> 블록 내에 명시되어 있습니다. NF-e가 상파울루의 18% 또는 리우데자네이루의 19%를 포함하든, AI는 XML에서 세율을 직접 읽습니다. 주 간 ICMS-ST 시나리오도 XML에 ICMS-ST 금액이 명시적으로 태그되어 있으므로 캡처됩니다.

AI가 포르투갈어 NF-e XML 데이터를 영어 컬럼 스프레드시트로 추출할 수 있나요?

네, 가능합니다. "Supplier CNPJ", "Invoice Total"과 같이 출력 컬럼을 영어로 정의하면 AI가 포르투갈어 XML 필드를 영어 헤더에 매핑합니다. XML 태그는 언어에 구애받지 않으며, 의미 기반 매핑은 언어를 넘어 작동합니다. 자세한 내용은 AI의 다국어 추출 처리 방식을 참조하세요.

NFS-e는 어떤가요?

NFS-e(Nota Fiscal de Serviços Eletrônica)는 별도의 시립 수준 문서로, 각 도시마다 고유한 스키마를 가지고 있습니다. NF-e의 연방 표준화와 달리 NFS-e 형식은 지자체별로 다릅니다. AI가 NFS-e XML에서도 추출할 수 있지만, 도시별 스키마 차이로 인해 더 많은 검증이 필요합니다. NF-e가 신뢰할 수 있는 반면, NFS-e는 더 많은 변수를 도입합니다. 서비스 측면에 대해서는 NFS-e 추출 가이드를 참조하세요.

NF-e XML에서 AI 추출이 브라질 세무 기록 보관 요건을 준수하나요?

추출은 데이터 변환 단계일 뿐이며 원본 XML을 변경하지 않으므로, 원본 XML이 법적 세무 기록으로 유지됩니다. 브라질 세무 당국은 전자서명된 NF-e XML을 5년간 보관하도록 요구합니다. AI 추출은 파생 스프레드시트를 생성할 뿐, 전자서명된 원본 XML은 그대로 유지됩니다.

NF-e XML과 DANFE PDF 추출 간 정확도 차이는 무엇인가요?

완전히 다른 범주입니다. NF-e XML 추출은 데이터가 명확한 XML 태그에 있기 때문에 핵심 필드에서 99% 이상의 정확도를 달성합니다. DANFE PDF 추출은 인쇄된 표현을 읽는 것으로, 이미지 인식 문제가 되어 정확도가 90-95%로 떨어집니다. 글꼴 변형, 인쇄 품질, 컬럼 정렬 문제로 인해 스캔 문서와 동일한 오류가 발생합니다. 둘 다 사용 가능한 경우 항상 DANFE보다 XML을 우선하세요.

결론

NF-e XML 추출은 AI 역량의 문제가 아니라 워크플로우 결정의 문제입니다. 구조화된 형식 덕분에 이미지 기반 문서보다 훨씬 정확한 추출이 가능하지만, 그 구조가 오히려 착각을 불러일으킬 수 있습니다. "그냥 XML일 뿐이야"라는 생각이 통합 문제를 실제보다 단순해 보이게 만듭니다. 실제 작업인 30개 공급업체, 4가지 NF-e 버전, 다양한 세무 구성을 아우르는 불일치 필드 매핑은 반복적인 패턴 매칭이며, AI가 XSLT 스크립트나 Excel 매크로보다 훨씬 효과적으로 자동화합니다.

문제는 AI가 NF-e XML을 추출할 수 있는지가 아닙니다. 200개 파일에서 <ICMS><ICMSSN102><orig> 경로를 추적하며 오후를 보낼지, 아니면 AI가 CNPJ, NCM 코드, ICMS 값을 1분 안에 스프레드시트로 매핑하게 할지의 문제입니다.

NF-e XML 파일로 직접 사용해 보기 →

📮 contact email: [email protected]