CFDI-Datenextraktion:
Der vollständige Leitfaden zu mexikanischen elektronischen Rechnungen
Eine CFDI ist kein Dokument zum Lesen – sie ist ein Steuerdatensatz, den Sie korrekt entschlüsseln müssen. Mexikos verpflichtendes System für elektronische Rechnungen, das seit 2014 vom SAT durchgesetzt wird, erzeugt Rechnungen, die als XML-Dateien mit einer 36-stelligen UUID, gepaarten RFC-Steuer-IDs, Steuerregime-Codes und – je nach Transaktionsart – einem oder mehreren strukturierten Ergänzungen (complementos) ankommen, die die tatsächlichen Zahlungs-, Gehalts- oder Zolldaten enthalten. Diese Daten in eine Tabellenkalkulation zu extrahieren bedeutet, eine Dokumentarchitektur zu verstehen, die für die Echtzeit-Validierung durch die Regierung konzipiert wurde, nicht für die Lesbarkeit durch Menschen. Dieser Leitfaden deckt die gesamte Landschaft ab: die sechs CFDI-Dokumenttypen, das Ergänzungssystem, jede verfügbare Extraktionsmethode und die Integration der Ausgabe in die Buchhaltungssoftware, die Ihr mexikanisches Team bereits verwendet.

Wichtigste Erkenntnisse
- Jedes AP-Team, das mexikanische Lieferantenrechnungen verarbeitet, extrahiert Daten aus dem CFDI-PDF – aber nach SAT-Regeln hat das PDF keinerlei rechtliches Gewicht; die XML-Datei ist das einzige gültige Dokument.
- Wenn Sie die Extraktion beim Rechnungskopf stoppen und Ergänzungen ignorieren, erfassen Sie nur etwa 60 % der Daten, die Sie tatsächlich benötigen – Pago-Zahlungsdetails, Nómina-Gehaltsaufschlüsselungen und Comercio-Exterior-Zolldaten befinden sich in XML-Anhängen, die die meisten Teams nie extrahieren.
- Ein semantisches Extraktionstool, das Dokumente nach Feldbedeutung statt nach Feldposition liest, verarbeitet CFDI-PDFs, XMLs und Ergänzungen von jedem PAC in einem einzigen Workflow – ohne 8-Vorlagen-Setup, ohne PAC-spezifische Konfiguration.
Was CFDI von jeder anderen Rechnung unterscheidet

Jede Rechnung, die Sie je von einem Lieferanten aus den USA, Europa oder Asien verarbeitet haben, folgt demselben Grundmuster: Der Lieferant stellt ein Dokument aus, Sie empfangen es, und die Daten – Rechnungsnummer, Datum, Betrag, Steuer – befinden sich auf dem Dokument selbst. Das Dokument ist die Quelle der Wahrheit. CFDI kehrt dieses Modell vollständig um.
Ein CFDI (Comprobante Fiscal Digital por Internet) ist ein XML-Dokument, das von einem staatlich autorisierten PAC (Proveedor Autorizado de Certificación) validiert und gestempelt werden muss, bevor es rechtlich gültig wird. Dies wird als Freigabemodell bezeichnet: Der Aussteller erzeugt das XML, übermittelt es an einen PAC, der PAC prüft die Struktur und die digitale Signatur, wendet einen timbre fiscal (digitalen Stempel) an und leitet eine Kopie in Echtzeit an den SAT – Mexikos Steuerbehörde – weiter. Erst nach diesem Drei-Wege-Handshake existiert die Rechnung als rechtliches Dokument. Die vom SAT in diesem Moment zugewiesene UUID (Folio Fiscal) wird zur dauerhaften Kennung, die diese Transaktion mit jeder späteren Prüfung, Zahlung und Steuererklärung verbindet.
Dies hat eine praktische Konsequenz, die die meisten AP-Teams beim ersten Umgang mit mexikanischen Lieferanten überrascht: Die XML-Datei ist die rechtlich gültige Rechnung. Das PDF, das derselben E-Mail beiliegt, ist ein dekorativer Ausdruck – nützlich für die menschliche Prüfung, aber ohne rechtliches Gewicht. Gemäß Artikel 30 CFF müssen sowohl Aussteller als auch Empfänger das ursprüngliche CFDI-XML mindestens fünf Jahre lang aufbewahren. Die Entsorgung des XML unter Beibehaltung nur des PDFs schafft ein Prüfungsrisiko, das viele Teams erst entdecken, wenn der SAT Unterlagen anfordert.
Die aktuelle Version, CFDI 4.0, ist seit April 2023 verpflichtend. Sie führte eine strengere Empfängerprüfung ein: Die RFC, der gesetzliche Name und die Postleitzahl des steuerlichen Wohnsitzes des Empfängers müssen exakt mit dem Steuerzahlerregister des SAT übereinstimmen. Rechnungen der Version 3.3 werden nicht mehr akzeptiert. Für jeden, der einen CFDI-Extraktions-Workflow aufbaut, bedeutet dies, dass jedes verarbeitete Dokument dem 4.0-Schema folgt – ein konsistentes Ziel für die Extraktion, das jedoch mehr Pflichtfelder als frühere Versionen mit sich bringt.
Das Kernproblem bei der CFDI-Extraktion ist nicht, dass die Daten fehlen. Es ist, dass die Daten in einem Format vorliegen, das für die staatliche Freigabe entwickelt wurde, nicht für den Konsum in Tabellenkalkulationen – und die Brücke zwischen den beiden zu bauen, fällt den meisten Teams schwer.
Die sechs CFDI-Dokumenttypen – und wann Sie jedem begegnen
CFDI ist kein einzelner Dokumenttyp. Die SAT definiert sechs verschiedene Comprobante-Typen, jeweils mit eigenen Schema-Regeln, Pflichtfeldern und Extraktionsanforderungen. Wenn Sie Rechnungen von mehr als einer Handvoll mexikanischer Lieferanten verarbeiten, werden Sie den meisten davon begegnen.
| Typ | Code | Wann er erscheint | Extraktionskomplexität |
|---|---|---|---|
| Ingreso | I | Standard-Verkaufsrechnung – Einnahmen aus Waren oder Dienstleistungen. ~85 % aller CFDIs, die Sie erhalten. | Basisschema. IVA-Aufschlüsselung, UsoCFDI erforderlich. |
| Egreso | E | Gutschriften, Erstattungen, Rabatte – Minderungen zuvor ausgestellter Ingreso-Rechnungen. | Muss die ursprüngliche UUID referenzieren. Erfordert dokumentübergreifenden Abgleich. |
| Pago | P | Zahlungsbeleg – wird ausgestellt, wenn eine PPD-Rechnung teilweise oder vollständig beglichen wird. | Hoch. Enthält Complemento de Pago mit UUID-Referenzen pro Zahlung. |
| Nómina | N | Lohnbeleg – Pflicht für jede Mitarbeiterzahlung. Die SAT nutzt ihn zur Gegenprüfung von Einkommensteuer und Sozialversicherung. | Hoch. Ergänzung mit über 50 Feldern, einschließlich IMSS, INFONAVIT, SAR und anderer Abzugsarten. |
| Traslado | T | Transferdokument – Warenbewegung ohne Verkauf (Lagerumbuchungen, Konsignation, Carta Porte). | Mittel. Erfordert Carta-Porte-Ergänzung für Frachtbewegungen. |
| Retenciones | R | Einbehaltungsdokument – meldet einbehaltene Steuern (ISR, IVA) auf Zahlungen an Dritte. | Verwendet ein separates XSD. Nicht Teil des Basis-CFDI-Schemas. |

Der Typ, der in der Praxis die meisten Extraktionsprobleme verursacht, ist Pago. Wenn ein Lieferant eine Rechnung mit PPD-Zahlungsbedingungen ausstellt, enthält die Rechnung selbst die Positionen und Summen, aber nicht die Zahlungsdetails. Bei jeder Zahlung des Käufers stellt der Lieferant einen separaten Pago-CFDI mit einem Complemento de Pago aus, der angibt, welche UUID bezahlt wird, in welcher Höhe, an welchem Datum und mit welcher Methode. Eine AP-Abteilung, die 40 PPD-Rechnungen verarbeitet, muss möglicherweise 60–80 CFDIs abgleichen – jeder erfordert eine UUID-Referenz zwischen dem Ingreso und seinen Zahlungs-Ergänzungen (complementos). Für einen schrittweisen Monatsend-Workflow, der diesen Abgleich über 50+ Rechnungen von mehreren Lieferanten hinweg bewältigt, lesen Sie unseren Leitfaden zu Batch-Verarbeitung mexikanischer CFDI-Rechnungen in der Kreditorenbuchhaltung.
Kernfelder, SAT-Kataloge und was sie für Ihre Tabelle bedeuten
Zu verstehen, welche Felder extrahiert werden sollen, ist nicht nur eine technische Frage – es entscheidet darüber, ob Ihre Ausgabe für die DIOT-Meldung, den IVA-Gutschriftabgleich und die Prüfungsantwort verwendbar ist. Jedes Feld in einem CFDI ist einem SAT-Katalogcode zugeordnet, und dasselbe Feld kann je nach ausgewähltem Code unterschiedliche steuerliche Konsequenzen haben.
Felder auf Kopfebene (Comprobante-Knoten)
| Feld | XPath (vereinfacht) | Warum wichtig |
|---|---|---|
| UUID (Folio Fiscal) | /cfdi:Comprobante/Complemento/TimbreFiscalDigital/UUID | Primärschlüssel jeder Transaktion. Wird für Zahlungsabgleich, Stornierungsverfolgung und Prüfpfad verwendet. |
| RFC Emisor / Receptor | /cfdi:Comprobante/Emisor/@Rfc, /Receptor/@Rfc | Steuer-ID beider Parteien. Ein einziger falscher Buchstabe macht die Ausgabe steuerlich nicht abzugsfähig. |
| Régimen Fiscal | /cfdi:Comprobante/Emisor/@RegimenFiscal | Bestimmt die Steuerregeln des Lieferanten – natürliche vs. juristische Person, RESICO vs. allgemeines Regime. |
| Fecha | /cfdi:Comprobante/@Fecha | ISO-8601-Zeitstempel der Ausstellung. Vom SAT für die Zuordnung zum Steuerzeitraum verwendet. |
| Serie + Folio | /cfdi:Comprobante/@Serie, @Folio | Interne Rechnungsnummer des Lieferanten – nützlich für den Abgleich mit Lieferantenauszügen. |
| SubTotal / Total | /cfdi:Comprobante/@SubTotal, @Total | Nettobetrag und Endbetrag. Der Gesamtbetrag muss Nettobetrag + übertragener IVA − einbehaltener IVA entsprechen. |
| Moneda + TipoCambio | /cfdi:Comprobante/@Moneda, @TipoCambio | Währungscode (MXN, USD, EUR) und Wechselkurs, falls nicht in mexikanischen Pesos. |
| MétodoPago / FormaPago | /cfdi:Comprobante/@MetodoPago, @FormaPago | PUE (einmalig) vs. PPD (Raten) – bestimmt, ob ein Complemento de Pago erwartet wird. |
| UsoCFDI | /cfdi:Comprobante/@UsoCFDI | Verwendungscode des Empfängers – G01 (Anschaffungen), G03 (Ausgaben), D01 (Kfz), P01 (PPD). Bestimmt die IVA-Vorsteuerabzugsberechtigung. |
| Exportación | /cfdi:Comprobante/@Exportacion | Pflichtfeld in CFDI 4.0. 01=Inland, 02=endgültiger Export. Trennt Rechnungen für die DIOT-Meldung. |
Steueraufschlüsselung: IVA, Retenciones und IEPS
Die Steuerstruktur in einem CFDI befindet sich unterhalb der Konzeptebene (Positionsebene), verschachtelt in jedem Concepto. Das bedeutet, dass IVA-Satz und -Betrag positionsbezogen sind und nicht als Rechnungssummen aufgeführt werden. Die Extraktion muss sie summieren, wenn Ihre Ausgabe eine einzelne Steuerzeile pro Rechnung benötigt, aber die zugrunde liegenden Daten sind granular:
- IVA 16% – der Standardsatz, der auf die meisten Waren und Dienstleistungen angewendet wird. Die Grenzregion (nördliche und südliche Grenze) hat unter bestimmten Bedingungen Anspruch auf einen reduzierten IVA-Satz von 8%.
- IVA 0% – gilt für Exporte (Exportación=02/03) sowie bestimmte Grundnahrungsmittel, Medikamente und landwirtschaftliche Betriebsmittel.
- IVA Retenido – der Empfänger kann verpflichtet sein, zwei Drittel der IVA einzubehalten und direkt an das SAT abzuführen. Der CFDI zeigt sowohl
ImpuestosTrasladados(vom Lieferanten berechnete IVA) als auchImpuestosRetenidos(vom Käufer einbehaltene IVA). - ISR Retenido – 10% Einbehalt auf Dienstleistungen von natürlichen Personen, 1,67% auf Einkäufe aus dem allgemeinen Regime, 20% auf Zinszahlungen. Diese müssen in der monatlichen DIOT gemeldet werden.
- IEPS – Verbrauchsteuer auf bestimmte Waren: Alkohol, Tabak, Benzin, zuckerhaltige Getränke. Jede Produktkategorie ist einem anderen IEPS-Satz zugeordnet (3%–160%).
Für die Extraktion ist der entscheidende Punkt, dass ein CFDI mehrere Steuerkombinationen über verschiedene Positionen hinweg enthalten kann. Eine einzelne Rechnung eines Händlers, der sowohl Standardwaren (IVA 16%) als auch IEPS-pflichtige Produkte verkauft, enthält Positionen mit 16%, mit 16%+IEPS und möglicherweise mit 0%. Ihre Extraktionsausgabe muss entweder die Steuerdetails auf Positionsebene bewahren oder korrekt nach Satz aggregieren.
Die Complemento-Ebene: Wo die meisten Extraktionsanleitungen aufhören

Ein Complemento ist ein strukturierter XML-Zusatz, der das Basis-CFDI-Schema für bestimmte Transaktionsarten erweitert. Das Basis-CFDI deckt den Rechnungskopf und die Positionen ab. Alles andere – Zahlungsdetails, Lohnaufschlüsselungen, Zolldaten, Transportinformationen – befindet sich in Complementos. Für AP-Teams, die mexikanische Rechnungen verarbeiten, sind drei Complementos am wichtigsten.
Complemento de Pago (Zahlungs-Ergänzung)
Dieses Complemento ist an jedem Pago-CFDI angebracht und die größte Quelle für Extraktionskomplexität in der realen mexikanischen Kreditorenbuchhaltung. Wenn ein Lieferant eine Rechnung unter PPD-Bedingungen ausstellt (MétodoPago=PPD), enthält die ursprüngliche Ingreso-Rechnung keine Zahlungsdaten. Bei jeder Zahlung des Käufers – ob vollständig, teilweise oder mit aufgeschobenen Bedingungen – stellt der Lieferant ein Pago-CFDI aus, dessen Complemento de Pago Folgendes erfasst:
- Die UUID der ursprünglichen Ingreso-Rechnung, die bezahlt wird
- Den Zahlungsbetrag, der auf diese UUID angewendet wird
- Das Zahlungsdatum und die Zahlungsmethode (Überweisung, Scheck, Bargeld, Karte)
- Die Währung und den Wechselkurs zum Zahlungszeitpunkt (kritisch, wenn die ursprüngliche Rechnung in USD ausgestellt wurde)
- Den Restsaldo (saldo insoluto) nach dieser Zahlung
Eine Ingreso-Rechnung kann durch mehrere Pago-CFDIs beglichen werden – jedes mit derselben UUID, aber einem anderen Zahlungsbetrag. Die Extraktionsherausforderung ist nicht technischer Natur (die UUID ist immer vorhanden), sondern verfahrenstechnisch: Die meisten AP-Teams extrahieren das Complemento de Pago überhaupt nicht und lassen die Zahlungsdaten in einem separaten Dokument, das im Workflow mit nichts verbunden ist, das mit der ursprünglichen Rechnung verknüpft ist.
Eine CFDI-Positionsextraktion, die beim Rechnungskopf aufhört und Complementos unberührt lässt, erfasst nur etwa 60 % der Daten, die Ihr AP-Team tatsächlich benötigt.
Complemento de Nómina (Gehaltsergänzung)
Arbeitgeber in Mexiko müssen für jede Mitarbeiterzahlung eine Nómina-CFDI ausstellen – Gehalt, Boni, Provisionen, Urlaubsprämien, Abfindungen und Weihnachtsgeld (aguinaldo). Das Complemento de Nómina ist eines der feldreichsten Dokumente im CFDI-System und enthält über 50 strukturierte Felder, darunter:
- CURP des Mitarbeiters und IMSS-Sozialversicherungsnummer
- Grundgehalt und Tagesgehalt (Salario Base de Cotización)
- Ordentliche Einkünfte (percepciones), aufgeschlüsselt nach Typschlüssel – Sueldos, Aguinaldo, Prima Vacacional, PTU
- Abzüge (deducciones) – einbehaltene ISR, IMSS-Beiträge, INFONAVIT-Darlehenszahlungen, SAR/Afore, Pensionsdarlehen
- Überstunden (Horas Extra) mit Zeittyp und Prozentsatz
- Gesamtnettobetrag
Für Arbeitgeber mit mehreren Unternehmen bedeutet die Gehaltsabrechnung die Verarbeitung von Hunderten von Nómina-CFDIs pro Abrechnungszyklus. Jeder Mitarbeiter erzeugt eine CFDI pro Zahlung, und jede erfordert, dass die Complemento-Felder in eine HR- oder Gehaltsabrechnungs-Tabelle überführt werden.
Complemento de Comercio Exterior (Außenhandelsergänzung)
Erforderlich bei Exportación=02 (endgültiger Export mit A1-Zollschlüssel) oder Exportación=03 (endgültiger Export mit A2-Schlüssel). Diese Ergänzung enthält die zollseitigen Daten für grenzüberschreitende Transaktionen:
- Zollanmeldungsnummer (pedimento)
- Exporteur-RFC und vollständige Adresse
- Ausländische Steuernummer des Empfängers
- INCOTERM-Code
- Positionsdetails: Zolltarifnummer (fracción arancelaria), zollseitige Maßeinheit, USD-Wert der Waren
- Ursprungs- und Zielland
Version 2.0 dieser Ergänzung ist seit Januar 2024 in CFDI 4.0 integriert. Für Unternehmen, die Waren aus Mexiko exportieren, ist eine Extraktion, die sowohl die Basis-CFDI-Felder als auch die Außenhandelsdaten erfasst, unerlässlich, um Frachtrechnungen mit Zollanmeldungen abzugleichen.
Warum unterschiedliche PACs unterschiedliche PDF-Layouts bedeuten
Jeder CFDI basiert auf demselben XML-Schema — Anexo 20 Version 4.0, definiert in der von SAT veröffentlichten XSD. Das XML ist konsistent, unabhängig davon, welcher PAC es stempelt. Aber die PDF-Darstellung, die die meisten AP-Teams tatsächlich betrachten, hängt vollständig davon ab, wie jeder PAC das XML in ein visuelles Format rendert.
In der Praxis wird ein CFDI-PDF, das von Finkok gestempelt wurde, die Felder in einer anderen visuellen Reihenfolge anordnen als eines, das von SW sapien, Digifact, FacturAPI oder dem kostenlosen Tool von SAT selbst gestempelt wurde. Die Daten sind identisch. Das Layout nicht. Für template-basierte OCR-Tools, die auf fest positionierte Extraktionszonen angewiesen sind, erfordert jedes PAC-Layout eine separate Vorlage. Ein Unternehmen, das Rechnungen von 20 Lieferanten erhält, die gemeinsam 8 verschiedene PACs verwenden, bräuchte 8 Extraktionsvorlagen — und würde Rechnungen vom 9. PAC verpassen, den es noch nicht konfiguriert hat.
Hier kommt die semantische Extraktion ins Spiel — KI, die ein Dokument liest, indem sie versteht, was jedes Feld bedeutet, statt wo es sitzt — und die Wirtschaftlichkeit der CFDI-Verarbeitung verändert. Ein semantisches Extraktionstool, das den Unterschied zwischen einer UUID und einem RFC kennt, kann beide Felder überall auf der Seite finden, egal ob der PAC sie oben, links, rechts, unten oder in einem umrandeten Kästchen platziert hat. Das Layout des PAC wird irrelevant, was bedeutet, dass eine einzige Extraktionskonfiguration jeden Lieferanten und jeden PAC in Ihrem Portfolio abdeckt.
Extraktionsmethoden im Vergleich: Welcher Ansatz passt zu Ihrem CFDI-Workflow?
Verschiedene Teams wählen unterschiedliche Ansätze für die CFDI-Extraktion, basierend auf Dokumentvolumen, Formatmix, technischen Fähigkeiten und Budget. Die folgende Tabelle ordnet die vier Hauptmethoden den Dimensionen zu, die für die mexikanische Rechnungsverarbeitung relevant sind.
| Dimension | Manuelle Dateneingabe | XML-Parsing (Skript) | Vorlagen-OCR | KI-semantische Extraktion |
|---|---|---|---|---|
| Einrichtungszeit | Keine | 1–3 Tage (Skript schreiben, testen) | 1–2 Stunden pro PAC-Layout | ~15 Minuten |
| Alle PAC-Layouts | Ja (manuell) | N/V (arbeitet mit XML) | Nein – jedes Layout braucht eine Vorlage | Ja – layoutunabhängig |
| Scans/Fotos | Ja | Nein | Teilweise – Qualitätsverlust | Ja |
| Complementos | Wenn der Nutzer danach sucht | Ja (wenn Skript dafür geschrieben) | Nein – Complementos nicht im PDF | Ja – wenn Tool beide Quellen verarbeitet |
| Zeit pro 50 CFDIs | ~3–4 Stunden | ~2 Minuten (Stapel) | ~15 Minuten + Korrekturen | ~2–5 Minuten |
| Fehlerquote (feldebene) | ~3–5% (Tippfehler, Vertauschungen) | ~1% (Schema-Konflikte) | ~8–15% (Layout-Konflikte) | ~1–3% |
| Erforderliche Fachkenntnisse | Keine | Python/XPath/XML | Mittel (Zonenkonfiguration) | Keine |
| Skalierbar auf 500+/Monat | ❌ | ✅ | ⚠️ | ✅ |
Die Wahl zwischen XML-Parsing und KI-gestützter semantischer Extraktion ist nicht immer eindeutig. Wenn jeder Lieferant das rohe CFDI-XML sendet und Ihr Team über Skriptfähigkeiten verfügt, erzeugt XML-Parsing mit XPath oder einer Bibliothek wie lxml in Python eine saubere, direkte Feldextraktion aus den strukturierten Daten. Die Einschränkung besteht darin, dass XML-Parsing keine gescannten Rechnungen lesen kann, die visuelle PDF-Darstellung nicht interpretieren kann, wenn das XML nicht angehängt ist, und eine aktive Wartung erfordert, wenn SAT das Schema aktualisiert (wie bei der Migration von 3.3→4.0 geschehen).
Die KI-gestützte semantische Extraktion hingegen arbeitet mit jedem visuellen Dokument — PDF, gescanntes Bild, Handyfoto — und benötigt keine strukturierte XML-Eingabe. Moderne Vision-Modelle, die mit Tausenden von Rechnungslayouts trainiert wurden, können die UUID-, RFC- und IVA-Felder lokalisieren, indem sie verstehen, was diese Bezeichnungen bedeuten, unabhängig davon, wo im Dokument sie erscheinen. Für Teams, die eine Mischung aus PDF-Anhängen (ohne XML) und gescannten Dokumenten erhalten, ist dies die einzige skalierbare Option.
Dateien werden sicher verarbeitet und nicht gespeichert. Testen Sie es mit einer echten CFDI-PDF oder -XML.
Wie KI-Extraktion CFDI-Dokumente verarbeitet – in allen drei Formaten
Das häufigste Szenario für die meisten AP-Teams ist, dass Sie eine Mischung aus XML-Dateien, PDF-Anhängen und gescannten Dokumenten von verschiedenen Lieferanten mit unterschiedlichen PACs erhalten. Einen separaten Workflow für jedes Format zu erstellen, erzeugt Wartungsaufwand und Verarbeitungslücken. Ein KI-Extraktionsansatz, der alle drei als Eingabequellen mit einer einzigen Felddefinition behandelt, vereinfacht dies erheblich.
ImageToTable.ai verarbeitet CFDI-Extraktion über das Paradigma der Benutzerdefinierten Spaltenextraktion – Sie definieren die Spalten, die Sie in Ihrer Ausgabe wünschen, und die KI findet jeden Wert, indem sie versteht, was das Feld bedeutet, nicht wo es auf der Seite steht. Für CFDI sieht der Workflow so aus:
UUID (Folio Fiscal), RFC Emisor, RFC Receptor, SubTotal, IVA Tasa, IVA Monto, Total, UsoCFDI, MétodoPago, Moneda. Fügen Sie bei PPD-Rechnungen UUID Pagado und Monto del Pago hinzu, um die Felder der Ergänzung (complemento) Pago zu erfassen.Dieser Ansatz löst das PAC-Layout-Problem automatisch: Die KI hängt nicht davon ab, dass Felder an einer festen Position stehen, sodass ein von Finkok gerenderter CFDI (mit UUID in der oberen rechten Ecke der zweiten Seite) und einer von FacturAPI gerendert (mit UUID in der unteren linken Fußzeile) beide dieselbe strukturierte Ausgabe erzeugen.
Für die Extraktion der Ergänzung (complemento) im Speziellen: Bei der direkten Verarbeitung von XML-Dateien kann die KI die hierarchische Struktur navigieren — vom /Complemento/Pagos-Knoten eines Pago-CFDI ausgehend, um die referenzierte UUID, den Zahlungsbetrag und das Datum zu extrahieren. Bei PDF-Darstellungen desselben Pago-CFDI liest die KI die Felder der Ergänzung (complemento) dort, wo der PAC sie im visuellen Dokument platziert hat.
Integration von CFDI-Daten mit mexikanischer Buchhaltungssoftware
Extrahierte CFDI-Daten sind nur dann nützlich, wenn sie das System erreichen, mit dem Ihr Buchhaltungsteam tatsächlich arbeitet. Die mexikanische Buchhaltungssoftwarelandschaft unterscheidet sich erheblich von der in den USA oder Europa – die dominierenden Anbieter sind lokal, und jeder hat spezifische Erwartungen an den Datenimport.
CONTPAQi
CONTPAQi ist die am weitesten verbreitete Buchhaltungs- und Unternehmensverwaltungssuite in Mexiko und deckt Buchhaltung (Contabilidad), elektronische Rechnungsstellung (Factura Electrónica), Lohnabrechnung (Nóminas) und Handelsaktivitäten (Comercial) ab. CONTPAQi importiert CFDI-XML nativ zur Prüfung, aber für die Massendatenanalyse – Abgleich von 200 Lieferantenrechnungen mit Budgetcodes, Erstellung von Ausgabenberichten nach UsoCFDI-Kategorie oder Vorbereitung von DIOT-Eingaben – müssen die Daten in einem Excel-Format vorliegen, das dem Kontenplan von CONTPAQi entspricht. Extrahierte Spalten wie RFC, UUID und IVA-Betrag füllen direkt CONTPAQis auxiliar de cuentas, wenn sie als Sammelbuchungseintrag importiert werden.
Aspel SAE / COI / NOI
Aspel ist die zweithäufigste Buchhaltungsplattform in mexikanischen KMU, mit den Modulen SAE (Verwaltung), COI (Buchhaltung) und NOI (Lohnabrechnung). Wie CONTPAQi kann Aspel CFDI-XML zur Einzelrechnungsprüfung verarbeiten, aber die Berichtsebene funktioniert am besten, wenn CFDI-Massendaten in einer Excel-Tabelle vorkompiliert werden, die Aspels Importvorlagen entspricht. Üblich ist bei mexikanischen Controllern, ein CFDI-Hilfsregister in Excel zu führen – eine Zeile pro Rechnung, Spalten für RFC, UUID, Folio, IVA-Satz und Einbehalt – und es monatlich mit Aspels Hauptbuch abzugleichen. Die automatisierte Extraktion verwandelt dieses Hilfsregister von einer manuellen Tippübung in einen direkten Export.
SAP und Oracle NetSuite
Größere Unternehmen in Mexiko nutzen typischerweise SAP oder Oracle NetSuite mit Lokalisierungen für die CFDI-Konformität. Diese Systeme verarbeiten die XML-Validierung und PAC-Übermittlung automatisch über ihre integrierten CFDI-Module. Die Herausforderung verschiebt sich jedoch von der Konformität zum Abgleich: Beschaffungs- und Kreditorenbuchhaltungsteams müssen extrahierte CFDI-Daten mit Bestellungen, Wareneingangsbelegen und Lieferantenvertragsbedingungen abgleichen. Ein KI-Extraktionsworkflow, der CFDI-Daten als strukturierte Zeilen ausgibt – mit UUID, RFC, Positionsartikel-Produktcodes (c_ClaveProdServ) und Steueraufschlüsselung – speist direkt in SAPs MIRO (Logistik-Rechnungsprüfung) oder NetSuites AP-Stapelimportprozesse ein.
Häufig gestellte Fragen
Kann KI Daten aus CFDI-XML-Dateien extrahieren?
Ja. Moderne KI-Extraktionstools können CFDI-XML-Dateien direkt parsen und die strukturierten Felder aus dem Anexo-20-Schema auslesen. Im Gegensatz zu reinen XML-Parsing-Skripten, die für jedes Feld XPath-Abfragen benötigen, kann die KI-basierte Extraktion Schema-Varianten verarbeiten und die Daten in die von Ihnen definierte Spaltenstruktur ausgeben – unabhängig davon, ob die Quelle XML, PDF oder ein gescannter Scan ist. Dies ist besonders nützlich für gemischte Chargen, bei denen einige Lieferanten XML-Anhänge und andere PDFs senden.
Welche Felder sollte ich aus einer CFDI für die DIOT-Meldung extrahieren?
Für die monatliche DIOT (Declaración Informativa de Operaciones con Terceros) benötigen Sie mindestens: RFC des Lieferanten, UUID, SubTotal, IVA (aufgeschlüsselt nach Steuersatz – 16 %, 8 %, 0 %), einbehaltene IVA, einbehaltene ISR und UsoCFDI. Die DIOT verlangt, dass die IVA nach Steuersatz gemeldet wird. Ihre Extraktionsausgabe muss die IVA daher nach Steuersatz-Code trennen und nicht als einzelnen Gesamtbetrag angeben. Das Feld Exportación bestimmt zudem, ob es sich um eine Inlands- oder Exporttransaktion handelt – die DIOT trennt diese Kategorien.
Wie verarbeite ich eine PPD-Rechnung, wenn nur das PDF verfügbar ist?
Wurde die ursprüngliche Ingreso-CFDI unter PPD ausgestellt und Sie haben nur das PDF, sind die Rechnungsdaten (Positionen, Summen, IVA) aus dem PDF lesbar, aber die Zahlungsdetails fehlen – diese befinden sich in der separat ausgestellten Pago-CFDI. Sie benötigen entweder die ursprünglichen XML-Dateien oder die Pago-CFDI-PDFs, um den Zahlungsabgleich durchzuführen. Ein KI-Extraktionstool, das sowohl PDF-Rechnungen als auch Pago-CFDI-Dokumente verarbeitet, kann die Zahlungs-UUID-Referenzen in einem einzigen Schritt ausgeben, wenn Sie Spalten für die Complemento-de-Pago-Felder einfügen.
Berücksichtigt die CFDI-Extraktion automatisch die unterschiedlichen PAC-PDF-Layouts?
Vorlagenbasierte OCR-Tools benötigen eine separate Vorlage für jedes PAC-Layout – Finkok, SW sapien, Digifact, FacturAPI und das kostenlose SAT-Tool erzeugen alle visuell unterschiedliche PDFs aus denselben XML-Daten. KI-gestützte semantische Extraktionstools, die Dokumente durch das Verständnis der Feldbedeutung und nicht der Feldposition lesen, verarbeiten automatisch alle PAC-Layouts ohne individuelle PAC-Konfiguration. Dieselbe Extraktionskonfiguration, die für eine Finkok-gestempelte CFDI funktioniert, funktioniert auch für eine, die von einem anderen PAC gestempelt wurde.
Ist die PDF-Darstellung für Extraktionszwecke rechtlich gültig?
Für AP-Workflows und Abstimmungszwecke ist die Datenextraktion aus dem PDF betrieblich ausreichend – das PDF enthält dieselben Rechnungsdaten wie das XML. Nach mexikanischem Steuerrecht (CFF Artikel 30) ist jedoch nur das XML rechtlich gültig. Für die Prüfungsaufbewahrung müssen Sie das originale XML unabhängig vom verwendeten Extraktionsformat archivieren. Ein praktischer Workflow ist die Extraktion aus dem empfangenen Format (meist PDF), aber die Archivierung des XML in einem strukturierten Repository für die vorgeschriebene fünfjährige Aufbewahrungsfrist gemäß NOM-151-SCFI-2016.
Kann ich mit demselben Tool Daten aus Nómina-(Gehalts-)CFDIs extrahieren?
Ja, wenn das Extraktionstool eine feldspezifische Spaltenbenennung unterstützt, die mit den Angaben im Gehaltsdokument übereinstimmt. Der Complemento de Nómina enthält über 50 Felder – Gesamtbezüge, Gesamtabzüge, einbehaltene ISR, IMSS, INFONAVIT sowie einzelne Einkommens- und Abzugsartcodes. Ein KI-Tool, das Dokumente semantisch liest, kann diese Felder extrahieren, wenn Sie die Spalten nach den benötigten Gehaltsdatenpunkten benennen. Die Genauigkeit ist bei gedruckten Nómina-PDFs höher als bei handschriftlichen Gehaltsaufzeichnungen, und die hierarchische Struktur der Nómina-Ergänzungen führt dazu, dass die XML-Version für tief verschachtelte Felder wie Percepciones/Percepcion/TipoPercepcion zuverlässigere Ergebnisse liefert als die visuelle PDF-Version.
Was passiert bei Stornierung eines CFDI – muss ich erneut extrahieren?
Die CFDI-Stornierung folgt einem Empfänger-Zustimmungsmodell. Wenn ein Lieferant eine Rechnung storniert (Grundcodes 01–04), muss der Empfänger die Stornierung innerhalb von 72 Stunden annehmen oder ablehnen. Bei Annahme wird der ursprüngliche CFDI ungültig, und bei Ausstellung eines Ersatzbelegs (Grundcode 01) wird eine neue UUID vergeben. Ihr Extraktionsworkflow muss diesen Lebenszyklus abbilden: entweder durch Markieren stornierter UUIDs in Ihrer Datenbank und Import des Ersatzbelegs oder durch Pflegen einer „CFDI-Status“-Spalte (aktiv/storniert), die beim Prüfen des SAT-Stornierungsfeeds aktualisiert wird. Automatisierte Extraktionstools mit Verarbeitungshistorie können den Ersatz-CFDI erneut einlesen und den ursprünglichen als ersetzt kennzeichnen – dies erfordert jedoch entweder das originale XML oder eine persistente Datenbank zuvor extrahierter UUIDs.
Was mache ich mit den Complemento-de-Pago-Feldern in meiner Ausgabe?
Die Complemento-de-Pago-Felder – insbesondere die referenzierte UUID, der Zahlungsbetrag, das Zahlungsdatum und der offene Saldo – sollten in dieselbe Tabelle extrahiert werden, die Ihre Ingreso-Rechnungsdaten enthält. Der empfohlene Ansatz ist, sie als zusätzliche Spalten in die Batch-Ausgabe aufzunehmen: Bei PPD-Rechnungen liefert die Extraktion sowohl die Basisdaten der Rechnung als auch die Zahlungsfelder aus dem Pago CFDI. Anschließend können Sie mit einem SVERWEIS (oder einer vergleichbaren Funktion) die Pago-UUID-Referenz mit der ursprünglichen Ingreso-UUID abgleichen und so feststellen, welche Rechnungen vollständig beglichen sind und welche noch offen stehen. Dies eliminiert den manuellen Abgleichsschritt, der bei der monatlichen CFDI-Abstimmung die meiste Zeit in Anspruch nimmt.
Die Kluft zwischen „Ich habe CFDI-Dokumente“ und „Mein Buchhaltungssystem hat die Daten“ ist keine technologische Kluft — es ist eine Formatübersetzungslücke. Der richtige Extraktionsworkflow schließt diese Lücke in Minuten, nicht in Stunden.
Die CFDI-Datenextraktion ist grundsätzlich nicht schwierig. Das XML ist strukturiert. Das PDF trägt dieselben Daten. Die Complementos sind in den von SAT veröffentlichten XSDs dokumentiert. Was es in der Praxis schwierig macht, ist die Vielfalt der Formate, die Unterschiedlichkeit der PAC-Layouts, die hierarchische Verschachtelung von Steuer- und Complemento-Daten sowie die Tatsache, dass die meisten Extraktionsworkflows für flache, positionsbasierte Dokumente konzipiert wurden, die jedes Mal gleich aussehen. Ein semantischer Ansatz — einer, der Dokumente liest, indem er versteht, was jedes Feld ist, nicht wo es sitzt — bewältigt all diese Komplexitäten mit einer einzigen Felddefinition. Sie definieren die Spalten. Die KI findet die Daten. Das Format wird irrelevant.
Wenn Sie heute mexikanische Lieferantenrechnungen verarbeiten und mehr Zeit damit verbringen, Daten zwischen Dokumenten zu verschieben, als sie zu nutzen, ist der nächste Schritt klar: Nehmen Sie eine Beispiel-Batch — 10 bis 20 CFDI-Dateien in welchem Format auch immer Sie haben — und führen Sie sie durch einen KI-Extraktionsworkflow. Die Kluft zwischen „Ich habe die Dokumente“ und „Meine Tabelle hat die Daten“ ist kleiner, als es der manuelle Prozess erscheinen lässt.
Dieser Artikel ist Teil der ImageToTable.ai-Leitfadenreihe zur Rechnungsdatenextraktion. Für einen breiteren Überblick siehe Was ist Rechnungsdatenextraktion? und Was ist OCR?. Für die Einführung in CFDI für Anfänger lesen Sie Was ist ein CFDI?. Für ein praktisches Schritt-für-Schritt-Extraktionstutorial, das jedes CFDI-Format abdeckt, siehe Mexikanische CFDI-Rechnungsdatenextraktion nach Excel. Für einen tieferen Einblick, warum die CFDI-Verarbeitung traditionelle AP-Workflows herausfordert, lesen Sie Warum die Verarbeitung mexikanischer CFDI-Rechnungen schwieriger ist, als die meisten Teams erwarten.