Warum Finanzberichte
Einheiten, Vorzeichen und Zwischensummen verlieren
Eine Bilanz mit der Überschrift „in Tausend“ ist keine Zahlentabelle mit einer Anmerkung darüber. Die Anmerkung ist Teil jeder Zahl. Jede Zahl unter dieser Überschrift bedeutet das Tausendfache dessen, was ihre Ziffern angeben, und die eine Zeile, die den Multiplikator angibt, enthält selbst keine Zahl. Ein Extraktionsdurchlauf, der die Arithmetik und nicht die Struktur liest, liest jeden Wert exakt so, wie er geschrieben steht, und verwirft den Multiplikator – so wird eine Zeile mit 156.857 in einem Bericht in Tausend als 156.857 $ statt als 156,9 Millionen $ behandelt.
Das ist eine von drei Stellen, an denen ein Finanzbericht Bedeutung außerhalb der Zahlen selbst trägt. Negative Beträge werden in Klammern geschrieben statt mit einem Minuszeichen. Zwischensummen stehen über den Positionen, die sie zusammenfassen, sodass die Hierarchie entscheidet, welche Zahlen addiert werden dürfen und welche nicht. Zieht man einen Bericht in ein flaches Raster, können alle drei Konventionen auf einmal verschwinden – und es bleibt eine Tabelle, die vollständig aussieht und mit nichts übereinstimmt.

Wichtigste Erkenntnisse
- Ein Bericht mit der Angabe „in Tausend“ kann einen 1.000-fachen Fehler in Zellen tragen, die exakt richtig aussehen.
- Nichts in einem sauberen Raster warnt Sie, denn die Extraktion ebnet die Hierarchie ein und eine Spaltensumme zählt dasselbe Geld zwei- oder dreimal.
- Prüfen Sie die Einheit, die Vorzeichen und jede Zwischensumme gegen die eigene Arithmetik des Berichts – dann zeigen sich die Fehler, die jede Formatprüfung bestehen, innerhalb von Minuten.
Buchhalter und Finanzteams übertragen Bilanzen und Gewinn- und Verlustrechnungen in Tabellenkalkulationen für Arbeitspapiere, Konsolidierung, Kennzahlenanalysen und Dreistufenmodelle. Die Quelle kann ein QuickBooks- oder Xero-Export, ein NetSuite- oder Sage-Bericht, ein gescannter geprüfter Abschluss oder ein in Excel erstelltes und als PDF gedrucktes Board-Paket sein. Der Extraktionsteil ist inzwischen schnell. Was darüber entscheidet, ob das Ergebnis brauchbar ist, ist, ob die drei oben genannten Strukturen den Weg überstanden haben. Dieser Artikel erläutert jede einzelne, was es kostet, wenn sie verloren geht, und wie Sie die extrahierten Zahlen prüfen, bevor sie weiterverwendet werden. Wenn Sie neu im Bereich Dokumentextraktion sind, legt der allgemeinverständliche Leitfaden zur KI-Dokumentextraktion zunächst die Grundlagen dar.
Ein Jahresabschluss ist eine dreifache Struktur, keine Zahlenspalte
Was einen Jahresabschluss von einer Rechnung unterscheidet, sind nicht die Zahlen. Es sind die drei Dinge, von denen die Zahlen abhängen: eine einmalig für den gesamten Abschluss angegebene Einheitenangabe, eine Vorzeichenkonvention für negative Werte und eine Hierarchie von Zwischensummen, die Positionen zu übergeordneten Summen gruppiert. Ein Abschluss ist dafür konzipiert, von einer Person gelesen zu werden, die alle drei Konventionen bereits kennt, daher werden sie leichtgewichtig und nur einmal genannt.
Auf einer Rechnung ist jede Zeile unabhängig. Menge, Einzelpreis und Zeilensumme einer Position sagen nichts über die nächste aus, und das Einlesen in separate Spalten geht nicht verloren, weil es nichts gab, das sie verband. Eine Bilanz ist das Gegenteil. Liest man die Aktivseite nach unten, passiert man eine Überschrift, dann die darunterliegenden Konten, dann eine Zwischensumme, dann die nächste Überschrift. Die Zwischensumme ist kein Gegenposten zu den Zeilen darüber. Sie ist deren Summe, und die Summe darunter ist die Summe der Zwischensummen. Ein Tool, das jede sichtbare Zahl als zu extrahierende Zelle behandelt, behandelt einen Baum als Liste.
Auf einer Rechnung steht jede Zeile für sich. Bei einem Jahresabschluss sind die Zeilen keine Gegenposten, und die Zeile am oberen Rand der Seite verändert die Bedeutung jeder darunterliegenden Zahl.
Die Einheitenangabe „in Tausend“ ist die teuerste Zeile, die man weglassen kann

Das folgenreichste Element eines Abschlusses ist eine Zeile, die keine Zahl enthält: die Einheitenangabe in der Überschrift. Gemäß IAS 1, Paragraph 51(e), muss ein Unternehmen die verwendete Rundungsstufe angeben, und Paragraph 53 erlaubt, Abschlüsse in Tausend oder Millionen der Darstellungswährung darzustellen, sofern diese Rundungsstufe angegeben und keine wesentlichen Informationen ausgelassen werden (IFRS Foundation, IAS 1). US-Einreichungen handhaben dies ebenso gemäß SEC Regulation S-X, die Geldbeträge in ganzen Dollar oder Vielfachen davon erlaubt und verlangt, dass das Vielfache direkt unter der Abschlussüberschrift oder am Kopf der Geldspalten angegeben wird (17 CFR § 210.4-01(b)).
Genau diese Platzierung ist das Problem. Die Angabe steht außerhalb des Zahlenrasters, oft als kleiner Text unter dem Titel, während die Zahlen in den Spalten stehen. Eine Extraktion, die die Geldspalten liest, liefert Werte, die Ziffer für Ziffer korrekt und um den Faktor tausend falsch sind. Eine beim SEC eingereichte konsolidierte Bilanz mit der Überschrift „$ in Tausend“ weist Zahlungsmittel und Zahlungsmitteläquivalente von 156.857 aus. Als Dollar gelesen sind das 156.857 $. Mit der Überschrift angewendet sind es 156,9 Millionen $ (SEC-EDGAR-Beispiel). Ein weggelassenes „in Tausend“ ist ein 1.000-facher Fehler, und anders als eine falsch gelesene Ziffer ist er in der Zelle unsichtbar.
Zwei Details machen dies schlimmer als eine einzelne fehlende Fußnote. Erstens ist der Multiplikator nicht über alles, was ein Unternehmen veröffentlicht, einheitlich. Ein Abschluss kann in Tausend sein, eine Segmentangabe im selben Bericht in Millionen und ein Nachhaltigkeitsanhang in einer dritten Einheit, was bedeutet, dass eine einzelne Annahme, die auf eine gesamte Einreichung angewendet wird, irgendwo falsch sein wird. Zweitens schränken sich Überschriften oft selbst ein mit „mit Ausnahme der Beträge je Aktie“ oder Prozentangaben. Ein pauschaler Multiplikator, der auf eine Angabe je Aktie angewendet wird, ist selbst ein Fehler, weil diese eine Zeile nicht in Tausend ist. Ein Entwickler, der Monate damit verbracht hat, genau dieses Problem für SEC-Daten zu lösen, beschreibt es unverblümt: „Erkennen Sie den Multiplikator (Tausend, Millionen usw.) ... Manchmal stehen diese Informationen im Tabellenkopf, manchmal innerhalb der Perioden, manchmal darunter, manchmal fehlen sie vollständig.“ (r/datasets).
Die Lösung besteht darin, die Einheit mit der Zahl reisen zu lassen. Da die Angabe gedruckter Text auf der Seite ist, kann sie als eigene Spalte extrahiert werden, sodass jede Zeile den Maßstab trägt, unter dem sie gelesen wurde, und jeder nachgelagerte Prozess ihn sehen kann. Wenn bekannt ist, dass ein Batch einheitlich ist, kann der Multiplikator stattdessen einmal als fester Faktor in den Extraktionsregeln angewendet werden, aber das gilt nur, solange jeder Abschluss im Batch dieselbe Einheit verwendet. In beiden Fällen ist die Prüfung dieselbe Frage: Wenn Sie jede Zahl in dieser Zelle mit 1.000 multiplizieren würden, wäre der Abschluss dann immer noch sinnvoll? Wenn die Antwort nein lautet, fehlt der Multiplikator oder wurde doppelt angewendet.
Klammern bedeuten negative Zahlen, keine Formatierung

In der Finanzberichterstattung ist ein Wert in Klammern ein negativer Betrag, also ist (1.049.779) minus eine Million neunundvierzigtausend siebenhundertneunundsiebzig, kein Dekor für eine positive Zahl. Die SEC Regulation S-X macht dies explizit: Negative Beträge, historisch als rote Zahlen dargestellt, müssen so angezeigt werden, dass das negative Attribut klar erkennbar ist, und die Regel verlangt von den Erstellern, die Grenzen der Reproduktionsverfahren bei der Wahl der Darstellung zu berücksichtigen (17 CFR § 210.4-01(c)). Die Klammerkonvention existiert genau deshalb, weil rote Tinte einen Fotokopierer oder Scanner nicht übersteht.
In einer Bilanz sind die negativen Zahlen keine Randfälle. Dort liegt die eigentliche Aussage: ein kumulierter Fehlbetrag, eigene Aktien, kumulierte sonstige Verluste im Gesamtergebnis, ein steuerlicher Verlustvortrag und jede „Weniger:“-Gegenposten-Zeile, die eine Summe reduziert. Entfernt man die Klammern, wird aus einem Defizit einbehaltene Gewinne, aus einem Verlust ein Gewinn, und der Eigenkapitalbereich stimmt nicht mehr mit der Aktivsumme überein. Der Fehler ist still, aus demselben Grund wie der Einheitenfehler: Die Zahl in der Zelle ist ein völlig gewöhnlicher positiver Betrag und besteht jede Prüfung, die nur fragt, ob die Zelle eine Zahl enthält.
Klammern sind außerdem das schwierigere der beiden Vorzeichen-Signale, das automatisch erhalten werden muss, denn ein führendes Minuszeichen ist ein Zeichen, das ein Parser erwartet, während ein Klammerpaar eine Interpunktion um einen Wert herum ist. Die praktische Verteidigung besteht darin, das extrahierte Vorzeichen gegen die Buchhaltungsstruktur zu prüfen und nicht gegen sich selbst. Eine Zeile, die das Dokument als Defizit oder Verlust kennzeichnet, sollte negativ herauskommen. Ist das nicht der Fall, wurde das Vorzeichen entfernt, und der Ort zur Bestätigung ist die Quellseite, nicht die Tabellenkalkulation.
Zwischensummen sind keine Einzelposten – das Summieren der Spalte führt zu Doppelzählungen

Die dritte Struktur übersteht wahrscheinlich den Blick des Lesers, scheitert aber an einer Formel. Die Zeilen eines Jahresabschlusses sind nicht unabhängig, und der häufigste Extraktionsfehler besteht darin, eine Zwischensumme wie eine weitere zu addierende Zeile zu behandeln. Die Summe des Umlaufvermögens ist die Summe der darüber liegenden Konten. Die Bilanzsumme ist die Summe aus Umlaufvermögen, Anlagevermögen und allen anderen Vermögens-Zwischensummen. Wenn jede numerische Zeile extrahiert und die Spalte dann summiert wird, wird derselbe Betrag zwei- oder dreimal gezählt, und die Summe ist auf eine Weise bedeutungslos, die dennoch präzise aussieht.
Gegenposten fügen eine zweite Ebene hinzu. „Abzüglich: kumulierte Abschreibungen und Amortisationen“ reduziert den Bruttobetrag des Anlagevermögens auf einen Nettobetrag. Wird dieser als positiver Betrag summiert, bläht er das Vermögen auf, statt es zu reduzieren. Dasselbe Muster erscheint als „Abzüglich: Wertberichtigung auf zweifelhafte Forderungen“, „Abzüglich: eigene Aktien“ und „Abzüglich: kumulierte Amortisationen“. Jeder dieser Posten ist ein echter Negativposten, der als Einzelposten in der Mitte eines Abschnitts erscheint, und jeder verändert die Zwischensumme, die er speist, nur dann korrekt, wenn sein Vorzeichen richtig gelesen wird.
| Strukturelement | Wie es auf der Seite aussieht | Fehler, wenn die Extraktion die Tabelle als flach behandelt |
|---|---|---|
| Einheitenangabe | Kleiner Beschriftungstext, z. B. „in Tausend, außer Beträge je Aktie“ | Jeder Wert um den Faktor 1.000 falsch, oder Zeilen je Aktie falsch skaliert |
| Konvention für negative Vorzeichen | Klammern, z. B. (1.049.779) | Fehlbetrag als Gewinn gelesen, Verlust als Gewinn, Eigenkapital stimmt nicht mehr |
| Hierarchie der Zwischensummen | Eingerückte Zeilen unter Überschriften gruppiert, mit einer Zwischensummenzeile | Das Summieren der gesamten Spalte zählt denselben Betrag zwei- oder dreimal |
| Gegenposten | „Abzüglich: kumulierte Abschreibungen“ | Ein Abzug wird als positiver Betrag addiert und bläht die Abschnittssumme auf |
| Spalten für Vergleichsperioden | Zwei oder mehr Jahres-Spalten nebeneinander | Vorjahreswerte in der Spalte des aktuellen Jahres platziert und umgekehrt |
Vergleichsspalten haben ihre eigene Variante desselben Problems. Ein Abschluss zeigt das aktuelle und das Vorjahr nebeneinander, manchmal drei Perioden quer. Die Periodenbeschriftungen stehen in einer Kopfzeile, die strukturell von den Zahlen getrennt ist. Eine Extraktion, die die Zahlen, aber nicht die Periodenzuordnung erfasst, kann Vorjahreswerte unter das aktuelle Jahr setzen. Nichts in der Zelle verrät die Vertauschung. Sie fällt erst später auf, wenn der gezeichnete Trend in die falsche Richtung läuft oder die berechnete Veränderung das falsche Vorzeichen hat.
So validieren Sie einen extrahierten Finanzbericht
Validierung bedeutet, die vier Dinge zu prüfen, die bei der Extraktion am wahrscheinlichsten verloren gehen: die Einheitenangabe, die Vorzeichen, die Zwischensummen-Arithmetik und den Zeitraum, zu dem jeder Wert gehört. Die Prüfungen stützen sich auf die interne Logik des Berichts selbst, benötigen also keine externen Daten, und sie schließen die Lücke, die die drei Fallstricke öffnen.
Einheitenangabe bestätigen und genau einmal anwenden
Finden Sie die Überschrift und prüfen Sie, auf welche Werte sie sich bezieht. Wenn der Bericht „in Tausend" angibt und die extrahierte Zelle weiterhin 156.857 anzeigt, entscheiden Sie, ob der Multiplikator in die Zelle oder in eine nachgelagerte Spalte gehört, und wenden Sie ihn nur an einer Stelle an. Ein doppelt angewendeter Multiplikator ist genauso falsch wie ein fehlender.
Jedes Vorzeichen anhand der Beschriftung prüfen, nicht anhand der Zelle
Eine Zeile, die der Bericht als Defizit, Verlust oder „Weniger:"-Zeile bezeichnet, sollte negativ ausgegeben werden. Bestätigen Sie, dass die Werte in Klammern ihr Vorzeichen behalten haben. Wenn ein Vorzeichen falsch aussieht, verwenden Sie den Review-Modus, um von der Zelle zum hervorgehobenen Quellbereich auf der Originalseite zu springen und die Klammern selbst zu lesen.
Jede Zwischensumme aus ihren eigenen Komponenten neu berechnen
Addieren Sie die Unterposten einer Zwischensumme und vergleichen Sie das Ergebnis mit der im Bericht ausgewiesenen Zwischensumme. Wiederholen Sie dies für die Summe eine Ebene höher. Summieren Sie nicht eine gesamte Spalte. Wenn eine ausgewiesene Zwischensumme korrekt ist, Ihre Spaltensumme jedoch falsch, ist der Summierungsfehler bestätigt – nicht eine falsch gelesene Zahl.
Die Bilanzidentität zuletzt testen
In einer Bilanz müssen die Gesamtaktiva den Gesamtpassiva plus dem Gesamteigenkapital entsprechen. Wenn dies fehlschlägt, gehen Sie die früheren Prüfungen der Reihe nach durch: Ein falsches Vorzeichen oder eine falsch gelesene Zwischensumme ist die übliche Ursache. In einer Gewinn- und Verlustrechnung besteht die entsprechende Prüfung darin, dass die Komponenten mit dem Nettoergebnis übereinstimmen.
Diese Prüfungen sind mechanisch, und die Extraktion kann einen Teil davon übernehmen. Benutzerdefinierte Spaltenextraktion bedeutet, dass Sie die gewünschten Felder benennen, z. B. „Einheitenangabe", „Konto", „Aktuelles Jahr", „Vorjahr", und die KI findet jeden Wert anhand seiner Bedeutung statt anhand seiner Position auf der Seite, sodass eine gedruckte Überschrift wie „in Tausend" als eigene Spalte zurückkommt und der Maßstab mit den Werten mitwandert. Eine berechnete Spalte kann dies noch einen Schritt weiterführen: Da sie zeilenübergreifende Aggregation innerhalb eines Abschnitts und bedingte Logik unterstützt, die die Differenz ausgibt, wenn Summen nicht übereinstimmen, können Sie die Beziehung Zwischensumme-zu-Summe und die Identität Aktiva-gleich-Passiva-plus-Eigenkapital während der Extraktion auswerten lassen, sodass sich ein Bericht, der nicht aufgeht, selbst kennzeichnet, bevor er Ihr Modell erreicht. Und wenn ein Wert dennoch ein menschliches Auge benötigt, hebt der Review-Modus mit Bbox-Lokalisierung genau hervor, woher er auf der Quellseite stammt, sodass das Bestätigen einer Klammer oder einer Einheitenangabe einen Klick statt eines Scrollens durch das PDF erfordert.
Dateien werden sicher verarbeitet und nicht gespeichert.
Die umfassendere Prüfroutine, einschließlich Spaltenausrichtung, Zeilenanzahl, Prüfung auf fehlende Felder und der Frage, wann eine erneute Extraktion sinnvoller ist als eine manuelle Korrektur, ist im Sieben-Punkte-QA-Checkliste für die Extraktion beschrieben. Die Fehlerbilder, die einer ersten Prüfung entgehen, sind in Warum sich Fehler in extrahierten Daten nachträglich vervielfachen aufgeführt. Diese Artikel behandeln die Verifizierung allgemein; was spezifisch für einen Finanzbericht ist, sind die drei oben genannten Strukturen, denn kein anderer Dokumenttyp gibt seine Einheitenangabe nur einmal an, schreibt negative Werte in Klammern und verbirgt seine Bedeutung in einer Hierarchie von Zwischensummen.
Was die Extraktion nicht bestätigen kann und warum der Prüfpfad dennoch wichtig ist
Kein Extraktionstool entscheidet, ob eine Zahl im buchhalterischen Sinne korrekt ist, und die Teile eines Berichts, die in den Anmerkungen stehen, liegen außerhalb seines Zugriffsbereichs. Ob ein Leasingverhältnis als Operating- oder Finanzierungsleasing zu klassifizieren ist, ob eine Rückstellung ausreichend ist, ob eine Vorperiode neu dargestellt werden muss: Das sind Ermessensentscheidungen, die nicht in der Tabelle stehen. Wenn die maßgebliche Zahl in einer Fußnote, einem Nebenplan oder einer Anlage steht, die Sie nicht hochgeladen haben, wird nichts sie finden, denn sie ist nicht dort, wo man sie suchen würde.
Die Tragweite ist größer als bei einer einzelnen Rechnung, denn die Ausgabe fließt in die Berichterstattung ein, nicht nur in eine Zahlung. Der PCAOB Auditing Standard 2810 verlangt, dass der Abschlussprüfer während der Prüfung festgestellte falsche Darstellungen ansammelt, außer solchen, die eindeutig belanglos sind, und die Darstellung des Abschlusses bewertet, einschließlich der Klassifizierung von Posten und der „Grundlagen der ausgewiesenen Beträge“ (PCAOB AS 2810). Eine Einheitenangabe im falschen Maßstab oder ein verlorenes Vorzeichen beim Eigenkapital ist genau die Art von unkorrigierter falscher Darstellung, die dieser Standard erfassen soll.
Die Daten, die in diese Abschlüsse einfließen, sind bereits fehleranfällig. Eine Feldstudie zu 25 operativen Tabellenkalkulationen fand Fehler in 0,8% bis 1,8% der Formelzellen, und unter den bestätigten Fehlern überstieg der größte einzelne 100 Millionen Dollar (Powell, Baker und Lawson, 2009). Frühere Feldprüfungen ergaben, dass 94% der geprüften Tabellenkalkulationen mindestens einen Fehler enthielten, mit einer durchschnittlichen Zellfehlerrate von etwa 5,2%. Eine verlorene Einheitenangabe oder eine vergessene Klammer verstärkt diese Grundfehlerrate, anstatt sie zu ersetzen – deshalb schützen diejenigen, die Modelle bauen, die Zahlen so streng. Wie ein Praktiker der Finanzmodellierung es ausdrückte: „Stellen Sie sicher, dass alles zu 100% korrekt ist, und wenn irgendetwas auch nur um eine Dezimalstelle abweicht, sind Sie gefeuert." (r/financialmodelling).
Das ist das Argument für Quellenverankerung gegenüber einer sauber aussehenden Tabelle. Eine Zahl, die Sie auf ihre Zeile im Abschluss zurückführen können, ist prüfbar; eine Zahl, die nur plausibel aussieht, ist es nicht. Dieselbe Logik gilt für die angrenzenden Finanzabschlüsse, die Teams bereits extrahieren, weshalb die Fehlerpipeline zur Extraktion von Kontoauszügen und der Workflow zur Extraktion des Hauptbuchs die Verifizierung ins Zentrum stellen und nicht ans Ende.
Häufig gestellte Fragen
Warum kommt mein extrahierter Finanzabschluss 1.000-mal zu klein heraus?
Die wahrscheinlichste Ursache ist eine verlorene Einheitenangabe. Abschlüsse, die mit „in Tausend" oder „in Millionen" betitelt sind, geben diesen Maßstab einmal im Titel an, außerhalb der Geldspalten. Eine Extraktion, die nur die Zahlen liest, liefert daher die Ziffern ohne den Multiplikator. Prüfen Sie den Titel des Abschlusses, bestätigen Sie, welche Zahlen er abdeckt, und wenden Sie den Multiplikator an genau einer Stelle an.
Wie verhindere ich, dass negative Vorzeichen in Klammern verloren gehen?
Behandeln Sie die Klammern als Wert, nicht als Formatierung. Prüfen Sie nach der Extraktion jede negative Zahl gegen die Beschriftung, die der Abschluss ihr gibt: Ein Fehlbetrag, ein Verlust oder eine „Abzüglich:"-Zeile sollte negativ sein. Wenn ein Vorzeichen falsch aussieht, springen Sie über die Review-Ansicht zum Quellbereich und bestätigen Sie die Klammern auf der Originalseite, anstatt der Zelle zu vertrauen.
Kann KI eine gescannte oder fotografierte Bilanz extrahieren?
Ja. Ein visuelles Modell liest eine gescannte oder fotografierte Aufstellung, indem es die Seite betrachtet; es kann daher gedruckten Text, handschriftliche Anmerkungen und die Tabellenstruktur ohne Textebene erfassen. Die limitierenden Faktoren sind die Scanqualität und ob der Scan die gesamte Seite erfasst hat, einschließlich des Titels mit der Einheitenangabe und eventueller Klammern am Rand.
Warum ist meine Spaltensumme falsch, obwohl jede einzelne Zahl stimmt?
Weil die Spalte Zwischensummen enthielt. Zwischensummen eines Finanzabschlusses sind die Summen der Zeilen darüber; wenn Sie also jede numerische Zeile addieren, zählen Sie dasselbe Geld mehrfach. Berechnen Sie jede Zwischensumme aus ihren eigenen Zeilen neu und vergleichen Sie das mit der gedruckten Zwischensumme, anstatt die gesamte Spalte zu summieren.
Verändert „in Millionen" oder „außer Betrag pro Aktie" die Extraktion?
Ja. „In Millionen" setzt einen anderen Multiplikator, und jede Einschränkung wie „außer Betrag pro Aktie" oder Prozentangaben bedeutet, dass diese spezifischen Zeilen überhaupt nicht skaliert werden. Ein pauschaler Multiplikator für den gesamten Abschluss ist bei diesen Ausnahmen falsch; erfassen Sie daher den Titeltext und lesen Sie, was er tatsächlich abdeckt.
Ist eine Extraktion genau genug, um einen Abschluss ohne Prüfung zu verwenden?
Kein Tool, auch unseres nicht, macht es überflüssig, die Einheitenangabe, Vorzeichen und Zwischensummen eines Abschlusses zu bestätigen. Unsere Extraktion erreicht bis zu 99% Genauigkeit bei gedruckten Tabellendaten, und Abschlüsse enthalten weiterhin die drei oben genannten Strukturen sowie die buchhalterische Beurteilung, die ein Tool nicht treffen kann. Führen Sie die vier Validierungsprüfungen beim ersten Abschluss jeder neuen Quelle durch und prüfen Sie dann stichprobenartig jeden Batch.
Die Struktur ist Teil der Daten
Der Fehler hinter den meisten Problemen bei der Extraktion von Abschlüssen besteht darin, die Struktur als Präsentation zu betrachten. Das ist sie nicht. Die Einheitenangabe, das Vorzeichen und die Gruppierung der Zwischensummen sind Daten, in dem Sinne, dass eine Zahl ohne sie nicht dasselbe bedeutet. Eine in ein sauberes Raster extrahierte Bilanz ist nur so gut wie das Überleben dieser drei Elemente, und die Prüfungen, die sie bestätigen, basieren auf der eigenen Arithmetik des Abschlusses, sodass sie nur Minuten kosten und die Fehler aufdecken, die jede Formatprüfung übersieht. Beginnen Sie mit der Überschrift und den Klammern, zwei Dinge, die ein menschlicher Leser kaum bemerkt und die ein Extraktionsdurchlauf spurlos verlieren kann.
Bevor Sie einem extrahierten Abschluss vertrauen, tun Sie drei Dinge: Bestätigen Sie, dass die Einheitenangabe einmal angewendet wurde, bestätigen Sie, dass die negativen Werte ihr Vorzeichen behalten haben, und bestätigen Sie, dass die Zwischensummen aus ihren eigenen Zeilen addiert werden. Diese drei Prüfungen decken die Fehler auf, die ein flaches Raster verbirgt.