Feldgenauigkeit vs. Zeichengenauigkeit: Was ist der Unterschied?
Zuletzt geprüft: 2026-08-13 · Gilt für: Dokumentdatenextraktion / OCR-Auswertung / AP- und Datenerfassungs-Workflows
Auch bekannt als: Feldgenauigkeit wird manchmal als „Feldgenauigkeit“, „Felderkennungsgenauigkeit“ oder „Feldextraktionsgenauigkeit“ bezeichnet. Die Zeichengenauigkeit wird üblicherweise als ihr Kehrwert, die Zeichenfehlerrate (CER), ausgedrückt.
Die Feldgenauigkeit misst, ob jedes extrahierte Feld vollständig korrekt ist; die Zeichengenauigkeit misst, ob einzelne Zeichen korrekt gelesen werden. Ein einziges falsch gelesenes Zeichen macht ein gesamtes Feld unbrauchbar, daher beschreiben die beiden Metriken völlig unterschiedliche Dinge.
So funktionieren die beiden Genauigkeitsmetriken
Beide Metriken sind Verhältnisse, aber sie zählen unterschiedliche Dinge. Die Zeichengenauigkeit fragt: „Wie viele der Zeichen auf diesem Dokument wurden korrekt gelesen?“ Die Feldgenauigkeit fragt: „Wie viele der tatsächlich benötigten Datenfelder wurden ohne einen einzigen Fehler extrahiert?“
Zeichengenauigkeit = korrekt erkannte Zeichen ÷ Gesamtzahl der Zeichen. Die formale Standarddefinition stammt aus der OCR-Bewertungsgemeinschaft: Die Zeichenfehlerrate (CER) ist die Levenshtein-Editierdistanz zwischen dem erkannten Text und der Ground Truth – die Mindestanzahl an Substitutionen, Löschungen und Einfügungen, die nötig ist, um einen in den anderen zu überführen – geteilt durch die Gesamtzahl der Zeichen (OCR-D-Projektspezifikation). Die Zeichengenauigkeit ist einfach 100 % − CER. Das eigene Bewertungsframework von NIST (TRAIT) definiert die Zeichengenauigkeit auf dieselbe Weise, als 100 × (1 − normalisierte Editierdistanz) über alle Annotationen (NISTIR 8199, 2017).
Feldgenauigkeit = korrekt extrahierte Felder ÷ Gesamtzahl der Felder. Ein Feld – Rechnungssumme, Datum, Lieferantenname, Kontonummer – wird als binäre Einheit bewertet: Entweder es stimmt exakt mit der Ground Truth überein oder es ist fehlerhaft. Die formale Version, die in akademischen Benchmarks verwendet wird, ist der F1-Wert auf Feldebene, das harmonische Mittel aus Präzision und Recall: F1 = 2 × (Präzision × Recall) / (Präzision + Recall), wobei Präzision der Anteil der korrekten extrahierten Felder und Recall der Anteil der gefundenen erwarteten Felder ist (LlamaIndex-Glossar, ausgearbeitetes 10-Felder-Beispiel). Eine einzige falsche Ziffer in einer Rechnungsnummer macht das gesamte Feld falsch – Teilpunkte gibt es nicht.
Hier trennen sich die beiden Metriken. Ein Feld mit N Zeichen bei C % Zeichengenauigkeit hat eine ungefähre Wahrscheinlichkeit von C^N, vollständig korrekt zu sein – der verstärkende Effekt, der die Zeichengenauigkeit unbrauchbar für die Vorhersage der Feldgenauigkeit macht. Bei einer 9-stelligen Rechnungsnummer mit 99 % Zeichengenauigkeit: 0,99^9 ≈ 91,3 % Feldgenauigkeit für dieses Feld. Dieselbe Nummer steigt bei 99,9 % Zeichengenauigkeit auf 99,1 %. Ein 20-stelliges Feld fällt bei 95 % Zeichengenauigkeit auf nur 35,9 % Feldgenauigkeit. Dies ist eine Näherung, die annimmt, dass Fehler unabhängig und gleichmäßig verteilt sind – reale Systeme konzentrieren Fehler jedoch genau in den Feldern, die wichtig sind (Zahlen, Codes, Kennungen), daher ist die tatsächliche Feldgenauigkeit meist schlechter als vom Modell vorhergesagt. NISTs eigene OCR-Arbeit beobachtete dies direkt: Das Erkennen von Seitennummern erzeugte eine Feldfehlerrate von 12 %, selbst als die Gesamtzeichenerkennung respektabel aussah (NISTIR 6101).
Die Lücke ist nicht theoretisch. Beim ICDAR-2019-SROIE-Benchmark – 1.000 gescannte Belege, bei denen die Teams bei beiden Aufgaben bewertet wurden: Wortgenauigkeit (OCR, Aufgabe 2) und Extraktion von Schlüsselfeldern (Aufgabe 3) auf denselben Bildern – übertrafen 7 von 24 eingereichten Methoden 90 % Wortgenauigkeit (Hmean), aber nur 1 von 18 übertraf 90 % F1-Wert auf Feldebene (90,49 %), und mehr als die Hälfte der Einreichungen auf Feldebene erzielte weniger als 80 % (Huang et al., ICDAR 2019). Selbst die beste OCR-Methode in Aufgabe 2 konnte die strengen 99 % Genauigkeit, die Beleg-Anwendungen erfordern, nicht erreichen – und die Extraktion auf Feldebene war noch schwieriger. Der moderne F1-Wert auf Feldebene beim CORD-Beleg-Benchmark liegt zwischen 78 % und 97 %, je nach Modell (LayoutLM 78,4, LayoutLMv2 78,9, Donut 84,1, LayoutLMv3 etwa 96,6), laut den ursprünglichen Modell-Publikationen (Kim et al., Donut, 2022).
Warum die Unterscheidung wichtig ist
Anbieter nennen Zeichengenauigkeit, weil sie die höchste und am einfachsten zu erzielende Kennzahl ist – während Geschäftsentscheidungen von der Feldgenauigkeit abhängen, die immer niedriger ist.
Die Kluft zwischen Marketing und Realität ist systematisch. Angaben zur Zeichengenauigkeit von 98–99,5 % sind bei sauberen, gedruckten Dokumenten üblich – und selbst die besten OCR-Einreichungen beim ICDAR-2019-SROIE-Benchmark blieben hinter den 99 % Genauigkeit zurück, die Beleg-Anwendungen erfordern (Huang et al., ICDAR 2019). Aber die Feldgenauigkeit, gemessen auf denselben Bildern, ist deutlich niedriger: Nur 1 von 18 Methoden auf Feldebene beim SROIE übertraf 90 % F1, während 7 von 24 OCR-Methoden auf Wortebene 90 % erreichten – dieselben Dokumente, zwei sehr unterschiedliche Ergebnisse (Huang et al., ICDAR 2019). Das C^N-Modell oben erklärt die Lücke: Bei 95 % Zeichengenauigkeit ist ein Feld mit 20 Zeichen nur in 35,9 % der Fälle vollständig korrekt. Beide Zahlen können auf demselben Beleg zutreffen – hohe Zeichengenauigkeit und deutlich niedrigere Feldgenauigkeit –, weil sie unterschiedliche Fragen beantworten.
Der Grund, warum die Feldgenauigkeit die entscheidende Kennzahl ist, liegt darin, dass nachgelagerte Systeme Felder verarbeiten, nicht Zeichen. Eine falsche Ziffer in einer Rechnungssumme korrumpiert eine Zahlung; eine falsche Kontonummer korrumpiert eine Buchung – unabhängig davon, wie viele andere Zeichen korrekt gelesen wurden. Die eigene OCR-Technologie des NIST demonstrierte diesen Punkt in seiner Forschung zur Dokumentkonvertierung: Die Erkennung von Seitenzahlen des Federal Register ergab eine Fehlerrate von 12 % auf Feldebene, obwohl die Gesamtzeichenerkennung respektabel aussah (NISTIR 6101).
Die operative Konsequenz ist die Dimensionierung der Prüfwarteschlange. Jeder Fehler auf Feldebene bedeutet ein Dokument, das erkannt und korrigiert werden muss. Moderne Modelle erreichen auf Benchmark-Belegen einen F1-Wert auf Feldebene in der Mitte der 90er – LayoutLMv3 erzielt etwa 96,6 % auf CORD, gegenüber 78–84 % bei früheren Modellen (Kim et al., Donut, 2022) – aber die Genauigkeit in der Praxis hängt von Dokumenttyp, Bildqualität und Feldgestaltung ab, und jedes Dokument unter 100 % Feldgenauigkeit landet in einer Prüfwarteschlange. Ein Team, das ein Tool nur anhand der Zeichengenauigkeit bewertet, wird konsequent überschätzen, wie viele Dokumente unverändert durchlaufen können – genau deshalb sollten Einkaufs- und Kreditorenbuchhaltungs-Teams vor der Entscheidung für eine Pipeline die Feldgenauigkeit auf ihren eigenen Dokumenttypen anfordern.
Häufige Missverständnisse
- Missverständnis: „99 % Genauigkeit bedeutet, dass 99 % meiner Daten korrekt sind.“
- Realität: Es hängt vollständig davon ab, was gemessen wurde. 99 % Zeichengenauigkeit bedeutet nicht 99 % Feldgenauigkeit – ein einziges falsch gelesenes Zeichen verfälscht das gesamte Feld. Bei 99 % Zeichengenauigkeit hat eine neunstellige Rechnungsnummer nur eine 91,3 %ige Chance, vollständig korrekt zu sein (0,99^9), und ein 20 Zeichen langes Feld ist nur in 81,8 % der Fälle vollständig korrekt. Dasselbe Dokument kann auf Zeichenebene gut abschneiden, während ein erheblicher Anteil seiner Felder falsch ist – der SROIE-Benchmark dokumentierte 7 von 24 Wortgenauigkeitsmethoden über 90 %, aber nur 1 von 18 Feldgenauigkeitsmethoden (Huang et al., ICDAR 2019).
- Missverständnis: „Zeichengenauigkeit und Feldgenauigkeit sind umrechenbar – man kann einfach einen festen Prozentsatz abziehen.“
- Realität: Die Umrechnung hängt von der Feldlänge und der Fehlerverteilung ab, daher gibt es keine feste Zuordnung. Das C^N-Modell zeigt, dass die Abweichung mit der Feldlänge wächst: Ein 9 Zeichen langes Feld behält bei 99 % Zeichengenauigkeit eine Feldgenauigkeit von 91,3 %, aber ein 20 Zeichen langes Feld fällt bei derselben Zeichengenauigkeit auf 81,8 %, und bei 95 % Zeichengenauigkeit sinkt ein 20 Zeichen langes Feld auf nur 35,9 %. Verschiedene Felder im selben Dokument haben unterschiedliche Längen und unterschiedliche Fehlerraten – es gibt keinen einzigen Umrechnungsfaktor.
- Missverständnis: „Eine höhere Zeichengenauigkeit bedeutet immer ein besseres Tool.“
- Realität: Die Leistung auf Feldebene hängt von mehr ab als vom reinen Zeichenlesen – Kontext, Strukturverständnis und Validierung können die Feldgenauigkeit über das hinaus anheben, was die Zeichengenauigkeit vorhersagt, oder darunter absinken lassen. Ein System kann fast jedes Zeichen korrekt lesen und trotzdem einen Wert dem falschen Feld zuordnen – ein struktureller Fehler, den die Zeichengenauigkeit nicht einmal messen kann, da sie nie prüft, ob der richtige Wert am richtigen Ort gelandet ist. Der F1-Wert auf Feldebene erfasst dies: Er bestraft sowohl falsche Werte als auch extrahierte, aber falsch beschriftete Werte, weshalb Benchmarks F1 statt der rohen Zeichengenauigkeit bewerten (LlamaIndex-Glossar). Bewerten Sie die Feldgenauigkeit direkt anhand Ihrer eigenen Dokumente.
Häufig gestellte Fragen
Was ist der Unterschied zwischen Feldgenauigkeit und Zeichengenauigkeit?
Die Zeichengenauigkeit misst, wie oft einzelne Zeichen korrekt gelesen werden (als Verhältnis korrekter Zeichen zur Gesamtzahl der Zeichen); die Feldgenauigkeit misst, wie oft vollständige Datenfelder — Rechnungsnummer, Datum, Gesamtbetrag, Lieferant — als Einheit korrekt extrahiert werden. Ein Feld ist falsch, wenn auch nur eines seiner Zeichen falsch ist. Daher ist die Feldgenauigkeit bei demselben Dokument immer niedriger als die Zeichengenauigkeit, und sie ist die Kennzahl, die für reale Arbeitsabläufe zählt.
Bedeutet 99 % Genauigkeit, dass 99 % meiner Daten korrekt sind?
Nur wenn die 99 % auf Feldebene gemessen wurden. „99 % Genauigkeit“ in der Vermarktung von Anbietern ist in der Regel Zeichengenauigkeit, da dies die höchste und am einfachsten zu erzielende Zahl ist — und sie ist nicht in Feldgenauigkeit umrechenbar. Bei 99 % Zeichengenauigkeit ist eine 9-stellige Rechnungsnummer nur in etwa 91,3 % der Fälle vollständig korrekt (0,99^9), und das Fehlerrisiko pro Feld summiert sich über die Felder jedes Dokuments.
Welche Genauigkeitskennzahl sollte ich bei der Bewertung von Dokumentextraktions-Tools verwenden?
Fragen Sie nach der Feldgenauigkeit, gemessen an Ihren eigenen Dokumenttypen. Die Zeichengenauigkeit sagt Ihnen, wie gut die OCR-Engine Text liest; sie sagt Ihnen nichts darüber, ob der richtige Wert im richtigen Feld gelandet ist — das, was Ihre nachgelagerten Systeme verarbeiten. Wenn Sie eine Schlagzeile mit einer Genauigkeitsangabe sehen, fragen Sie, was gemessen wurde, an welchen Dokumenten und an welchen Feldern. Der F1-Wert auf Feldebene (Präzision und Recall zusammen) ist die standardmäßige formale Kennzahl, da er auch Felder erfasst, die extrahiert, aber mit dem falschen Label versehen wurden (LlamaIndex-Glossar).
Wie berechnen Sie die Feldgenauigkeit?
Feldgenauigkeit = korrekt extrahierte Felder ÷ insgesamt erwartete Felder × 100%. Ein Feld gilt nur dann als korrekt, wenn es exakt dem Ground Truth entspricht — ein einziges falsches Zeichen lässt das Feld durchfallen. Der akademische Standard ist der F1-Wert auf Feldebene: F1 = 2 × (Präzision × Recall) / (Präzision + Recall), wobei Präzision den Anteil der korrekt extrahierten Felder und Recall den Anteil der gefundenen erwarteten Felder angibt (LlamaIndex-Glossar). Dies ist dieselbe Bewertungsmethode, die auch die SROIE- und CORD-Benchmarks verwenden.
Warum ist die Feldgenauigkeit immer niedriger als die Zeichengenauigkeit?
Weil ein Feld bereits durchfeilt, wenn nur eines seiner Zeichen falsch ist, und lange Felder schnell durchfallen. Das multiplikative Modell C^N bedeutet, dass ein 9-stelliges Feld bei 99% Zeichengenauigkeit nur 91,3% Feldgenauigkeit behält, und die Strafe wächst mit der Feldlänge (0,99^20 ≈ 81,8%). Reale Systeme konzentrieren Fehler zudem in numerischen Feldern, wo ein einziges falsches Zeichen fatal ist — NIST beobachtete dies in seiner eigenen OCR-Arbeit, die trotz respektabler Zeichenerkennung eine Feldfehlerrate von 12% bei Seitennummern ergab (NISTIR 6101).
Was sind typische Benchmarks für die Feldgenauigkeit?
Bei akademischen Benchmarks liegt der F1-Wert auf Feldebene je nach Modell zwischen 78% und 97%: Beim ICDAR-2019-SROIE-Wettbewerb erreichten nur 1 von 18 Einreichungen über 90% F1-Wert auf Feldebene (mehr als die Hälfte lag unter 80%), während die besten Modelle der CORD-Benchmark etwa 96–97% erreichen (Huang et al., 2019; Kim et al., 2022). Produktionswerte variieren stärker als Benchmarks, da reale Dokumente unordentlicher sind — betrachten Sie jede einzelne Zahl als dokument- und feldabhängig und testen Sie mit Ihren eigenen Dokumenten.
Quellen
- Huang, Z., et al. — „ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction" (IEEE ICDAR, 2019). Benchmark mit 1.000 gescannten Belegen, 24 OCR-Einreichungen und 18 Einreichungen zur Extraktion auf Feldebene; 7 von 24 OCR-Methoden übertrafen 90 % Hmean, während dies nur 1 von 18 Methoden auf Feldebene gelang (90,49 %), über die Hälfte lag unter 80 %. Primärquelle für die Kluft zwischen Zeichen- und Feldgenauigkeit bei identischen Dokumenten.
- Kim, G., et al. — „OCR-free Document Understanding Transformer" (ECCV, 2022). CORD-Benchmark für Belege, F1-Wert auf Feldebene über Modelle: LayoutLM 78,4, LayoutLMv2 78,9, Donut 84,1, LayoutLMv3 (base) ~96,6. Quelle für den Bereich von 78–97 % F1-Wert auf Feldebene.
- NIST — „The Text Recognition Algorithm Independent Evaluation (TRAIT)" (NISTIR 8199, 2017). Offizielle NIST-Definition der Zeichengenauigkeit = 100(1 − normalisierte Editierdistanz)/#Annotationen. Quelle für die formale Definition der Zeichengenauigkeit.
- NIST — „Impact of Image Quality on Machine Print OCR" (NISTIR 6101, 2001). NISTs eigene OCR erzeugte eine Feldfehlerrate von 12 % bei Seitenzahlen des Federal Register, trotz respektabler Erkennung auf Zeichenebene. Quelle für das Beispiel zur Feldfehlerrate.
- OCR-D-Projekt — Spezifikation zur Qualitätssicherung. Formale CER = (Einfügungen + Löschungen + Substitutionen) / Gesamtzahl der Zeichen sowie das analoge WER. Quelle für die CER-Formel.
- LlamaIndex — „What is F1 Score for Document Extraction?". F1 = 2·(P·R)/(P+R) mit einem durchgerechneten Beispiel mit 10 Rechnungsfeldern; erklärt die Bewertung auf Feldebene im Vergleich zur Dokumentebene. Quelle für die F1-Formel und das durchgerechnete Beispiel.
Verwandte Begriffe
- Was ist optische Zeichenerkennung (OCR)?: Die Lesetechnologie, deren Zeichengenauigkeit die Quelle der Verwirrung ist – OCR wandelt Pixel in Zeichen um; es erzeugt von sich aus keine korrekten Felder.
- Zeichengenauigkeit über Dokumenttypen hinweg: Zeichengenauigkeits-Benchmarks, aufgeschlüsselt nach Dokumenttyp – die Ebene, die die Feldgenauigkeit speist (aber nie erreicht).
- Was ist die Straight-Through-Processing (STP)-Rate?: Die End-to-End-Kennzahl, die von der Feldgenauigkeit (und Dokumentgenauigkeit) abhängt – ein System benötigt eine nahezu 100%ige Feldgenauigkeit, bevor Dokumente ohne menschliches Eingreifen durchlaufen können.
Weiterführende Lektüre: Der Leitfaden zu 4 Genauigkeitsebenen: Zeichen, Feld, Dokument und STP · Warum „99 % Genauigkeit“ fast immer Zeichenebene bedeutet · So messen Sie die Feldgenauigkeit in der Praxis