OCR-Genauigkeit bei Belegen: Thermopapier, zerknittert, verblasst,
und Multi-Währungs-Benchmarks (2026)
Zuletzt geprüft: 2026-08-10 · Datenabdeckung: Teilweise · Quellen: 14 unabhängige Studien
Was diese Seite NICHT abdeckt: Allgemeine OCR-Genauigkeit nach Dokumenttyp (siehe die Aufschlüsselung nach Dokumenttyp), Handschrifterkennungs-Genauigkeit (siehe Handschrifterkennungs-Genauigkeit) oder anbieterspezifische Behauptungen über die unten zitierten Benchmark-Zahlen hinaus.
Alle Zahlen unten basieren auf öffentlich zugänglichen Drittanbieter-Studien und Branchenberichten, die im Methodik-Abschnitt zitiert werden. Wo Quellen voneinander abweichen, werden konservative Spannen (niedrigste–höchste gemeldete Werte) verwendet. Metrik-Ebenen (Zeichen / Wort / Feld) sind pro Zahl gekennzeichnet und werden nie zu einer einzigen Zahl vermischt. Diese Seite ist ein Richtungs-Benchmark, keine präzise Prognose für eine einzelne Engine oder Organisation.
Die Beleg-OCR-Geschichte beginnt mit einer Obergrenze, nicht mit einer Basislinie. Im einzigen standardisierten Beleg-Benchmark — ICDAR 2019's SROIE — erzielte das beste Key-Information-Extraction-System 90,49 % F1 bei sauberen gescannten Belegen, und mehr als die Hälfte der 18 teilnehmenden Teams erzielte weniger als 80 % (Huang et al., 2019). Reale Spesen-Workflows gehen dann von dieser Obergrenze eine physische Degradationsleiter hinunter: verblasstes Thermopapier senkt die Open-Source-Wortgenauigkeit auf 55–73 % (KORIE, 2026), und per Handy fotografierte reale Belege liefern 66,7–68,7 % Händlernamen-Genauigkeit (RMIT Textract-Studie, 2025). Anbieter-Behauptungen von „99 % Beleg-Genauigkeit“ beschreiben einen Zustand, den Belege selten überleben.
Aufschlüsselung nach Belegzustand: Die Degradationsleiter
Die OCR-Genauigkeit von Belegen wird weniger vom Engine als vom physischen Zustand des Papiers und der Art der Erfassung bestimmt. Derselbe Beleg wandert die Leiter hinab — frisch und flach, verblasst, zerknittert, per Handyfoto aufgenommen — und jede Stufe kostet 5 bis 30 Genauigkeitspunkte.
Belege unterscheiden sich von Rechnungen in einer Hinsicht, die wichtiger ist als das Layout: Das Medium selbst ist instabil. Die meisten Belege werden auf Thermopapier gedruckt, einer wärmeempfindlichen Beschichtung, die durch Lichteinwirkung, Hitze und Zeit zunehmend verblasst — ein Beleg, der am Kauftag lesbar ist, kann Wochen später teilweise unlesbare Steuerbeträge, Daten und Einzelposten aufweisen, und kein OCR-Engine kann Text wiederherstellen, der physisch vom Papier verschwunden ist. Die SROIE-Organisatoren nennen ausdrücklich „schlechte Papierqualität, schlechte Tinten- und Druckqualität, Scanner mit niedriger Auflösung und Scanverzerrung, gefaltete Rechnungen" unter den zentralen Herausforderungen des Benchmarks (Huang et al., 2019). Das folgende Diagramm zeigt die veröffentlichte Genauigkeitsbandbreite für jede Stufe der Leiter; die von jeder Studie verwendete Metrik ist in der Zeile beschriftet, da Zeichen-, Wort- und Feldgenauigkeit nicht austauschbar sind. Die SROIE-Werte sind F1-Scores — das harmonische Mittel aus Präzision und Recall (Hmean), das sowohl verlangt, dass die meisten erkannten Wörter korrekt sind, als auch, dass die meisten Ground-Truth-Wörter gefunden werden.
Quellen: IJSAT (2026) — EasyOCR bei 300 DPI auf gedruckten Dokumenten, Zeichengenauigkeit (flach 94,7 %, zerknittert 86,9 %; dieselbe Studie maß verschmutzt 80,9 % und nass 72,7 %); KORIE (2026) — Wortgenauigkeit bei 748 degradierten koreanischen Thermobelegen, 17.587 Ausschnitten, Open-Source-Engines (Tesseract 64,7 %, EasyOCR 68,6 %, PaddleOCR 73,3 %); RMIT-Textract-Studie (2025) — Exakte-Übereinstimmung-Feldgenauigkeit beim Händlernamen bei 118 echten Belegen (65 % Handyfotos, 50 % gefaltet/zerknittert, 44 % schief). Zeichengenauigkeitswerte sind nicht direkt mit Wort- oder Feldgenauigkeitswerten vergleichbar — siehe Warum die Metriken wichtig sind.
| Belegzustand | Genauigkeitsbereich | Metrik (je Studie) | Quelle | Jahr | Stichprobe |
|---|---|---|---|---|---|
| Saubere gescannte Belege (Benchmark-Obergrenze) | >90 % (7 von 24 Teams); beste <99 % | Wortgenauigkeit F1 (Hmean) | SROIE / Huang et al. | 2019 | 1.000 gescannte Belege, 24 Teams |
| Flaches, sauberes Original (gedrucktes Dokument) | 94,7 % | Zeichengenauigkeit | IJSAT | 2026 | EasyOCR, 300 DPI |
| Zerknittertes Original | 86,9 % (−7,8 Punkte vs. flach) | Zeichengenauigkeit | IJSAT | 2026 | EasyOCR, 300 DPI |
| Verblasster / geknickter Thermobeleg | 55–73 % (PaddleOCR 73,3 % am besten) | Wortgenauigkeit | KORIE | 2026 | 748 koreanische Thermobelege, 17.587 Ausschnitte, 4 Engines |
| Handyfoto aus der Praxis (Händlernamen-Feld) | 66,7–68,7 % | Feldebene Exakte Übereinstimmung | RMIT Textract-Studie | 2025 | 118 australische Belege, ~65 % Handyfotos |
Quellen sind in der obigen Tabelle aufgeführt. Die KORIE-Zeilen sind der einzige veröffentlichte Benchmark, der echte Thermopapier-Artefakte (Tintenverblassen, Druckkopf-Banding, Reibungsabrieb, Knicke) statt synthetischer Degradation bewahrt; seine 300-DPI-Flachbettscans bedeuten, dass selbst der „gescannte“ Bestfall den eigenen Papierzerfall enthält. Die SROIE-Obergrenzenzeile stammt aus der Technologie von 2019 — moderne LLM-Engines erreichen auf demselben Datensatz 84,3–93,0 % Gesamtfeldgenauigkeit (Doubleword, 2026; siehe Engine-Ebenen-Tabelle).
Aufschlüsselung nach Feldtyp: Gesamtbetrag ist einfach, Händlername schwer
Der Feldtyp ist der zweitgrößte Einflussfaktor und ist in jeder Studie, die ihn ausweist, bemerkenswert konsistent: Numerische Summenfelder — insbesondere der Gesamtbetrag — werden weitaus zuverlässiger extrahiert als Text-Identitätsfelder wie Händler- oder Lieferantenname. Das folgende Diagramm zeigt fünf moderne LLM-Engines auf dem vollständigen 626-Belege-SROIE-Testset, alle gemessen mit demselben Feld-Level-Protokoll für exakte Übereinstimmung (Doubleword, 2026).
Quellen: Doubleword (2026) — 626 SROIE-Testbelege, Feld-Level exakte Übereinstimmung, 5 Engines (Qwen3-VL-235B/30B, GPT-5-mini/5.2/5-nano). D-Grade-Anbieter-Benchmark mit vollständig offengelegter Methodik; in der Tendenz bestätigt durch ReceiptSense (2024), das numerische #Units-Felder mit 93,42 F1 fand, während Text-Brand-Felder auf 62,30 F1 bei arabisch–englischen Belegen abfielen.
Dieses Muster übersteht radikal unterschiedliche Bedingungen und Sprachen. Die RMIT-Textract-Studie — echte Handyfotos, kein sauberer Korpus — fand, dass der Gesamtbetrag „durchgängig erkannt" wurde, während Händlernamen fehlschlugen (nahegelegener Text falsch klassifiziert oder „Unbekannt" bei Abwesenheit), was exakt dem Doubleword-Ranking entspricht (2025). Die praktische Konsequenz: Eine Schlagzeile zur „Beleg-OCR-Genauigkeit" mittelt die einfachsten und schwersten Felder zu einer einzigen Zahl — und Spesen-Workflows, die nur den Gesamtbetrag benötigen, bewältigen eine grundlegend einfachere Aufgabe als Workflows, die Händlername plus Einzelposten benötigen.
Aufschlüsselung nach Engine-Stufe
Die Wahl der Engine ist weniger entscheidend als Zustand und Feldtyp, aber sie setzt die Obergrenze, die jeder Zustand erreichen kann. Die folgende Tabelle trennt vier Stufen mit inkompatiblen Messkontexten: Forschungsmodelle, die auf Belegkorpora feinabgestimmt sind (feldbezogenes F1 auf den CORD/SROIE-Benchmarks), allgemeine LLMs ohne Feinabstimmung, Cloud-APIs für reale Dokumente und ältere/traditionelle Engines.
| Engine-Stufe | Genauigkeit | Metrik / Kontext | Quelle | Jahr |
|---|---|---|---|---|
| Feinabgestimmte Dokumenten-KI (SOTA auf CORD) | 91,3–97,5 % Feld-F1 | Donut 91,3 %, LayoutLMv2 96,0 %, LayoutLMv3 97,5 % — saubere indonesische Belege, auf die Aufgabe trainiert | Donut; LayoutLMv2; MDPI-Übersicht | 2021–2022 |
| Feinabgestimmte Dokumenten-KI (SROIE) | 97,8 % Feld-F1 (LayoutLMv2); ~0,95 Durchschnitt über Studien | Saubere gescannte englische Belege; systematische Übersicht mit durchschnittlichem F1 von 0,95 | LayoutLMv2; KIE-SLR | 2021 / 2024 |
| Allgemeines LLM, ohne Feinabstimmung (Three-Shot) | 80,9 % CORD / 83,9 % SROIE Feld-F1 | Nur In-Context-Learning, kein Aufgabentraining — die ehrliche „Zero-Setup“-Basislinie | LLM-TKIE | 2025 |
| Moderne LLM-Engines auf SROIE (2026) | 84,3–93,0 % Gesamtfeldgenauigkeit | Qwen3-VL-235B 93,0 %, GPT-5-mini 87,7 %, GPT-5-nano 84,3 % — 626 vollständiger Testsatz | Doubleword | 2026 |
| Cloud-API auf vielfältigen echten Dokumenten | F1 0,75–0,85 | Google Invoice/Expense Parser, ~1.500 vielfältige Layouts (nutzergemeldet) | Google Developer Forum | 2024 |
| Cloud-APIs auf echten Handyfoto-Belegen | 66,7–68,7 % Händlername-Feld | AWS Textract AnalyzeExpense auf 118 echten australischen Belegen | RMIT-Textract-Studie | 2025 |
| Cloud-APIs — Rechnungskontext (einfachere Referenz) | 78–98 % Feldgenauigkeit | GPT-4o+OCR 98 %, Azure 93 %, Google 82 %, Textract 78 % — Rechnungen, keine Belege; als einfachere Obergrenze gezeigt | BusinessWareTech | 2025 |
| Legacy-/traditionelle OCR auf Belegen | ~64 % (branchengemeldete Untergrenze) | Anspruch auf White-Paper-Ebene des Anbieters; nur als D-Stufen-Referenzuntergrenze verwendet | DATABASICS | 2024 |
Quellen in der Tabelle oben aufgeführt. Die CORD- und SROIE-Werte sind feldbezogene F1-Werte auf sauberen Benchmark-Korpora, bei denen das Modell auf die Aufgabe feinabgestimmt wurde — sie sind die optimistische Obergrenze, nicht die realistische Erwartung. Die Realwelt-Zeilen (Google-Forum, RMIT Textract) messen andere Dokumentpopulationen und sind nicht direkt vergleichbar; beide sind mit ihren Bedingungen gekennzeichnet. Der DATABASICS-Wert ist eine Stufenangabe eines einzelnen Anbieters und dient nur als Untergrenzen-Referenz.
Belege mit mehreren Währungen und Sprachen
Globale Spesen-Workflows fügen eine dritte Dimension hinzu: Jeder Benchmark-Datensatz auf dieser Seite ist einsprachig oder zweisprachig, und die einzige mehrsprachige Studie mit veröffentlichten feldbezogenen Zahlen zeigt dieselbe Gesamtbetrag-gegen-Text-Lücke plus eine zusätzliche Schriftzeichen-Strafe. Bei 20.000 arabisch-englischen Belegen erreichten allgemeine LLMs ohne Feinabstimmung nur 32,07–42,98 F1 im Zero-Shot-Modus, steigend auf 60,60–80,26 F1 mit drei Beispielen pro Feld — während numerische #Units-Felder 93,42 F1 erreichten, verglichen mit 62,30 F1 für Text-Brand-Felder (ReceiptSense, 2024). Die RMIT-Studie beobachtete denselben Schriftzeichen-Effekt in der Produktion: Belege mit nicht-englischen Produktnamen wurden „teilweise geparst“, wobei Positionsdaten stillschweigend verworfen wurden (2025).
| Sprache / Korpus | Genauigkeit | Metrik | Quelle | Jahr |
|---|---|---|---|---|
| Englisch (SROIE, Malaysia/SG-Händler) | 90,49 % bestes KIE-F1 (2019); 84,3–93,0 % LLM gesamt (2026) | Feldbezogenes F1 / exakte Übereinstimmung | SROIE; Doubleword | 2019 / 2026 |
| Indonesisch (CORD) | 91,3–97,5 % Feld-F1 (feinabgestimmt) | Feldbezogenes F1 | Donut; LayoutLMv2 | 2021–2022 |
| Koreanisch (KORIE, thermisch degradiert) | 55–73 % Wortgenauigkeit (Open-Source) | Wortgenauigkeit | KORIE | 2026 |
| Arabisch–Englisch gemischt (ReceiptSense) | Zero-Shot-F1 32–43 %; 3-Shot 61–80 %; numerische Felder 93,4 vs. Textfelder 62,3 | Feldbezogenes F1 | ReceiptSense | 2024 |
| Nicht-englische Produktnamen (Realwelt) | Einzelposten teilweise oder vollständig verworfen | Qualitativ (keine Genauigkeitsmetrik) | RMIT-Textract-Studie | 2025 |
Quellen in der obigen Tabelle aufgeführt. Keine Peer-Review-Studie isoliert den Währungseffekt (Symbol, Dezimalkonvention, Drei-Buchstaben-Codes), während die Schrift konstant gehalten wird — die „Multi-Währungs“-Lücke in realen Arbeitsabläufen wird hauptsächlich durch Schrift- und Layoutvariationen verursacht, wobei der numerische Wert selbst nach der Erkennung gut extrahiert wird. Dies wird als Datenlücke in Limitations gekennzeichnet und nicht mit Herstellerzahlen gefüllt.
Warum die Metriken wichtig sind: Zeichen, Wort und Feld sind drei verschiedene Antworten
Die breiten Bänder auf dieser Seite sind kein Messrauschen — sie sind drei verschiedene Fragen, die dasselbe Wort „Genauigkeit“ verwenden. Ein Beleg kann gleichzeitig 98 % Zeichengenauigkeit, ~85 % Wortgenauigkeit und ~75 % Feldgenauigkeit erreichen, und alle drei Zahlen sind wahr.
Zeichengenauigkeit zählt einzelne Zeichen: Eine Fehlerrate von 1 % bedeutet ein falsches Zeichen pro hundert. Wortgenauigkeit lässt ein ganzes Wort bei einem einzigen falsch gelesenen Zeichen durchfallen — gemessen als Wortfehlerrate (WER), weshalb KORIEs beste Engine nur 15,84 % Zeichenfehler (CER), aber eine WER von 26,73 % aufweist, fast doppelt so viel Fehler auf Wortebene (KORIE, 2026). Feldgenauigkeit lässt ein gesamtes Feld — Händlername, Datum, Gesamtbetrag — bei jedem falschen Zeichen oder Token darin durchfallen, weshalb die SROIE-Organisatoren zu dem Schluss kamen, dass „Beleg-OCR viel höhere Genauigkeitsanforderungen hat als allgemeine OCR-Aufgaben“ und warum Feld-F1 die Metrik ist, die Ausgaben-Workflows tatsächlich konsumieren (Huang et al., 2019). Jede Zahl auf dieser Seite ist mit ihrer Ebene gekennzeichnet; sie zu einer einzigen „Beleg-OCR-Genauigkeits“-Zahl zu vermischen, ist genau die Art, wie die 99-%-Behauptung hergestellt wird.
So verwenden Sie diese Daten
Sie benötigen kein Pilotprojekt, um abzuschätzen, was Beleg-OCR für Ihren Spesenprozess leistet. Eine vierstufige Überschlagsrechnung mit den obigen Spannen verwandelt „Anbieter sagen 99 %“ in eine belastbare erwartete Fehlerzahl — und zeigt meist, dass der Zustand Ihrer Belege und nicht die Engine das Ergebnis bestimmt.
- Klassifizieren Sie Ihren Belegmix nach Zustand. Sortieren Sie Ihr Monatsvolumen in die obige Degradationsleiter. Ein typischer Außendienst-Spesenfluss sieht so aus: 40 % frische flache Handyfotos (~70 % wortäquivalent), 30 % gefaltet/zerknittert (~87 % zeichenäquivalent), 20 % verblasstes Thermopapier (55–73 % Wort), 10 % mehrsprachig oder handschriftlich annotiert (Worst Case).
- Wählen Sie das Feld, das Sie tatsächlich benötigen. Wenn Ihr Workflow nur Gesamtbetrag und Datum braucht, verwenden Sie die Spannen 94,9–98,9 % und 84,3–92,5 % (Doubleword 2026). Wenn Sie Händlernamen benötigen — für Richtlinienprüfungen oder Lieferantenanalysen — verwenden Sie die Spanne 73,1–87,7 % und rechnen Sie mit einer realen Untergrenze nahe 67 % (RMIT-Textract-Studie 2025).
- Rechnen Sie auf erwartete Fehler pro Monat hoch. Bei 80 % durchschnittlicher Feldgenauigkeit über 6 Felder pro Beleg und 1.000 Belegen pro Monat erhalten Sie grob 1.200 falsche Felder pro Monat (1.000 × 6 × 20 %) vor der Prüfung. Leiten Sie nur Felder mit niedriger Konfidenz an die manuelle Prüfung weiter statt ganzer Belege — die von den meisten Engines bereitgestellten feldbezogenen Konfidenzwerte verwandeln einen vollständigen Neuerfassungs-Workflow in eine kleine Ausnahmewarteschlange.
- Setzen Sie die Erwartung, bevor Sie kaufen. Vergleichen Sie diese Fehlerzahl mit Ihrer aktuellen Fehlerquote bei manueller Erfassung (typischerweise 1–4 % der Felder) und mit den Prüfkosten pro falschem Feld. Jedes Angebot, das für Ihren spezifischen Zustandsmix über den Spannen dieser Seite liegt, sollte mit einem feldbezogenen Benchmark auf Ihren eigenen Belegen untermauert werden.
Dies sind grobe Schätzformeln, kein Ersatz für ein Benchmarking Ihrer eigenen Dokumente. Jede veröffentlichte Spanne auf dieser Seite wurde an einem fremden Korpus gemessen — die einzige Genauigkeitszahl, die für Ihren Belegfluss gilt, ist die, die Sie daran messen. Der Wert dieser Seite liegt darin, die Erwartung vor der Messung zu setzen und zu wissen, welche Kennzahl Sie anfordern sollen.
Häufig gestellte Fragen
Wie genau ist die Beleg-OCR?
Die ehrliche Antwort ist eine Leiter, keine Zahl: 90 %+ auf Wortebene bei sauberen gescannten Belegen (bestes SROIE-Team 2019, Huang et al.), 55–73 % Wortgenauigkeit bei echten verblassten Thermopapierbelegen (KORIE 2026) und 66,7–68,7 % Feldgenauigkeit bei Händlernamen aus echten Handyfotos (RMIT-Textract-Studie 2025). Herstellerangaben von 97–99 % beziehen sich auf frische, flache, gut beleuchtete Aufnahmen einfacher Felder – die Spitze der Leiter, nicht die Mitte.
Kann OCR verblasste Thermopapierbelege lesen?
Teilweise – und der Verlust ist physisch: Verblasster Thermopapiertext ist dauerhaft vom Papier verschwunden, daher kann keine Engine ihn wiederherstellen. Bei koreanischen Thermobelegen mit echten Verblassungs- und Knitterartefakten erzielten Open-Source-Engines nur 55–73 % Wortgenauigkeit (KORIE 2026) – die beste (PaddleOCR, 73,3 %) scheitert weiterhin an etwa einem von vier Wörtern. Die einzige zuverlässige Lösung ist, Belege zu erfassen, bevor sie verblassen.
Beeinträchtigt Zerknitterung die OCR-Genauigkeit?
Ja – messbar. In einem kontrollierten Test mit 300 DPI senkte Zerknitterung die Zeichengenauigkeit von 94,7 % auf 86,9 %, etwa 8 Prozentpunkte; Schmutz- und Wasserschäden senken sie weiter auf 80,9 % und 72,7 % (IJSAT 2026). Die realen Belege der RMIT-Studie waren zu etwa 50 % gefaltet oder zerknittert, was mit dem Ergebnis von etwa 67 % beim Händlerfeld übereinstimmt.
Welches Belegfeld ist für OCR am schwersten zu extrahieren?
Der Händlername ist durchgängig am schwersten, mit 73,1–87,7 % Feldgenauigkeit über fünf LLM-Engines, während der Gesamtbetrag mit 94,9–98,9 % am einfachsten ist und das Datum mit 84,3–92,5 % dazwischen liegt (Doubleword 2026, 626 SROIE-Belege). Dieselbe Rangfolge zeigt sich bei echten Handyfotos (RMIT 2025) und bei arabisch-englischen Belegen (ReceiptSense 2024: numerische Felder 93,4 vs. Textfelder 62,3 F1).
Ist die Beleg-OCR weniger genau als die Rechnungs-OCR?
Ja, in der Praxis. Rechnungen kommen als kontrollierte PDFs oder Flachbettscans mit standardisierten Layouts; Belege sind Thermopapier, Handyfotos, zerknittert und ohne Vorlage. Der Unterschied zeigt sich bei vergleichbaren Cloud-Engines: Bei Rechnungen liegt die Feldgenauigkeit je nach Engine bei 78–98% (BusinessWareTech 2025), während dieselbe Engine-Klasse bei echten Handyfotos von Belegen 66,7–68,7% für das Feld Händlername erreichte (RMIT Textract Studie 2025).
Wie stark beeinträchtigt ein Handyfoto die Beleg-OCR-Genauigkeit im Vergleich zum Scannen?
Es gibt keinen peer-reviewten kontrollierten Vergleich mit identischen Belegen — eine echte Datenlücke (siehe Einschränkungen). Die vorhandenen Belege: Die Belege der RMIT-Studie waren zu ~65% Handyfotos, davon 44% schief und 12,7% verschwommen, was eine Genauigkeit von 66,7–68,7% beim Händlernamen ergab, während die SROIE- und KORIE-Benchmarks, die höhere Werte erzielen, Flachbettscans verwendeten. In der Tendenz fügt das Handyfoto Schräglage, Schatten und Unschärfe hinzu, die jeweils die Genauigkeit auf der Leiter nach unten drücken, aber der genaue Abzug ist in der veröffentlichten Literatur nicht gemessen.
Was ist SROIE und warum ist es wichtig?
SROIE (Scanned Receipt OCR and Information Extraction) ist der ICDAR-2019-Wettbewerb, der den ersten standardisierten Beleg-OCR-Benchmark schuf: 1.000 echte gescannte Belege mit Aufgaben zur Textlokalisierung, OCR und Schlüsselfeldern (Firma, Adresse, Datum, Gesamtbetrag) (Huang et al., 2019). Er ist wichtig, weil er der einzige Beleg-Benchmark mit veröffentlichten teamübergreifenden Ergebnissen ist: Selbst die beste Methode von 2019 verfehlte die 99% Genauigkeit, die Beleg-Anwendungen verlangen. Moderne LLMs auf demselben Datensatz erreichen insgesamt 84,3–93,0% (Doubleword 2026).
Methodik & Quellen
So wurde diese Seite erstellt
Diese Seite bündelt Daten aus 14 unabhängigen Studien aus den Jahren 2019–2026. Die Quellen wurden anhand von drei Kriterien ausgewählt: (1) öffentlich dokumentierte Methodik mit angegebener Stichprobengröße, (2) Daten, die – sofern verfügbar – innerhalb der letzten 3 Jahre erhoben wurden, wobei ältere Quellen im Text mit Jahreszahl gekennzeichnet sind, und (3) Relevanz für belegspezifische OCR und Extraktion statt allgemeiner Dokumentbehauptungen. Wenn mehrere Quellen dieselbe Dimension berichten, werden konservative Spannen (niedrigster–höchster berichteter Wert) verwendet – wir untertreiben lieber. Wo Quellen erheblich voneinander abweichen, wird die Abweichung durch Metrikebene, Dokumentzustand oder Korpus erklärt und nicht weggemittelt.
Die Metrikunterscheidung ist das Rückgrat dieser Seite: Zeichen-, Wort- und Feldebene werden nie zu einer einzigen Zahl vermischt, und jedes Diagramm und jede Tabellenzeile kennzeichnet seine Metrik. Selbst gemeldete Anbieterzahlen (DATABASICS ~64 % Untergrenze) sind als D-Note gekennzeichnet und werden nur als bestätigte Referenzen verwendet. Die SROIE-Benchmark-Ergebnisse stammen aus der Technologie von 2019 und sind nach Jahr gekennzeichnet; die modernen LLM-Ergebnisse desselben Datensatzes (Doubleword 2026) werden zur Aktualität daneben gezeigt.
Quellenverzeichnis
- Huang, Z. et al. — „ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction" (2019). Peer-reviewter Wettbewerbsbericht; 1.000 gescannte Belege, 29/24/18 gültige Einsendungen in drei Aufgaben. Liefert die beste Task-3-F1 von 90,49 %, die Erkenntnisse „nur eines von 18 Teams über 90 %"/„mehr als die Hälfte unter 80 %" sowie die Task-2-Aussage „selbst die beste Methode erreicht die 99-%-Anforderung nicht".
- Park, S. et al. — „CORD: A Consolidated Receipt Dataset for Post-OCR Parsing" (2019). Akademisches Dataset-Paper; über 11.000 indonesische Belege, 30 Felder unter 4 Oberklassen; öffentliches Subset 800/100/100. Liefert die Korpusdefinition und das Feld-F1-Bewertungsprotokoll, das für die Forschungsmodell-Zeilen verwendet wird.
- Xu, Y. et al. — „LayoutLMv2" (ACL 2021). Peer-reviewtes Paper. Liefert CORD-Feld-F1 96,01 % (426M Parameter) und SROIE-Feld-F1 97,81 %.
- Kim, G. et al. — „Donut: OCR-free Document Understanding Transformer" (ECCV 2022). Peer-reviewtes Paper und offizielles Modell-Repository. Liefert CORD-Feld-F1 91,3 % (donut-base-finetuned-cord-v2).
- „KORIE: A Multi-Task Benchmark for Detection, OCR, and Information Extraction on Korean Retail Receipts" — MDPI Mathematics (2026). Peer-reviewte Fachzeitschrift; 748 koreanische Thermopapier-Belege mit realen Verblassungs-, Streifen- und Knitterartefakten; 17.587 OCR-Crops. Liefert die einzigen realen Degradations-Wortwerte: PaddleOCR WER 26,73 % (73,3 % Wortgenauigkeit), EasyOCR 31,43 %, Tesseract 35,26 %, BiGRU 44,47 %.
- „Towards Analysing Invoices and Receipts with Amazon Textract" (RMIT, 2025). Akademische Fallstudie (Preprint); 118 australische Belege, ca. 65 % Handyfotos, ca. 50 % gefaltet/zerknittert, 44 % schief. Liefert die Exakte-Übereinstimmung des Händlernamens von 68,7 % (Textlayouts) / 66,7 % (Logolayouts), die Erkenntnis „Summen werden durchgängig erkannt" sowie die Beobachtung zu Spracheinschränkungen.
- Abdallah, A. et al. — „ReceiptSense: Beyond Traditional OCR" (2024). Akademischer Preprint; 20.000 arabisch-englische Belege, 30.000 OCR-Bilder. Liefert Zero-Shot-F1 32,07–42,98 %, Three-Shot-F1 60,60–80,26 % und die Lücke zwischen numerischen und Textfeldern (93,42 vs. 62,30).
- „Optical Character Recognition Accuracy on Degraded Documents" — IJSAT 17(2) (2026). Peer-reviewt; EasyOCR bei 300 DPI unter vier physischen Bedingungen. Liefert die Zeichengenauigkeits-Degradationsleiter mit 94,7 % (flach) / 86,9 % (zerknittert) / 80,9 % (verschmutzt) / 72,7 % (nass), die für die Zeilen zu physischen Schäden verwendet wird.
- „Deep Learning based Key Information Extraction from Business Documents: Systematic Literature Review" (2024). Akademische systematische Übersichtsarbeit. Liefert die durchschnittliche Feld-F1 über veröffentlichte Papers: CORD 0,94, SROIE 0,95.
- „Large language model driven transferable key information extraction mechanism for nonstandardized tables" (2025). Peer-reviewt; LLM-TKIE, ohne Feinabstimmung, 3-Shot. Liefert CORD-F1 80,9 / SROIE-F1 83,9 als LLM-Baseline ohne Einrichtung.
- Doubleword — „Structured Data Extraction“ SROIE-Benchmark (2026). Anbieter-Benchmark mit vollständig offengelegter Methodik; vollständiger SROIE-Testsatz mit 626 Belegen, Exakte Übereinstimmung auf Feldebene, 5 LLM-Engines. Liefert insgesamt 84,3–93,0 % und die feldspezifischen Spannen (Gesamtbetrag 94,9–98,9 %, Datum 84,3–92,5 %, Händlername 73,1–87,7 %).
- Google Developer Forum — „Low F1 Score with Document AI on Diverse Invoice and Expense Layouts“ (2024). Anekdotische Nutzermessung im offiziellen Google-Forum; ca. 1.500 verschiedene Dokumente. Liefert die Cloud-API-Realwelt-Spanne mit F1 0,75–0,85.
- BusinessWareTech — „AWS Textract vs Google, Azure, and GPT-4o: Invoice Extraction Benchmark“ (2025). Unabhängiger Drittanbieter-Benchmark (Note C, transparente Methode, echte Rechnungen). Liefert die Engine-Abstufung im Rechnungskontext: GPT-4o+OCR 98 %, Azure 93 %, Google 82 %, Textract 78 % — die einfachere Obergrenze für Belege.
- DATABASICS — Whitepaper „Receipt Capture & OCR for Expense Reports“. Anbieter-Whitepaper (Note D); nur als Untergrenzen-Referenz verwendet. Liefert die Einordnung in Stufen von ca. 64 % traditioneller OCR / 85–95 % KI-verbessert / 97–99 % LLM, mit dem Hinweis, dass die Genauigkeit mit Bildqualität, Layout und Handschrift variiert.
Einschränkungen
- Geografische Abdeckung: Die Quellen konzentrieren sich auf Asien-Pazifik und den Nahen Osten (Malaysia/Singapur, Indonesien, Korea, Ägypten/Arabisch, Australien). Es wurde keine belegspezifische akademische Benchmark für Nordamerika, Lateinamerika oder Afrika gefunden – die OCR-Genauigkeit für Belege in den USA/Großbritannien ist derzeit nur über Anbieterangaben und anekdotische Forenberichte dokumentiert, nicht über Peer-Review-Studien.
- Methodische Einschränkungen: Die Metrikebenen (Zeichen / Wort / Feld) unterscheiden sich zwischen den Studien und werden pro Zeile gekennzeichnet statt vermischt; mehrere Schlüsselzahlen stützen sich auf Einzelstudien (KORIE Thermopapier-Degradation; RMIT Textract Händlername-Feld; ReceiptSense mehrsprachig), und die Doubleword- und Google-Forum-Zahlen sind D/C-Note (Anbieter oder anekdotisch) und werden mit offengelegter Note verwendet. Die IJSAT-Zahlen zu zerknittert/verblasst stammen von gedruckten Dokumenten, nicht von Belegen – es ist zu erwarten, dass Belege auf Thermopapier stärker degradieren, aber das ist eine Schlussfolgerung und wird als solche gekennzeichnet.
- Zeitliche Lücken: Die SROIE-Wettbewerbsdaten stammen aus dem Jahr 2019; ihre absoluten Zahlen spiegeln die Methoden von 2019 wider und sind nach Jahr gekennzeichnet, wobei moderne LLM-Ergebnisse auf demselben Datensatz (Doubleword 2026) daneben bereitgestellt werden. Nach SROIE 2019 wurde kein neuerer standardisierter Belegwettbewerb mit veröffentlichten teamübergreifenden Ergebnissen gefunden.
- Was wir nicht finden konnten: (1) eine Peer-Review-kontrollierte Studie, die Handyfoto vs. Flachbettscan auf identischen Belegen vergleicht – die am häufigsten zitierte Variable im Anbietermarketing; (2) eine belegspezifische Benchmark zur Extraktion von Einzelposten (die einzigen Einzelpostenzahlen stammen aus dem Rechnungskontext, 40–82 % je nach Engine, BusinessWareTech 2025); (3) eine Studie, die den Währungseffekt (Symbol, Dezimalkonvention) isoliert, während die Schrift konstant gehalten wird; (4) Benchmarks für handschriftliche Ergänzungen auf Belegen (Trinkgeld, Notizen, Korrekturen); (5) öffentliche Benchmarks für E-Belege/Screenshots im Vergleich zu fotografiertem Papier. Diese Lücken werden benannt, statt mit nicht verifizierbaren Anbieterzahlen gefüllt.
Verwandte Referenzen: OCR-Genauigkeit nach Dokumenttyp · Genauigkeit der Handschrifterkennung · Kostenaufschlüsselung der Dokumentenverarbeitung · Fehlerraten bei manueller Dateneingabe
Weiterführende Lektüre: Die Kosten der manuellen Dateneingabe handschriftlicher Belege · Wie die Genauigkeit der KI-Handschriftextraktion kontinuierlich steigt