Referenzen
Datenreferenzen und Terminologie-Definitionen für Dokumenten-KI. Jede Seite ist quellengeprüft und zur Zitierung konzipiert.
Statistiken
Direkter Vergleich aus erster Hand: docTR vs. Docling bei 361 SROIE- und 100 CORD-Belegen – 6,7-fache Latenz, 8,3-fache Kosten, 3,0-fache CER, 2,9-facher Regex-Feldwechsel. Methodik.
Direkter Vergleich aus erster Hand: docTR vs Surya2 auf 361 SROIE- und 100 CORD-Belegen — CER-Gleichstand, 4,2-facher Field-F1-Wechsel, 22-fache Kostenlücke, Methodik.
Eigener Benchmark: EasyOCR vs docTR auf 361 SROIE- und 100 CORD-Belegen – docTR 30 % niedrigere CER, 1,66-facher LLM-Feld-F1; EasyOCR 1,93-facher Regex-F1.
Benchmark aus erster Hand: OCR-Kosten pro 1.000 Seiten für 8 Open-Source-Engines auf RTX 4090 — 0,048 $ (docTR) bis 1,061 $ (Surya2). SROIE + CORD, Methodik.
Latenz pro Seite für 8 Open-Source-OCR-Engines auf RTX 4090 — 108,7 ms (docTR) bis 2.668 ms (Surya2) p50. p95-Tails, Durchsatz, Methodik.
Direkter Vergleich aus erster Hand: PaddleOCR vs EasyOCR bei Belegen – CER 0,204 vs. 0,283, 2,2x Regex-F1, 2x Kostendifferenz, LLM-Paradoxon. Methodik.
Benchmark aus erster Hand: Surya2 vs Unlimited-OCR vs PaddleOCR-VL auf 361 SROIE- und 100 CORD-Belegen – Feld-F1, CER-Fairness, Kosten, Latenz.
Direkter Vergleich: Tesseract (CPU) vs. PaddleOCR (GPU) bei 361 SROIE- und 100 CORD-Belegen – CER, Feld-F1, Durchsatzparität, Kosten. Methodik.
Benchmark aus erster Hand: 8 Open-Source-OCR-Engines vs. Dokument-Parsing-VLMs auf 361 SROIE- und 100 CORD-Belegen — CER, Feld-F1, Latenz, Kosten. Methodik enthalten.
Warum VLM-CER aufgebläht ist: Fallnormalisierung und GT-Struktur erzeugen Phantomfehler. Erstpartei-SROIE- und CORD-Daten — Feld-F1 ist die faire familienübergreifende Metrik.
Eigener Benchmark: LLM-Nachbearbeitung schlägt regex bei der Beleg-Feldextraktion, Feld-F1 für 8 OCR-Modelle auf SROIE + CORD, Methodik enthalten.
Benchmark aus erster Hand mit 5 Open-Source-OCR-Modellen auf 461 Belegen (SROIE + CORD): CER, WER, Feld-F1, Latenz, Kosten pro 1.000 Seiten.
Ausnahmeraten in der Dokumentenautomatisierung: 9 % Best-in-Class vs. 22 % Durchschnitt, Ursachen, Prüfkosten und Schwellenwert-Abwägungen mit allen Quellenangaben.
Unabhängige Benchmarks zu Dokumentverarbeitungskosten pro Datensatz: manuell 8–16 $, Vorlage 2–5 $, KI ab 0,02 $/Seite. Nach Dokumenttyp, Größe, Region.
Handschrift-OCR-Genauigkeitsdaten: IAM CER 1,2–1,7 %, Arabisch 8,9–16 %, historisch 71–82 %. Aufgeschlüsselt nach Schrift, Modell und Dokumenttyp. 15 zitierfähige Quellen.
Benchmarks zur Rechnungsverarbeitungszeit: 12,5 Min. manuelle Bearbeitung vs. 9,2 Tage Durchlaufzeit, nach Methode, Komplexität und Phase – mit vollständigen Quellen für die Zitierung.
Unabhängige Benchmarks zum ROI der Automatisierung der Datenerfassung: Amortisation in 3–12 Monaten, 60–80 % Einsparungen, Gewinnschwelle sowie eine Formel zur Berechnung der eigenen Rendite.
Unabhängige Benchmarks zur OCR-Genauigkeit nach Dokumenttyp: 99,2–99,8 % bei digital erstellten PDFs, 98–99 % bei Scans, 46–95 % bei Handschrift, Tabellen-TEDS. 15 zitierfähige Quellen.
Beleg-OCR-Genauigkeit nach Zustand und Feld: 90 %+ bei sauberen Scans, 55–73 % bei verblasstem Thermopapier, 67–69 % bei Handyfotos. Gesamtbeträge 95–99 %, Händlernamen 73–88 %. 14 Quellen.
Unabhängige Benchmarks zu Fehlerquoten bei manueller Dateneingabe: auf Feldebene 1–4 %, auf Datensatzebene bis zu 40 %, nach Dokumenttyp, Branche und Rolle.
Definitionen
Datenerfassung wandelt Papier, Scans, PDFs und Fotos in maschinenlesbare Daten um. So funktioniert sie, ihre Arten und Missverständnisse.
ICR ist maschinelles Lernen zur Zeichenerkennung für handgeschriebene Druckschrift. Wie es sich aus OCR entwickelt hat, die Unterschiede zwischen ICR, OCR und IWR sowie Einsatzgebiete.
Die Schlüsselinformationsextraktion (KIE) überführt Felder wie Rechnungsnummern und Datumsangaben aus Dokumenten in strukturierte Daten. Funktionsweise, Grenzen, Missverständnisse.
Ein durchsuchbares PDF ist ein Scan mit einer unsichtbaren OCR-Textschicht — Sie können den Text auswählen, kopieren und mit Strg+F durchsuchen. So funktioniert es, PDF/A-Regeln und häufige Fallstricke.
Die Feldgenauigkeit zählt korrekt extrahierte Felder; die Zeichengenauigkeit zählt korrekt gelesene Zeichen. 99 % Zeichengenauigkeit sind nicht 99 % genaue Daten.
IDP ist KI-Software, die Daten aus Dokumenten erfasst, klassifiziert, extrahiert und validiert. So funktioniert es, die Entwicklung von OCR zu LLMs und Missverständnisse.
Die STP-Rate misst den Anteil der Dokumente, die ohne menschliches Eingreifen verarbeitet werden – Branchendurchschnitt 32 %, Best-in-Class 49 %, KI 60–80 %. Formel und Missverständnisse.
OCR wandelt Bilder von gedrucktem, handschriftlichem oder getipptem Text in maschinenlesbare Daten um. So funktioniert es, die 4 Arten von OCR, ihre Geschichte und Anwendungsfälle.