Ergebnisse des Receipt-OCR-Benchmarks:Genauigkeit, Latenz und Kosten von 5 Open-Source-OCR-Modellen (2026)

Zuletzt geprüft: 2026-08-12 · Ausführungsebene: offiziell · 10 Durchläufe (5 Modelle × 2 Datensätze) · 461 Belege

Was diese Seite abdeckt: Erstparteien-Benchmark-Ergebnisse aus unabhängigen, von ImageToTable.ai durchgeführten Läufen unter Verwendung öffentlich verfügbarer Datensätze und Open-Source-Modelle — 5 Modelle auf 461 Belegbildern aus 2 öffentlichen Testsätzen. Alle Vorhersage-Artefakte, Metriken und Manifeste sind zur Prüfung verfügbar. Dies ist KEINE Aggregation von Drittanbieterdaten — jede Zahl stammt aus reproduzierbaren Benchmark-Läufen auf RTX-4090-Hardware unter einem einzigen Messprotokoll.
Was diese Seite NICHT abdeckt: Aggregationen von Drittanbietern zur Beleg-OCR-Genauigkeit (siehe Receipt-OCR-Genauigkeit), Cloud-/API-Modelle (AWS Textract, Google Document AI, Azure — noch nicht ausgeführt), vLLM-basierte Modelle (Surya2, Unlimited-OCR — für eine spätere Charge geplant) oder feinabgestimmte Forschungsmodelle aus dem ursprünglichen SROIE-Wettbewerb.

Dies ist eine Erstparteien-Benchmark-Referenz. Alle Zahlen lassen sich auf eingefrorene Benchmark-Artefakte zurückführen, die am 11.–12. August 2026 unter einem versionierten Protokoll erstellt wurden (siehe Methodik). Das vollständige Artefaktpaket — Vorhersagen, Metriken, Manifeste, Leistungsprotokolle — ist auf Anfrage erhältlich. Wo eine Metrik für ein Modell nicht zutrifft, wird sie als nicht zutreffend und nicht als Null angegeben.

Die Schlagzeile dieses Benchmarks ist eine Umkehrung: docTR liest Belegtext am genauesten (19,7 % CER), extrahiert strukturierte Felder jedoch am schlechtesten (7,7 % Feld-F1), während PaddleOCR etwas weniger genau liest (20,5 % CER), Felder aber 4× besser extrahiert (32,5 % Feld-F1). Textgenauigkeit ist nicht Feldgenauigkeit — und jede Modellauswahlentscheidung, die auf einer einzigen „Genauigkeits"-Zahl basiert, übersieht diese Trennung.

19,7 %
Niedrigste Zeichenfehlerrate (CER) bei englischen SROIE-Belegen — docTR v1.0.1, 361 Stichproben, 95 %-KI 18,5–21,0 %
32,5 %
Höchste Feld-F1 (Firma/Datum/Adresse/Summe, Regex-Nachbearbeitung aus OCR-Text) — PaddleOCR 3.7.0, 361 Stichproben
7,7×
Geschwindigkeitsunterschied in Wanduhrzeit zwischen dem schnellsten (docTR, 256,0 Seiten/Min.) und dem langsamsten (Docling, 33,2 Seiten/Min.) Modell auf identischer RTX-4090-Hardware — Kosten pro 1.000 Seiten unterscheiden sich um das 7,8×-Fache

Das Paradoxon: Bester Textleser, schlechtester Feldextraktor

Derselbe Benchmark-Lauf erzielte sowohl das beste als auch das schlechteste Feldextraktionsergebnis auf denselben 361 Belegen. Der Unterschied liegt nicht in der Datenqualität — sondern im Unterschied zwischen Textlesen und Feldextraktion.

Zwei Genauigkeitsmetriken beantworten unterschiedliche Fragen. Die Zeichenfehlerrate (Character Error Rate, CER) misst, wie viele einzelne Zeichen relativ zur Ground-Truth-Transkription falsch gelesen wurden — eine CER von 19,7 % bedeutet etwa ein falsches Zeichen pro fünf. Die Wortfehlerrate (Word Error Rate, WER) wertet ein ganzes Wort als fehlerhaft, wenn ein einziges Zeichen darin falsch gelesen wurde, weshalb WER-Werte immer höher sind als CER. Das Feld-F1 misst in diesem Benchmark, ob die vier SROIE-Felder — Firmenname, Datum, Adresse und Gesamtsumme — aus dem OCR-Text durch einen festen Regex-Nachbearbeiter wiederhergestellt werden können, berechnet als harmonisches Mittel aus Präzision und Recall über den 361-Dokument-Feldsatz.

docTR erzeugte die sauberste Transkription (19,7 % CER, 32,0 % WER), aber seine Feldwiederherstellung fiel auf 7,7 % F1 zusammen — ein Regex-Durchlauf über sauberen Text kann dennoch scheitern, wenn das Wertformat (Währungssymbole, Komma-Dezimalbeträge, mehrzeilige Adressen) nicht zum Extraktionsmuster passt. Die Transkription von PaddleOCR war geringfügig verrauschter (20,5 % CER), doch seine Ausgabe passte besser zu den Feldmustern und ergab 32,5 % F1. Keines der Ergebnisse ist ein Fehler — es sind zwei verschiedene Ebenen derselben Pipeline, und kein Modell in dieser Gruppe erreichte auch nur ein einziges vollständig korrektes Dokument bei allen vier Feldern (dokumentgenaue Feldübereinstimmung = 0 für jedes Modell). Dies ist die praktische Bedeutung der Aussage, dass OCR-Textgenauigkeit nicht Feldgenauigkeit ist.

SROIE 2019-Ergebnisse: Textgenauigkeit, Feld-F1, Latenz und Kosten

Das primäre Ranking-Set ist SROIE 2019 (Scanned Receipt OCR and Information Extraction, der ICDAR-2019-Wettbewerbsdatensatz) — 361 englischsprachige gescannte Belege im festen offiziellen Test-Split, bewertet mit allen fünf Modellen in derselben Ausführungsgruppe auf derselben GPU. Niedrigere CER/WER sind besser; höheres Feld-F1 ist besser.

Zeichenfehlerrate (CER) nach Modell auf SROIE 2019 (niedriger ist besser): docTR 19,7 %, PaddleOCR 20,5 %, EasyOCR 28,3 %, Tesseract 33,6 %, Docling 58,4 %.

Quelle: ImageToTable.ai Receipt OCR Benchmark v1, SROIE-2019-Test-Split (361 Stichproben). Läufe: offizielle Stufe, warm_then_scored-Protokoll, RTX 4090. Bootstrap-95%-Konfidenzintervall über 2.000 Resamples. Vollständiges Artefaktpaket auf Anfrage erhältlich. Datensatz: ICDAR 2019 SROIE-Wettbewerb.

Modell (Version)CER (95%-KI)WER (95%-KI)Feld-F1p50-Latenzp95-LatenzSeiten/Min. (Wand)$/1.000 Seiten
docTR v1.0.119,7% (18,5–21,0)32,0% (30,4–33,5)7,7%153 ms455 ms256,0$0,049
PaddleOCR 3.7.020,5% (19,2–21,7)32,6% (31,0–34,1)32,5%219 ms612 ms157,8$0,080
EasyOCR 1.7.228,3% (27,1–29,5)61,6% (59,5–63,5)14,8%660 ms1.440 ms77,4$0,164
Tesseract 5.3.433,6% (31,2–35,9)56,2% (53,4–58,9)23,2%939 ms2.314 ms54,4$0,233
Docling 2.119.058,4% (52,8–64,6)75,1% (69,6–81,2)22,3%1.196 ms4.834 ms33,2$0,381

Quelle: ImageToTable.ai Receipt OCR Benchmark v1, SROIE-2019-Test-Split. Alle Metriken stammen aus eingefrorenen Benchmark-Artefakten (n=361 pro Modell, 100 % Erfolgsquote). CER/WER: Zeichen-/Wortfehlerrate gegenüber der Ground-Truth-Transkription. Feld-F1: nachgelagerte Feldextraktion aus OCR-Text mittels fester Regex — KEINE native Modell-Feldausgabe (keines der fünf Modelle erzeugt native strukturierte Felder). KI: Bootstrap-Perzentil 95 %, 2.000 Resamples. Kosten: berechnet auf RunPod RTX 4090 bei $0,76/Stunde (Preis erfasst am 11.08.2026). Vollständige Artefakte auf Anfrage verfügbar.

Warum die Feld-F1 so weit hinter der Texterkennung zurückliegt

Jedes Modell in dieser Charge liest den Text einigermaßen, liefert aber bei den meisten Belegen kein brauchbares strukturiertes Feld — die beste Feld-F1 liegt bei 32,5 %, und kein Modell erzeugte ein einziges vollständig korrektes Dokument (Firma + Datum + Adresse + Summe alle exakt).

Die SROIE-Feldmetriken sind hier Regex-nachbearbeitet: Der Benchmark nimmt den OCR-Text jedes Modells und wendet eine feste, musterbasierte Extraktion für die vier Felder an. Dies unterscheidet sich bewusst von der nativen strukturierten Feldausgabe eines Modells — keines der fünf Open-Source-OCR-Engines in dieser Charge erzeugt native strukturierte Felder für Beleglayouts, daher ist der Nachprozessor der einzige verfügbare Feldpfad. Die Lücke zwischen einer CER von 19,7 % und einer Feld-F1 von 7,7 % ist das, was eine echte Extraktionspipeline für die fehlende strukturierte Ausgabeschicht zahlt: Hochwertiger Text benötigt dennoch Layoutverständnis und Wertnormalisierung, um zu Feldern zu werden.

Die Rangumkehr zwischen den Modellen ist stabil: PaddleOCR führt die Feld-F1 mit 32,5 % an (30,5–34,5 %-KI), gefolgt von Tesseract 23,2 %, Docling 22,3 %, EasyOCR 14,8 % und docTR 7,7 % — während die Rangfolge der Textmetriken an der Spitze fast genau umgekehrt ist (docTR 19,7 % CER gegenüber PaddleOCR 20,5 % CER). Jede Pipeline, die nur „OCR-Genauigkeit“ meldet, verbirgt die Feldextraktionsebene, in der die eigentliche Varianz liegt.

CORD v2: Der Sprach-Stresstest

Bei 100 indonesischsprachigen Belegen (CORD v2) fällt die CER jedes Modells auf 90–95 % — ein auf Englisch trainierter OCR-Stack lässt sich nicht auf eine andere Sprache übertragen, und dieser Benchmark quantifiziert die Strafe, anstatt sie zu beschönigen.

CORD v2 (ein konsolidierter Belegdatensatz für die Post-OCR-Analyse) bietet den sprachübergreifenden Stresstest. Seine 100 geprüften Testproben sind indonesischsprachige Belege, und jedes Modell in dieser Charge wurde hauptsächlich mit englischen Daten trainiert. Die folgenden Ergebnisse sind keine Rangfolge der Modellqualität — CORD-Textmetriken dienen als Beleg für die Robustheit von Beleg/Sprache/Layout und dürfen nicht mit SROIE zu einer einzigen Gesamtrangfolge zusammengeführt werden. Feldmetriken sind bei CORD nicht anwendbar, da kein Modell native CORD-Strukturfelder ausgibt und für diese Charge kein CORD-Nachprozessor definiert ist.

Modell (Version)CERWERp50-Latenz$/1.000 Seiten
PaddleOCR 3.7.090,8 %94,1 %123 ms$0,067
docTR v1.0.191,0 %93,7 %123 ms$0,055
EasyOCR 1.7.291,8 %96,2 %6.450 ms$1,445
Docling 2.119.092,2 %95,3 %524 ms$0,244
Tesseract 5.3.495,2 %97,7 %652 ms$0,161

Quelle: ImageToTable.ai Receipt OCR Benchmark v1, CORD-v2-Testsplit (100 Stichproben). Alle Läufe offizielle Stufe, RTX 4090, 100 % Erfolgsquote. Hinweis: Sprachmismatch-Stresstest — CORD-CER-Werte nicht mit SROIE-CER-Werten vergleichen. Datensatz: CORD v2 (Clova AI).

Geschwindigkeit und Kosten: Die 7,7×-Spreizung

Auf identischer Hardware beträgt die Durchsatz-Spreizung das 7,7×-Fache und die Kosten pro 1.000 Seiten das 7,8×-Fache — bei Belegvolumen kann die Wahl des schnellsten Modells die OCR-Rechenkosten um rund 87 % senken, bevor Genauigkeit überhaupt berücksichtigt wird.

Der Durchsatz wird in diesem Benchmark auf zwei Arten angegeben: als p50/p95-Latenz pro Seite (aus erfolgreichen Vorhersagedatensätzen, ohne Runner-Initialisierung) und als End-to-End-Wanduhr-Seiten pro Minute (einschließlich Runner-Prozessstart im warm_then_scored-Modus). Die Kosten pro 1.000 Seiten werden aus der Laufzeit zum aufgezeichneten RunPod-RTX-4090-Satz von 0,76 $ pro Stunde berechnet. Die folgenden Diagramme zeigen den SROIE-Wanduhr-Durchsatz und die Kosten; CORD folgt demselben Muster, wobei docTR und PaddleOCR erneut am schnellsten und günstigsten sind.

Wanduhr-Durchsatz auf SROIE 2019 (RTX 4090, warm_then_scored): docTR 256,0, PaddleOCR 157,8, EasyOCR 77,4, Tesseract 54,4, Docling 33,2 Seiten pro Minute.

Quelle: ImageToTable.ai Receipt OCR Benchmark v1, SROIE-2019-Testsplit (361 Stichproben). Wanduhr-Seiten pro Minute aus zeitgesteuerten Benchmark-Läufen einschließlich Runner-Initialisierung. Alle Läufe offizieller Stufe, RTX 4090.

Kosten pro 1.000 Seiten auf SROIE 2019 (RTX 4090 bei 0,76 $ pro Stunde): docTR 0,049 $, PaddleOCR 0,080 $, EasyOCR 0,164 $, Tesseract 0,233 $, Docling 0,381 $.

Quelle: ImageToTable.ai Receipt OCR Benchmark v1, SROIE-2019-Testsplit. Kosten = Laufzeit × 0,76 $ pro Stunde (RunPod RTX 4090, Preis erfasst am 11.08.2026). Enthält Initialisierungsaufwand pro Lauf.

So wählen Sie ein Modell aus diesen Ergebnissen aus

Es gibt kein einzelnes „bestes" Modell in diesem Benchmark — die Ergebnisse unterstützen die Auswahl nach Priorität, und dieselbe Tabelle beantwortet verschiedene Fragen. Drei häufige Prioritäten lassen sich direkt auf die Daten abbilden:

  • Wenn rohe Transkriptionsgenauigkeit das Ziel ist (Volltext-Indexierung, menschenlesbare Digitalisierung): docTR führt mit 19,7 % CER und ist mit 256,0 Seiten pro Minute und 0,049 $ pro 1.000 Seiten auch am schnellsten und günstigsten — es gewinnt gleichzeitig in allen drei Kategorien Textgenauigkeit, Geschwindigkeit und Kosten.
  • Wenn strukturierte Feldextraktion das Ziel ist (für nachgelagerte Systeme, die Firma/Datum/Summe benötigen): PaddleOCR führt mit 32,5 % Feld-F1, aber selbst das ist eine Feldausfallrate von etwa 2 von 3 — die ehrliche Schlussfolgerung ist, dass keines dieser Open-Source-OCR-Engines allein produktionsreife Belegfeldextraktion ohne eine strukturierte Extraktionsschicht darüber liefert.
  • Wenn Kosten bei Volumen die Einschränkung sind: Die 7,8×-Kostenspreizung bedeutet, dass eine Million Seiten mit docTR etwa 49 $ kosten gegenüber 381 $ mit Docling — ein Unterschied von etwa 332 $ pro Million Seiten auf identischer Hardware.

Unabhängig davon, welche Priorität gilt: Das Protokoll und die Artefakte ermöglichen es Ihnen, jede Zahl in dieser Tabelle auf Ihrer eigenen GPU zu reproduzieren, bevor Sie sich festlegen — und für einen mehrsprachigen Belegworkflow sind die CORD-Ergebnisse die Warnung, dass auf Englisch trainierte Modelle zuerst auf der Zielsprache stresstestet werden sollten.

Häufig gestellte Fragen

Welches Open-Source-OCR-Modell ist bei Belegen am genauesten?

Das hängt von der Metrik ab: docTR hat die beste Texterkennung (19,7 % CER bei 361 SROIE-Belegen), während PaddleOCR die beste Feldextraktion (32,5 % Feld-F1) im ImageToTable.ai Receipt OCR Benchmark erzielt. Kein einzelnes Modell führt in beiden Bereichen — Texterkennung und Feldextraktion sind unterschiedliche Pipeline-Ebenen.

Warum ist die Texterkennung von docTR besser, aber die Feldextraktion schlechter als bei PaddleOCR?

Weil die beiden Metriken unterschiedliche Pipeline-Ebenen messen. docTR erkannte Zeichen genauer (19,7 % CER gegenüber 20,5 %), aber die Ausgabe entsprach nicht den festen Regex-Feldmustern für Firma/Datum/Adresse/Summe, wodurch der nachbearbeitete Feld-F1 auf 7,7 % fiel, während PaddleOCR 32,5 % erreichte. Saubererer Text garantiert keine bessere Feldextraktion, wenn das Wertformat (Währungssymbole, Komma-Trennzeichen, mehrzeiliges Layout) vom Extraktionsmuster abweicht.

Ist PaddleOCR besser als Tesseract für Beleg-OCR?

Ja, bei jeder Metrik in diesem Benchmark: PaddleOCR übertrifft Tesseract bei CER (20,5 % gegenüber 33,6 %), WER (32,6 % gegenüber 56,2 %), Feld-F1 (32,5 % gegenüber 23,2 %), Geschwindigkeit (157,8 gegenüber 54,4 Seiten/Min.) und Kosten ($0,080 gegenüber $0,233 pro 1.000 Seiten) auf dem 361-Beleg-SROIE-Testsatz.

Sinkt die OCR-Genauigkeit bei nicht-englischen Belegen?

Erheblich: Bei 100 indonesischen CORD-v2-Belegen erzielte jedes auf Englisch trainierte Modell 90–95 % CER (PaddleOCR mit 90,8 % am besten, Tesseract mit 95,2 % am schlechtesten) gegenüber 20–58 % bei englischen SROIE-Belegen. Dies ist als Sprach-Stresstest zu betrachten, nicht als Modell-Ranking — dieselben Modelle wurden nicht für Indonesisch trainiert.

Wie viel kostet Open-Source-OCR pro Seite auf einer GPU?

Zwischen $0,049 und $0,381 pro 1.000 Seiten auf einer RTX 4090 zum aufgezeichneten RunPod-Satz von $0,76/Stunde — also etwa $0,00005 bis $0,0004 pro Seite inklusive Startzeit, je nach Modell.

Was ist SROIE und was testet es?

SROIE 2019 (Scanned Receipt OCR and Information Extraction) ist der ICDAR-2019-Wettbewerbsdatensatz mit echten gescannten englischen Belegen inklusive Transkription und Ground Truth für Schlüsselfelder — dieses Benchmark verwendet seinen festen Test-Split mit 361 Stichproben. Es testet, ob ein OCR-Modell Belegtext lesen (CER/WER) und die Felder Unternehmen, Datum, Adresse und Gesamtsumme wiederherstellen kann; für die hier verwendeten Open-Source-Modelle wurden die Felder über einen festen Regex-Postprozessor wiederhergestellt, da keines von ihnen native strukturierte Felder ausgibt.

Kann ich diese Benchmark-Zahlen selbst reproduzieren?

Ja. Das Benchmark-Protokoll ist versioniert und eingefroren, alle Datensätze sind öffentlich verfügbar (SROIE von ICDAR 2019, CORD v2 von Clova AI), und alle fünf Modelle sind Open Source mit veröffentlichten Versionen. Das vollständige Artefaktpaket — Vorhersagen, Metriken, Manifeste, Leistungsprotokolle — ist auf Anfrage erhältlich. Eine Einschränkung: Die aktuellen Manifeste stammen aus der Zeit vor dem Schema-v2-Umgebungs-Fingerabdruck, und für eine vollständige byte-genaue Reproduzierbarkeit wäre eine erneute Ausführung in den exakten Modellumgebungen erforderlich; siehe Einschränkungen.

Methodik & Quellen

Protokoll

Dieses Benchmark folgt einem versionierten, eingefrorenen Protokoll (v0.1, 2026-08-11). Jede Zahl auf dieser Seite lässt sich auf ein bestimmtes Vorhersage-Artefakt zurückführen, das unter dem Protokoll erstellt wurde, und jeder Durchlauf erfüllt denselben Satz an Veröffentlichungsbedingungen: run_tier=official, expected_split=test, keine fehlenden Vorhersagen und alle not_applicable-Metriken unverändert beibehalten (nicht auf null gesetzt). Ein Qualitätsaudit (2026-08-12) hat alle Vorhersageverträge, Stichproben-Hashes und Leistungs-Hashes verifiziert.

Laufzeitumgebung

KomponenteDetail
GPUNVIDIA GeForce RTX 4090, 24 GB VRAM, Treiber 570.211.01
GPU-AnbieterRunPod, $0,76/Stunde (Preis erfasst am 2026-08-11T18:30:00Z)
Python3.12.3
PyTorch2.8.0+cu128 (EasyOCR, docTR, Docling); nicht verwendet von Tesseract, PaddleOCR
Messmoduswarm_then_scored: 5 Proben Aufwärmphase pro Datensatz, gefolgt vom vollständigen Test-Split
SplitNur Test; keine Trainings- oder Validierungsproben bewertet
Manuelle PrüfungAlle Vorhersage-Verträge bestanden — keine fehlenden/verwaisten/doppelten Proben-IDs (Prüfung 2026-08-12)

So reproduzieren Sie die Ergebnisse

Der Benchmark-Code, die Runner-Skripte und die Evaluatoren werden im Repository ImageToTable.ai benchmark-ocr gepflegt (Git-Commit 8bdc616; öffentliche Veröffentlichung ausstehend). Die genauen Befehle, die jede Zahl auf dieser Seite erzeugt haben:

SROIE 2019 (englische Belege, 361 Testproben):

export BENCHMARK_RUN_TIER=official
export BENCHMARK_EXPECTED_SPLIT=test
export BENCHMARK_MEASUREMENT_MODE=warm_then_scored
export BENCHMARK_GPU_LABEL="rtx_4090"
export BENCHMARK_GPU_PROVIDER="runpod"
export BENCHMARK_GPU_HOURLY_USD="0.76"
export BENCHMARK_FIELD_POSTPROCESSOR=sroie_receipt_regex

for model in tesseract paddleocr easyocr doctr docling; do
  BENCHMARK_WARMUP_SAMPLES=sroie_warmup_5.jsonl \
    bash server/run_model.sh "$model" sroie 361 "receipt-v1-sroie-${model}"
done

CORD v2 (indonesische Belege, 100 Testproben):

unset BENCHMARK_FIELD_POSTPROCESSOR

for model in tesseract paddleocr easyocr doctr docling; do
  BENCHMARK_WARMUP_SAMPLES=cord_v2_warmup_5.jsonl \
    bash server/run_model.sh "$model" cord_v2 100 "receipt-v1-cord-v2-${model}"
done

Alle Modelle wurden out-of-the-box mit Standardkonfigurationen verwendet. Kein Fine-Tuning, keine benutzerdefinierten Sprachpakete, keine Anpassungen nach dem Training. Weitere Informationen zu den Runner-Skripten pro Modell und zur Umgebungseinrichtung finden Sie im Benchmark-Repository.

Metrikdefinitionen

  • CER (Character Error Rate, Zeichenfehlerrate): Levenshtein-Distanz auf Zeichenebene geteilt durch die Anzahl der Ground-Truth-Zeichen (niedriger ist besser). Bootstrap-95%-Konfidenzintervall über 2.000 Resamples, Seed 20260811.
  • WER (Word Error Rate, Wortfehlerrate): Levenshtein-Distanz auf Wortebene (Leerzeichen-Tokenisierung) geteilt durch die Anzahl der Ground-Truth-Wörter (niedriger ist besser). Gleiche KI-Methode wie bei CER.
  • Feld-F1 (nur SROIE): harmonisches Mittel aus Präzision und Recall über die vier SROIE-Felder (company, date, address, total), extrahiert aus dem OCR-Text durch einen festen Regex-Nachbearbeiter (sroie_receipt_regex). KEINE native strukturierte Feldausgabe des Modells — für alle fünf Modelle gilt nicht zutreffend für native Feldmetriken.
  • p50 / p95-Latenz: Inferenzzeit pro Seite (ms) aus erfolgreichen Vorhersagedatensätzen, ohne Initialisierung des Runners.
  • Seiten/Min. (Wanduhrzeit): Gesamtzahl der bewerteten Stichproben geteilt durch die gesamte Laufzeit (Wanduhrzeit), einschließlich Start des Runner-Prozesses. Höher ist besser.
  • Kosten pro 1.000 Seiten: Laufzeit (Stunden) × $0.76 × (1.000 / Stichprobenanzahl). Verwendet tatsächliche Preismetadaten des Anbieters, keine geschätzten Tarife.
  • Erfolgsquote: 100 % für alle 10 Läufe in diesem Batch (0 Fehler, 0 Timeouts, 0 fehlende Vorhersagen).

Datensätze

  1. SROIE 2019 (Scanned Receipt OCR and Information Extraction) — ICDAR 2019 Robust Reading Competition, Aufgabe 3. 361 echte, gescannte englischsprachige Belege mit Transkription auf Zeilenebene und Ground-Truth-Labels für vier Schlüsselfelder (company, date, address, total). Fester Test-Split.
  2. CORD v2 (Consolidated Receipt Dataset) — Clova AI Research, NAVER Corp. 100 geprüfte indonesischsprachige Belegstichproben aus dem öffentlichen Test-Split, verwendet als sprachübergreifender Stresstest. Enthält verschachtelte Menü-Positionen und Zwischensummen/Gesamtsummen-Ground-Truth (in diesem Batch nicht bewertet — erfordert native strukturierte Feld-Emitter).

Getestete Modelle

ModellVersionTypQuelle
Tesseract5.3.4Klassische OCR-Engine (CPU+GPU)GitHub
PaddleOCR3.7.0Deep-Learning-OCR (PaddlePaddle)GitHub
EasyOCR1.7.2Deep-Learning-OCR (PyTorch)GitHub
docTRv1.0.1Neuronale OCR (TensorFlow / PyTorch)GitHub
Docling2.119.0Dokumentparser (IBM)GitHub

Artefaktzugriff & Reproduzierbarkeit

Quellcode des Benchmarks: wird im Repository benchmark-ocr gepflegt (Git-Commit 8bdc616). Das Repository enthält Runner-Skripte pro Modell, Evaluatoren (CER/WER, Feldmetriken, Bootstrap-KI), Beispiel-Manifeste der Datensätze mit SHA256-Hashes sowie das eingefrorene Protokoll. Die öffentliche Veröffentlichung steht aus — sobald sie erfolgt ist, ist jede Zahl auf dieser Seite unabhängig reproduzierbar, indem das Repository geklont, die öffentlichen Datensätze bezogen und die obigen Befehle auf einer RTX 4090 ausgeführt werden.

Vollständiges Artefaktpaket: Vorhersagen pro Modell (*.jsonl), Metriken mit 95%-KI (metrics.csv), Diagnosen auf Feldebene (field_details.csv), Leistungsprotokolle der Wanduhrzeit (performance.json) und Laufmanifeste (manifest.json) sind unter dem Protokoll versioniert und zusammen mit dem Quellcode verfügbar. Für einen frühen Zugang vor der öffentlichen Veröffentlichung kontaktieren Sie [email protected].

Hinweis zu Schema v1: Die aktuellen Manifeste stammen aus der Zeit vor dem Umgebungs-Fingerabdruck von Schema v2 (der OS, CUDA-Version und Python-Paketversionen pro Modell zur Laufzeit erfasst). Die obige Umgebungstabelle spiegelt wider, was Schema v1 aufzeichnet; eine vollständige bytegenaue Reproduzierbarkeit erfordert eine erneute Ausführung mit Schema v2. Dies hat keinen Einfluss auf die Korrektheit der berichteten Metriken.

Einschränkungen

  • Manifest-Schema v1: Die aktuellen Lauf-Manifeste stammen aus der Zeit vor dem Schema-v2-Umgebungs-Fingerabdruck, der die exakte Python-Umgebung zur Laufzeit erfasst. Eine vollständige Byte-für-Byte-Reproduzierbarkeit erfordert eine erneute Ausführung mit Schema v2 in den exakten Modellumgebungen.
  • SROIE-Feldmetriken sind Regex-nachbearbeitet, nicht native Extraktion: Feld-F1 misst die Feldwiederherstellung aus OCR-Text über feste Muster — es handelt sich nicht um die native strukturierte Feldfähigkeit der Modelle (die für kein Modell in dieser Charge verfügbar ist).
  • CORD-Ergebnisse sind ein Sprachfehlanpassungs-Stresstest, kein Genauigkeitsranking: Alle fünf Modelle sind auf Englisch trainiert; CORD-CER-Werte (90 %+) quantifizieren den sprachübergreifenden Kollaps und dürfen nicht mit SROIE zu einem einzigen Leaderboard zusammengeführt werden.
  • PaddleOCR-VL vom Ranking ausgeschlossen: Aufgrund direkter Pipeline-Probleme ausgeschlossen; seine Ergebnisse sind nicht mit den fünf gerankten Modellen vergleichbar.
  • Surya2 und Unlimited-OCR nicht enthalten: Sie erfordern einen vLLM-Server-Pod und sind für eine v1.1-Charge geplant; die aktuelle Version deckt nur die local_torch-Gruppe ab.
  • Nur eine einzelne GPU-Stufe: Alle Läufe erfolgen auf RTX 4090; es gibt noch keinen Multi-GPU- oder RTX 3090/A100-Vergleich, daher gelten die Kosten-/Durchsatzschlussfolgerungen nur für diese eine Stufe.
  • Nur Open-Source-Modelle: Keine Cloud-/API-Modelle (AWS Textract, Google Document AI, Azure Form Recognizer) sind enthalten; deren Vergleich ist ein separates geplantes Benchmark.

Verwandte Referenzen: Beleg-OCR-Genauigkeit · OCR-Genauigkeit nach Dokumenttyp · Was ist OCR?

Weiterführende Lektüre: ABBYY FineReader vs. moderne KI-OCR · Adobe Acrobat OCR vs. KI-Extraktion · So lesen Sie OCR-Genauigkeitsangaben

📮 contact email: [email protected]