Genauigkeit der Handschrifterkennung:
Nach Schrift, Modell & Dokumenttyp (2026)
Zuletzt geprüft: 2026-08-10 · Datenabdeckung: Teilweise · Quellen: 15 unabhängige Studien
Was diese Seite NICHT abdeckt: OCR-Genauigkeit für gedruckten Text (siehe wie OCR bei verschiedenen Dokumenttypen abschneidet), den Mechanismus von OCR/HTR selbst (siehe Was ist OCR?), Fehlerraten bei manueller Dateneingabe (siehe Fehlerraten bei manueller Eingabe) oder herstellerspezifische Leistungsaussagen zu einem einzelnen Produkt, die über die unten zitierten unabhängigen Messungen hinausgehen.
Alle unten genannten Zahlen basieren auf öffentlich zugänglichen Drittanbieter-Studien und Branchen-Benchmarks, die im Methodik-Abschnitt zitiert werden. Wo Quellen voneinander abweichen, werden konservative Spannen (niedrigste–höchste gemeldete Werte) verwendet. Diese Seite ist ein Richtwert für die Handschrifterkennungsforschung und die Planung der Dokumentdigitalisierung, keine präzise Prognose für eine einzelne Engine oder ein einzelnes Korpus.
Die besten Systeme im Jahr 2026 lesen moderne englische Handschrift mit einer Zeichenfehlerrate (CER) von 1,22–1,71 % im IAM-Benchmark – nahezu in Druckqualität. Richtet man dieselbe Modellgeneration auf Manuskripte aus dem 15. bis 19. Jahrhundert, springt die Fehlerrate auf 71–82 % CER (Crosilla et al., 2025). Handschrifterkennung ist keine einzelne Genauigkeitszahl – sie ist eine Schwierigkeitsleiter, deren Sprossen durch Schrift, Schreibstil, Modellarchitektur und Dokumenttyp festgelegt werden, in etwa dieser Reihenfolge ihrer Auswirkung.
Warum Handschrift schwieriger ist als gedruckter Text
Gedruckter Text ist eine geschlossene Menge standardisierter Zeichen; Handschrift ist eine offene Menge idiosynkratischer Zeichen. Jedes Modell auf dieser Seite kämpft mit denselben drei strukturellen Unterschieden – und diese erklären, warum sich jede Schrift, jeder Stil und jede Architektur unten unterschiedlich verhält.
Erstens: Schreibervariation. Keine zwei Personen formen denselben Buchstaben auf dieselbe Weise. Allein das IAM-Korpus enthält Handschriften von 657 verschiedenen Schreibern über 13.353 Textzeilen (Heyberger & Guyeux, 2024) – derselbe Buchstabe erscheint in Hunderten von materiell unterschiedlichen Darstellungen, weshalb die Genauigkeit bei der Hand eines festen Schreibers für die allgemeine Erkennung bedeutungslos ist. Zweitens: Verbundene Zeichen. In Schreibschrift und in vollständig verbundenen Schriften verschmelzen Buchstaben zu Ligaturen ohne klare Segmentierungsgrenze – die Erkennungsengine muss entscheiden, wo ein Zeichen endet und das nächste beginnt, eine Entscheidung, die gedruckter Text nie erzwingt. Arabisch ist der Extremfall: Seine Schrift ist innerhalb von Wörtern vollständig verbunden, wird von rechts nach links geschrieben und weist Buchstabenformen auf, die je nach Position im Wort ihre Form ändern – ein wesentlicher Grund, warum arabische Benchmarks hinter lateinischen zurückbleiben (IIETA-Vergleichsstudie, 2024). Drittens: kontextabhängige und mehrdeutige Buchstabenformen – ein schlampiges „u“ und „n“ unterscheiden sich nur in der Richtung eines Serifenendes; nur das umgebende Wort disambiguiert sie. Deshalb kombinieren fast alle modernen Systeme ein visuelles Modell mit einem Sprachmodell: Beim IAM-Korpus reduziert das Hinzufügen eines Lexikons oder Sprachmodells die Wortfehler typischerweise um ein Drittel oder mehr (Detektionsbasierte Textzeilenerkennung, 2024).
Die praktische Konsequenz ist eine anhaltende Metriklücke. Die Zeichenfehlerrate (CER) zählt falsch gelesene Zeichen pro Hundert – eine CER von 2 % bedeutet etwa zwei falsche Zeichen pro Hundert. Die Wortfehlerrate (WER) zählt ganze Wörter, die falsch transkribiert wurden; da ein einziges falsch gelesenes Zeichen ein ganzes Wort scheitern lässt, liegt die WER bei Handschrift typischerweise 2–4× höher als die CER – beim arabischen KHATT-Korpus koexistiert eine CER von 8,9 % mit einer WER von 37,6 % (IIETA, 2024). Jede Genauigkeitsangabe, die eine einzelne Zahl nennt, ohne zu sagen, welche Metrik und welches Korpus gemeint ist, ist bestenfalls unvollständig.
Die Schrift ist der größte einzelne Genauigkeitstreiber bei der Handschrifterkennung – größer als die Wahl des Modells. Das Diagramm unten zeigt die veröffentlichte CER-Bandbreite (beste gemeldete bis typische modellübergreifende) für jedes große Benchmark-Korpus. Die Geschichte ist eine Treppe: Moderne lateinische Handschrift ist nahezu Druckqualität; Arabisch und Chinesisch sind eine Größenordnung schwieriger; historische Dokumente sind die Klippe – es sei denn, das Modell wurde für sie trainiert.
Aufschlüsselung nach Schrift und Sprache
Quellen: Crosilla et al. (2025) — LLM-Benchmark über IAM/RIMES/READ-2016/Bentham, 8 multimodale LLMs; CodeSOTA IAM-Bestenliste (2024–2026) — CER/WER pro Modell mit Papierquellen; Heyberger & Guyeux (2024) — Überblick über den Stand der Technik auf Zeilenebene (VAN 1,91 % CER auf RIMES); Springer SNCS (2023) — CVL-Ergebnisse über verschiedene Korpora; IIETA (2024) & MDPI (2024) — KHATT-Ergebnisse; ICDAR-2013-Chinesisch-Wettbewerb & PMC11951872 (2024) — chinesische Zeichenkorrektheitsrate; arXiv 2409.17095 (2024) — aufgabenspezifisch trainierte WER auf READ-2016. Die chinesische Zeile verwendet die Zeichenkorrektheitsrate (CR), nicht die CER – siehe Hinweis unterhalb der Tabelle.
| Schrift / Korpus | CER (beste–typische) | WER (beste–typische) | Quelle | Jahr | Stichprobe |
|---|---|---|---|---|---|
| Englisch — IAM (modern) | 1,2–5,5 % | 3,3–16,3 % | CodeSOTA; Crosilla | 2024–2026 | 657 Schreiber, 13.353 Zeilen, 115.320 Wörter |
| Französisch — RIMES (modern, Schreibschrift) | 1,6–4,2 % | 2,0–7,7 % | Crosilla; Heyberger | 2024–2025 | Französische Geschäftsbriefe; 1.500 Seiten, 12.723 Zeilen |
| Deutsch — CVL (modern, Schreibschrift) | 3,3–10,9 % | 10,4–26,2 % | Springer SNCS | 2023 | In-Domain ~3,3 % CER; IAM-trainiertes Modell, Kreuztransfer 10,89 % CER / 26,24 % WER |
| Arabisch — KHATT (modern) | 8,9–16,3 % | 27,3–43,9 % | IIETA; MDPI | 2024 | 1.000 Schreiber, 4.000 Dokumente; vollständig verbundene Rechts-nach-links-Schrift |
| Chinesisch — CASIA-HWDB / ICDAR-2013 (modern) | 6,8–11,2 % Zeichenfehler | — | ICDAR 2013; PMC11951872 | 2013–2024 | 1.020 Schreiber; Offline-Texterkennung 88,76 % CR (2013) → 93,18 % CR (2024) auf ICDAR-2013-Testset |
| Historisches Deutsch — READ-2016 (aufgabenspezifisch trainierte Engines) | 3,6–6,2 % | 4,1–5,5 % | Heyberger; arXiv 2409.17095 | 2016–2024 | 30.000 Seiten Ratsprotokolle, 15.–19. Jahrhundert; VAN 3,59 % CER, DAN 4,10 % WER |
| Historisches Englisch/Deutsch — Bentham & READ (allgemeine LLMs) | 71–82 % | 95–100 % | Crosilla | 2025 | 8 multimodale LLMs, Zero-Shot/feinabgestimmt; Transkriptionen als unbrauchbar bewertet |
Quellen in der obigen Tabelle aufgeführt. Zwei Anmerkungen zu den Metriken: (1) Die chinesische Zeile berichtet die Zeichenkorrektheitsrate (CR), die Metrik, die sowohl vom ICDAR-2013-Wettbewerb als auch von nachfolgenden Arbeiten verwendet wird – sie zählt korrekt erkannte Zeichen, bestraft aber Einfügungen nicht so wie die CER, daher ist sie in der Tendenz vergleichbar, aber nicht identisch mit der CER. (2) Die historischen Zeilen sind bewusst nach Modelltyp aufgeteilt: aufgabenspezifisch trainierte Engines und allgemeine LLMs sind bei denselben Dokumenten unterschiedliche Kategorien – siehe Aufschlüsselung nach Modellarchitektur.
Der Schreibstil – Druckschrift, Schreibschrift oder gemischt – ist die Dimension, die Praktiker zuerst wahrnehmen, und diejenige mit den am wenigsten belastbaren Daten. Kein großer Benchmark-Korpus kennzeichnet jede Stichprobe als Druck- oder Schreibschrift, daher beruht die Lücke zwischen Druck- und Schreibschrift auf Branchen-Benchmarks und der Zusammensetzung der Korpora selbst (RIMES und CVL sind Schreibschrift; IAM ist gemischt).
Aufschlüsselung nach Schreibstil
| Schreibstil | Beobachtete Genauigkeit | Belege | Quelle | Jahr |
|---|---|---|---|---|
| Druckschrift (Manuskript) | Einfachere Basislinie; Top-Systeme nahezu Druckqualität | AIMultiple: „Texte im Manuskriptstil sind leichter zu erkennen, da die Zeichen als einzelne Druckbuchstaben geschrieben werden“; es existiert kein kontrollierter akademischer Benchmark (Datenlücke) | AIMultiple | 2025 |
| Schreibschrift (verbundene Buchstaben) | 100-Stichproben-Benchmark: Gemini 3 Pro 100 %, GPT-5 & olmOCR-2-7B Spitzengruppe | 10 Schreiber × 10 Schreibschrift-Absätze, natürliche Verbundenheit und Neigungswinkel erhalten; 14 Lösungen nach semantischer Ähnlichkeit bewertet | AIMultiple-Schreibschrift-Benchmark | 2025 |
| Schreibschrift (Korpus-Ebene, aufgabenspezifisch trainiert) | CER 1,6–3,7 % | RIMES (französische Schreibschrift-Briefe) und CVL (deutsche/englische Schreibschrift) erreichen nahezu IAM-CER, wenn Modelle darauf trainiert werden – die Schwierigkeit des Stils ist trainierbar, nicht intrinsisch | Crosilla; Springer SNCS | 2023–2025 |
| Gemischt (Druck- + Schreibschrift auf einem Formular) | Beste Modelle unter 95 % auf Dokumentebene | 10 reale handschriftlich ausgefüllte Formulare mit Druck-, Schreib- und Mischschrift: GPT-5 Mini und Gemini 2.5 Flash Lite führten, aber „selbst die besten Modelle haben Mühe, eine geschäftliche Genauigkeit von 95 %+ zu erreichen“ | BusinessWareTech | 2025 |
Quellen in der obigen Tabelle aufgeführt. Datenlücke ehrlich benannt: Es gibt keine begutachtete Studie, die die Genauigkeit von Druckschrift vs. Schreibschrift anhand eines kontrollierten, stilbeschrifteten Korpus isoliert – RIMES und CVL sind zufällig Schreibschrift und IAM gemischt, aber kein Benchmark beschriftet jede Stichprobe – daher beruht die Stildimension hier auf dem AIMultiple-Benchmark für reine Schreibschrift und der Korpuszusammensetzung der begutachteten Ergebnisse, mit dem Hinweis, dass ein direkter akademischer Stilvergleich noch nicht existiert (siehe Einschränkungen).
Die Modellarchitektur hat in zehn Jahren auf demselben IAM-Korpus eine etwa 5-fache Fehlerreduktion erzielt. Die folgende Leaderboard-Entwicklung – CTC-basierte rekurrente Netze, dann Transformer, dann multimodale LLMs – ist die klarste veröffentlichte Aufzeichnung darüber, wie sich die Handschriftgenauigkeit verbessert hat, und sie ist auch die Achse, auf der „Genauigkeit“ am stärksten davon abhängt, wie das Modell trainiert wurde.
Aufschlüsselung nach Modellarchitektur
| Architektur | Ära | IAM CER (beste) | IAM WER (beste) | Repräsentative Modelle | Quelle |
|---|---|---|---|---|---|
| CNN-LSTM + CTC | 2016–2022 | ~4,1–5,5 % | 5,0–16,3 % | DAN 5,01 WER; Start-Follow-Read 6,4; PyLaia 7,5–8,4; VAN 16,3 (Zeilen-WER) / 4,45 CER | arXiv 2409.17095; CodeSOTA |
| Transformer (Encoder-Decoder) | 2021–2024 | 2,38–2,89 % | ~2,4–2,9 % (berichtet) | TrOCR 2,89 % CER (2021); DTrOCR 2,38 % CER (WACV 2024); HTR-VT 14,9 WER ohne Vortraining | CodeSOTA; IIETA |
| Multimodales LLM (VLM) | 2025–2026 | 1,22–1,75 % | 3,34–3,59 % | GPT-5 ~1,22 % CER (2026); GPT-4o-mini 1,71 % CER / 3,34 % WER (2025); Claude 3.5 Sonnet 1,75 % CER | CodeSOTA; Crosilla |
| Allgemeine OCR-Engines (nicht angepasst) | 2023–2026 | RIMES-Korpus: 11–18 % CER, 33–53 % WER | DOCSUMO 11 % CER; Transkribus 18 % CER; Ocelus 15 % CER (Supermodelle nicht auf RIMES feinabgestimmt) | Heyberger | |
Quellen in der obigen Tabelle aufgeführt. Die Zeilen vergleichen die besten veröffentlichten Ergebnisse auf demselben IAM-Korpus, mit Ausnahme der letzten Zeile, die die nicht angepasste kommerzielle Bewertung der Umfrage auf RIMES berichtet – aufgenommen, um zu zeigen, dass sich eine nicht abgestimmte kommerzielle Engine auf einem unbekannten Korpus eher wie ein Forschungsmodell von 2016 als von 2026 verhält. Vergleiche zwischen Architekturen auf identischen Aufteilungen sind selten; die IAM-„Aachen-Aufteilung“ und die Standardaufteilung erzeugen für dasselbe Modell unterschiedliche Zahlen (z. B. DRetHTR-base 6,55 WER auf IAM-A, 2026).
Der Dokumenttyp bestimmt, wie viel der theoretischen Genauigkeit in der Praxis erhalten bleibt. Saubere Benchmark-Korpora sind zeilenweise segmentiert und auf glattem Papier geschrieben; reale Dokumente kommen als Formulare mit überlappenden Feldern, Briefe mit Randnotizen und Manuskripte mit Abkürzungen und verblasster Tinte. Der veröffentlichte Bereich für jeden Dokumenttyp – nicht die Benchmark-Obergrenze – ist die Zahl, mit der man planen sollte.
Aufschlüsselung nach Dokumenttyp
| Dokumenttyp | Genauigkeitsbereich | Kontext | Quelle | Jahr |
|---|---|---|---|---|
| Standardformulare mit handschriftlichen Einträgen | Beste Modelle <95 % auf Dokumentebene | 10 reale Formulare, Druckschrift/Schreibschrift/gemischt; GPT-5 Mini und Gemini 2.5 Flash Lite führten; die Extraktion strukturierter Felder führt zusätzlich zu Fehlern auf Feldebene über die Lesefehler hinaus | BusinessWareTech | 2025 |
| Freiform-Briefe (modern) | CER 1,2–1,9 % (SOTA), 11–18 % (nicht angepasste kommerzielle Systeme) | IAM und RIMES sind Briefe; die Lücke zwischen SOTA und nicht angepassten kommerziellen Engines auf demselben Korpus beträgt eine volle Größenordnung | Crosilla; Heyberger | 2024–2025 |
| Historische Manuskripte | CER 3,6–6,2 % (aufgabenspezifisch trainiert) / 71–82 % (allgemeines LLM) | READ-2016, Bentham, glagolitische Schriften; Abkürzungen, alter Wortschatz und Schriftkomplexität treiben spezialisierte Engines auf 4,8–6,05 % CER bei den schwierigsten Schriften | arXiv 2409.17095; PMC12202554; Crosilla | 2024–2025 |
| Reale Notizen / gemischte Dokumente | 46–95 % semantische Ähnlichkeit über alle Lösungen | AIMultiple-Benchmark mit 12 OCR-Lösungen auf unterschiedlichen Handschriften; LLM-basierte Lösungen führen mit 93–95 %, ältere OCR-Engines liegen am unteren Ende des Bereichs | AIMultiple | 2026 |
Quellen in der obigen Tabelle aufgeführt. Hinweis: Die Zeilen „Freiform-Briefe“ verwenden CER, während „reale Notizen“ die semantische Ähnlichkeit als Bewertungsmaßstab nutzen – unterschiedliche Messskalen, die getrennt statt vermischt dargestellt werden. Der Bereich von 46–95 % ist die einzige Kennzahl, die sowohl moderne als auch historische, saubere und unordentliche Dokumente in einer Messung abdeckt.
So verwenden Sie diese Daten
Sie müssen keinen Benchmark ausführen, um aus „Handschrifterkennungsgenauigkeit“ eine vertretbare Erwartung für Ihre eigenen Dokumente abzuleiten. Eine vierstufige Überschlagsprüfung mit den obigen Tabellen genügt – und sie zeigt meist, dass die Schlagzeilenzahl an einem anderen Dokumenttyp gemessen wurde als an dem, den Sie verarbeiten.
- Klassifizieren Sie Ihr Dokument. Beantworten Sie vier Fragen: Schrift (lateinisch? arabisch? chinesisch?), Stil (Druckschrift, Schreibschrift oder gemischt?), Dokumenttyp (Formular, Brief oder historisch?) und ob der Korpus, mit dem Ihr System trainiert wurde, dem Ihren ähnelt. Ein modernes Formular in lateinischer Schrift ist die einfache Kategorie; ein Manuskript aus dem 19. Jahrhundert in nicht-lateinischer Schrift ist die schwierige Kategorie – die obigen Tabellen geben jeder Kategorie ihren eigenen Bereich.
- Wählen Sie die ehrliche Metrik. Verwenden Sie den CER-Bereich, wenn Ihr nachgelagerter Prozess ein paar falsche Zeichen pro Hundert tolerieren kann; verwenden Sie den WER-Bereich, wenn ganze Wörter wichtig sind (Suche, benannte Entitäten, Adressen); verwenden Sie die Dokumentgenauigkeit für Formulare, bei denen ein falsches Feld den Datensatz ungültig macht. Dasselbe System kann legitim 1,7 % CER und 3,3 % WER und 80 % Feldgenauigkeit aufweisen.
- Wenden Sie den Modellspezialisierungsabschlag an. Wenn Ihre Engine auf Ihren Dokumenttyp trainiert oder feinabgestimmt wurde, ist die beste veröffentlichte CER erreichbar (1,2–1,9 % für moderne lateinische Buchstaben). Wenn es sich um ein nicht angepasstes allgemeines System handelt, planen Sie die 11–18 % CER-Stufe bei ungewohnter Schreibschrift ein (Heyberger 2024) – oder die 71–82 % Stufe bei historischen Dokumenten (Crosilla 2025).
- Dimensionieren Sie die Prüfwarteschlange. Bei 3 % WER auf 200 handschriftlichen Seiten mit je 50 Wörtern erwarten Sie grob 300 falsche Wörter pro Stapel (200 × 50 × 3 %) vor jeder Korrektur. Bei 16 % CER auf arabischen Dokumenten enthält derselbe Stapel Tausende verdächtiger Zeichen – die Arithmetik bestimmt, ob eine menschliche Prüfung, ein Konfidenzschwellenwert oder ein Lexikon-Nachbearbeitungsschritt wirtschaftlich erforderlich ist.
Dies sind grobe Schätzformeln, kein Ersatz für das Benchmarking Ihrer eigenen Dokumente. Jeder veröffentlichte Bereich auf dieser Seite wurde an einem fremden Korpus gemessen – die einzige Genauigkeitszahl, die für Ihren Workflow gilt, ist die, die Sie daran messen. Der Wert dieser Seite besteht darin, die Erwartung zu setzen, bevor Sie messen.
Häufig gestellte Fragen
Wie genau ist die Handschrifterkennung im Jahr 2026?
Das hängt fast vollständig von Schrift und Dokumenttyp ab. Bei moderner englischer Handschrift (IAM-Benchmark) erreichen die besten Systeme 1,22–1,71 % CER (CodeSOTA 2026; Crosilla 2025); französische Schreibschrift ist mit 1,63–1,91 % ähnlich (Crosilla 2025; Heyberger 2024); Arabisch liegt bei 8,9–16,3 % CER (IIETA 2024; MDPI 2024); und allgemeine Modelle bei historischen Manuskripten erreichen 71–82 % CER (Crosilla 2025). Bei 12 kommerziellen Lösungen mit vielfältiger realer Handschrift liegen die Werte für semantische Ähnlichkeit zwischen 46–95 % (AIMultiple 2026).
Was ist der Stand der Technik bei der IAM-Handschriftdatenbank?
Stand 2026 berichtet GPT-5 ~1,22 % CER auf IAM, GPT-4o-mini erreicht 1,71 % CER / 3,34 % WER (Crosilla 2025) und die spezialisierte HTR-JAND 1,23 % CER mit Lexikonkorrektur (CodeSOTA 2024). Auf demselben Korpus lag der Stand der Technik vor der Transformer-Ära bei etwa 8 % Zeichenfehler (Chowdhury & Vig, 2018) und typische CNN-LSTM-Systeme erreichten 7,5–8,4 % WER (PyLaia — arXiv 2409.17095) — die Fehlerraten sind um ein Vielfaches gesunken, doch IAM bleibt der Referenz-Benchmark für englische Handschrift (657 Schreiber, 13.353 Zeilen).
Kann KI Schreibschrift lesen?
Ja — die führenden multimodalen Modelle verarbeiten Schreibschrift inzwischen gut. Im AIMultiple-Benchmark 2025 mit 100 absichtlich unordentlichen Schreibschriftproben erreichte Gemini 3 Pro 100 % semantische Ähnlichkeit, GPT-5 und olmOCR-2-7B lagen in der Spitzengruppe (AIMultiple, 2025); ältere OCR-Engines blieben hinter der Gruppe zurück. Schreibschrift bleibt schwieriger als Druckschrift — die Zeichen sind verbunden, daher ist die Segmentierung mehrdeutig — aber die Lücke ist eine Frage der Modellgeneration, keine absolute Hürde.
Wie schneidet die Handschrifterkennung im Vergleich zur OCR von gedrucktem Text ab?
Die OCR von gedrucktem Text erreicht 98–99 %+ Zeichengenauigkeit bei sauberen Dokumenten (siehe OCR-Genauigkeit nach Dokumenttyp), während die besten Handschriftsysteme bei 98,3–98,8 % Zeichengenauigkeit (1,2–1,7 % CER) bei modernem Englisch liegen – nahe, aber nicht gleich – und auf 83–91 % bei Arabisch und Chinesisch sowie unter 30 % für allgemeine Modelle bei historischen Dokumenten fallen (Crosilla 2025; IIETA 2024; PMC11951872 2024). Die Lücke zwischen gedrucktem und handschriftlichem Text beträgt bei jeder Schrift etwa eine Größenordnung.
Warum ist die Handschrifterkennung bei historischen Dokumenten so ungenau?
Historische Dokumente kombinieren alte Schriften, Abkürzungen, verblasste Tinte und Vokabular außerhalb moderner Trainingsdaten. Das Ergebnis ist ein deutlicher Modellspezialisierungseffekt: aufgabenspezifisch trainierte Engines erreichen 3,6–6,2 % CER auf dem READ-2016-Korpus und 4,8–6,05 % bei den schwierigsten Schriften wie Glagolitisch (Heyberger 2024; PMC12202554 2025), während acht allgemeine LLMs 71–82 % CER erzielten – unbrauchbare Transkription (Crosilla 2025). Erkennung ist möglich, aber nur mit einem Modell, das für die spezifische historische Sammlung trainiert wurde.
Was ist ein guter CER für die Handschrifterkennung?
Die in der HTR-Literatur übernommene Arbeitsskala des Fachgebiets definiert CER unter 5 % als „sehr gut“, 5–10 % als „gut“ und unter 2,5 % als „ausgezeichnet“ (Muehlberger et al. 2019; Hodel et al. 2021, angewendet von Crosilla et al. 2025). Bei moderner Handschrift in lateinischer Schrift liegen die besten Systeme im Bereich „ausgezeichnet“; bei Arabisch, Chinesisch und historischen Dokumenten ist „sehr gut“ (5–10 %) derzeit das realistische Produktionsziel.
Was ist der Unterschied zwischen CER und WER bei der Handschrifterkennung?
Zeichenfehlerrate zählt einzelne falsch erkannte Zeichen; Wortfehlerrate (WER) zählt ganze Wörter als falsch, sodass ein einzelnes falsch erkanntes Zeichen ein ganzes Wort durchfallen lässt. Bei Handschrift liegt die WER typischerweise 2–4× höher als die CER – beim arabischen KHATT koexistieren 8,9 % CER mit 37,6 % WER (IIETA 2024). Prüfen Sie immer, welche Metrik eine Aussage verwendet: „95 % Genauigkeit“ bedeutet als CER, WER oder Dokumentgenauigkeit sehr unterschiedliche Dinge.
Methodik & Quellen
Wie diese Seite erstellt wurde
Diese Seite aggregiert Daten aus 15 unabhängigen Quellen aus dem Zeitraum 2013–2026, überwiegend Peer-Review-Fachartikel, akademische Wettbewerbsberichte und eine Peer-Review-TPAMI-Übersichtsarbeit. Die Quellen wurden anhand von drei Kriterien ausgewählt: (1) öffentlich dokumentierte Methodik mit angegebener Korpusgröße, (2) Ergebnisse, die auf benannten Benchmark-Korpora (IAM, RIMES, CVL, KHATT, READ-2016, ICDAR-2013) oder transparenten industriellen Testmengen berichtet wurden, und (3) Relevanz für die Handschrifterkennung statt Marketingbehauptungen. Wenn mehrere Quellen dieselbe Dimension berichten, werden konservative Spannen (niedrigste–höchste berichtete Werte) verwendet – wir bevorzugen es, zu untertreiben. Wenn Quellen erheblich voneinander abweichen, wird die Abweichung durch Metrikebene, Korpusaufteilung oder Trainingsregime erklärt und nicht weggemittelt.
Die Metrikunterscheidung ist das Rückgrat dieser Seite: CER, WER und Zeichenkorrektheitsrate (CR) werden nie zu einer einzigen Zahl vermischt, und aufgabenspezifisch trainierte versus allgemeine Modelle werden als getrennte Zeilen berichtet, da es sich um unterschiedliche Messregime auf denselben Dokumenten handelt. Selbstberichtete Angaben von Anbietern werden vollständig ausgeschlossen – keine vom Anbieter veröffentlichte Handschrifterkennungsgenauigkeit bestand den Test mit zwei unabhängigen Quellen, was selbst ein Befund ist (siehe Einschränkungen).
Quellenliste
- Crosilla, G., Klic, L. & Colavizza, G. — „Benchmarking Large Language Models for Handwritten Text Recognition“, Journal of Documentation 81(7) (2025). Peer-reviewed; 8 multimodale LLMs × 7 Korpora (IAM, RIMES, READ-2016, Bentham, Leopardi, LAM, ICDAR-2017). Liefert IAM 1,71 % CER/3,34 % WER (GPT-4o-mini), RIMES 1,69 % CER (GPT-4o), historische 71–82 % CER sowie die Qualitätsbänder <5 %/<2,5 % CER.
- Heyberger, L. & Guyeux, C. — „Advancements and Challenges in Handwritten Text Recognition: A Comprehensive Survey“, Journal of Imaging 10(1):18 (2024). Peer-reviewed Übersichtsstudie; 250+ Studien. Liefert Korpus-Spezifikationen (IAM 657 Schreiber/13.353 Zeilen, READ 30.000 Seiten), Zeilenebenen-SOTA (VAN 1,91 % CER auf RIMES) sowie nicht angepasste kommerzielle Ergebnisse (DOCSUMO 11 % CER, Transkribus 18 % CER auf RIMES).
- Garrido-Muñoz, C., Ríos-Vila, A. & Calvo-Zaragoza, J. — „Handwritten Text Recognition: A Survey“, IEEE TPAMI 48(4) (2026). Peer-reviewed Übersichtsstudie. Liefert Absatzebenen-SOTA auf IAM (VAN 4,7 %, OrigamiNet 4,6 %) sowie die 58-prozentige Fehlerreduktion des CTC-Paradigmas und die Kritik der Out-of-Distribution-Generalisierung aktueller Benchmarks.
- CodeSOTA — „IAM Leaderboard“ (2024–2026). Technischer Benchmark-Aggregator; jeder Eintrag verlinkt die Originalstudie. Liefert modellspezifische CER/WER auf IAM (GPT-5 ~1,22 % CER, HTR-JAND 1,23 % CER/3,78 % WER, GPT-4o-mini 3,34 % WER, DRetHTR-base 6,55 % WER auf IAM-A, MetaWriter 10,32 % WER) sowie den Hinweis, dass Tesseract-Klasse-OCR für Handschrift ungeeignet ist (~12,5 % CER).
- „General Detection-based Text Line Recognition“ (2024, arXiv 2409.17095). Preprint mit modellübergreifenden Vergleichstabellen. Liefert WER-Vergleich auf IAM/READ/RIMES (DAN 5,01 WER auf IAM, 4,10 auf READ; DTrOCR 2,38 auf IAM; RIMES bestes 1,99 mit Sprachmodell) sowie die IAM-Aachen-Split-Statistiken.
- „Data Augmentation for Offline Handwritten Text Recognition: A Systematic Literature Review“, SN Computer Science (2023). Peer-reviewed. Liefert korpusübergreifende Generalisierungszahlen: Ein auf IAM trainiertes Modell erreicht auf CVL 10,89 % CER / 26,24 % WER gegenüber 8,62 % CER auf IAM selbst, sowie die CVL-Korpusbeschreibung (deutsche/englische Schreibschrift).
- „A Comparative Study of Four Handwritten Text Recognition Models“, Ingénierie des Systèmes d'Information 29(6) (2024). Peer-reviewed; DAN/VAN/FCN/GFCN auf KHATT. Liefert KHATT-Bestergebnisse: DAN 8,9 % CER / 37,6 % WER; VAN 10,7 % CER / 43,9 % WER; sowie Analyse der Herausforderungen arabischer Schrift (verbundene Buchstaben, positionsabhängige Formen).
- „Machine Learning Approach for Arabic Handwritten Recognition“, Applied Sciences 14(19):9020 (2024). Peer-reviewed; BiLSTM-CTC auf KHATT. Liefert KHATT-BiLSTM-Ergebnisse (13,2–15,8 % CER / 27,31–31,6 % WER) und historische Basiswerte (MDLSTM 31,3 % WER, 2015); dokumentiert KHATTs 1.000 Schreiber / 4.000 Dokumente.
- Yin, F. et al. — „ICDAR 2013 Chinese Handwriting Recognition Competition“. Akademischer Wettbewerb (IEEE). Liefert das Offline-Texterkennungsergebnis von 88,76 % Zeichenkorrektheitsrate auf CASIA-HWDB-basierten Testdatensätzen (1.020 Schreiber).
- „Attention-based Handwritten Chinese Recognition for Power Industry“ (2024). Peer-reviewed. Liefert das ICDAR-2013-Ergebnis von 2024 (92,67 % AR / 93,18 % CR) sowie HWDB-Ergebnisse (96,92 % AR / 97,66 % CR) und zeigt die Verbesserung von 2013→2024 bei chinesischem Offline-Text.
- „Assessing Advanced Handwritten Text Recognition Engines for Digitizing Historical Documents“ (2025). Peer-reviewed; fünf Engines × vier Schriften. Liefert die Zeichenfehlerrate nach Schrift: Druckschrift (römisch) 1,74–2,78 %, Kroatische Republik 3,54–6,32 %, Glagolitisch 4,83–6,05 %, Kurzschrift 9,53–11,9 %.
- „Enhancing Handwritten Text Recognition Accuracy with Gated Mechanisms“ (2024). Peer-reviewed; GatedLexiconNet. Liefert einen zweiten IAM-Datenpunkt (Wortfehlerrate 5,73 % / Zeichenfehlerrate 2,27 %) sowie RIMES-Zeichenfehlerrate 0,9 % / Wortfehlerrate 2,76 % aus einem dedizierten Modell.
- AIMultiple — „Handwriting Recognition Benchmark: LLMs vs OCRs“ (2025-11). Anbieterneutraler Analysten-Benchmark; 100 Schreibschriftproben von 10 Schreibern; Kosinus-Ähnlichkeits-Pipeline. Liefert den Benchmark nur für Schreibschrift: Gemini 3 Pro 100 %, GPT-5 und olmOCR-2-7B in der Spitzengruppe unter 14 Lösungen.
- AIMultiple — „OCR Benchmark: Text Extraction / Capture Accuracy“ (2026). Anbieterneutral; 12+ Lösungen. Liefert die lösungsübergreifende Handschrift-Spanne von 46–95 % sowie die Spitzenreiter je Lösung (GPT-5 95 %, olmOCR-2-7B 94 %, Gemini 2.5 Pro 93 %).
- BusinessWareTech — „Handwritten Form Recognition Benchmark“ (2025). Unabhängiger Benchmark, Note C (einzelner Testdatensatz, transparente Methode); 10 real handausgefüllte Formulare. Liefert die Erkenntnis auf Dokumentebene, dass selbst Top-Modelle bei realen Formularen unter 95 % bleiben, und dass GPT-5 Mini / Gemini 2.5 Flash Lite führten.
Einschränkungen
- Geografische und Schriftsystem-Abdeckung: In der Literatur dominieren Korpora lateinischer Schriften — Englisch (IAM), Französisch (RIMES) und Deutsch (CVL, READ). Arabisch (KHATT) und Chinesisch (CASIA-HWDB) sind solide, aber dünner abgedeckt; für Japanisch, Koreanisch und Devanagari-Handschrift fehlen standardisierte CER/WER-Benchmarks in den von uns gefundenen Quellen vollständig. Der ICDAR-2023-Indic-Wettbewerb (Sieger mit 95,94 % Zeichenerkennungsrate über zehn Schriften) ist der einzige aggregierte Indic-Datenpunkt und ist in den obigen Tabellen nicht enthalten, da er eine andere Metrik und einen anderen Schriftsatz verwendet.
- Methodische Einschränkungen: Die Aufteilungen der Korpora unterscheiden sich zwischen den Arbeiten (IAM-Standard vs. Aachen-Split) und führen für dasselbe Modell zu deutlich unterschiedlichen Zahlen — die obigen Spannen umfassen beide, sofern veröffentlicht. Kein größeres Korpus kennzeichnet den Schreibstil (Druckschrift vs. Schreibschrift) pro Stichprobe, daher stützt sich die Stildimension auf Branchen-Benchmarks und nicht auf kontrollierte akademische Daten. Cloud-Anbieter (Google, Microsoft, Amazon) veröffentlichen keine handschriftsspezifischen Genauigkeitsmessungen; ihre „99%+“-Angaben beziehen sich auf gedruckten Text, und es konnten keine zwei unabhängigen Anbietermessungen zur Handschriftgenauigkeit gefunden werden — weshalb auf dieser Seite keine D-Bewertungen von Anbietern erscheinen.
- Zeitliche Lücken: Die Zahl des ICDAR-2013-Chinesisch-Wettbewerbs (88,76 % CR) ist 13 Jahre alt und dient als historischer Anker neben dem Ergebnis von 2024 auf demselben Testset. Das IAM-Korpus stammt aus dem Jahr 1999, bleibt aber der De-facto-Benchmark für englische Handschrift. Die LLM-Ergebnisse 2025–2026 (GPT-4o-mini, GPT-5) sind die neuesten Daten und dürften sich voraussichtlich noch verändern.
- Was wir nicht finden konnten: (1) eine begutachtete kontrollierte Studie, die Druckschrift- vs. Schreibschriftgenauigkeit auf demselben Korpus isoliert; (2) einen von Anbietern veröffentlichten, methodisch transparenten Handschriftgenauigkeits-Benchmark für Google Document AI, Azure Document Intelligence oder Amazon Textract; (3) einen standardisierten Benchmark für gemischte Dokumente aus Druck- und Handschrift (der häufigste reale Fall, der derzeit nur durch den BusinessWareTech-10-Formularsatz abgedeckt ist); (4) eine Aggregation der Genauigkeitsvarianz pro Schreiber; (5) einen LLM-Ära-Benchmark für chinesische oder arabische Handschrift, vergleichbar mit der auf IAM basierenden Crosilla-Studie. Diese Lücken werden benannt, statt sie mit unbelegbaren Behauptungen zu füllen.
Verwandte Referenzen: Genauigkeits-Benchmarks nach Dokumenttyp · Fehlerrate bei manueller Transkription · Dokumentverarbeitungskosten pro Datensatz · Was ist optische Zeichenerkennung (OCR)?
Verwandte Lektüre: Erschwingliche KI-Handschrifterkennung für kleine Unternehmen · Wie sich die Genauigkeit der KI-Handschrifterkennung verbessert hat