KI-Handschrifterkennung vs. traditionelle OCR: Warum die Lücke größer ist, als die meisten Teams erwarten
Traditionelle OCR scheitert bei Handschrift katastrophal – Tesseract erreicht 24 % Genauigkeit bei handschriftlichen Formularen, während KI-Extraktion 95 %+ erreicht. Hier erfahren Sie, warum die Lücke strukturell ist.
Einordnung: Diese Seite ist der direkte Vergleich von KI vs. traditioneller OCR bei Handschrift – Genauigkeit, Geschwindigkeit, Kosten und Halluzination. Eine Definition der KI-Handschrifterkennung finden Sie unter Was ist KI-Handschrifterkennung; Genauigkeitszahlen nach Handschrifttyp finden Sie unter Kann KI Handschrift aus Fotos lesen.
Was klassische OCR richtig macht – und wo sie aufhört
Die klassische optische Zeichenerkennung analysiert Pixelmuster auf einer Seite, gleicht sie mit bekannten Zeichenformen ab und gibt eine Textzeichenfolge aus. Bei sauberen, maschinell gedruckten Dokumenten, die mit 300 DPI gescannt wurden, liefert sie gute Ergebnisse – oft mit einer Zeichengenauigkeit von über 95 %. Eine frisch gedruckte Rechnung, ein PDF-Formular, ein getippter Vertrag: Das sind die Eingaben, für die OCR entwickelt wurde, und sie bleiben ihr optimaler Anwendungsfall.
Aber Zeichengenauigkeit ist nicht gleich Datengenauigkeit. Zu wissen, dass die Zeichenfolge „1.234,56“ irgendwo auf einer Seite steht, sagt noch nichts darüber aus, ob es sich um einen Rechnungsbetrag, eine Menge oder eine Referenznummer handelt. Diese Interpretation erfordert immer noch einen Menschen – oder eine Schicht von Regeln, die Sie auf Basis der OCR-Ausgabe erstellen und pflegen müssen. Bei maschinell gedrucktem Text ist diese Lücke mit Nachbearbeitungsskripten und Feldpositionsvorlagen beherrschbar. Bei Handschrift wird aus der Lücke ein Abgrund.
Das grundlegende Problem ist architektonischer Natur. Klassische OCR arbeitet Bottom-up: Sie erfasst zuerst einzelne Zeichen, versucht dann, sie zu Wörtern und schließlich zu Zeilen zusammenzusetzen. Sie hat kein Konzept davon, worum es in dem Dokument geht. Wenn jedes Zeichen klar und vorhersagbar ist, funktioniert das. Wenn Zeichen verbunden sind, in der Größe variieren, unberechenbar geneigt sind oder ineinander verlaufen – wie es bei Handschrift der Fall ist – bricht der Bottom-up-Ansatz zusammen, bevor er die Wortebene erreicht.
Die drei Stellen, an denen klassische OCR bei Handschrift versagt
Die Handschrift eines jeden Menschen ist ein eigener Datensatz. Strichstärke, Neigungswinkel, Buchstabenverbindungen, Grundlinienversatz – all das variiert nicht nur zwischen verschiedenen Personen, sondern auch innerhalb der Schrift einer einzelnen Person an verschiedenen Tagen, mit verschiedenen Stiften und auf verschiedenen Untergründen. Klassische OCR stößt auf drei spezifische Fehlermodi, die sich gegenseitig verstärken.
Zeichensegmentierung erfolgt vor der Zeichenerkennung
OCR setzt voraus, dass jedes Zeichen einen trennbaren Begrenzungsrahmen einnimmt. Handschriftliche Schreibschrift widerspricht dieser Annahme völlig. Buchstaben fließen ohne klare Grenze ineinander. Die Engine fasst entweder mehrere Buchstaben zu einem Klecks zusammen (liest „clear" als „dear") oder teilt einen einzelnen Buchstaben auf zwei Kästchen auf (liest „m" als „rn"). Unabhängige Benchmarks aus Produktionsumgebungen zeigen, dass Tesseract – die am weitesten verbreitete Open-Source-OCR-Engine – bei allgemeiner Schreibschrift eine Wortgenauigkeit von 45–50 % erreicht. Das bedeutet, dass von je zwei geschriebenen Wörtern eines falsch gelesen wird. Bei einem 50-Felder-Formular mit gemischter Druck- und Schreibschrift enthalten vor der manuellen Prüfung etwa 25 Felder Fehler.
Fehlendes Kontextverständnis verhindert Fehlerkorrektur
Wenn ein Mensch ein verschmiertes Wort auf einem Lieferformular liest, schränken die umliegenden Felder – Datum, Adresse, Artikelauflistung – ein, was dieses Schmierwort sinnvollerweise sein könnte. Eine Zahl im Feld „Gesamtsumme" kann kein Name sein. Ein Datum im Feld „Geburtsdatum" kann nicht nächstes Jahr sein. Herkömmliche OCR besitzt diese Logik nicht. Sie wendet denselben Zeichenabgleichsalgorithmus auf jede Position auf der Seite an, unabhängig davon, was dort stehen sollte. Eine verschmierte „5" in einer Preisspalte wird als „S" klassifiziert, weil das Pixelmuster mehrdeutig ist – und die Engine hat keine Möglichkeit zu erkennen, dass „S" in einem Währungsfeld keinen Sinn ergibt.
Layout-Variabilität zerbricht vorlagenabhängige Pipelines
Viele produktive OCR-Setups basieren auf Vorlagen: Sie definieren feste Koordinaten für jedes Feld, und die Engine liest die Zeichen in diesen Kästchen. Das funktioniert bei standardisierten Formularen einer einzigen Quelle. Es scheitert, sobald ein Lieferant sein Formularlayout ändert, ein Feld um einen halben Zentimeter verschoben wird oder jemand eine Notiz an den Rand statt in das vorgesehene Kästchen schreibt. Handschriftliche Dokumente verstärken dieses Problem – Schreiber überschreiten regelmäßig Kästchen, fügen Randnotizen hinzu oder verwenden Pfeile, um Informationen neu zu positionieren. Eine Vorlage für „Name: [____________]" kann nicht mit „Name: [Hans M—— siehe beigefügten Ausweis]" umgehen. Die OCR-Ausgabe für dieses Feld ist entweder abgeschnitten, verstümmelt oder leer, und der restliche Workflow hat keine Möglichkeit zu erkennen, welcher Fall vorliegt.
Wie KI-Handschrifterkennung anders denkt
Vision-Language-Modelle (VLMs) – die KI-Klasse, zu der Modelle wie GPT-4o, Claude und Gemini gehören – verarbeiten Dokumente von oben nach unten statt von unten nach oben. Sie beginnen nicht damit, einzelne Buchstabenformen zu suchen. Sie betrachten das gesamte Seitenbild, verstehen dessen Struktur und Zweck und decodieren dann den Text in diesem Kontext. Das ähnelt dem menschlichen Lesen: Man untersucht nicht jeden Stiftstrich isoliert; man erkennt das Wort „Total“, weil man erwartet, dass am Ende einer Rechnung eine Summe erscheint, und interpretiert die Zahl daneben als Währung, weil der Kontext es verlangt.
Die praktische Konsequenz ist, dass die VLM-basierte Extraktion Mehrdeutigkeiten so behandelt, wie es ein Mensch tun würde – durch Abgleich dessen, was auf der Seite steht, mit dem, was auf der Seite stehen sollte. Ein Zeichen, das wie „5“ oder „S“ aussieht, wird als „5“ aufgelöst, wenn es in einem numerischen Feld erscheint. Ein Datum wie „Jan 5 25“ wird zu „2025-01-05“ normalisiert, weil das Modell Datumsformate versteht. Diese kontextuelle Disambiguierung ist keine geringfügige Verbesserung gegenüber der Zeichengenauigkeit von OCR – sie ist der Unterschied zwischen brauchbarer Ausgabe und Ausgabe, die einen zweiten manuellen Durchgang erfordert.
In der Praxis ermöglichen auf diesem Ansatz basierende Tools die Benutzerdefinierte Spaltenextraktion: Sie geben die gewünschten Feldnamen ein – „Rechnungsnummer“, „Fälligkeitsdatum“, „Gesamtbetrag“ – und die KI lokalisiert jeden Wert überall auf der Seite, indem sie versteht, was die Feldbezeichnung bedeutet, nicht wo sie steht. Keine Vorlagenkoordinaten, keine Einrichtung pro Anbieter, keine Neukonfiguration bei sich ändernden Formularlayouts. Dieselbe Definition funktioniert über verschiedene Dokumente aus verschiedenen Quellen hinweg, weil die KI nach Bedeutung sucht, nicht nach Position.
Dateien werden sicher verarbeitet und nicht gespeichert.
Die Genauigkeitslücke: Zahlen und Fakten
Zahlen machen den Unterschied konkret. Mehrere unabhängige Benchmarks aus den Jahren 2025–2026 zeigen ein einheitliches Bild: Bei gedrucktem Text ist die Lücke zwischen traditioneller OCR und VLM-basierter Extraktion gering (3–7 Prozentpunkte). Bei Handschrift explodiert sie.
| Dokumenttyp | Genauigkeit traditioneller OCR | Genauigkeit VLM-basierter Extraktion | Lücke |
|---|---|---|---|
| Sauberer Drucktext (300 DPI) | 92–98 % | 95–99 % | 3–7 Pp. |
| Blockschrift (vorgegebene Felder) | 70–85 % | 85–93 % | 8–15 Pp. |
| Gemischte Schreib- und Druckschrift | 45–60 % | 80–90 % | 25–35 Pp. |
| Durchgehende Schreibschrift / unleserliche Handschrift | 15–30 % | 75–88 % | 50–65 Pp. |
| Fotos in schlechter Qualität (Handy, ungleichmäßige Beleuchtung) | <20 % | 65–80 % | 45–65 Pp. |
Zwei Anmerkungen zur Messmethode. Erstens: Die VLM-Spalte misst die Feldgenauigkeit – ob jeder extrahierte Wert in der richtigen Spalte Ihrer Tabelle landet – nicht die reine Zeichenerkennung. Die Feldgenauigkeit liegt höher als die rohe Zeichenfehlerrate (CER), weil der Dokumentkontext mehrdeutige Zeichen auflöst: Ein verschmierter Buchstabe in einem Gesamtfeld wird als 5 gelesen, nicht als S. Zweitens: Die Spalte der traditionellen OCR zeigt die rohe Erkennungsleistung auf denselben Dokumenten – genau deshalb fällt die Lücke so groß aus. Für rohe Zeichengenauigkeitswerte auf dem IAM-Benchmark finden Sie in unserem Deep Dive wie Handschrifterkennung funktioniert.
Das Muster ist nicht subtil. Bei der saubersten Handschrift (Blockschrift in begrenzten Feldern) ist der Unterschied überschaubar — traditionelle OCR könnte mit etwas Nachbearbeitung „gut genug“ sein. Doch sobald die Handschrift schlechter wird — von Blockschrift zu gemischter Schreibschrift, von begrenzten Feldern zu Freitextfeldern, von gescannten Seiten zu Handyfotos — fällt die Genauigkeit der traditionellen OCR drastisch ab, während die VLM-basierte Extraktion nur allmählich nachlässt. Derselbe Benchmark von 2026 testete die handschriftsspezifische Engine von Google Document AI mit Schreibschrift: etwa 63 % Wortgenauigkeit. Amazon Textract schnitt mit etwa 89,5 % bei denselben Eingaben besser ab, aber beide erforderten separate Vorverarbeitungspipelines für Schräglagenkorrektur, Kontrastverbesserung und Rauschunterdrückung — Arbeit, die VLM-basierte Systeme zur Inferenzzeit ohne zusätzliche Einrichtung bewältigen (Suparse, 2026).
Bei einem realen Workflow mit 100 gemischten Dokumenten pro Woche — die Hälfte gedruckt, die Hälfte handschriftlich — beträgt der kumulative Unterschied etwa 4–6 Stunden manuelle Korrektur pro Woche bei traditioneller OCR gegenüber 30–45 Minuten bei VLM-basierter Extraktion. Bei diesem Unterschied geht es nicht um Bequemlichkeit. Er entscheidet darüber, ob handschriftliche Automatisierung ohne einen dedizierten menschlichen Prüfschritt betrieben werden kann.
Wo der Vergleich kompliziert wird: Geschwindigkeit, Kosten und Halluzination
Wenn der Genauigkeitsvergleich die ganze Geschichte wäre, wäre die Entscheidung einfach. Doch die VLM-basierte Extraktion bringt drei Kompromisse mit sich, die eine pauschale Empfehlung unehrlich machen.
Geschwindigkeit
Traditionelle OCR ist schnell – sie verarbeitet eine einzelne Seite in unter 2 Sekunden auf handelsüblicher Hardware. VLMs sind langsamer, weil sie eine umfangreichere Analyse durchführen. Ein typischer VLM-Aufruf für die Extraktion auf Seitenebene dauert 5–12 Sekunden, abhängig von der Dokumentkomplexität und der Modellgröße. Bei einem Stapel von 500 Seiten macht das den Unterschied zwischen 15 Minuten und über einer Stunde aus. Wenn Ihr Workflow volumenabhängig ist und Ihre Dokumente durchgehend sauberer gedruckter Text sind, bleibt die traditionelle OCR die schnellere Option – und ist möglicherweise alles, was Sie benötigen.
Kosten
Traditionelle OCR ist günstig. Tesseract ist kostenlos und Open Source. Cloud-OCR-APIs kosten etwa 0,001–0,005 $ pro Seite. VLM-basierte Extraktion kostet pro Seite mehr, da die Berechnung aufwendiger ist – aber der Vergleich ist irreführend, wenn Sie beim API-Preis pro Seite stehen bleiben. Ein Reddit-Nutzer, der über 150.000+ Seiten in der Produktion verarbeitet hat, stellte fest, dass der Kostenvorteil der traditionellen OCR pro Seite verschwand, wenn man die Kosten für manuelle Korrekturen einrechnete: „Traditionelle OCR-Plattformen erscheinen kosteneffektiv (~0,001–0,005 $ pro Seite), aber ihre schlechte Handschriftgenauigkeit (~45–50 %) macht sie für Geschäftsworkflows mit erheblichen handschriftlichen Inhalten unbrauchbar. Die Zeit, die für manuelle Fehlerkorrekturen aufgewendet wird, macht die tatsächlichen Kosten weit höher als bei spezialisierten Lösungen" (r/computervision, 2025). Die tatsächliche Kostengleichung lautet: Extraktionskosten pro Seite + Korrekturkosten pro Fehler × Fehlerrate. Bei gedruckten Dokumenten dominieren die Kosten pro Seite. Bei handschriftlichen Dokumenten dominieren die Korrekturkosten – und genau hier verändert die höhere Genauigkeit von VLMs die Rechnung.
Halluzination
Hier ist, was die meisten Vergleichsartikel auslassen: VLMs können halluzinieren. Da sie darüber nachdenken, was sollte auf einer Seite stehen, fügen sie gelegentlich Informationen ein, die nicht vorhanden sind – ein plausibel aussehendes Datum, wo das Feld leer gelassen wurde, oder einen geratenen Betrag, wo die Handschrift wirklich unleserlich war. Traditionelle OCR hat das gegenteilige Fehlerverhalten (sie liefert nichts oder Unsinn), wodurch ihre Fehler leichter zu erkennen sind. Eine VLM-Halluzination ist gefährlicher, weil sie korrekt aussieht. Der Unterschied zwischen selbstsicherem falschem Tesseract-Output („OOO OOO") und selbstsicherem falschem VLM-Output besteht darin, dass die VLM-Version wie echte Daten liest – und möglicherweise die automatisierte Validierung passiert. Bei Feldern, bei denen Fehler teuer sind (Zahlungsbeträge, Vertragsdaten, Compliance-Daten), bleiben Konfidenzbewertung und Human-in-the-Loop-Überprüfung unabhängig von der gewählten Technologie notwendig (F22 Labs, 2026).
Wichtigste Erkenntnis: Traditionelle OCR scheitert, indem sie falsche Zeichen liefert. VLM-basierte Extraktion kann scheitern, indem sie glaubwürdige Erfindungen liefert. Die erste Fehlerart ist verrauscht, aber erkennbar. Die zweite ist still und gefährlich. Keine Technologie macht die Validierung bei kritischen Feldern überflüssig – sie erfordern lediglich unterschiedliche Validierungsstrategien.
Der hybride Ansatz: Wann was verwenden
Die praktische Antwort für die meisten Teams lautet nicht „alles auf KI umstellen“ oder „bei OCR bleiben“. Es ist eine hybride Pipeline, die jedes Dokument basierend auf seinen Merkmalen an die richtige Engine weiterleitet.
Bei Dokumenten, die zu 100 % maschinell gedruckt, einheitlich formatiert und mit 300+ DPI gescannt sind, ist die traditionelle OCR schneller, günstiger und ausreichend. Die Ausgabe benötigt möglicherweise eine Nachbearbeitung der Feldpositionen, aber die Zeichengenauigkeit ist hoch genug, dass die Nachbearbeitungsregeln stabil sind.
Bei Dokumenten, die handschriftliche Einträge enthalten – selbst nur ein einziges Feld – verschiebt sich die hybride Strategie. Verwenden Sie traditionelle OCR für die gedruckten Abschnitte und leiten Sie die handschriftlichen Felder an ein VLM weiter. So nutzen Sie den Geschwindigkeitsvorteil der OCR für den Großteil der Seite und setzen kontextbezogene KI für die Teile ein, die OCR nicht bewältigen kann. Die Weiterleitungslogik ist einfach: Sinkt die OCR-Konfidenz für ein Feld unter einen Schwellenwert (typischerweise 70–75 %), wird dieses Feld über den VLM-Pfad erneut verarbeitet. Eine Mindestzeichenzahl (mindestens 40 Zeichen pro Seite) dient als zweite Kontrollinstanz, um Seiten zu erfassen, bei denen OCR hohe Konfidenz für vier korrekt gelesene Zeichen meldet, den Rest der Seite jedoch vollständig übersehen hat.
Der Schwellenwertansatz kontrolliert auch die Kosten – Sie zahlen nur für die VLM-Verarbeitung der Felder, bei denen sie einen Unterschied macht. Bei einem Workflow, bei dem 30 % der Dokumente Handschrift enthalten und jedes Dokument durchschnittlich 15 Felder aufweist, bedeutet dies, dass etwa 5 Felder pro Dokument über den VLM-Pfad laufen, nicht die gesamte Seite. Im großen Maßstab macht dieser Unterschied etwas aus.
Was das für Ihren Dokumenten-Workflow bedeutet
Die Entscheidung zwischen traditioneller OCR und KI-basierter Handschrifterkennung ist keine Technologieentscheidung – es ist eine Workflow-Designentscheidung. Wenn Ihr Dokumenteneingang zu 100 % gedruckt und vorlagenbasiert ist, funktioniert traditionelle OCR und wird weiterhin funktionieren. Wenn ein nennenswerter Anteil Ihrer Dokumente Handschrift enthält – Zustellbestätigungen mit Fahrernotizen, Inspektionsberichte mit Feldbeobachtungen, medizinische Aufnahmeformulare mit Patientensignaturen, Finanzanträge mit handschriftlichen Erklärungen – dann verliert eine reine OCR-Pipeline bei jeder Charge stillschweigend Daten.
Der häufigste Rechenfehler ist die Annahme, dass „OCR das abdeckt“, weil die Marketingseite des Tools Handschriftunterstützung auflistet. Die Lücke zwischen der gelisteten Fähigkeit und der realen Leistung bei Ihren tatsächlichen Dokumenten – nicht den bereinigten Demo-Beispielen des Anbieters – entscheidet darüber, ob die Automatisierung funktioniert oder mehr Arbeit erzeugt, als sie spart. Tests mit Ihren eigenen Dokumenten, insbesondere den unordentlichsten 10 % Ihres Eingangs, sind der einzige Weg, um zu wissen, welcher Ansatz – reine OCR, reines VLM oder hybrid – unter Produktionslast standhält.
FAQ
Kann traditionelle OCR kursiv geschriebene Handschrift überhaupt lesen?
Ja, aber unzuverlässig. Selbst mit LSTM-basierten Engines wie Tesseract 4.x liegt die Genauigkeit bei kursiver Schrift auf Wortebene typischerweise unter 50 %. Die Zeichen in verbundener Schrift sind für Bottom-up-Mustererkennung zu mehrdeutig. Traditionelle OCR wurde nicht für diese Eingabeklasse entwickelt, und keine noch so große Parametereinstellung ändert die zugrunde liegende architektonische Einschränkung.
Ist KI-Handschrifterkennung genau genug, um manuelle Dateneingabe zu ersetzen?
Für viele Workflows ja – mit Einschränkungen. Bei Druckschrift in begrenzten Formularfeldern erreicht KI-Extraktion eine Feldgenauigkeit von 85–93 %, wodurch manuelle Eingabe eher die Ausnahme als die Regel ist. Bei unordentlicher Kursivschrift oder minderwertigen Handyfotos sinkt die Genauigkeit auf 65–80 % – immer noch eine dramatische Verbesserung gegenüber den unter 20 % der traditionellen OCR, aber nicht hoch genug für eine vollautomatische Verarbeitung ohne Prüfschritt bei kritischen Feldern. Der praktische Idealpunkt ist Extraktion mit konfidenzbasierter Weiterleitung: Felder mit hoher Konfidenz werden automatisch verarbeitet, Felder mit niedriger Konfidenz werden zur manuellen Prüfung markiert. Für einen tieferen Einblick, wie die Genauigkeit je nach Eingabequalität und Feldgestaltung variiert, siehe unseren Leitfaden zur Genauigkeitsverbesserung.
Wie sieht es mit der Geschwindigkeit aus – ist KI-Extraktion langsamer als OCR?
Pro Seite ja – typischerweise 5–12 Sekunden für VLM-basierte Extraktion gegenüber unter 2 Sekunden für traditionelle OCR. Der faire Vergleich umfasst jedoch die Zeit, die durch den Wegfall manueller Korrekturen von OCR-Fehlern bei handschriftlichen Feldern gespart wird. Bei einem Batch von 100 Seiten mit 40 % handschriftlichem Inhalt benötigt VLM-Extraktion etwa 10 Minuten Verarbeitungszeit + 30 Minuten Prüfung. Traditionelle OCR benötigt etwa 3 Minuten Verarbeitungszeit + 3–5 Stunden Korrektur. Die Gesamtworkflow-Zeit spricht für VLM bei jedem Batch mit Handschriftanteil.
Kann ich traditionelle OCR und KI-Extraktion in derselben Pipeline verwenden?
Ja — und genau das ist in den meisten Produktionsumgebungen der Fall. Verwenden Sie traditionelle OCR für maschinengedruckte Seiten mit einer Konfidenz über 75 % und einer Mindestanzahl an Zeichen. Leiten Sie alles unterhalb dieser Schwelle — sowie jedes Dokument, das als handschriftlich gekennzeichnet ist — über den VLM-Pfad. Diese hybride Architektur nutzt die Kosten- und Geschwindigkeitsvorteile der OCR, wo sie funktioniert, und deckt gleichzeitig die Lücken bei Handschrift, die OCR nicht schließen kann.
Halluzinieren KI-Extraktionstools Daten, die nicht auf der Seite stehen?
Das können sie. VLM-basierte Systeme erzeugen manchmal plausibel wirkende Daten für Felder, die tatsächlich leer oder unleserlich waren. Das ist der wichtigste Unterschied zum Fehlermodus der traditionellen OCR: Traditionelle OCR liefert offensichtlich falsche Ergebnisse; eine VLM-Halluzination kann korrekt aussehen und unbemerkt die Validierung passieren. Für jedes Feld, bei dem ein Fehler kostspielig ist — Zahlungsbeträge, rechtliche Daten, Patientenidentifikatoren — bleiben Konfidenzbewertung und menschliche Prüfung notwendig, unabhängig davon, welche Extraktionstechnologie Sie verwenden.
Der einzige Benchmark, der zählt
Benchmarks und Vergleichstabellen zeigen, was im Durchschnitt gilt. Sie zeigen nicht, was für Ihre Dokumente gilt — mit der Handschrift Ihrer Lieferanten, den Abkürzungen Ihres Außendienstes, Ihren Jahrzehnte alten gescannten Formularen. Der Unterschied zwischen traditioneller OCR und KI-Handschrifterkennung wird in Prozentpunkten gemessen, aber ob diese Punkte relevant sind, hängt ganz davon ab, was passiert, wenn ein Feld in Ihrem Workflow falsch gelesen wird. Eine falsch gelesene Rechnungssumme ist ein Zahlungsfehler. Ein falsch gelesenes Inspektionsergebnis ist ein Compliance-Verstoß. Ein falsch gelesener Patientendatensatz ist ein Sicherheitsproblem.
Testen Sie mit Ihren eigenen Dokumenten. Nicht mit den saubersten — sondern mit den acht zusammengehefteten Formularen mit Kaffeeflecken und Randnotizen. Diese entscheiden, ob Ihre Extraktionspipeline funktioniert oder nur so aussieht, bis jemand einen Fehler entdeckt.