Extraktion handschriftlicher Rezepte

Rezepttitel, Zutaten und Anleitungen aus handschriftlichen Rezeptfotos erfassen

Das manuelle Übertragen einer handschriftlichen Rezeptkarte in eine digitale Datei dauert 10–15 Minuten pro Rezept – dieses Tool liest sie in 5–10 Sekunden.

5–10 s pro Rezept · Bis zu 95 % bei gedruckter Handschrift · Bruch- & Mengenangaben-Parsing

Titel · Zutaten · Anleitungen
Schreibschrift & Druckschrift
Stapelverarbeitung von Familienarchiven

Was Sie aus einem handgeschriebenen Rezeptfoto extrahieren können

Eine Rezeptkarte vereint Schreibschrift, Brüche, gemischte Einheiten und ein halbstrukturiertes Layout. Mit der Custom Column Extraction benennen Sie die Felder – die KI lokalisiert jedes einzelne, indem sie dessen Bedeutung versteht, nicht indem sie versucht, jedes Zeichen pixelgenau per OCR zu erfassen.

Rezepttitel

Meist die größte Handschrift oben auf der Karte. Die KI identifiziert ihn anhand von Position und Schriftgröße – selbst in Schreibschrift, ohne dass Sie manuell kennzeichnen müssen, welcher Text der Titel ist.

Zutat

Einzelne Zutaten aus der Zutatenliste. Die KI unterscheidet die Liste von der Anleitung, indem sie die interne Struktur des Rezepts erkennt – ein Block aus kurzen Zeilen mit Mengenangaben ist eine Zutatenliste, kein Kochschritt.

Menge (mit Einheit)

Die Mengenangaben inklusive Brüche – 1½ Tassen, ¼ TL, 200 g. Herkömmliche OCR zerlegt „1½“ in einzelne Zeichen und verliert die Bruchbedeutung. Das visuelle Modell liest das Bruchzeichen als einzelnes Mengentoken und gibt es zusammen mit der Einheit in Ihrer Tabelle aus.

Garzeit & Temperatur

Zeiten (30 Min., 2 Stunden) und Temperaturen (350°F, mittlere Hitze), die im Anleitungsteil oder in der Nähe des Titels erscheinen. Die KI erkennt Zeit-Temperatur-Muster, selbst wenn „bei 350° 30 Min. backen“ in einem Absatz in Schreibschrift steht.

Anleitung

Die Kochschritte aus dem Anleitungsteil – typischerweise Absätze oder nummerierte Schritte. Die KI leitet sie basierend auf ihrer Position und Struktur im Rezept in die Spalte „Anleitung“ um, getrennt von der Zutatenliste oben.

Warum handschriftliche Rezepte jedes herkömmliche Extraktionstool überfordern

Eine Rezeptkarte ist kein strukturiertes Formular – sie besteht aus Schreibschrift, Bruchziffern, gemischten Maßeinheiten und einem halbwegs organischen Layout (Zutaten, dann Anleitung, dann Notizen) auf Papier, das fleckig, gefaltet oder verblasst sein kann. Herkömmliche OCR wurde für maschinell gedruckten Text auf sauberem Papier entwickelt. Die semantische Extraktion liest das Rezept so, wie ein Koch es tun würde.

Was Rezeptkarten schwierig macht

01

Schreibschrift senkt die OCR-Genauigkeit auf nahezu null. Verbundene Buchstaben unterbrechen die zeichenweise Segmentierung. Herkömmliche OCR erreicht bei sauberer Schreibschrift etwa 50 % und fällt bei lockerer Handschrift auf 20–30 % – für eine vollständige Rezeptkarte praktisch unbrauchbar. Wie ein Reddit-Nutzer in r/Cooking anmerkte: „Ich bezweifle, dass die Rezepte per OCR erfasst werden, da sie in halbkursiver Handschrift verfasst sind.“

02

Brüche und gemischte Einheiten sind für zeichenbasierte OCR unsichtbar. „1½ Tassen“ enthält ein Bruchzeichen (½), das die OCR als zwei separate Zeichen liest. „TL“, „EL“, „g“, „oz“, „ml“ sind ohne einheitliches Trennzeichen vermischt – die OCR gibt die rohen Zeichen aus, versteht aber nicht, was eine Einheit und was ein Zutatenname ist.

03

Teilstrukturierte Layouts überfordern positionsbasierte Werkzeuge. Zutaten sind eine Liste, Anweisungen sind Absätze und Notizen sind auf den Rändern verstreut – alles in derselben Handschrift. Die zonale OCR benötigt für jede Region ein eingezeichnetes Rechteck. Wenn der Rezeptautor zwischen den Abschnitten springt, stimmen die Zonen nicht mehr überein.

Wie semantische Extraktion ein Rezept liest

01

Sie benennen die Spalten – die KI findet Werte anhand der Bedeutung, nicht der Pixelposition. Geben Sie „Rezepttitel, Zutat, Menge, Garzeit, Anleitung“ ein. Das visuelle Modell liest die gesamte Karte, erkennt, welcher Bereich die Zutatenliste und welcher die Zubereitung ist, und ordnet jeden Wert seiner Spalte zu – unabhängig davon, ob die Karte in Schreibschrift, Blockschrift oder einer Mischung verfasst ist.

02

Bruchzeichen und Einheiten werden als semantische Paare gelesen. „1½ Tassen“ sind nicht drei separate Token – das Modell erkennt den Bruch als einzelnen Mengenwert, paart ihn mit der Einheit „Tassen“ und gibt „1½ Tassen“ in Ihrer Mengenspalte aus. „350°F“ wird als Temperatureinheit geparst, nicht in Zahl und Gradsymbol aufgespalten.

03

Der Kontext löst Mehrdeutigkeiten in der Schreibschrift auf. Wenn ein Wort in Schreibschrift „flour“ oder „flourish“ sein könnte, nutzt das Modell seine Position in der Zutatenliste und die umgebende Menge, um die Bedeutung zu ermitteln. Derselbe Buchstabe in einem anderen Kontext (einem Methodenabsatz) würde anders gelesen werden – weil die Spaltendefinition dem Modell sagt, was es erwarten soll.

Von einem Stapel handgeschriebener Rezeptkarten zu einer durchsuchbaren Tabelle in drei Schritten

1

Fotografieren Sie die Rezeptkarten

Sie haben eine Schachtel mit handschriftlichen Rezeptkarten Ihrer Großmutter – einige in sauberer Schreibschrift, andere mit verblasstem Kugelschreiber, ein paar mit Fettflecken, die älter sind als Sie. Machen Sie Fotos mit Ihrem Smartphone: Legen Sie jede Karte flach auf einen Tisch bei natürlichem Licht. Laden Sie alle Fotos in einem Batch hoch – 50, 100 oder 200 Karten auf einmal. Kein Sortieren nach Handschrift, Kartengröße oder Zustand nötig.

2

Benennen Sie die Felder – einmalig für den gesamten Batch

Geben Sie Ihre Spaltennamen ein: Rezepttitel, Zutat, Menge, Garzeit & Temperatur, Anleitung. Dieselben fünf Spalten funktionieren für jede Karte im Batch – egal, ob das Rezept für Hühnersuppe auf einer Karteikarte oder für Schokoladenkuchen auf einer befleckten Notizbuchseite steht. Die KI liest jedes Bild unabhängig und lokalisiert die Zutatenliste, die Zubereitungsmethode sowie die Zeit-Temperatur-Daten, indem sie die Rezeptstruktur versteht, anstatt sich auf eine feste Vorlage zu stützen.

3

Exportieren Sie eine einzige Tabelle

Die Verarbeitung dauert 5-10 Sekunden pro Foto. Die Ausgabe ist eine XLSX-Datei: Jede Zeile ist ein Rezept, jede Spalte ist ein von Ihnen benanntes Feld. Großmutters Hühnersuppe in Zeile 1, der Schokoladenkuchen von Tante Maria in Zeile 2, die befleckte Nudelkarte in Zeile 3 – alle in derselben Tabelle. Etwa 60-mal schneller als das manuelle Abschreiben jeder Karte (~10-15 Min. manuell pro Rezept vs. ~5-10s hier). Teilen Sie die Datei mit der Familie, importieren Sie sie in eine Rezept-App oder behalten Sie sie als Ihr digitales Archiv.

Genauigkeit bei handschriftlichen Rezepten – was Sie erwarten können

Die Genauigkeit variiert je nach Handschrift und physischem Zustand. Hier sehen Sie, was das Tool gut verarbeitet und wo Sie die Ergebnisse genauer prüfen sollten.

Wann es am besten funktioniert

Gedruckte oder saubere Schreibschrift auf flachen, gut beleuchteten Karten. Bis zu 95 % Genauigkeit bei Zutaten und Mengen. Das Modell verarbeitet Mehlflecken und leichte Knicke.

Standard-Rezeptformat. Zutaten zuerst aufgelistet, dann die Anleitung. Das halbstrukturierte Layout ist genau das, wofür die semantische Extraktion entwickelt wurde – ein Spaltensatz passt auf jede Karte.

Stapelweise Digitalisierung von Familienarchiven. Verarbeiten Sie 50–200 Karten in einem Durchgang mit einer einzigen Spaltendefinition. Das Tool benötigt keine kartenweise Konfiguration oder manuelle Sortierung nach Handschriftstil.

Wann Vorsicht geboten ist

Starke Schreibschrift oder unleserliches Gekritzel. Die Genauigkeit sinkt auf 65–75 %. Stark verbundene Schrift, bei der einzelne Buchstaben selbst für menschliche Leser mehrdeutig sind, führt zu teilweisen oder falschen Extraktionen. Behandeln Sie die Ausgabe als Entwurf und überprüfen Sie jede Zeile.

Stark verblasste Tinte, eingerissene Stellen oder physisch fehlender Text. Das Modell kann nur das extrahieren, was visuell vorhanden ist. Wenn ein Fettfleck oder eine Falte einen Teil einer Zutat oder Menge verdeckt, kann dieser Wert unvollständig oder fehlend sein.

Dekorative Elemente, die die Handschrift überlappen. Ränder, Kritzeleien oder Aufkleber, die über den Text verlaufen, beeinträchtigen die Lesbarkeit. Fotografieren Sie die Karte so flach und gerade wie möglich, um visuelles Rauschen zu minimieren.

Häufig gestellte Fragen

Kann die KI Mengen mit Brüchen wie „1½ Tassen“ von einer verblassten, handgeschriebenen Rezeptkarte extrahieren?

Ja. Wenn Sie eine Mengenspalte definieren, liest das visuelle Modell das Bruchzeichen und die Einheit als ein semantisches Paar – „1½ Tassen“ wird als ein Wert ausgegeben, nicht aufgeteilt in „1“, „½“, „Tassen“. Herkömmliche OCR kann dies nicht, da sie jedes Zeichen einzeln verarbeitet. Starke Verblassung kann die Zeichenklarheit verringern, aber das Modell übertrifft dennoch die zeichenweise OCR, da es die Zahl und ihre Einheit als zusammengehöriges Paar und nicht als isolierte Pixel liest.

Wie trennt die KI Zutaten von Anleitungen, wenn beides in derselben Schreibschrift handschriftlich vorliegt?

Das Modell liest die gesamte Karte und identifiziert zwei unterschiedliche Bereiche: eine Zutatenliste (kurze Zeilen, jede beginnend mit einer Menge und Einheit) und einen Methodenteil (Absätze oder nummerierte Schritte, die auf diese Zutaten verweisen). Wenn Sie separate Spalten für Zutaten und Anleitungen definieren, leitet die KI den Text basierend auf dem Dokumentbereich und der semantischen Rolle in die jeweilige Spalte. Ein Spaltensatz – Rezepttitel, Zutat, Menge, Garzeit, Anleitung – verarbeitet jedes Rezeptlayout ohne kartenweise Konfiguration.

Kann ich die Gartemperatur aus einem Rezept extrahieren, bei dem „350°F“ winzig in Schreibschrift am Rand steht?

Das Modell ist darauf trainiert, Zeit-Temperatur-Muster zu erkennen – Zahlen gefolgt von °F, °C, „Grad“, „Minuten“ oder „Stunden“ – selbst wenn sie in einen Absatz eingebettet oder an den Rand geschrieben sind. Definieren Sie eine Spalte Garzeit & Temperatur und die KI lokalisiert diese Werte auf der gesamten Karte. Randnotizen und kleine Handschrift verringern die Genauigkeit im Vergleich zum Haupttext der Karte, aber die musterbasierte Erkennung hilft, den Wert zu erfassen, wo herkömmliche Zeichen-OCR ihn vollständig überspringen würde.

Ein Batch, 200 Rezeptkarten von Oma – kann ich sie alle verarbeiten, ohne jede einzelne zu konfigurieren?

Ja. Laden Sie alle 200 Fotos in einen Batch hoch. Definieren Sie Ihre fünf Spalten einmal: Rezepttitel, Zutat, Menge, Garzeit & Temperatur, Anleitung. Die KI verarbeitet jedes Bild mit derselben Spaltendefinition, unabhängig von Handschriftstil, Kartengröße oder physischem Zustand. Die Ausgabe ist eine einzige XLSX-Datei mit 200 Zeilen – eine pro Rezept. Felder, die auf einer bestimmten Karte nicht vorkommen, bleiben leer. Vorlagenbasierte Tools erfordern eine Konfiguration pro Karte; Custom Column Extraction nicht – das ist der Unterschied zwischen einem Wochenendprojekt und einem mehrmonatigen Unterfangen.

Eine Karte hat einen Fettfleck quer über der Mitte, der einen Teil der Zutatenliste verdeckt – wird der fehlende Daten erkannt?

Das Modell extrahiert nur, was visuell lesbar ist. Wenn ein Fleck, eine Falte oder ein eingerissener Bereich einen Teil einer Zutat oder Menge verdeckt, fehlt dieser spezifische Wert in der Ausgabe oder ist unvollständig. Das Tool errät oder erfindet keine verdeckten Texte – es gibt leere Zellen für Werte zurück, die es nicht lesen kann. Diese Ehrlichkeit ist beabsichtigt: Sie sehen genau, was extrahiert wurde und was nicht, anstatt stillschweigend plausible Daten zu erfinden. Fotografieren Sie bei kritischen Rezepten die Karte unter gleichmäßigem Licht und erwägen Sie mehrere Aufnahmewinkel, wenn die Karte stark beschädigt ist.

📮 contact email: [email protected]