VLM Powered OCR

OCR-API – Entwicklerfreundliche Texterkennung und strukturierte Datenextraktion

Die meisten OCR-APIs liefern nur Rohtext und Koordinaten – Sie müssen für jeden Dokumenttyp eigenen Parsing-Code schreiben. Dieser kombinierte Ansatz extrahiert Text und erkennt Felder in einem Durchgang und gibt strukturierte Daten nach den von Ihnen definierten Spaltennamen aus.

Enterprise-grade security · TLS 1.3 encrypted

REST-API
PDF/JPG/PNG
XLSX/CSV/JSON
Kostenlose Stufe

Was Sie aus jedem Dokument extrahieren können

Geben Sie die benötigten Spaltennamen ein – die KI findet diese Werte auf jeder Seite, indem sie deren Bedeutung versteht, nicht deren Position. Ausgabe als strukturiertes JSON, CSV-Zeilen oder eine Excel-Datei mit einem einzigen API-Aufruf.

Roher Dokumenttext
Rechnungsnummer
Datum
Gesamtbetrag
Lieferantenname
Positionen
Bestellnummer
Steuerbetrag
Fälligkeitsdatum
Dokumenttyp

Warum OCR-APIs Sie nur auf halbem Weg bringen

Eine OCR-API liefert Ihnen Text und Koordinaten. Um Rechnungsnummer: INV-2024-0892 anstelle der Zeichenkette "INV-2024-0892" zu erhalten, die zwischen anderen erkannten Wörtern schwebt, benötigen Sie eine zweite Verarbeitungsebene.

01
Roher Textauszug ohne Struktur

OCR-APIs geben einen flachen String oder eine Wortliste mit Koordinaten zurück. Die Zahl $322,38 und die Bezeichnung "GESAMT" sind im Output von jedem anderen Text nicht zu unterscheiden – Ihr Code muss selbst herausfinden, welche Zahl die Gesamtsumme, welche die Zwischensumme und welche eine Position ist.

02
Jedes Dokumentenlayout benötigt eigenen Parsing-Code

Koordinaten sind seitenbezogen. Eine Regel, die die Rechnungsnummer an Position (x=100, y=200) extrahiert, funktioniert nicht mehr, sobald ein anderer Anbieter sie an (x=300, y=150) platziert. Die Wartung einer anbieterspezifischen Parsing-Logik skaliert nicht.

03
Nachbearbeitungspipelines erhöhen Komplexität und Kosten

Entwickler auf Reddit beschreiben durchgängig die Lücke zwischen OCR-Output und nutzbaren Daten als „extrem frustrierend“ – die API hat ihren Job gemacht, aber die Daten sind noch nicht einsatzbereit.

01
Strukturierte Daten nach Spaltennamen ausgeben

Definieren Sie die gewünschten Felder — Rechnungsnummer, Gesamtsumme, Lieferant — und die KI gibt sie als benannte Spalten in JSON oder einer Tabelle zurück. Kein manuelles Beschriften und Sortieren von Rohtext nötig.

02
Layoutunabhängige semantische Extraktion

Da die KI versteht, was Rechnungsnummer bedeutet, findet sie diese unabhängig von der Position auf der Seite. Ein Lieferant ändert seine Vorlage – die Extraktion funktioniert trotzdem, ohne dass Regeln aktualisiert werden müssen.

03
Eine Pipeline vom Upload zur strukturierten Ausgabe

Keine separate OCR-Stufe, dann Parsing, dann Feldextraktion. Laden Sie ein PDF oder Bild hoch, definieren Sie Ihre Spalten und erhalten Sie strukturierte Daten in einer einzigen Antwort. Für Teams, die durchgängig strukturierte Daten benötigen, ist dieser kombinierte Ansatz einfacher als die Wartung einer OCR → Parse → Extraktionskette.

Vom Upload zu strukturierten Daten in einem Durchlauf

So läuft es ab, wenn Sie einen Stapel Rechnungen über die API verarbeiten – kein zusätzlicher Parsing-Schritt erforderlich.

1

Dateien per API oder Weboberfläche hochladen

Senden Sie PDFs, JPGs oder PNGs – einzelne Dokumente oder gemischte Formate im selben Batch. Die API akzeptiert Multipart-Upload und gibt sofort eine Aufgaben-ID für die Statusabfrage zurück. Jede Datei wird asynchron in die Warteschlange gestellt und verarbeitet, wobei dieselbe Engine sowohl die Weboberfläche als auch den API-Endpunkt antreibt.

2

Definieren Sie Ihr Spaltenschema

Geben Sie die benötigten Felder an – Rechnungsnummer, Datum, Lieferant, Positionen (Beschreibung / Menge / Einzelpreis / Gesamt), Steuer, Gesamtsumme. Die KI liest jedes Dokument semantisch und ordnet die Werte Ihren Spaltennamen zu, unabhängig davon, wo sie auf der Seite erscheinen.

3

Strukturierte Daten abrufen – JSON, CSV oder Excel

Jedes Dokument wird als Zeile mit Ihren benannten Spalten zurückgegeben. Laden Sie einen Batch als formatiertes Excel-Arbeitsblatt herunter, rufen Sie einzelne Ergebnisse als JSON mit Feld:Wert-Paaren ab oder exportieren Sie ein mehrzeiliges CSV. Keine regulären Ausdrücke zum Schreiben, kein Koordinatenabgleich zum Debuggen, keine Nachbearbeitungspipeline zum Warten.

Wann dieser Ansatz sinnvoll ist

Ideale Anwendungsfälle

  • Sie benötigen strukturierte Feld:Wert-Paare aus Dokumenten, nicht nur Rohtext.
  • Ihre Dokumente stammen aus verschiedenen Quellen mit unterschiedlichen Layouts – die semantische Extraktion passt sich an, ohne dass Regeln geändert werden müssen.
  • Sie möchten die Nachbearbeitung überspringen – das Extraktionsergebnis ist bereit für den Import in eine Datenbank, API-Antwort oder Tabelle.
  • Ihr Team verfügt nicht über dedizierte NLP- oder Dokumentenparsing-Ressourcen, um Extraktionsregeln zu erstellen und zu warten.

Vorsicht ist geboten bei

  • Sie benötigen Rohtext mit präzisen Begrenzungsrahmen-Koordinaten pro Zeichen für die freie Textrekonstruktion – dieser Ansatz liefert benannte Felder, keine vollständige Layout-Geometrie.
  • Ihre Pipeline verarbeitet Millionen von Dokumenten pro Monat zu weniger als einem Cent pro Seite – prüfen Sie die volumenbasierte Preisgestaltung im Verhältnis zu Ihrem Durchsatz.
  • Extrem verschnörkelte Handschrift oder stark beschädigte Scans mit erheblicher physischer Beeinträchtigung können die Extraktionsgenauigkeit verringern – saubere Druck- und Scandokumente erzielen die höchste Zuverlässigkeit.

Häufig gestellte Fragen

Kann ich Rechnungsnummer und Gesamtbetrag aus gescannten PDFs per API extrahieren?

Ja. Gescannte PDFs werden wie Bilder behandelt – die visuelle KI liest die Seite direkt, es gibt keine Abhängigkeit von einer Textebene. Definieren Sie Rechnungsnummer und Gesamtbetrag als Spaltennamen, und die API gibt die Werte als benannte Felder in der Antwort zurück – unabhängig davon, ob das PDF digital erstellt oder gescannt wurde.

Worin unterscheidet sich das von Google Cloud Vision oder AWS Textract?

Google Cloud Vision und AWS Textract liefern Rohtext mit Begrenzungsrahmen oder Schlüssel-Wert-Paare für Dokumente, die ihre Felder bereits kennzeichnen. Diese API gibt die von Ihnen definierten Felder durch semantisches Verständnis zurück – wenn Sie nach Lieferantenname fragen, findet sie den Lieferantennamen, auch wenn das Dokument ihn nicht explizit ausweist. Sie definieren das Ausgabeschema, nicht das Dokument.

Wie gehe ich mit Positionsartikeln um, deren Zeilenanzahl in verschiedenen Dokumenten variiert?

Definieren Sie eine Spalte wie Positionen mit verschachtelten Unterfeldern (Beschreibung, Menge, Einzelpreis, Gesamt). Die KI erkennt die vollständige Liste der Positionen pro Dokument – unabhängig davon, ob es 3 oder 30 Zeilen sind – und gibt sie als Array in JSON oder als erweiterte Zeilen im Export zurück.

Gibt es einen kostenlosen Tarif, um die OCR-API vor einer Verpflichtung zu testen?

Ja. Sie können die Ausgabequalität über die Weboberfläche in der Gastdemo ohne API-Integration bewerten. Kostenpflichtige Pläne mit API-Schlüssel-Zugang beginnen bei 9 $/Monat und beinhalten ein tägliches kostenloses Guthaben. Die Weboberfläche und die API nutzen dieselbe Extraktions-Engine, daher sind die Ergebnisse konsistent.

Welche Eingabe- und Ausgabeformate werden unterstützt?

Upload: PDF (auch passwortgeschützte Dateien), JPG, PNG, WebP und AVIF. Ausgabe: strukturiertes JSON mit Ihren Spaltennamen als Schlüsseln, CSV-Zeilen oder formatierte Excel-Arbeitsmappen. Die API unterstützt auch den Batch-Export als herunterladbare .xlsx-Datei.

📮 contact email: [email protected]