Erste Schritte

Übersicht

ImageToTable.ai verwandelt Dokumente in strukturierte Daten, und strukturierte Daten bedeuten hier mehr als nur Textwerte. Sie benennen die Spalten, die Sie möchten, und die KI füllt sie – indem sie einen Wert von der Seite liest, einen aus Zahlen berechnet, die das Dokument zeigt, einen beurteilt, den das Dokument nicht angibt, oder ein visuelles Element wie eine Unterschrift oder ein Logo lokalisiert und dessen Position im Bild zurückgibt. Ergebnisse aus einem Dokument, das als mehrere Seiten eingegangen ist, werden zu einem Datensatz zusammengeführt, und die fertige Tabelle wird als Zeilen und Spalten exportiert, die Sie sortieren, summieren, filtern und in ein anderes System einspeisen können – ohne an irgendeinem Punkt manuelles Abtippen.

Was ImageToTable.ai ist

Dokumente hinein, strukturierte Daten heraus, ohne manuelles Abtippen dazwischen. Richten Sie ImageToTable.ai auf Bilder, Screenshots, PDFs, Word-Dokumente oder Klartext, und es liefert die darin enthaltenen Informationen als Zeilen und Spalten, die Sie sortieren, summieren, filtern, verknüpfen und in ein anderes System einspeisen können. Dabei tut es mehr als nur Text lesen: Es kann Werte aus Zahlen berechnen, die das Dokument zeigt, Werte beurteilen, die das Dokument nicht angibt, und ein visuelles Element wie eine Unterschrift, ein Logo oder einen Stempel auf der Seite lokalisieren.

Die Arbeit, die es ersetzt, ist die manuelle Dateneingabe: eine Person, die Werte von Belegen, Rechnungen, Kontoauszügen oder Formularen abliest und sie Zeile für Zeile in eine Tabelle eintippt. Mit ImageToTable.ai entfällt dieser Abtippschritt; die Tabelle kommt bereits ausgefüllt zurück.

Der Weg von einer Datei zu einer fertigen Tabelle ist jedes Mal derselbe: Die Werte werden extrahiert, die Spalten, die Sie zum Berechnen oder Beurteilen eingerichtet haben, erzeugen ihre Ergebnisse, Ergebnisse aus einem Dokument, das in mehreren Teilen eingegangen ist, werden zu einem Datensatz zusammengeführt, und die fertige Tabelle wird als strukturierte Daten exportiert.

Es arbeitet mit einer Gruppe von Dateien statt mit einer einzelnen. Die Dateien, die Sie zusammen einreichen, bilden einen Stapel, der die Einheit ist, die Sie verarbeiten, prüfen und exportieren; wie viele Zeilen eine Datei beiträgt, hängt von ihrem Inhalt ab.

Was es nicht ist

Zwei Dinge, mit denen dieses Produkt oft in einen Topf geworfen wird, und worin der Unterschied liegt:

  • Kein reines Text-OCR-Tool. OCR liest die Zeichen auf einer Seite und gibt den Text zurück. Es kann Ihnen sagen, welche Wörter auf einer Quittung stehen, aber nicht, welches davon der Anbieter, die Summe oder die Steuer ist. ImageToTable.ai liest, was ein Dokument bedeutet, und nicht nur, was es sagt, sodass es die Werte finden kann, die Sie angefragt haben, selbst wenn kein festes Label verrät, wo sie sich befinden — und es kann ein visuelles Element wie ein Porträt oder eine Unterschrift lokalisieren, ohne überhaupt Text zu lesen.
  • Keine Enterprise-Dokumenten-Workflow-Plattform. Es ist kein System zum Entwerfen von Genehmigungsketten, zum Weiterleiten von Dokumenten zwischen Teams oder zur Integration in ein Records-System, bevor etwas Nützliches passieren kann. Es startet mit einer Datei und der Liste der Werte, die Sie zurückhaben möchten, und seine Ausgabe ist eine Tabelle.

Die Kategorie, zu der es gehört, ist strukturierte Datenextraktion: Dokumente rein, strukturierte Daten raus. Es wird auch als semantische oder intent-basierte Extraktion beschrieben, weil das Ergebnis davon bestimmt wird, was Sie anfragen, und nicht davon, wo die Daten zufällig auf der Seite platziert sind.

Sie benennen die Spalten; die KI findet die Werte

Das ist das gesamte Modell. Sie listen die Spalten auf, die Sie möchten — dieselben Namen, die Sie als Kopfzeilen einer Tabellenkalkulation eingeben würden — und die KI liest jedes Dokument und gibt den Wert zurück, der unter jeden Namen gehört. Es gibt keine Parsing-Vorlage zu entwerfen, keine Zonen um Felder zu zeichnen und kein Modell, das auf Ihren Dokumenten trainiert werden muss.

Weil die Spaltennamen die Bedeutung tragen, funktioniert dieselbe Liste über Dokumente mit unterschiedlichen Layouts hinweg: Ein Wert muss nicht auf jeder Seite an derselben Stelle sitzen, um gefunden zu werden. Eine Liste kann für einen einzelnen Durchlauf verwendet oder als wiederverwendbare Vorlage gespeichert werden; wenn Sie lieber gar keine Spalten benennen möchten, kann die KI das Dokument lesen und selbst eine Tabellenstruktur vorschlagen.

Der Wert einer Spalte muss kein Text sein, der auf der Seite gedruckt ist. Was eine Spalte zurückgibt, wird dadurch bestimmt, was ihre Anweisung verlangt:

  • Einen gedruckten Wert lesen — die Standardeinstellung, die den Wert so übernimmt, wie er erscheint.
  • Einen Wert berechnen — einen aus den im Dokument gezeigten Zahlen berechnen, wie eine Positionssumme oder eine Differenz zwischen zwei Beträgen.
  • Einen Wert beurteilen oder ableiten — einen entscheiden, den das Dokument nicht angibt, wie die Kategorie, zu der eine Quittung gehört.
  • Ein visuelles Element lokalisieren — statt Text zu lesen, ein Porträt, eine Unterschrift, ein Logo oder einen Stempel auf der Seite finden und zurückgeben, wo es sich befindet; die App zeigt eine zugeschnittene Vorschau dieser Region, und das lokalisierte Element ist das, was in der Tabelle landet.

Berechnen, Beurteilen und Lokalisieren unterscheiden das Produkt von einem bloßen Lesen der Seite, und alle vier werden auf dieselbe Weise eingerichtet, durch das, was die Anweisung der Spalte verlangt. Benutzerdefinierte Spalten behandelt, wie Sie jede Art schreiben.

Wo ein Konto auf der Modellstufen-Skala steht, bestimmt, welches KI-Modell die Arbeit erledigt und daher, wie viele Credits jede Datei kostet. Wenn ein reales Dokument als mehrere Fotos oder Seiten ankommt, kann die Mehrseiten-Zusammenführung diese Ergebnisse wieder zu einem einzigen Datensatz zusammenführen.

So geht es weiter

Diese Seite ist die Orientierung, nicht das Handbuch. Der kürzeste Weg zum ersten Ergebnis führt über Schnellstart; die Begriffe, die der Rest der Website verwendet, sind im Glossar definiert.

  • Schnellstart — der kürzeste Weg von der Anmeldung bis zu Ihrer ersten strukturierten Tabelle.
  • Vorlagen & Spalten — was eine Vorlage ist, woraus eine Spalte besteht und wo gespeicherte Vorlagen wiederverwendet werden können.
  • Benutzerdefinierte Spalten — wie eine Spalte einen Wert direkt lesen, berechnen, ableiten oder ein visuelles Element lokalisieren kann.
  • Modellstufe — die Verarbeitungsqualitätsstufe hinter einem Konto und was sie für Credits bedeutet.
  • Mehrseiten-Zusammenführung — wie ein Dokument, das als mehrere Dateien eingegangen ist, wieder zu einem Datensatz zusammengeführt wird.
  • Stapel — wie Dateien während der Verarbeitung gruppiert, benannt und verfolgt werden.
  • Grenzen & Spezifikationen — unterstützte Dateitypen, Seiten- und Größenbegrenzungen sowie Plangrenzen.

Für die Entwicklung mit der API statt der Web-App ist die Entwicklerdokumentation eine separate Website: Siehe API-Dokumentation.

📮 contact email: [email protected]