Copilot wurde dafür gebaut, innerhalb von Excel zu arbeiten,nicht um Daten aus einer PDF-Datei zu ziehen

Microsofts eigener Leitfaden besagt, dass Copilot in Excel eine PDF-Datei in eine bearbeitbare Tabelle verwandeln kann (Microsoft). Ein Thread auf r/excel klingt anders: Ein Nutzer schrieb, dass Copilot "die einfache Anfrage, eine PDF in Excel zu konvertieren, nicht erfüllen konnte", während ChatGPT "es in Sekunden mit perfektem Ergebnis erledigte" (r/excel). Die Lücke entsteht durch etwas Spezifischeres als eine kaputte Funktion: einen Konversationsassistenten, der eine Aufgabe erledigen soll, für die er nie konzipiert wurde.

Schluss mit Abtippen — lassen Sie KI Ihre Dokumente lesen
Bild oder PDF hochladen — strukturierte Daten in 10 Sekunden
Jetzt testen →
Blog-Titelbild mit dem Titel 'Warum Excel Copilot bei PDF zu Excel versagt (und was Sie stattdessen verwenden sollten)' und drei Symbolen darunter: rotes X für Kein Spaltenvertrag, rotes X für Eine Datei nach der anderen, grüner Haken für Batch-First-Verarbeitung

Die wichtigsten Erkenntnisse

  1. Es liegt wahrscheinlich nicht an Ihrer Eingabeaufforderung, denn Copilot in Excel wurde entwickelt, um Arbeitsmappen zu bearbeiten – das Einlesen eines Ordners mit PDF-Dateien in eine Tabelle passiert, bevor seine Aufgabe überhaupt beginnt.
  2. Ein Tool, das bei einzelnen Feldern 86% erreicht, bekommt trotzdem weniger als die Hälfte seiner Zeilen vollständig richtig.
  3. Hören Sie auf, nach einer besseren Eingabeaufforderung zu suchen, denn die Lösung ist, Ihre Spalten einmal zu benennen und den gesamten Ordner in einem einzigen Batch auszuführen.

Copilot in Excel und ein PDF-zu-Tabelle-Tool lösen zwei verschiedene Probleme

Zweispaltiger Vergleich: linke Spalte mit rotem X-Symbol, beschriftet mit 'Copilot in Excel' und Text 'Analysiert Daten, die bereits in der Arbeitsmappe vorhanden sind', rechte Spalte mit grünem Häkchen-Symbol, beschriftet mit 'PDF-zu-Tabelle-Tool' und Text 'Verwandelt einen Ordner mit PDFs zuerst in diese Daten'

Copilot analysiert Daten, die bereits in Ihrer Arbeitsmappe vorhanden sind. Einen Ordner mit PDFs in diese Daten zu verwandeln, ist eine Aufgabe, die erledigt wird, bevor Copilots Aufgabe beginnt.

Copilot in Excels dokumentierte Aufgabe ist die Arbeitsmappe. Microsoft beschreibt es als eine Funktion, die Ihnen hilft, Arbeitsmappen zu "erstellen und zu bearbeiten": Formeln generieren und erklären, Erkenntnisse als Diagramme oder PivotTables zurückgeben, Textspalten hervorheben, sortieren, filtern und zusammenfassen. Jede dieser Aufgaben beginnt mit einer Tabelle, die bereits auf einem Blatt vorhanden ist.

Die PDF-zu-Tabelle-Aufgabe ist die Datenerfassung. Die Daten befinden sich außerhalb der Arbeitsmappe, in einem Dateiformat, das speichert, wo Zeichen auf einer Seite stehen, und nicht, zu welcher Spalte sie gehören. Diese Daten aus jeder Datei in eine Tabelle mit den gewünschten Spalten zu bringen, ist ein separater Schritt, der erledigt wird, bevor eine Analyse beginnen kann.

Microsoft hat seit Jahren eine separate Pipeline für die Datenerfassung bereitgestellt. Der ältere Importeur Daten → Daten abrufen → Aus Datei → Aus PDF liest nur die Textebene, die ein PDF zufällig enthält. Deshalb liefert er bei einem gescannten Dokument nichts. Dieser Pfad und Copilots Pfad sind nicht derselbe Code, und keiner von beiden wurde entwickelt, um aus fünfzig unterschiedlich formatierten Dateien denselben Spaltensatz zu erzeugen. Der Leitfaden für PDF zu strukturierten Daten erläutert, warum jede Konvertierungsmethode scheitert und bei welchen Dateitypen.

Die beiden Aufgaben getrennt zu halten, erklärt die Frustration in diesem Thread, ohne daraus ein Markenargument zu machen. Copilot scheitert nicht bei der Analyse. Es bekommt eine Datenerfassungsaufgabe übertragen – und genau hier hat es am wenigsten zu arbeiten.

Was Copilot in Excel wirklich gut kann

Copilot ist gut bei der Arbeit, für die es entwickelt wurde, und genau das sagt auch der skeptische Thread.

Nutzer, die dabei blieben, beschrieben es als „großartig beim Erstellen von Formeln" und nützlich für Besprechungsnotizen, Dokumentzusammenfassungen und den Aufbau einer Analyse zu einem technischen Thema. Eine Antwort war unverblümt über den echten Wert: „Das Einzige, wobei es mir wirklich geholfen hat, ist das Schreiben von VBA." Wenn die Daten bereits im Blatt sind, ist es eine sinnvolle Nutzung eines KI-Assistenten, Copilot zu bitten, eine Formel zu erklären oder einen Ausreißer hervorzuheben.

Die ehrliche Trennlinie ist, ob die Daten bereits in der Arbeitsmappe vorhanden sind.

Was Sie tunCopilot in ExcelEin Stapelverarbeitungs-Extraktionstool
Daten sind bereits in einem BlattStarke Passung: Formeln, Erkenntnisse, Pivots, ZusammenfassungenNicht der Punkt; die Daten sind bereits strukturiert
Ein sauberes PDF, das Sie einmal brauchenFunktioniert meist nach manuellem Einfügen und BereinigenFunktioniert, aber der Einzelfall braucht keine Pipeline
Ein Ordner mit PDFs mit denselben FeldernFragil: eine Datei nach der anderen, Spaltenüberschriften weichen zwischen den Durchläufen abDer vorgesehene Fall: dieselben Spalten aus jeder Datei
Ein wiederkehrender monatlicher DurchlaufFalsche Form: erneutes Auffordern führt die Abweichung wieder einDieselben Spalten wiederverwenden und den Batch erneut ausführen

Sobald die Quelldaten eine Tabelle sind, kann Copilot übernehmen und nützliche Arbeit daran leisten. Das Problem ist alles, was vor diesem Moment passieren muss.

Warum ein Konversationsassistent bei wiederholbarer Extraktion scheitert

Vier strukturelle Eigenschaften eines Chat-Assistenten wirken gegen wiederholbare Extraktion, und keine davon wird durch einen besseren Prompt behoben.

Die Ausgabeform ist nicht garantiert. Microsofts eigener FAQ sagt, dass Copilot "manchmal Fehler machen, Informationen falsch interpretieren oder ungenaue Ergebnisse liefern kann", und rät davon ab, es "für Entscheidungen in sensiblen Bereichen wie Finanzen, Recht oder Medizin" zu verwenden (Microsoft Support). Eine ausgemusterte Copilot-Arbeitsblattfunktion trug dieselbe Warnung in schärferer Form: Ergebnisse "können sich im Laufe der Zeit ändern, selbst bei denselben Argumenten", und für alles, was "Genauigkeit oder Reproduzierbarkeit" erfordert, verwies Microsoft die Benutzer auf native Formeln zurück (COPILOT-Funktion). Ein Werkzeug, dessen Hersteller Ihnen sagt, ihm bei Finanzentscheidungen nicht zu vertrauen, ist ein guter Denkpartner, aber ein schlechtes System of Record.

Es gibt keinen Spaltenvertrag. Sie fragen nach einer Tabelle und erhalten eine Tabelle, aber nicht unbedingt zweimal dieselbe. Der nächste Lauf kann "Invoice Date" in "Date" umbenennen, eine Spalte verschieben oder zwei Felder zu einem zusammenfassen. Ein Benutzer im r/excel-Thread beschrieb den Effekt präzise: "Ich erhalte stark unterschiedliche Ergebnisse mit exakt denselben Daten und Anweisungen." Wenn vierzig Dateien vierzig leicht unterschiedliche Tabellen erzeugen, landen das Zusammenführen und Umbenennen wieder bei der Person, die Zeit sparen wollte.

Es ist auf eine Datei nach der anderen ausgelegt. Die Dokumentation zum Datei-Upload von OpenAI begrenzt Dokumentdateien auf 2 Millionen Tokens pro Datei und Bilder auf 20 MB, und diese Grenzen gelten für eine einzelne Konversation und nicht für einen Ordner (OpenAI). Ein zwölfseitiger Kontoauszug mit drei Tabellen ist genau die Form, die diese Obergrenzen erreicht, und der Fehler ist still: Die Antwort kommt kürzer zurück als das Dokument. Gescannte Dateien machen es schlimmer, da es keine Textebene zum Lesen gibt, es sei denn, das Tool behandelt die Seite als Bild, was unter ob KI Daten aus einer PDF extrahieren kann behandelt wird.

Die Genauigkeit auf Datensatzebene ist weitaus geringer als die Genauigkeit auf Feldebene. Dies ist die Zahl, die die meisten Menschen nie sehen. Cleanlabs Structured-Output-Benchmark trennt Field Accuracy (den Anteil einzelner Felder, die korrekt sind) von Output Accuracy (den Anteil der Datensätze, bei denen jedes einzelne Feld korrekt ist). Bei seinem Data Table Analysis-Set erzielte gpt-4.1-mini 86,3% auf Feldebene, aber 45% auf Datensatzebene; bei der Extraktion von Versicherungsansprüchen lag die Datensatzgenauigkeit bei Frontmodellen zwischen 30% und 40%; bei der PII-Extraktion fiel sie auf 26% bis 46% (Cleanlab).

Eine Feldzahl wie 90% klingt beruhigend, bis Sie die ganze Zeile brauchen. Zehn Felder mit je 95% lassen ungefähr eine 60%ige Chance, dass eine bestimmte Zeile vollständig sauber ist, und die Fehler stapeln sich, wenn der Batch wächst. Bei einem Ordner mit Rechnungen ist die einzige Zahl, die zählt, wie viele Zeilen korrekt sind.

Dasselbe Muster zeigt sich auch außerhalb von Excel. In einem r/ChatGPT-Thread über das Parsen von Auftragnehmerlisten aus PDFs funktionierte ein einzelnes Dokument beim ursprünglichen Poster einwandfrei, doch die Ausgabe brach zusammen, als drei Dateien kombiniert wurden: „Ich konnte nicht mehr als 4 Ergebnisse aus einer Tabelle herausholen, die über 100 hätte haben sollen." Ein Kommentator fasste die Erfahrung zusammen: „PDFs zu parsen ist wirklich Glückssache ... Seiten fehlen, Zeilen fehlen, Werte fehlen" (r/ChatGPT). Nichts an einem größeren Modell entfernt diese vier Eigenschaften, weshalb ein speziell entwickeltes Tool für Stapelverarbeitung von Dokumenten eine andere Produktkategorie ist als ein stärkerer Chatbot.

Ein Test, den Sie in zwanzig Minuten durchführen können

Die meisten Suchanfragen zu Excel Copilot, der nicht funktioniert, laufen auf eine Frage hinaus: Liegt es an meiner Eingabeaufforderung oder am Tool? Sie können das mit Ihren eigenen Dateien klären, bevor Sie irgendetwas umstellen, und Sie sollten dieselben Prüfungen sowohl bei einem Copilot-PDF-zu-Excel-Lauf als auch bei einem ChatGPT-Lauf durchführen. Vier davon unterscheiden eine Demo, die Sie einmal beeindruckt hat, von einem Tool, auf dem Sie einen monatlichen Prozess aufbauen können.

Listen-Infografik mit dem Titel '4 Prüfungen in 20 Minuten' mit nummerierten Punkten: 1 Gleiches PDF, gleiche Eingabeaufforderung, zweimal, 2 Zehn Dateien, Zeilen zählen, 3 Eine elfte Datei hinzufügen, 4 Eine Zahl bis zur Quelle zurückverfolgen
1

Führen Sie dasselbe PDF zweimal mit derselben Eingabeaufforderung aus

Vergleichen Sie die Kopfzeile Zelle für Zelle. Wenn sich die Spaltennamen oder ihre Reihenfolge zwischen zwei Läufen mit derselben Datei unterscheiden, haben Sie keinen Spaltenvertrag, und keine nachgelagerte Formel wird Bestand haben.

2

Führen Sie zehn Dateien aus und zählen Sie die Zeilen

Ein Kontoauszug mit 63 Transaktionen sollte 63 Zeilen ergeben. Notieren Sie die erwartete Anzahl neben der tatsächlichen für jede Datei. Eine einzelne Datei, die 40 Zeilen zurückgibt, ist die Fehlerart, die sich nie von selbst ankündigt.

3

Fügen Sie eine elfte Datei mit einem anderen Layout hinzu

Verwenden Sie einen Kontoauszug einer anderen Bank oder eine Rechnung eines anderen Anbieters. Ein Tool, das nur bei identischen Layouts funktioniert, ist eine Demo, keine Pipeline, denn echte Dokumentensätze sind nie einheitlich.

4

Verfolgen Sie eine Zahl bis zu ihrer Seite zurück

Wählen Sie einen einzelnen extrahierten Wert und finden Sie heraus, woher er in der Quelle stammt. Wenn die Überprüfung bedeutet, jedes PDF von Hand erneut zu öffnen, hat die Extraktion weniger Zeit gespart, als das Vertrauen gekostet hat.

Wenn eine dieser Prüfungen fehlschlägt, ist das Tool für einen einmaligen Einsatz in Ordnung und für eine wiederholbare Aufgabe falsch. Diese Unterscheidung, nicht ein Urteil über die Marke, ist der Zweck des Tests.

Was ein Tool für den Batch-Betrieb braucht

Radialdiagramm mit dem Titel 'Was ein stabiles Tool braucht', zentrales Tabellen-Symbol mit Häkchen und drei umgebende Knoten: Benutzerdefinierte Spaltenextraktion, Batch-First-Verarbeitung und überprüfbare Zellen mit grünem Häkchen

Ein Tool, das diese Prüfungen besteht, ist zuerst auf den Ausgabe-Vertrag ausgerichtet, nicht auf das Dokument. Diese eine Designentscheidung bringt die meisten anderen Eigenschaften mit sich.

Die erste Anforderung ist, dass Sie die Ausgabespalten benennen und diese Namen exakt die Spaltenüberschriften des Ergebnisses werden. Das ist Benutzerdefinierte Spaltenextraktion: Statt das Modell entscheiden zu lassen, was es zurückgibt, geben Sie die gewünschten Felder ein, z. B. „Invoice Number", „Statement Date" und „Balance", und die KI findet jeden Wert danach, was er bedeutet, statt wo er steht. Der Spaltensatz gehört Ihnen und bleibt von einer Datei zur nächsten gleich.

Die zweite Anforderung ist, dass das Tool den Ordner verarbeitet statt die Datei. Batch-First-Verarbeitung bedeutet, dass fünfzig Dokumente hineingehen und eine Tabelle herauskommt, statt fünfzig einzelner Unterhaltungen, die Sie danach zusammenfügen. Es ist der Unterschied zwischen fünfzigmal eine Frage zu stellen und einmal einen Auftrag auszuführen – und genau hier sind allgemeine Assistenten strukturell am schwächsten.

Zwei kleinere Anforderungen folgen. Die Kopfzeile sollte bei jedem Durchlauf mit demselben Spaltensatz identisch sein, und Sie sollten auf jede extrahierte Zelle zeigen und den Quellbereich sehen können, aus dem sie stammt, denn ein Wert, den Sie nicht überprüfen können, ist ein Wert, den Sie von Hand nachprüfen. Ein Tool, dem eines von beiden fehlt, spart den Prüfschritt nicht ein – es verschiebt ihn nur.

ImageToTable.ai basiert auf diesen beiden zentralen Bausteinen, Benutzerdefinierte Spaltenextraktion und Batch-Verarbeitung: Sie laden die Dokumente hoch, geben die gewünschten Spaltennamen ein und erhalten eine Tabelle, in der diese Namen die Überschriften sind. Das Produkt gibt eine Genauigkeit von bis zu 99% bei gedruckten Tabellendaten an, wobei eine einzelne Seite in 5 bis 10 Sekunden verarbeitet wird, gegenüber den rund 3 Minuten, die eine Person für dieselbe Seite per Hand benötigt. Derselbe Ansatz wird im Vergleich der Datenextraktionssoftware gegen das breitere Feld positioniert – dort lohnt sich der Blick, wenn die Entscheidung zwischen Anbietern statt zwischen Kategorien fällt.

JPG/PNG/PDF AI Extraction

Dateien werden sicher verarbeitet und nicht gespeichert.

Der Unterschied zwischen dem Beschreiben eines Dokuments und dem Extrahieren eines festen Satzes von Feldern daraus ist nicht nur ein Produktmerkmal. Er verändert, was Sie auf Basis der Ausgabe aufbauen können – und genau das ist das Argument dafür, warum allgemeine Assistenten bei derselben Aufgabe mit Screenshots an ihre Grenzen stoßen.

Wann Copilot, ChatGPT oder Claude die richtige Wahl ist

Copilot ist das richtige Werkzeug für einmalige Arbeiten an Daten, die bereits in einer Arbeitsmappe vorliegen, und das falsche Werkzeug für eine wiederkehrende Stapelverarbeitung, bei der die Spalten übereinstimmen müssen.

Verwenden Sie es, wenn die Quelle eine einzelne saubere Datei ist, wenn Sie einen bereits vorhandenen Datensatz erkunden oder wenn Sie eine Formelerklärung oder eine Zusammenfassung einer Textspalte benötigen. ChatGPT ist in denselben Situationen eine vernünftige Wahl und konvertiert möglicherweise ein übersichtliches PDF beim ersten Versuch korrekt. Ein einzelner Erfolg ist ein Datenpunkt über eine Datei, keine Garantie für den gesamten Ordner.

Übergeben Sie die Arbeit einem dedizierten Extraktionstool, wenn der Vorgang sich wiederholt, wenn Dateien aus mehreren Quellen eintreffen, wenn die Ausgabe in Berichte oder Zahlungen einfließt und wenn eine falsche Zelle Kosten verursacht. Die Grenze zwischen Transkription und Extraktion trennt die beiden Kategorien – und es lohnt sich, den vollständigen Artikel zur Extraktion handschriftlicher Dokumente zu lesen, wo dieselbe Unterscheidung darüber entscheidet, ob einer Zahl überhaupt vertraut werden kann. Nichts davon macht einen allgemeinen Assistenten zu einem schlechten Produkt. Es macht ihn zum falschen Produkt für eine Aufgabe, die von Wiederholung und Konsistenz geprägt ist.

Excel Copilot und PDF zu Excel: Häufig gestellte Fragen

Warum sagt Copilot in Excel, dass es mein PDF nicht lesen kann?

Copilot in Excel arbeitet mit Daten innerhalb der Arbeitsmappe. Ein PDF in einem Ordner gehört nicht zu seinem Kontext, es sei denn, Sie fügen es in einer unterstützten Oberfläche hinzu – und selbst dann wird es als Dokument verarbeitet und nicht als Tabelle geladen. Wenn das PDF ein Scan ohne Textebene ist, gibt es für einen textbasierten Schritt nichts zu lesen.

Ist ChatGPT besser als Copilot für PDF zu Excel?

Für eine einmalige ChatGPT-PDF-zu-Excel-Konvertierung einer einzelnen sauberen Datei ist es manchmal besser, und der r/excel-Thread enthält jemanden, der genau diese Erfahrung gemacht hat. Beide sind allgemeine Assistenten, und keiner garantiert, dass beim nächsten Durchlauf dieselben Spaltennamen zurückkommen. Entscheiden Sie zwischen ihnen anhand des Workflows, den Sie benötigen, und nicht danach, welcher zufällig einmal erfolgreich war.

Kann Copilot in Excel überhaupt ein PDF in eine Tabelle konvertieren?

Microsofts eigener Leitfaden sagt, dass es das kann, und für eine gut formatierte Datei ist das eine faire Beschreibung. Die Einschränkung zeigt sich bei Umfang und bei unübersichtlichen Eingaben: mehrere Dateien in einem Durchgang, inkonsistente Layouts und gescannte Seiten. Die Konvertierung, die in einer Demo funktioniert, ist nicht dasselbe wie ein Prozess, den Sie nächsten Monat erneut ausführen können.

Warum ändern sich die Spaltenüberschriften zwischen den Durchläufen?

Weil ein Konversationsmodell jedes Mal eine Antwort generiert, anstatt ein festes Schema zu befüllen. Die Form der Ausgabe ist Teil dessen, was das Modell entscheidet, sodass sie sich je nach Datei, Formulierung oder auch ohne besonderen Grund ändern kann. Nur ein definierter Spaltensatz legt die Überschriften fest.

Worauf sollte ich bei einem PDF-zu-Excel-Tool achten?

Fünf Dinge: Sie definieren die Ausgabespalten, es verarbeitet viele Dateien in einem Durchlauf, die Überschriften sind über alle Durchläufe identisch, extrahierte Werte lassen sich auf die Quellseite zurückführen, und es verarbeitet gescannte Dokumente statt nur Dateien mit einer Textebene.

Ist das ein Prompt-Problem?

Meistens nicht. Ein besserer Prompt kann ein einzelnes Ergebnis verbessern, und es ist einen Versuch wert. Er schafft jedoch keinen festen Spaltenvertrag über fünfzig Dateien hinweg und erhöht auch nicht die Obergrenze für die Dateigröße oder die Anzahl der Dateien in einem Durchgang. Das sind strukturelle Grenzen, keine Formulierungsprobleme.

Der nützliche Perspektivwechsel ist, nicht zu fragen „welche KI ist schlauer", sondern „welche Form hat diese Aufgabe". Copilot, ChatGPT und Claude sind darauf ausgelegt, über Daten nachzudenken, die Sie bereits haben. Ein Ordner mit PDFs sind Daten, die Sie noch nicht haben, und die Arbeit, sie in eine Tabelle zu verwandeln, ist durch Wiederholung, feste Spalten und Verifizierung definiert – nicht durch Cleverness. Entscheiden Sie zuerst, welche der beiden Aufgaben Sie erledigen, und die Tool-Wahl hört auf, eine Frage der Meinung zu sein.

📮 contact email: [email protected]