PDF-Import teilt Excel in Blätter auf.So erhalten Sie eine Tabelle

Der PDF-Import von Excel schlägt nicht laut fehl. Er formt Ihre Datei in etwas um, das wie geparst aussieht und es nicht ist. Im r/excel-Thread zur Frage, welche Funktion Nutzer Excel hinzufügen würden, nennt ein Top-Kommentar genau das Symptom: Daten aus PDFs importieren, „ohne ... jede Seite auf ein separates Arbeitsblatt zu verschmieren." Führen Sie Daten > Daten abrufen > Aus Datei > Aus PDF bei einem mehrseitigen Kontoauszug aus, erhalten Sie eine Abfrage pro Seite, nach der ersten Seite einen neuen Satz Spaltenüberschriften Column1 und Column2 sowie Zeilen, die am Seitenumbruch abgeschnitten sind. Sie wollten eine Tabelle. Excel lieferte einen Stapel Fragmente.

Schluss mit Abtippen — lassen Sie KI Ihre Dokumente lesen
Bild oder PDF hochladen — strukturierte Daten in 10 Sekunden
Jetzt testen →
Ein zentrales Symbol einer Lupe über einem Dokument, mit drei ausstrahlenden Knoten: Mehrseitiges PDF, Eine durchgehende Tabelle und Seitenweises Lesen, auf einem sauberen Verlaufs-hintergrund mit handgezeichneten Linienverzierungen.

Die wichtigsten Erkenntnisse

  1. Ihr fünfseitiger Kontoauszug ist nicht beschädigt: Das PDF enthielt nie eine einzelne Tabelle, daher meldet Power Query eine Tabelle pro Seite.
  2. Nur das erste Fragment behält die echten Titel, daher fallen Seiten 2 und 3 auf Column1, Column2 und Column3 zurück und Append Queries weigert sich, sie auszurichten.
  3. Hören Sie auf, Seite für Seite zu lesen, und benennen Sie die gewünschten Spalten – dann liest ImageToTable.ai das Dokument als einen Datensatz und vierzig Kontoauszüge landen als vierzig Zeilen.

Was Sie bei einem mehrseitigen PDF-Import tatsächlich erhalten

Ein Vergleich in zwei Spalten: links ein Stapel Dokumente mit der Beschriftung 'Was Sie erhalten' und 'Mehrere Blätter, eines pro Seite' in Rot, rechts eine saubere Tabelle mit der Beschriftung 'Was Sie möchten' und 'Eine durchgehende Tabelle' in Grün, auf einem Verlaufshintergrund mit Linienverzierungen.

Der Import erzeugt fast nie einen Fehler. Er liefert die falsche Struktur, und jedes spätere Symptom folgt aus dieser Struktur. Wenn Power Query eine Verbindung zu Ihrer Datei herstellt, listet das Navigator-Fenster zwei verschiedene Arten von Objekten auf: einzelne Tabellen oben und ganze Seiten unten. Aktivieren Sie mehr als eines, und Power Query erstellt für jedes Element eine separate Abfrage. Wählen Sie Laden, und Excel schreibt jede Abfrage in ein eigenes Blatt – so wird aus einem fünfseitigen Kontoauszug mehrere Arbeitsblätter, und die gewünschte Tabelle ist nun über alle verteilt.

Daher kommt „ein PDF wurde zu mehreren Blättern". Es ist kein Schaden an Ihrer Datei. Es ist der Connector, der meldet, was er zu finden glaubt – Seite für Seite. Die Zeilen und Spalten wirken erst danach kaputt, weil jedes dieser Seiten-Arbeitsblätter einzeln gelesen und mit eigenen Spaltennamen versehen wurde.

Ein mehrseitiges PDF kommt nicht als eine beschädigte Tabelle an. Es kommt als mehrere kleine Tabellen an, die nie verbunden wurden – deshalb behebt keine noch so große Neuformatierung das Problem.

Warum Power Query eine Tabelle pro Seite sieht

Ein zentrales Zahnrad-Symbol für Pdf.Tables mit drei abgehenden Knoten: Festes-Layout-Format, MultiPageTables Standard: True und Layoutverschiebung erkannt (gelb), auf einem Verlaufshintergrund mit Linienverzierungen.

Power Query liest Ihr PDF nicht falsch. Das PDF-Format enthält keine Tabelle, die es lesen könnte. PDF wurde als festes Layout spezifiziert, standardisiert als ISO 32000, wobei jede Seite eine Leinwand aus Text und Grafiken ist, die an Koordinaten gebunden sind. Die Idee, dass diese Koordinaten eine dreispaltige Tabelle mit einer Kopfzeile bilden, ist eine Interpretation – und das Format trägt diese Interpretation nur, wenn die Datei ein getaggtes PDF mit logischer Struktur ist (ISO 32000, Abschnitt 14.8). Die meisten PDFs, die aus Buchhaltungs- und Banksystemen exportiert werden, sind nicht getaggt.

Der Connector von Microsoft muss also raten, und dieses Raten steckt in einer einzigen Funktion. Pdf.Tables ist die Engine hinter Daten abrufen > Aus PDF. Sie gibt eine Tabelle mit drei Spalten zurück – Name, Art und Daten – und Art ist entweder Tabelle oder Seite. Eine ihrer Optionen bestimmt, wie aggressiv geraten wird: MultiPageTables, das in Microsofts Pdf.Tables-Referenz als Steuerung dafür beschrieben wird, „ob ähnliche Tabellen auf aufeinanderfolgenden Seiten automatisch zu einer einzigen Tabelle zusammengefasst werden". Sein Standardwert ist true.

Diese Standardeinstellung erklärt das Aufteilungsverhalten präzise. Wenn aufeinanderfolgende Seiten dieselbe Struktur aufweisen, behandelt der Detektor sie als eine Tabelle und kombiniert sie. Wenn sich das Layout von Seite zu Seite ändert – ein wiederholter Kopfzeilenbereich, eine unterschiedliche Spaltenanzahl, ein Zusammenfassungsblock, der nur auf einer Seite erscheint – erkennt der Detektor unterschiedliche Tabellen und meldet eine pro Seite. Je stärker die seitenbezogene Ausstattung Ihres Dokuments ist, desto wahrscheinlicher erhalten Sie Fragmente.

Dies ist der Teil, den die meisten Tutorials überspringen. Sie sagen Ihnen, Sie sollen Append klicken und weitermachen, ohne zu erklären, dass die Datei selbst nie eine einzelne Tabelle enthielt, sodass der Connector nichts zusammenzuhalten hatte. Das vollständige Bild dessen, was ein PDF enthalten kann und was nicht, ist es wert, verstanden zu werden, bevor Sie dem Export die Schuld geben; siehe wie PDFs zu strukturierten Daten werden für die umfassendere Version dieser Geschichte.

Warum die Kopfzeilen auf Seite 2 zu Datenzeilen werden

Ein Vergleich mit zwei Spalten: links ein Dokument mit einem Aufwärtspfeil mit der Beschriftung 'Seite 1' und 'Kopfzeilen: Datum, Beschreibung, Betrag' in Grün, rechts ein Dokument mit einem Fragezeichen mit der Beschriftung 'Seite 2' und 'Kopfzeilen: Column1, Column2, Column3' in Rot, auf einem Verlaufshintergrund mit Linienverzierungen.

Die Spaltentitel existieren nur einmal, im ersten Fragment. Nach dieser Seite sind dieselben Wörter nur noch Zellwerte. Ein Benutzer auf Microsoft Q&A beschreibt den genauen Fehler, den dies erzeugt: Eine PDF-Tabelle über drei Seiten wird „als drei separate Tabellen identifiziert", und „nur die erste Tabelle enthält die ursprünglichen Spaltentitel, während die anderen beiden Tabellen Column1, Column2 usw. anzeigen." Da die Spaltennamen nicht mehr übereinstimmen, können die Tabellen ohne Bearbeitung nicht angehängt werden. Sie können den vollständigen Thread im Microsoft Q&A-Beitrag lesen.

Der Mechanismus ist klar, sobald Sie die Form der Ausgabe sehen. Jede seitenbezogene Tabelle wird unabhängig erkannt, sodass jede ihren eigenen Kopfzeilen-Promotionsschritt erhält. Auf Seite eins wandelt „Erste Zeile als Kopfzeilen verwenden" Datum, Beschreibung und Betrag korrekt in Spaltennamen um. Auf Seite zwei gibt es keine Kopfzeile zu promoten, da die wiederholten Titel einfach die erste Datenzeile sind. Power Query fällt auf Column1, Column2 und Column3 zurück. Append Queries, das Tabellen durch Abgleich der Spaltennamen stapelt, weigert sich dann, sie auszurichten.

Wo Zeilen am Seitenumbruch in der Mitte geteilt werden

Seitenumbrüche landen dort, wo das Papier endete, sodass eine umbrochene Beschreibung oder eine mehrzeilige Zelle als zwei Zeilen ankommen kann. Die eigene PDF-Connector-Dokumentation von Microsoft listet dies als bekannte Einschränkung unter „Handling multi-line rows" und verweist auf Table.FillDown, um falsch ausgerichtete Werte in die Zeile darüber zu kopieren, oder auf Table.Group, um benachbarte Zeilen zu kombinieren. Keines davon läuft automatisch. Auf derselben Seite wird erwähnt, dass EnforceBorderLines steuert, „ob Rahmenlinien immer als Zellengrenzen erzwungen werden", und standardmäßig auf false gesetzt ist, sodass eine Tabelle ohne vollständige Linien mit falschen Zellkanten geparst werden kann.

Zwei Fehlermodi verstärken sich nun gegenseitig. Ein Datensatz, der über einen Seitenumbruch geteilt wird, wird zu zwei Zeilen, und das Kopfzeilenproblem aus dem vorherigen Abschnitt bedeutet, dass Sie es möglicherweise nicht einmal bemerken, weil die zweite Zeile oft die Bezeichnung verliert, die sie identifizieren würde. Zusammengeführte oder lose Zellränder verschlimmern die Spaltenzuordnung – ein separates Extraktionsproblem, das unter warum zusammengeführte Zellen die Tabellenextraktion stören behandelt wird.

Behebung in Excel: Append Queries und der Kopfzeilen-Tanz

Die Reparatur läuft in Excel ab und umfasst vier Schritte, die Sie für jede Datei mit anderem Layout wiederholen. Es funktioniert, und es ist manuell. Der Trick besteht darin, jedes Fragment gleich aussehen zu lassen, bevor Sie sie stapeln, und dann am Ende die echten Kopfzeilen wiederherzustellen.

1

Fragmente auswählen

Aktivieren Sie im Navigator Select multiple items und wählen Sie die benötigten Tabellen aus. Wenn die Liste unübersichtlich ist, können Sie stattdessen die gesamte Datei laden und die Abfrage nach Kind filtern, um nur Table-Zeilen zu behalten.

2

Kopfzeilen der ersten Tabelle herabstufen

Verwenden Sie beim ersten Fragment Transform > Use Headers as First Row. Die echten Spaltentitel wandern in die Daten, und die Tabelle verwendet nun wie die folgenden Seiten Column1, Column2 und Column3.

3

Die restlichen anhängen

Verwenden Sie Home > Append Queries > Append as New und fügen Sie jedes verbleibende Fragment hinzu. Da alle nun dieselben Platzhalternamen verwenden, richten sich die Spalten aus, ohne jede einzelne von Hand umzubenennen.

4

Kopfzeilen wiederherstellen

Klicken Sie in der kombinierten Abfrage auf Use First Row as Headers. Die ursprünglichen Titel kehren als oberste Zeile zurück, und die gestapelten Seiten werden zu einer durchgehenden Tabelle.

Zwei Einschränkungen halten das ehrlich. Die Schritte werden in der Abfrage gespeichert, sodass das Aktualisieren derselben Datei günstig ist, aber ein Kontoauszug, dessen Layout sich nächsten Monat ändert, kann die Erkennung erneut brechen und Sie dazu zwingen, die Kopfzeilen-Wiederherstellung zu wiederholen. Und wenn das PDF ein Scan ohne Textebene ist, gibt es nichts zu strukturieren, da der Connector keine OCR ausführt. Dieser Fall gehört stattdessen zu OCR eines gescannten PDFs in Excel.

Schluss mit Abtippen — lassen Sie KI Ihre Dokumente lesen
Bild oder PDF hochladen — strukturierte Daten in 10 Sekunden
Jetzt testen →

Ein Weg, der das PDF nie als Seiten modelliert

Das Ergebnis „ein Blatt pro Seite“ ist ein Symptom seitenorientierten Lesens. Die Alternative besteht darin, nicht mehr Seite für Seite zu lesen. Wenn das Ziel eine Tabelle und nicht eine Kopie der Seite ist, können Sie die Ausgabe zuerst definieren und das Dokument als Arbeitseinheit betrachten. Das ist der Unterschied zwischen seitenweisem Lesen und dokumentenweitem Verständnis – und genau hier beginnt sich ein Extraktionstool von einem Seiten-Importeur zu unterscheiden.

Mit der Benutzerdefinierten Spaltenextraktion geben Sie die gewünschten Spaltennamen ein, z. B. Rechnungsnummer, Belegdatum und Betrag. Diese Namen werden zu den Kopfzeilen der fertigen Tabelle. Das Tool liest das Dokument, um jeden Wert zu finden, statt eine feste Position zu lesen. Ein Kopfzeilenband, das sich oben auf jeder Seite wiederholt, wird daher als Seitenausstattung behandelt und nicht als Datenzeile. Die Ausgabe ist eine Zeile pro Datensatz, nicht ein Arbeitsblatt pro Seite. Da die Einheit das Dokument ist, gibt es keine zweite Seite, deren Spaltennamen aus der Ausrichtung mit der ersten Seite geraten könnten.

Für einen Ordner statt einer einzelnen Datei gilt dasselbe Prinzip im Batch. Batch-First-Verarbeitung bedeutet, dass Sie viele PDFs auf einmal ablegen und diese zu einer einzigen Tabelle mit denselben Kopfzeilen zusammengeführt werden. So werden vierzig monatliche Kontoauszüge zu vierzig Zeilen in einer Tabelle statt zu vierzig Blättern, die Sie von Hand zusammenstellen müssen. Wie das ohne Abfrage-Editor funktioniert, wird unter Batch-Verarbeitung von Dokumenten ohne Code erklärt. Wenn Sie die Ausgabestruktur vorab an Ihrer eigenen Datei prüfen möchten, läuft die eingebettete Demo unten mit einer Beispieldatei.

PDF/JPG/PNG KI-Extraktion

Dateien werden sicher verarbeitet und nicht gespeichert.

Wenn jede Seite eigentlich ein eigenes Dokument ist

Eine durchgehende Tabelle ist nur dann die richtige Antwort, wenn die Seiten zum selben Datensatz gehören. Manchmal tun sie das nicht. Ein PDF kann eine Reihe unzusammenhängender einseitiger Dokumente sein, ein anderes Kundenkonto pro Seite, ein Scan von Dutzenden separater Rechnungen – in diesem Fall würde das Zusammenführen in eine einzige Sammeltabelle Datensätze vermischen, die getrennt bleiben sollten. Der richtige Schritt ist kein besserer Import; es ist eine Gruppierungsregel.

Genau dafür gibt es Mehrseiten-Zusammenführung. Es ist eine Vorlageneinstellung, die bestimmt, welche extrahierten Ergebnisse zum selben logischen Dokument gehören, und Sie konfigurieren, wie gruppiert wird: eine neue Gruppe starten, wenn sich der Wert einer verfolgten Spalte ändert, Zeilen abgleichen, die eine Referenznummer über den gesamten Batch teilen, oder eine feste Anzahl von Uploads gruppieren. Wenn dasselbe Feld auf mehreren Seiten einer Gruppe erscheint, legen Sie fest, wie die Überschneidung aufgelöst wird: ersten Wert behalten, letzten Wert behalten, verketten oder in separate Zeilen aufteilen. Wichtig ist die Richtung der Kontrolle. Das Tool errät nicht stillschweigend, welche Seiten zusammengehören; Sie liefern die Regel, und es wendet diese Regel konsistent an.

Die Genauigkeit auf den Seiten, die tatsächlich zusammengehören, verdient dennoch eine Prüfung – genau das bietet der Überprüfungsmodus mit Bbox-gestützter Verifizierung. Fahren Sie mit der Maus über eine extrahierte Zelle oder klicken Sie sie an, und das Originalbild hebt hervor, woher dieser Wert stammt. Umgekehrt funktioniert es auch: Klicken Sie auf einen Bereich im Dokument, und es springt zurück zur passenden Zelle. Sie können die Hervorhebung bei Bedarf für eine einzelne Datei auslösen oder so einstellen, dass sie nach der Verarbeitung automatisch läuft. Bei Kontoauszügen, bei denen eine einzige falsch gelesene Ziffer zählt, ist diese visuelle Gegenprüfung schneller als das erneute Lesen der Seite.

FAQ

Fügt der Excel-Import „Aus PDF“ eine mehrseitige Tabelle jemals automatisch auf einem Blatt zusammen?

Manchmal. Wenn aufeinanderfolgende Seiten dieselbe Tabellenstruktur aufweisen, kombiniert die Option MultiPageTables, die standardmäßig aktiviert ist, sie zu einer einzigen Tabelle. Wenn sich das Layout von Seite zu Seite ändert, werden sie als separate Tabellen erkannt und landen in separaten Arbeitsblättern. Es gibt keine Einstellung, die beliebige Seiten in eine Tabelle zwingt.

Warum zeigen Seite 2 und 3 Spalte1 und Spalte2 statt meiner Kopfzeilen?

Die Tabelle jeder Seite wird separat erkannt, daher wird die Kopfzeilen-Promotion, die Sie auf Seite 1 angewendet haben, nicht übernommen. Nur das erste Fragment hat eine echte Kopfzeile; spätere Fragmente verwenden Platzhalternamen, weshalb Append Queries auch fehlschlägt, bis die Namen übereinstimmen.

Kann Google Sheets ein mehrseitiges PDF als eine Tabelle importieren?

Google Sheets hat keinen nativen Connector, der Tabellen in einem PDF so erkennt wie Power Query. Der übliche Workaround besteht darin, das PDF in ein Zwischenformat zu konvertieren und dieses zu importieren, oder ein spezielles Extraktionstool zu verwenden, das direkt eine Tabelle zurückgibt. Beides vermeidet einzelne Seitenblätter, aber nur der Extraktionsweg erspart Ihnen die Bereinigung.

Was, wenn mein PDF ein Scan ohne Textebene ist?

Der PDF-Connector von Power Query führt keine OCR durch, daher hat ein reiner Bildscan keinen Text, den er strukturieren könnte. Sie benötigen zuerst einen OCR-Schritt oder ein Tool, das das Bild direkt liest. Die Abwägungen sind in der Anleitung für gescannte PDFs zu Excel beschrieben.

Gibt es eine Ein-Klick-Einstellung, um die Aufteilung der Blätter zu stoppen?

Nein. Das Verhalten ergibt sich daraus, wie ein PDF Inhalte speichert, nicht aus einer Checkbox. Die nächsten integrierten Stellschrauben sind MultiPageTables für Strukturen, die zufällig passen, sowie Append Queries und Kopfzeilen-Schritte für alles andere. Wenn die Dateien sehr groß sind, erzeugen riesige PDFs ihre eigenen Probleme, bevor die Seitenaufteilung überhaupt relevant wird. Und falls Sie gehofft haben, dass Copilot die Bereinigung übernimmt, hat diese Erwartung ihre eigenen Gründe, die in warum Copilot bei PDF zu Excel scheitert behandelt werden.

Kann ich das PDF einfach in Excel konvertieren, statt es zu importieren?

Das können Sie, und es ist eine vernünftige Wahl, wenn das Dokument eine einzelne saubere Tabelle ist und Sie die Zahlen nur einmal benötigen. Wenn die Eingabe ein Ordner mit unterschiedlich formatierten Dokumenten ist und die Ausgabe konsistente Spalten behalten muss, ist eine spaltenbasierte PDF-zu-Excel-Konvertierung der stabilere Weg, weil die Kopfzeilen von Ihnen definiert statt pro Seite erkannt werden.

Das Ergebnis „eine Seite pro Blatt" ist kein Fehler in Ihrer Datei. Es passiert, wenn ein seitenorientierter Reader gebeten wird, eine datensatzorientierte Tabelle zu rekonstruieren, und die Lösung besteht darin, die Fragmente bewusst zu verbinden oder die Tabelle zu definieren, bevor etwas gelesen wird.

Sobald Sie die Aufteilung als Modellierungsentscheidung statt als Schaden sehen, wird die Entscheidung einfacher. Wenn Sie wenige Dateien und Zeit für die Pflege einer Abfrage haben, reicht die Append-und-Promote-Sequenz in Excel. Wenn die Tabelle der Kernpunkt ist und die Seiten nur Verpackung, benennen Sie die benötigten Spalten und lassen Sie das Dokument die Arbeitseinheit sein. Sie können das an Ihrem eigenen Kontoauszug testen, ohne etwas einzurichten, und sehen, ob Ihr nächstes mehrseitiges PDF als eine Tabelle oder als ein Stapel Blätter landet.

Schluss mit Abtippen — lassen Sie KI Ihre Dokumente lesen
Bild oder PDF hochladen — strukturierte Daten in 10 Sekunden
Jetzt testen →
📮 contact email: [email protected]