So OCR-en Sie ein gescanntes PDF in Excel:Eine vollständige Schritt-für-Schritt-Anleitung

Nach dieser Anleitung haben Sie aus einem gescannten PDF eine saubere Excel-Datei – nicht verstreuten Text in Zellen, sondern strukturierte Daten, bei denen jede Spalte die richtigen Werte enthält. Der Unterschied zwischen diesen beiden Ergebnissen liegt nicht nur in der Wahl des Tools. Es geht darum, zu wissen, mit welcher Art von PDF Sie arbeiten, die richtige Extraktionsmethode dafür zu wählen und genau zu verstehen, welche Nachbearbeitung die Ausgabe benötigt, bevor sie verwendbar ist. Wenn Sie nicht ganz sicher sind, was OCR ist oder wie es funktioniert, behandeln unsere Artikel über was OCR ist und wie OCR tatsächlich funktioniert die Grundlagen. Diese Anleitung geht davon aus, dass Sie bereit sind, mit der Konvertierung zu beginnen.

Schluss mit Abtippen — lassen Sie KI Ihre Dokumente lesen
Bild oder PDF hochladen — strukturierte Daten in 10 Sekunden
Jetzt testen →
Blog-Titelbild mit dem Titel So OCR-en Sie ein gescanntes PDF in Excel, das drei Symbole zeigt: prüfen, ob Text auswählbar ist, Spalten benennen und 10 % der Zeilen stichprobenartig prüfen.

Wichtige Erkenntnisse

  1. Wenn Ihre PDF-zu-Excel-Konvertierung jemals nichts ergeben hat, haben Sie wahrscheinlich ein Tool für native PDFs auf eine gescannte Datei angewendet – zwei grundlegend verschiedene Probleme, die als ein Dateiformat getarnt sind.
  2. Traditionelle OCR liest Zeichen, weiß aber nicht, dass 1.250 $ der Rechnungsbetrag ist und nicht eine Position oder eine Seitennummer – und genau in dieser Lücke steckt die gesamte manuelle Tabellenarbeit.
  3. Kein Tool liefert perfektes Excel aus einem gescannten PDF – der ehrliche Maßstab ist: unter 5 % der Zellen benötigen Korrekturen bei KI-Extraktion gegenüber über 50 % bei einfacher OCR, und genau dieser Unterschied entscheidet, ob sich der Prozess lohnt.

Bevor Sie beginnen – Warum Ihr PDF-Typ alles entscheidet

Der häufigste Grund, warum „PDF zu Excel“ scheitert, liegt nicht am Tool. Sondern daran, dass die Person, die die Datei konvertieren möchte, nicht erkennt, dass nicht alle PDFs gleich sind. Es gibt zwei grundlegend verschiedene PDF-Typen, die völlig unterschiedliche Konvertierungsmethoden erfordern:

MerkmalNatürliches (digitales) PDFGescanntes (Bild-)PDF
ErstellungGespeichert aus Word, Excel oder BuchhaltungssoftwareGedruckt und dann gescannt oder als Bild gespeichert
Enthält Text?Ja – auswählbarer, durchsuchbarer TextNein – nur ein Foto der Seite
Text kopierbar?Ja – Text markieren und Strg+CNein – Auswahl ergibt ein Feld, keine Wörter
Dateigröße (typisch)50–200 KB pro Seite500–2.000 KB pro Seite
Beste KonvertierungsmethodeDirekter Parser (keine OCR nötig)OCR oder KI-Extraktion

Wenn Sie ein Tool, das nur natürliche PDFs verarbeitet, auf ein gescanntes Dokument anwenden – oder schlimmer noch, versuchen, aus einer gescannten Datei zu kopieren und einzufügen – erhalten Sie nichts und gehen davon aus, dass das Tool defekt ist. In Wirklichkeit haben Sie den Diagnoseschritt übersprungen. Der Rest dieser Anleitung führt Sie durch einen Prozess, der unabhängig davon funktioniert, welchen PDF-Typ Sie haben.

Schritt 1 — Prüfen Sie Ihre PDF: gescannt oder nativ?

Vergleichskarte nebeneinander: ein natives PDF, dessen Text sich markieren und kopieren lässt, bei 50–200 KB pro Seite, gegenüber einem gescannten PDF, bei dem die Auswahl ein Kästchen statt Wörter ergibt, bei 500–2.000 KB pro Seite.
1

Versuchen Sie, Text mit der Maus zu markieren

Öffnen Sie die PDF und ziehen Sie den Cursor über eine Textzeile. Wenn der Text markiert wird (wie auf einer Webseite), haben Sie ein natives PDF. Wenn Sie nur ein rechteckiges Kästchen ziehen können, ist die PDF gescannt – was Sie sehen, ist ein Bild, kein Text.

2

Drücken Sie Strg+F und suchen Sie nach einem häufigen Wort

Suchen Sie nach „the", „Rechnung" oder einfach nur „a". Wenn die Suche Ergebnisse liefert, enthält die PDF auswählbaren Text. Wenn die Suche nichts findet, ist die PDF ein gescanntes Bild – es gibt keine Textebene.

3

Prüfen Sie die Dateigröße

Klicken Sie mit der rechten Maustaste auf die Datei und sehen Sie sich die Größe an. Eine 5-seitige native PDF mit Text ist in der Regel unter 300 KB. Eine 5-seitige gescannte PDF mit Bildern derselben Seiten ist 3–10 MB groß. Gescannte Dateien sind 10–50-mal größer, weil jede Seite ein komprimiertes Bild statt Textdaten ist.

Wenn sich herausstellt, dass Ihre PDF ein natives Text-PDF ist, können Sie sie in Excel direkt ohne OCR importieren. Gehen Sie in Excel (365 oder 2021+) zu Daten > Daten abrufen > Aus Datei > Aus PDF, wählen Sie Ihre Datei, die gewünschte Tabelle und klicken Sie auf Laden. Das funktioniert gut für textbasierte PDFs, die von Buchhaltungssystemen oder Textverarbeitungsprogrammen erstellt wurden.

Wenn Ihre PDF ein gescanntes Bild ist – und wenn Sie diesen Leitfaden lesen, ist sie es mit ziemlicher Sicherheit – benötigen Sie PDF-OCR (optische Zeichenerkennung) oder KI-gestützte Extraktion. Darum geht es im Rest dieses Leitfadens.

Schritt 2 — Wählen Sie Ihren Ansatz: Traditionelle OCR oder KI-Extraktion?

Sobald Sie bestätigt haben, dass Sie mit einem gescannten PDF arbeiten, stellt sich die Frage, welche Methode Sie verwenden möchten. Es gibt drei Hauptwege, und der richtige hängt davon ab, wie das Ergebnis aussehen soll.

Wenn Sie den Text nur in einem beliebigen Format benötigen — zum Lesen, Suchen oder Kopieren in ein Dokument — reicht ein kostenloses Online-OCR-Tool wie Google Drive OCR oder PDF24 aus. Diese Tools extrahieren die Wörter aus dem Bild und geben sie als Klartext oder als durchsuchbares PDF zurück.

Wenn Sie die Daten in strukturierten Spalten benötigen — Rechnungsnummern in einer Spalte, Beträge in einer anderen, Daten in einer dritten — benötigen Sie ein Extraktionstool, das die Dokumentstruktur versteht. Dies ist der entscheidende Unterschied zwischen OCR und KI-Extraktion. Der Scan-zu-Excel-Workflow mit benannten Spalten ist der kürzeste Weg zu diesem Ergebnis.

Traditionelle OCR liest Zeichen. Sie kann feststellen, dass die Zeichenfolge „1.250,00" auf einer Seite erscheint. Sie weiß jedoch nicht, ob diese Zeichenfolge die Rechnungssumme, ein Positionspreis oder eine Seitennummer ist. Ein KI-Extraktionstool versteht dagegen, was jedes Datenelement im Kontext bedeutet. Sie geben an, welche Spalten Sie möchten — „Rechnungsnummer", „Datum", „Gesamtbetrag" — und das Tool findet diese Werte auf allen Seiten.

Für einen detaillierten Vergleich kostenloser OCR-Tools in allen Kategorien, einschließlich Open-Source-Optionen wie Tesseract und kostenloser Stufen kommerzieller Plattformen, finden Sie in unserem Bestenliste kostenlose OCR-Software 2026 elf Optionen mit ehrlichen Genauigkeitsbewertungen und praktischen Grenzen.

Schneller Tool-Vergleich

MethodeAm besten geeignet fürAusgabequalitätEinrichtung
Adobe Acrobat OCRDurchsuchbare PDFs, Einzeldatei-BearbeitungGute Texterkennung, gemischte TabellenstrukturDesktop-App erforderlich (19,99 $/Monat)
Google Drive OCRSchnelle Textextraktion, mehrsprachigNur Text, Layout geht verlorenKostenlos, Google-Konto erforderlich
Tesseract + PythonEntwickler, die lokale Verarbeitung benötigenGuter Text, keine TabellenstrukturKommandozeile, technische Einrichtung
KI-ExtraktionStrukturierte Felder in Excel-SpaltenSaubere Tabellenausgabe, semantisches VerständnisWebbasiert, keine Installation

Schritt 3 — OCR des gescannten PDFs mit KI-Extraktion

Für diese Anleitung verwenden wir einen KI-Extraktionsansatz, da er die brauchbarsten Excel-Ausgaben aus gescannten PDFs erzeugt – insbesondere wenn das PDF strukturierte Daten wie Rechnungen, Bestellungen oder Kontoauszüge enthält. Der entscheidende Unterschied zur herkömmlichen OCR besteht darin, dass die KI das Dokument semantisch liest und nicht Zeichen für Zeichen. Sie erkennt nicht nur den Text „15. März 2026", sondern versteht, dass es sich dabei um ein Datum handelt, und platziert ihn in der Spalte „Datum".

Drei-Schritte-Flussdiagramm mit Pfeilen: gescanntes PDF hochladen (PDF, JPG oder PNG), Spalten wie Rechnungsnummer und Datum benennen, dann prüfen und nach Excel exportieren.

Sie können den Prozess hier direkt mit einem Beispieldokument ausprobieren. Die Demo unten ist für die Rechnungsextraktion vorkonfiguriert. Laden Sie ein gescanntes Rechnungs-PDF oder -Bild hoch und sehen Sie in Echtzeit, was die KI zurückgibt:

JPG/PNG/PDF KI-Extraktion

Dateien werden sicher verarbeitet und nicht gespeichert.

Der KI-Extraktions-Workflow

1

Laden Sie Ihr gescanntes PDF hoch

Ziehen Sie die Datei per Drag & Drop in den Upload-Bereich. Die meisten KI-Tools akzeptieren PDF, JPG und PNG. Eine gescannte Rechnung mit 2–5 Seiten benötigt etwa genauso viel Verarbeitungszeit wie eine einzelne Seite.

2

Definieren Sie Ihre Ausgabespalten

Geben Sie die Spaltennamen ein, die Sie in Ihrer Excel-Ausgabe wünschen – „Rechnungsnummer", „Datum", „Lieferantenname", „Gesamtbetrag", „Steuer". Die KI liest jede Seite und zieht passende Daten in diese Spalten. Sie können das Tool auch Spalten automatisch erkennen lassen, wenn Sie das bevorzugen.

3

Prüfen und exportieren

Das Tool verarbeitet alle Seiten und liefert die Daten in einer strukturierten Tabelle. Prüfen Sie die Ausgabe, nehmen Sie bei Bedarf kleine Korrekturen vor und exportieren Sie nach Excel. Der gesamte Vorgang dauert bei einer typischen Rechnung 5–10 Sekunden, verglichen mit etwa 3 Minuten pro Seite bei manueller Eingabe.

Verglichen mit herkömmlicher OCR hat dieser Ansatz einen entscheidenden Vorteil: Er erhält die Datentypen. Ihre Daten bleiben Daten, Ihre Zahlen bleiben Zahlen, und jedes Feld landet in seiner vorgesehenen Spalte. Herkömmliche OCR gibt alles als einen einzigen Textblock aus, den Sie anschließend manuell in Zellen aufteilen müssen.

Schritt 4 — Nach Excel exportieren

Sobald die KI Ihr gescanntes PDF verarbeitet hat, ist der Export nach Excel unkompliziert. Die meisten Extraktionstools bieten einen direkten Excel-Download (XLSX-Format) an. So unterscheiden sich die verschiedenen Ansätze:

MethodeExportpfadExcel-Bereitschaft
KI-ExtraktionstoolAuf „Nach Excel exportieren“ klicken oder XLSX herunterladenHoch — Daten in Spalten, Kopfzeilen erhalten, eine Zeile pro Dokument
Adobe Acrobat OCRWerkzeuge > PDF exportieren > Tabelle > ExcelMittel — Tabellen erkannt, aber Layoutverschiebungen häufig
Google Drive OCRIn Google Docs öffnen > kopieren > in Excel einfügenNiedrig — gesamte Formatierung verloren, Text läuft in eine Spalte
Online-OCR-DienstXLSX herunterladen (falls unterstützt)Variabel — Genauigkeit und Layout-Erhaltung unterscheiden sich je nach Dienst

Eines haben die meisten Exportmethoden gemeinsam: Die Ausgabe muss vor der tatsächlichen Nutzung noch einmal überprüft werden. Kein Tool – auch keine KI-Extraktion – liefert bei jedem gescannten Dokument zu 100 % perfekte Ergebnisse. Die Frage ist nicht, ob eine Nachbearbeitung nötig ist, sondern wie viel.

Schritt 5 — Nachbearbeitung (Ehrlicher Abschnitt)

Diesen Schritt überspringen die meisten Anleitungen. Hier ist die Realität: OCR-Ausgaben aus gescannten PDFs — selbst von guten Tools — müssen nachbearbeitet werden. Der Aufwand hängt von der Scanqualität, der Dokumentkomplexität und dem verwendeten Tool ab. Bei einem klaren, gut ausgerichteten Scan einer einfachen Rechnung, der mit KI-Extraktion verarbeitet wurde, müssen Sie möglicherweise weniger als 5 % der Zellen korrigieren. Bei einem Scan mit niedriger Auflösung einer dichten Bestellung, der mit einem einfachen OCR-Tool verarbeitet wurde, könnten Sie die Hälfte davon korrigieren müssen.

Zwei-mal-zwei-Checkliste mit vier OCR-Nachbearbeitungsproblemen und ihren Lösungen: als Text gespeicherte Zahlen, zusätzliche Leerzeichen und Zeilenumbrüche, zusammengeführte oder geteilte Zellen sowie inkonsistente Datumsformate.

Die häufigsten Probleme und wie Sie sie beheben:

1

Als Text gespeicherte Zahlen

Excel zeigt ein grünes Dreieck in der Ecke und Formeln werden nicht berechnet. Wählen Sie die Spalte aus, verwenden Sie Daten > Text in Spalten und klicken Sie auf Fertig stellen. Oder multiplizieren Sie alle Zellen mit 1 mithilfe einer Hilfsspalte: Geben Sie =A1*1 ein und kopieren Sie die Formel nach unten.

2

Zusätzliche Leerzeichen und Zeilenumbrüche

OCR fügt oft Leerzeichen zwischen Zeichen ein oder übernimmt unnötige Zeilenumbrüche aus dem Scan. Verwenden Sie =TRIM(A1), um zusätzliche Leerzeichen zu entfernen, und =CLEAN(A1), um nicht druckbare Zeichen zu entfernen. Kopieren Sie die bereinigte Spalte und fügen Sie sie als Werte über die Originaldaten ein.

3

Zusammengeführte oder geteilte Zellen durch falsche Tabellenerkennung

Wenn die Daten einer Zeile auf mehrere Zeilen verteilt wurden oder Spalten falsch ausgerichtet sind, prüfen Sie, ob der ursprüngliche Scan beschnitten oder schief war. Mit Text in Spalten in Excel (getrennt durch Komma, Leerzeichen oder ein benutzerdefiniertes Zeichen) können Sie Daten trennen, die in der falschen Zelle gelandet sind.

4

Inkonsistente Datumsformate

Eine Spalte kann „03/15/2026", „15. März 2026" und „15.03.26" aus verschiedenen Seiten enthalten. Verwenden Sie die DATEVALUE-Funktion von Excel oder wenden Sie ein einheitliches Datumsformat auf die gesamte Spalte an: Rechtsklick > Zellen formatieren > Datum > wählen Sie Ihr bevorzugtes Format.

Der Nachbearbeitungsaufwand ist direkt proportional dazu, wie viel Struktur Sie benötigen. Wenn Sie nur eine Spalte mit Gesamtbeträgen aus 50 Rechnungen benötigen, dauert eine schnelle Prüfung auf offensichtliche Fehler 5 Minuten. Wenn jede Position aus jeder Rechnung perfekt in eine standardisierte Vorlage passen muss, planen Sie 15–30 Minuten pro Stapel ein, bis Sie Vertrauen in das Ausgabemuster Ihres Tools haben.

Häufige Probleme beheben

"Excel's Get Data > From PDF found no tables"

Das passiert, wenn das PDF gescannt ist. Der native PDF-Import von Excel funktioniert nur mit digitalen PDFs, die eine auswählbare Textebene haben. Gehen Sie zurück zu Schritt 1, um Ihren PDF-Typ zu bestätigen, und verwenden Sie stattdessen ein OCR- oder KI-Extraktionstool.

"Der Ausgabetext enthält zufällige Zeichen (O statt 0, l statt 1)"

OCR-Zeichenverwechslungen sind bei Scans mit niedriger Auflösung häufig. Verwenden Sie in Excel Suchen und Ersetzen für bekannte Fehlermuster. Wenn Sie regelmäßig ähnliche Dokumente verarbeiten, notieren Sie die häufigen Fehler – die meisten KI-Extraktionstools verbessern sich durch Feedback, und Sie können für wiederkehrende Muster ein Bereinigungsmakro erstellen.

"Das PDF ist in einer anderen Sprache als Englisch"

Prüfen Sie, ob Ihr OCR- oder KI-Tool die Sprache unterstützt. Die meisten Tools sind standardmäßig auf Englisch eingestellt und liefern bei nicht-lateinischen Schriften fehlerhafte Ausgaben. Die Google-Drive-OCR verarbeitet über 200 Sprachen recht gut. KI-Extraktionstools, die Vision-Modelle verwenden, verarbeiten in der Regel jede im Dokument enthaltene Sprache, da sie visuell statt durch sprachspezifische Zeichenerkennung lesen.

"Die Scanqualität ist zu niedrig – der Text ist unscharf oder schief"

Scannen Sie mit 300 DPI oder höher neu, falls Sie das Originalpapier noch haben. Für Dateien, die Sie nicht neu scannen können, versuchen Sie ein KI-Verbesserungstool, das Bilder vor der OCR entzerren und schärfen kann. Einige Online-OCR-Dienste bieten eine Bildvorverarbeitung, die schlechte Scanqualität teilweise ausgleichen kann.

"Ich muss 50+ gescannte PDFs verarbeiten – gibt es eine Stapeloption?"

Ja. Die meisten kommerziellen OCR-Plattformen und KI-Extraktionstools unterstützen die Stapelverarbeitung. Sie laden alle Dateien auf einmal hoch, das Tool verarbeitet sie gemeinsam und gibt eine einzige Excel-Datei mit einer Zeile pro Dokument aus. Hier haben KI-Extraktionstools einen deutlichen Vorteil gegenüber herkömmlicher OCR, die Dateien in der Regel einzeln verarbeitet.

Häufig gestellte Fragen

Verfügt Excel über eine integrierte OCR-Funktion für gescannte PDFs?

Nein. Die Funktion Daten > Daten abrufen > Aus Datei > Aus PDF in Excel funktioniert nur mit nativen PDFs, die bereits auswählbaren Text enthalten. Für gescannte (bildbasierte) PDFs benötigen Sie ein externes OCR-Tool oder eine KI-Extraktionsplattform.

Kann Google Drive ein gescanntes PDF in Excel konvertieren?

Google Drive OCR extrahiert den Text aus dem Bild und fügt ihn in ein Google-Dokument ein, aber das Ergebnis ist reiner Text ohne erhaltene Tabellenstruktur. Sie können diesen Text in Excel kopieren, müssen die Daten jedoch manuell in Spalten aufteilen. Google Drive bietet keinen direkten Konvertierungspfad von gescanntem PDF zu Excel.

Ist die OCR-Genauigkeit für Buchhaltungsdaten ausreichend?

Das hängt vom Tool und der Scanqualität ab. Traditionelle OCR kann bei einem sauberen Scan einer Standardrechnung eine Zeichengenauigkeit von 95–97 % erreichen. KI-Extraktionstools, die den Dokumentkontext verstehen, sind bei strukturierten Feldern tendenziell zuverlässiger, da sie nach Bedeutung suchen statt nach einzelnen Zeichen. Als Faustregel gilt: Überprüfen Sie unabhängig vom verwendeten Tool stets mindestens 10 % der Zeilen in jedem kritischen Finanzdatensatz.

Was ist das beste kostenlose Tool, um ein gescanntes PDF in Excel zu konvertieren?

Es gibt keine einheitliche Antwort, da „kostenlos" bei verschiedenen Tools unterschiedliche Grenzen bedeutet. Google Drive OCR ist kostenlos, liefert aber nur Textausgabe. Adobe Acrobat Online OCR bietet eine kostenlose Datei pro Tag. OCR.space bietet Entwicklern 25.000 kostenlose API-Anfragen pro Monat. Für einen detaillierten Vergleich mit spezifischen Grenzen und Genauigkeitsabwägungen finden Sie in unserem Leitfaden zur besten kostenlosen OCR-Software 2026.

Wie unterscheidet sich KI-Extraktion von traditioneller OCR bei gescannten PDFs?

Traditionelle OCR liest jedes Zeichen auf der Seite und gibt einen Textblock zurück – sie sagt Ihnen, welche Wörter vorhanden sind, aber nicht, was sie bedeuten. KI-Extraktion verwendet visuelle Sprachmodelle, um die Dokumentstruktur zu verstehen: Sie kann eine Rechnungsnummer von einer Kundennummer, ein Datum von einer Seitenzahl und eine Summe von einer Zwischensumme unterscheiden. Anschließend platziert sie jedes Datenelement automatisch in der richtigen Ausgabespalte. Dieses semantische Verständnis macht die Excel-Ausgabe nutzbar, ohne stundenlange manuelle Neuorganisation.

Können KI-Tools handschriftliche gescannte PDFs verarbeiten?

Einige KI-Extraktionstools können Handschrift verarbeiten, aber die Genauigkeit ist geringer als bei gedrucktem Text – etwa 70–85 % bei klarer Handschrift gegenüber 95–99 % bei gedruckten Zeichen. Handschrift-OCR verbessert sich mit visuellen Modellen rasant, aber bei kritischen Daten sollten Sie eine manuelle Überprüfung einplanen. Wenn das handschriftliche Dokument ein strukturiertes Formular ist (wie ein Inspektionsbericht oder Stundenzettel), kann die KI dennoch erkennen, welches Feld welches ist, selbst wenn einzelne Zeichen unsicher sind.

Die Kluft zwischen einem gescannten PDF und einer brauchbaren Excel-Datei ist real, aber bei weitem nicht so groß, wie es die manuelle Dateneingabe erscheinen lässt. Das richtige Tool verkürzt den Weg von Stunden auf Sekunden und die Nachbearbeitung von mühsam auf machbar. Der erste Scan, den Sie durch einen KI-Extraktor laufen lassen, wird länger dauern – weil Sie das Ausgabemuster lernen und Ihre Prüfliste aufbauen. Beim zehnten Scan haben Sie den Prozess auf unter eine Minute pro Dokument reduziert.

Probieren Sie es mit einem gescannten PDF aus, an dem Sie gerade arbeiten. Laden Sie die Datei hoch, definieren Sie die benötigten Spalten und sehen Sie, was zurückkommt – das Ergebnis verrät Ihnen mehr über Ihren spezifischen Anwendungsfall als jede allgemeine Genauigkeitsstatistik.

Schluss mit Abtippen — lassen Sie KI Ihre Dokumente lesen
Bild oder PDF hochladen — strukturierte Daten in 10 Sekunden
Jetzt testen →
📮 contact email: [email protected]