PDF → Word
PDF-Text in ein bearbeitbares .docx umwandeln. Kostenlos, ohne Upload. max. 1 GB · Bis zu 1 GB · Lokal verarbeitet, nie an einen Server gesendet.
PDF ist ein Zielformat: Es friert ein Layout ein, damit es überall gleich aussieht. An dem Tag, an dem Sie in einem Angebot einen Betrag korrigieren müssen und die Quelldatei verschwunden ist, wendet sich genau diese Eigenschaft gegen Sie. PDF → Word holt dann heraus, was herauszuholen ist, nämlich den Text, und liefert ihn als bearbeitbares .docx-Dokument.
Das Werkzeug öffnet das Dokument mit PDF.js, fragt bei jeder Seite die Textebene ab, baut aus der senkrechten Position jedes Fragments zuerst Zeilen und daraus Absätze und schreibt eine minimale .docx-Datei, die JSZip im Vorbeigehen zusammensetzt. Die erzeugte Datei übernimmt den Namen des PDF, und der Hinweis nennt die Zahl der gefundenen Absätze.
Es gehört sich, ebenso deutlich zu sagen, was dieses Werkzeug nicht ist. Es ist keine Rekonstruktion des Layouts: Weder Schriftarten noch Schriftgrade, weder Fettungen noch Bilder noch Tabellenraster gelangen in das Word-Dokument. Zurück bekommen Sie sauberen, in Absätze zerlegten Text, den Sie anschließend selbst formatieren. Dienste, die das vollständige Layout versprechen, betreiben Engines zur Strukturerkennung auf ihren eigenen Servern; hier geschieht alles im Browser-Tab, ausgehend von der Textebene.
So funktioniert es
- Prüfen, ob das PDF Text enthält Öffnen Sie es und versuchen Sie, ein Wort zu markieren. Lässt sich nichts auswählen, ist das Dokument ein Scan, und die Extraktion findet überhaupt nichts.
- Datei ablegen und den Hinweis lesen Das Ablagefeld trägt die Beschriftung „Datei hier ablegen“, darunter „Datei auswählen“ und eine Zeile zur Obergrenze von 1 GB und zur lokalen Verarbeitung. Der Infokasten erinnert daran, dass Text und Absätze erhalten bleiben, komplexe Layouts samt Spalten und Bildern jedoch vereinfacht werden.
- Auf „Starten“ klicken Der Fortschritt zeigt die laufende Seite und die Gesamtzahl. Jede Seite wird genau einmal durchlaufen, um ihre Textfragmente und deren Koordinaten einzusammeln.
- Die .docx-Datei öffnen und formatieren Das Dokument kommt im Format A4, mit Rändern von 2,5 cm und acht Punkt Abstand nach jedem Absatz. Die Formatvorlagen bleiben Ihnen überlassen.
- Bei fehlendem Text den Weg über die OCR nehmen Werden weniger als fünf Zeichen erkannt, hält das Werkzeug an und verweist auf OCR — gescanntes PDF, das den Text von Seiten erkennt, die zu Bildern geworden sind.
Wie die Absätze rekonstruiert werden
PDF.js liefert keine Zeilen, sondern Fragmente, jedes mit seiner Positionsmatrix. Das Werkzeug rundet die senkrechte Koordinate jedes Fragments, fasst alle in dieselbe Zeile, die innerhalb von vier Einheiten Abstand liegen, und klebt die Stücke anschließend wieder zusammen, wobei Folgen von Leerzeichen auf ein einziges zusammenschrumpfen.
Die Zerlegung in Absätze richtet sich danach nach einer Zeichensetzungsregel: Eine Zeile, die auf einen Punkt, ein Ausrufezeichen, ein Fragezeichen, einen Doppelpunkt, ein Semikolon oder ein schließendes französisches Guillemet endet, schließt den laufenden Absatz ab, ebenso wie eine Leerzeile. Eine Überschrift ohne abschließendes Satzzeichen klebt deshalb am folgenden Absatz, und eine Zeile, die auf eine Abkürzung ausläuft, trennt zu früh.
Für deutsche Dokumente ist ein Detail dieser Regel wichtig: Geprüft wird das Zeichen », im Deutschen das öffnende Guillemet. Das schließende Anführungszeichen deutscher Texte – das obere Zeichen aus „…“ ebenso wie das « aus »…« – steht nicht auf der Liste. Eine Zeile, die auf ein wörtliches Zitat endet, beendet den Absatz also nicht von sich aus. Zwischen zwei Seiten wird ein Seitenumbruch eingefügt.
Was in der erzeugten .docx-Datei wirklich steckt
Eine .docx-Datei ist ein ZIP-Archiv aus XML-Teilen. Dieses hier enthält das strikte Minimum:
- die Tabelle der Inhaltstypen
- die Beziehungsdatei
- das Dokument selbst
Es gibt keine Formatvorlagen, keine Nummerierung und keinen Medienordner. Jeder Absatz wird ohne jede Formatierung geschrieben, gefolgt von 160 Twips Abstand, und der abschließende Abschnitt erklärt eine Seite von 11.906 mal 16.838 Twips, also ein A4, einschließlich Rändern von 1.417 Twips.
Das Paket hält die Struktur ein, die von einer .docx-Datei erwartet wird, und öffnet sich in jeder Software, die das Format liest: Ihre Überschriften werden wieder zu Überschriften, sobald Sie ihnen eine Formatvorlage zuweisen, und keinen Moment früher.
Dokumente, die schlecht durchlaufen
Zweispaltige Layouts sind der heikle Fall. Da die Zeilen nach ihrer Höhe rekonstruiert werden, landen zwei Spalten auf gleicher Höhe hintereinander in einer einzigen Zeile: Der Text ist vollständig, die Lesereihenfolge ist es nicht.
Tabellen verlieren ihr Raster: Die Zellen einer Reihe werden zu einem einzigen Satz. Kopfzeilen, Fußzeilen und Seitenzahlen werden wie jeder andere Text extrahiert und tauchen über das Dokument verteilt wieder auf.
Ein letzter Fall betrifft die Wortgrenzen. Die Fragmente einer Zeile werden ohne eingeschobenes Leerzeichen aneinandergehängt; das Werkzeug verlässt sich darauf, dass die Abstände im PDF selbst codiert sind. Manche Erzeugerprogramme setzen die Zeichen jedoch einzeln und positionieren sie allein über Koordinaten, ohne je ein Leerzeichen abzulegen. Der extrahierte Text zeigt dann aneinandergeklebte Wörter, und bei deutschen Texten fällt das besonders auf, weil lange Zusammensetzungen die Suche nach der richtigen Trennstelle zusätzlich erschweren.
Wann dieses Werkzeug nicht die richtige Wahl ist
Kommt es Ihnen auf das Layout an, wandeln Sie besser gar nicht um: Fragen Sie nach der Quelldatei oder kommentieren Sie das PDF. Ist das Dokument ein Scan, führt kein Weg an der OCR vorbei. Und um eine Abbildung zu retten, exportiert PDF → JPG die gesamte Seite als Bild, das Sie anschließend nur noch zuschneiden.
Auch der Hin- und Rückweg ist nicht folgenlos. Das Werkzeug Word → PDF, das mit mammoth die Gegenrichtung geht, rendert das Dokument in ein Bild, bevor es in Seiten zerlegt wird: Sein Text ist danach nicht mehr auswählbar. Ein Dokument, das umgewandelt und wieder zurückgewandelt wurde, kehrt nicht in seinen Ausgangszustand zurück.
Häufige Fragen
Warum sind meine Überschriften keine Überschriften mehr?
Das erzeugte Dokument enthält überhaupt keine Formatvorlagen, und jeder Absatz wird ohne Formatierung geschrieben. Die Textverarbeitung wendet auf alles ihre Standardvorlage an, sodass die Gliederung von Ihnen neu aufzubauen ist.
Wo sind die Bilder aus dem PDF geblieben?
Sie werden nicht gelesen, weil ausschließlich die Textebene durchlaufen wird. Um sie zurückzubekommen, exportieren Sie die betreffenden Seiten mit PDF → JPG und fügen sie anschließend in das Word-Dokument ein.
Zwei Absätze sind verschmolzen, wie erklärt sich das?
Die Trennung hängt von der Zeichensetzung am Zeilenende ab. Eine Zeile, die weder auf einen Punkt noch auf ein Semikolon noch auf eines der geprüften Schlusszeichen endet, führt den laufenden Absatz weiter.
Entspricht die angegebene Absatzzahl meinem Dokument?
Sie entspricht der Zahl der Blöcke, die der Algorithmus gebildet hat, Seitenumbrüche ausgenommen, und kann von der Gliederung abweichen, die das PDF mit bloßem Auge zeigt.
Bleiben Umlaute und Sonderzeichen erhalten?
Ja: Der Text wird genau so übernommen, wie PDF.js ihn zurückgibt, wobei die für XML reservierten Zeichen vor dem Schreiben maskiert werden. Umlaute und ß gehen also durch. Ein Zeichen, das schon im ursprünglichen PDF falsch codiert war, bleibt falsch.
Mein PDF ist ein Scan, lässt sich die Extraktion erzwingen?
Nein: Unterhalb von fünf erkannten Zeichen hält das Werkzeug an. Starten Sie stattdessen OCR — gescanntes PDF und fügen Sie den erkannten Text in ein leeres Dokument ein.
Ähnliche Werkzeuge
- PDF komprimieren
- PDF zusammenfügen
- PDF teilen
- PDF → JPG
- PDF schützen
- PDF signieren
- OCR — gescanntes PDF
- PDF drehen
Weitere Werkzeuge entdecken
- Hintergrund entfernen — Motiv auf einfarbigem Hintergrund freistellen, PNG.
- Lorem-Ipsum-Generator — Blindtext nach Wörtern, Sätzen oder Absätzen.
- SEO-Audit — Titel, Meta, Überschriften, Bilder und Links in Sekunden.
- Prozentrechner — Veränderungen, Rabatte und Anteile ohne Fehler.