PDF in Text
Text aus PDF kopieren – ohne kaputte Zeilenumbrüche
Ein Absatz aus dem PDF soll in eine E-Mail, ein Word-Dokument oder ein Übersetzungstool. Nach dem Einfügen endet jede Zeile mit einem Umbruch, Wörter sind mit „Silben- trennung“ zerrissen – oder es lässt sich gar nichts markieren. So kommst du an sauberen Text.
Direkt loslegen: PDF laden, Text als sauberen Fließtext kopieren oder als TXT speichern – auch aus Scans. Kostenlos, ohne Upload.
Text aus PDF holenWarum kopierter PDF-Text kaputt ist
Ein PDF ist für den Druck gemacht. Es speichert nicht „Absatz mit diesem Text“, sondern „diese Buchstaben an genau dieser Position“. Zeilen, Absätze und Spalten ergeben sich nur aus der Anordnung. Beim Kopieren rät das Programm, wo eine Zeile endet – und setzt dort einen harten Umbruch.
| Problem | Ursache |
|---|---|
| Umbruch nach jeder Zeile | Jede Zeile ist im PDF ein eigenes Textstück. |
| „Bundes- regierung“ | Die Silbentrennung des Layouts wird als echter Bindestrich mitkopiert. |
| Spalten durcheinander | Zeilen aus linker und rechter Spalte werden abwechselnd gelesen. |
| Seltsame Zeichen statt Text | Die Schrift ist ohne Zeichenzuordnung eingebettet – der Text ist für Programme nicht lesbar. |
| Gar nichts markierbar | Das PDF ist ein Scan (nur Bild) oder das Kopieren ist per Rechteeinstellung gesperrt. |
Sauberer Text in drei Schritten
- PDF laden. Datei in PDF in Text ziehen. Der Text aller Seiten erscheint im Textfeld.
- Einstellungen prüfen. „Zeilenumbrüche in Absätzen entfernen“ und „Silbentrennung zusammenfügen“ sind voreingestellt. Aufzählungen und nummerierte Listen bleiben dabei erhalten. Nur bestimmte Seiten? Unter „Seiten“ z. B.
3-5, 8eintragen. - Kopieren oder speichern. „Text kopieren“ legt alles in die Zwischenablage, „Als TXT speichern“ lädt eine Textdatei herunter.
Das PDF verlässt deinen Rechner nicht. Auch Verträge, Gutachten oder Arztbriefe kannst du bedenkenlos umwandeln – der Text wird im Browser ausgelesen.
Fließtext statt Zeilensalat – PDF hineinziehen, kopieren, fertig.
Wenn sich nichts markieren lässt
- Scan oder Foto: Der Text ist nur ein Bild. Das Tool erkennt solche Seiten automatisch und bietet die Texterkennung an (siehe unten).
- Kopierschutz: Manche PDFs verbieten das Kopieren über eine Rechteeinstellung. Respektiere solche Vorgaben bei fremden Werken; bei eigenen Dokumenten hilft der Ersteller oder die Originaldatei.
- Passwort zum Öffnen: Ohne Passwort lässt sich das PDF gar nicht lesen – auch nicht mit Tools.
- Kauderwelsch statt Text: Dann fehlt der Schrift die Zeichenzuordnung. Hier hilft ebenfalls die Texterkennung, weil sie die Buchstaben vom Bild liest.
Gescannte PDFs: Texterkennung
Findet das Tool Seiten ohne Text, erscheint ein Hinweis mit dem Knopf „Text per OCR erkennen“. Die Erkennung (Tesseract) läuft ebenfalls in deinem Browser und liest Deutsch und Englisch. Beim ersten Mal lädt sie etwa 20 MB Erkennungsdaten, danach geht es schneller.
- Je sauberer der Scan, desto besser: gerade, kontrastreich, mindestens 200 dpi.
- Handschrift wird kaum erkannt, Tabellen kommen als Fließtext.
- Ergebnis immer gegenlesen – typische Fehler sind
rnstattmoder0stattO.
Alternativen: Word, Acrobat, pdftotext
Microsoft Word
Word öffnet PDFs direkt und wandelt sie in ein bearbeitbares Dokument um. Gut für einfache Layouts; bei komplexen Seiten entstehen viele Textfelder und Umbrüche.
Adobe Acrobat
„Als Text speichern“ und die Texterkennung gibt es in den kostenpflichtigen Versionen. Im kostenlosen Reader nur Markieren und Kopieren.
Google Docs
PDF in Google Drive hochladen und mit Google Docs öffnen – Drive führt dabei eine Texterkennung durch. Die Datei liegt danach allerdings bei Google.
Kommandozeile
pdftotext aus Poppler holt Text in Sekunden aus vielen PDFs, ocrmypdf macht Scans durchsuchbar.
pdftotext -layout dokument.pdf dokument.txt
ocrmypdf -l deu scan.pdf scan-durchsuchbar.pdf
Text jetzt aus dem PDF holen
Sauberer Fließtext ohne Zeilensalat, kopieren oder als TXT speichern – auch aus Scans per OCR. Kostenlos, ohne Upload.
Häufige Fragen
Warum hat kopierter PDF-Text so viele Zeilenumbrüche?
PDFs speichern Text Zeile für Zeile an festen Positionen. Beim Kopieren wird jedes Zeilenende zum harten Umbruch.
Wie entferne ich die Zeilenumbrüche?
Mit „PDF in Text“: Die Option „Zeilenumbrüche in Absätzen entfernen“ verbindet die Zeilen wieder zu Absätzen, Listen bleiben erhalten.
Kann ich Text aus einem gescannten PDF kopieren?
Ja, mit Texterkennung (OCR). Das Tool erkennt Seiten ohne Text und liest sie auf Wunsch per OCR aus – direkt im Browser.
Wird mein PDF hochgeladen?
Nein. Auch die Texterkennung läuft lokal. Geladen werden nur einmalig die Erkennungsdaten.
Bleibt die Formatierung erhalten?
Nein, das Ergebnis ist reiner Text ohne Fett, Schriftgrößen oder Tabellenlinien.
Was passiert mit mehrspaltigen Layouts?
Sie werden meist richtig der Reihe nach gelesen, bei komplexen Layouts können Spalten aber durcheinandergeraten.
Kann ich nur einzelne Seiten umwandeln?
Ja. Unter „Seiten“ zum Beispiel 1-3, 5 eintragen.
Quellen
- Tesseract OCR und Tesseract.js – die Texterkennung, die das Tool im Browser nutzt (englisch).
- Poppler (pdftotext) und OCRmyPDF (englisch).
- PDF.js – die Open-Source-Bibliothek, mit der das Tool den Text ausliest.