PDF in Text umwandeln: wenn die Formatierung das eigentliche Problem ist
Lassen Sie einmal diff auf zwei PDFs los. Geht nicht – das sind Binärdateien, und selbst ein
„identisches“ Dokument, das erneut aus derselben Quelle exportiert wurde, unterscheidet sich Byte für Byte,
weil Zeitstempel und Objektreihenfolge nie gleich bleiben. Ziehen Sie stattdessen aus beiden den Text heraus
und vergleichen Sie den, dann wissen Sie in zwei Sekunden, welche drei Sätze sich zwischen Revision 11 und
Revision 14 des Vertrags geändert haben.
Damit ist das Argument für PDF zu reinem Text im Kern schon gesagt. Es geht nicht um
„Markdown, nur schlechter“, sondern um ein anderes Werkzeug für eine andere Aufgabe. Text ist das, was Sie
einem Klassifikator vorwerfen, in einen Suchindex schreiben, für eine Vektordatenbank in Chunks zerlegen,
durch grep schicken, für eine Wortzählung nehmen oder an alles übergeben, das
# und | als zu parsende Zeichen behandelt statt sie zu ignorieren. Ziehen Sie eine
Datei in den Konverter oben, und Sie haben das Ergebnis in Sekunden. Kostenlos, ohne Anmeldung, 50 MB pro
Datei, und bei uns bleibt nichts liegen.
Was Sie gewinnen, wenn Sie die Auszeichnung wegwerfen
Eine Textextraktion sind die Wörter in Lesereihenfolge, sonst nichts. Keine Syntaxzeichen, keine Escaping-Regeln, keine Frage mehr, ob ein Sternchen Hervorhebung oder schlicht ein Sternchen sein soll. Für erstaunlich viele Pipelines ist das kein Kompromiss, sondern die Voraussetzung:
- Embeddings und semantische Suche. Dokument in Chunks zerlegen, jeden Chunk einbetten, über Ähnlichkeit zurückholen. Pipes und Rauten aus Markdown tragen nichts zur Bedeutung bei, belegen aber trotzdem Positionen im Vektor – reine Verdünnung. Saubere Prosa-Chunks werden zuverlässiger gefunden.
- Klassifikatoren und Topic-Modelle. Alles, was mit Bag-of-Words, TF-IDF oder n-Grammen
arbeitet, hält
###bereitwillig für ein Token, solange Sie es nicht vorher entfernen. Sparen Sie sich den Schritt, indem es gar nicht erst hineinkommt. - Volltextindizierung. Elasticsearch, SQLite FTS,
tsvectorin Postgres – alle wollen Rohtext in einer Spalte. Markdown bedeutet hier einen zusätzlichen Bereinigungsdurchlauf. - Versionsvergleich. Zeilenbasierte Diffs funktionieren gut auf Prosa und schlecht auf Tabellen, denn wer eine einzige Zelle in einer Markdown-Tabelle ändert, formatiert die komplette Tabellenzeile neu.
- Token-Haushalt. Wenn Sie ein langes Dokument in ein Modell mit knappem Kontextfenster kopieren, ist jeder senkrechte Strich ein Token, für das Sie bezahlt und nichts bekommen haben.
Und was Sie verlieren – besser vorher wissen
Das Plattmachen ist destruktiv, und zwar mit Absicht. Zwei Verluste wiegen schwerer als der Rest.
Tabellen fallen in sich zusammen. Aus einer Finanztabelle wird eine Reihe von Zahlen, getrennt durch Leerzeichen. Die Werte sind alle noch da, die Spalte, zu der jeder einzelne gehörte, dagegen nicht – und kein noch so guter Prompt holt sie zurück. Wenn die Tabelle der eigentliche Inhalt ist, nehmen Sie besser PDF zu Markdown, wo Pipe-Tabellen Zeilen und Spalten unversehrt lassen.
Die Hierarchie verschwindet. Eine Abschnittsüberschrift und der Satz darunter werden zu zwei benachbarten Zeilen, die nichts mehr voneinander unterscheidet. Bitten Sie ein Modell, „Abschnitt 4 zusammenzufassen“, muss es allein aus der Formulierung erraten, wo Abschnitt 4 anfängt. Bei langen, strukturierten Dokumenten – Spezifikationen, Normen, Verträge mit nummerierten Klauseln – ist genau dieses Raten die Stelle, an der Antworten kippen.
Der Formatumschalter oben auf dieser Seite wechselt zwischen Text und Markdown und behält die bereits gewählte Datei bei. Beide Richtungen zum Vergleich zu konvertieren kostet Sie also einen Klick statt eines erneuten Uploads.
Text aus PDF extrahieren: die Eigenheiten, die in der Ausgabe auftauchen
PDF ist eine Seitenbeschreibungssprache. Es legt Glyphen an Koordinaten ab, und Extraktion heißt, daraus wieder Sätze zusammenzusetzen. Daraus folgen ein paar Artefakte, und wer sie kennt, spart sich eine ratlose halbe Stunde:
- Harte Zeilenumbrüche mitten im Satz. PDF kennt keinen Absatz, der neu umbricht – jede
sichtbare Zeile ist ein eigener Textblock. Ein Absatz kommt bei Ihnen deshalb als sechs kurze Zeilen an.
Das ist die größte Stolperfalle bei
grepund Regex: Suchen Sie nach einer Wendung, die zufällig über einen Zeilenumbruch lief, bekommen Sie null Treffer für Text, der sichtbar dasteht. - Silbentrennung bleibt stehen. Ein am Zeilenende in „Verwal-“ / „tung“ getrenntes Wort bleibt in aller Regel getrennt. Vor Wortzählungen oder Keyword-Extraktion lohnt sich ein Suchen-und-Ersetzen.
- Kopfzeilen und Seitenzahlen schieben sich dazwischen. Der Firmenname und „Seite 14 von 88“ landen alle paar tausend Zeichen mitten in Ihrer Prosa. Beim Lesen harmlos, beim Chunking leicht lästig und mit einer einzeiligen Regex schnell entfernt, sobald Sie das Muster erkannt haben.
- Die Spaltenreihenfolge kann durcheinandergeraten. Zweispaltige wissenschaftliche Layouts werden meist korrekt linearisiert, aber freistehende Marginalien, herausgestellte Zitate und Fußnotenblöcke landen mitunter mitten im Absatz.
- Ligaturen und schräge Glyphen. „fi“ und „fl“ sind in professionell gesetzten PDFs oft eine einzige Glyphe. Die meisten kommen sauber heraus. Ein PDF mit einer Subset-Schrift ohne ordentliches Unicode-Mapping kann dagegen als scheinbares Kauderwelsch herauskommen – selten, aber dann liegt es an der Datei und nicht am Konverter.
Aus einem gescannten PDF gibt es keinen Text zu holen
Ein gescanntes PDF ist ein Foto von Papier in einer PDF-Hülle. Darin steckt nichts außer Pixeln, und die Texterkennung greift nicht in ein PDF hinein – eine reine Bilddatei kommt leer zurück. (Laden Sie dieselbe Seite als JPG oder PNG hoch, wird sie problemlos gelesen, siehe Bild zu Text. Es ist die PDF-Hülle, die im Weg steht.) Der Test dauert zwei Sekunden: Datei öffnen und versuchen, mit dem Cursor einen Satz zu markieren. Wird Text hervorgehoben, ist alles in Ordnung. Bekommen Sie ein Rechteck über die ganze Seite, ist es ein Scan.
Bei Scans lassen Sie zuerst eine OCR laufen – Acrobat, die Vorschau unter macOS und die meisten aktuellen PDF-Reader haben einen Befehl „Text erkennen“ – und konvertieren danach hier. Der Qualitätsunterschied in der Ausgabe ist alles andere als subtil.
Wofür das im Alltag taugt
- Ein RAG-Korpus aufbauen. Hunderte Richtlinien-PDFs in Text, an Absatzgrenzen geschnitten, eingebettet. Text ist das Format, das jede Chunking-Bibliothek standardmäßig erwartet.
- Änderungen im Vertrag prüfen. Beide Fassungen extrahieren, einen Diff auf Wortebene laufen lassen und die tatsächlichen Änderungen lesen, statt einer zusammenfassenden E-Mail zu glauben.
- Compliance- und Stichwortdurchläufe. Einen Ordner extrahierter Berichte nach einem definierten Begriff, einem Lieferantennamen oder einer Formulierung durchgreppen, die dort nichts zu suchen hat. Sofort, offline, ohne anderes Werkzeug als die Shell.
- Lesbarkeits- und Stilanalyse. Verteilung der Satzlängen, Jargondichte, Lesbarkeitsindizes – all das will saubere Prosa ohne Formatierungszeichen im Datenstrom.
- Sprachausgabe füttern. Ein Screenreader oder eine TTS-Engine liest Ihnen bereitwillig „Raute Raute Einleitung“ vor, wenn Sie ihr Markdown hinlegen.
- Schnell die Tokenzahl prüfen. Der Zähler unter der Ausgabe sagt Ihnen, was ein Dokument kostet, bevor Sie es irgendwo einfügen – nützlicher, als es aus einem Abbruchfehler zu erfahren.
Häufige Fragen
Wie wandle ich eine PDF-Datei kostenlos in Text um?
Ziehen Sie die Datei in den Konverter oben auf der Seite, der extrahierte Text erscheint direkt darunter. Kein Konto, keine E-Mail-Adresse, kein Wasserzeichen im Ergebnis. Das Limit liegt bei 50 MB pro Datei, und nichts bleibt gespeichert, sobald Sie Ihren Text haben. Kopieren Sie ihn direkt heraus oder laden Sie ihn als .txt herunter.
Warum kommt mein PDF-Text als Zeichensalat heraus?
Fast immer liegt es an der Schrift, nicht am Konverter. Ein PDF mit einer Subset-Schrift ohne Unicode-Mapping speichert Glyphenindizes, ohne festzuhalten, welche Zeichen sie darstellen. Die Extraktion gibt diese Indizes dann als sinnlose Buchstaben zurück. Lässt sich der Text zusätzlich in Ihrem PDF-Reader nicht markieren, liegt der Fehler eindeutig in der Datei – exportieren Sie sie erneut aus dem Ausgangsdokument.
Kann ich ein gescanntes PDF in Text umwandeln?
Nicht direkt. Ein Scan ist ein Foto in einer PDF-Verpackung, es stecken keine Zeichen darin, die man herausziehen könnte, also kommt das Ergebnis leer zurück. Zwei Wege drumherum: erst „Text erkennen“ in Acrobat oder in der macOS-Vorschau ausführen und danach hier konvertieren – oder die Seite als PNG exportieren und Bild zu Text nehmen, das tatsächlich eine OCR auf den Pixeln ausführt.
Warum ist mein extrahierter Text mitten im Satz umgebrochen?
PDF kennt keinen neu umbrechenden Absatz, jede sichtbare Zeile ist als eigener Textblock abgelegt, deshalb kommt ein Absatz als sechs kurze Zeilen an. Am stärksten beißt das bei grep und Regex: Eine Wendung über einen Zeilenumbruch hinweg liefert null Treffer. Fügen Sie vor der Suche alle Zeilen zusammen, die nicht mit einem Satzzeichen enden.
Soll ich mein PDF in txt oder in Markdown umwandeln?
Text, wenn das Ziel rohe Wörter verarbeitet: Embeddings, Suchindizes, Klassifikatoren, Diffs. Markdown, wenn die Form des Dokuments Bedeutung trägt, denn Pipe-Tabellen überleben und Überschriften bleiben ausgezeichnet. Den Ausschlag geben die Tabellen: Machen Sie eine Finanztabelle zu Text platt, ist die Zuordnung jeder Zahl zu ihrer Spalte endgültig weg.
Wird mein PDF auf einen Server hochgeladen?
Die Datei geht an den Konvertierungsdienst, wird verarbeitet und verworfen – sie wird weder gespeichert noch protokolliert noch indiziert, und nach der Antwort bleibt nichts zurück. Wenn Sie eine Konvertierung brauchen, bei der die Datei den Rechner wirklich nie verlässt, liest der Konverter für lokale Ordner die Dateien stattdessen im Browser.
Der Rest des Werkzeugkastens
PDF ist eines von dreizehn unterstützten Formaten. File2Txt verarbeitet sie alle aus einem einzigen Upload, oder Sie gehen direkt zu Word zu Text für DOCX-Dateien, HTML zu Text für gespeicherte Webseiten, EPUB zu Text für E-Books oder Bild zu Text für Screenshots. Lieber Code? Wandeln Sie ein GitHub-Repository in Text um, ein GitLab-Projekt oder einen lokalen Ordner. Für Webseiten im Netz holt Web2Txt eine URL direkt ab. Der Leitfaden zur Aufbereitung von Dokumenten für LLMs behandelt die allgemeine Fassung des Ganzen.
Repo2Txt wird entwickelt und gepflegt von v12hero, einem unabhängigen Entwickler, der native und Web-Apps mit Datenschutz an erster Stelle baut.