RTF in Text umwandeln: Steuerwörter raus, Wörter behalten
Viele lernen RTF auf die harte Tour kennen. Sie haben einen Ordner voller .rtf-Dateien, brauchen
den Inhalt in einer Datenbank, und weil das Format technisch reines ASCII ist, denken Sie, Sie lesen die
Datei einfach ein und fertig. Dann schauen Sie sich an, was Sie geladen haben, und da steht
{\rtf1\ansi\deff0{\fonttbl{\f0\froman Times
New Roman;}}{\colortbl;\red0\green0\blue0;}\viewkind4\uc1\pard\f0\fs24 Dear Sir,\par und rund vier
Kilobyte davon, bevor der zweite Satz des Briefes kommt.
RTF ist Text, aber Text mit einer Auszeichnungssprache drumherum, und die Wörter herauszuholen heißt, die Steuerwörter tatsächlich zu parsen, statt hoffnungsvoll auf Backslashes loszuregexen. Genau das passiert hier. Text aus einer RTF-Datei extrahieren — und Sie bekommen den Fließtext in Lesereihenfolge und sonst nichts. Kostenlos, ohne Anmeldung, 50 MB Limit, bei uns bleibt nichts liegen.
Warum naives Wegschneiden schiefgeht
Es ist verlockend, eine zwanzigzeilige Funktion zu schreiben, die alles löscht, was mit einem Backslash beginnt. Bei den ersten drei Dateien klappt das, den Rest ruiniert sie still und leise. Die konkreten Bruchstellen sind auch dann wissenswert, wenn Sie diese Funktion nie schreiben — denn es sind dieselben Dinge, die ein echter Parser beherrschen muss:
- Die Header-Gruppen sind kein Inhalt. Fonttabelle, Farbtabelle, Stylesheet und Revisionstabelle stehen alle oben in der Datei in geschweiften Klammern. Entfernen Sie die Steuerwörter, behalten aber den Text in diesen Gruppen, beginnt Ihre Ausgabe mit einer Liste von Schriftnamen.
- Geschweifte Klammern tragen Bedeutung. Gruppen verschachteln sich und begrenzen den
Geltungsbereich von Formatierungen. Manche Gruppen —
\*\generator,\info, eingebettete Objektdaten — gehören komplett verworfen, nicht ausgepackt. - Escapes sehen aus wie Inhalt.
\'92ist ein echtes Zeichen und kein Steuerwort zum Löschen. Entfernen Sie es, verschwindet jeder Apostroph im Dokument mitten im Wort. - Binärdaten verstecken sich darin. Bilder liegen in
\pict-Gruppen als lange Ketten von Hex-Ziffern, die für einen dummen Filter exakt wie gewöhnlicher Text aussehen. So landen 40.000 Zeichen0100090000mitten in einem Brief. - Absatzmarken zählen.
\parmuss zu einem Zeilenumbruch werden und nicht zu nichts, sonst kommt das ganze Dokument als ein einziger endloser Absatz an.
Wo RTF in Massen auftaucht
Niemand hat drei RTF-Dateien. Die Leute haben dreitausend, weil irgendein System sie seit 2004 gleichmäßig ausspuckt. Die üblichen Verdächtigen:
- Juristische Akten und Beweismaterial. Protokolle, Schriftsätze und Korrespondenz, exportiert aus Aktenverwaltungssystemen, oft in einem flachen Verzeichnis mit kryptischen Dateinamen.
- Klinische Dokumentation. Diktierte Befunde, Entlassungsbriefe und Überweisungsschreiben, als RTF-Blobs in Tabellen der Patientenakte abgelegt — meist weil der Hersteller sich 2003 dafür entschieden hat und seither nichts einen Wechsel erzwungen hat.
- Behördenunterlagen. Gewählt aus demselben Grund wie bei den Gerichten: eine offene, stabile Spezifikation, die sich auch in dreißig Jahren noch öffnen lässt.
- Alte E-Mail-Archive. Der Rich-Text-Modus von Outlook ist unter der Haube RTF, deshalb fällt es ständig aus der MSG-E-Mail-Extraktion heraus.
- Exporte aus Altanwendungen. Jedes CRM, Ticketsystem oder Fachverfahren mit einem Rich-Text-Feld aus der Zeit vor den Web-Editoren speichert mit ziemlicher Sicherheit RTF in einer Spalte.
- WordPad-Dokumente. Jahrzehnte an informellen Notizen und Arbeitsanweisungen, gespeichert von Leuten, die genommen haben, was Windows standardmäßig geöffnet hat.
Gemeinsamer Nenner: Das sind Archive, die Sie durchsuchen, indizieren oder befragen wollen — und genau dafür ist reiner Text da.
Die Zeichenkodierung ist der Teil, der wirklich weh tut
Die meisten RTF-Probleme in freier Wildbahn sind Kodierungsprobleme, keine strukturellen. Das Format entstand, bevor Unicode gesetzt war, und ältere Dateien tragen diese Geschichte mit sich herum.
Der Header deklariert eine Codepage — \ansicpg1252 für Windows Westeuropäisch ist die häufigste,
aber Ihnen begegnen auch \ansicpg1251 für Kyrillisch, \ansicpg1250 für
Mitteleuropäisch und \mac für Dateien, die auf einem klassischen Macintosh entstanden sind.
Nicht-ASCII-Zeichen erscheinen dann als Hex-Escapes wie \'92 oder \'e9, deren
Bedeutung vollständig von dieser Deklaration abhängt. Liegen Sie daneben, wird aus é ein kyrillischer
Buchstabe oder aus einem typografischen Apostroph ein Kästchen.
Neuere Dateien verwenden \uN? — einen Unicode-Codepunkt gefolgt von einem Ersatzzeichen für
Leseprogramme, die zu alt dafür sind. Sauber geparst bekommen Sie das echte Zeichen; unsauber geparst das
Ersatzzeichen, das oft ein wörtliches Fragezeichen ist. Daher stammen die Dokumente, in denen jeder
Gedankenstrich und jedes typografische Anführungszeichen zu ? geworden ist.
Also: Bevor Sie einen ganzen Stapel in eine Datenbank schreiben, öffnen Sie zwei oder drei konvertierte Dateien und schauen gezielt auf Apostrophe, Anführungszeichen, Gedankenstriche und Namen mit Umlauten oder Akzenten. Diese vier Dinge sagen Ihnen, ob die Kodierung richtig gelesen wurde. Sind sie falsch, sind sie durchgängig falsch, und ein Suchen-und-Ersetzen über den Stapel bringt es in einem Zug in Ordnung.
Text oder Markdown? Die entscheidende Frage
Es läuft darauf hinaus, ob im Dokument Tabellen stehen, an denen Ihnen etwas liegt.
RTF-Tabellen sind mit \trowd und \cellx explizit definiert, sie lassen sich also
sauber zu Pipe-Tabellen rekonstruieren, wenn Sie Markdown wählen. Machen Sie sie zu Text platt, überleben
zwar alle Werte, aber nicht die Spalte, zu der jeder gehörte — aus einer Abrechnungstabelle wird eine Reihe
von Zahlen, getrennt durch Leerraum, und kein noch so guter Prompt holt die Spalten zurück. Ist das Ihr
Dokument, nehmen Sie
RTF zu Markdown. Der
Format-Umschalter oben auf dieser Seite wechselt hinüber und behält die bereits gewählte Datei.
Für alles andere — Briefe, Notizen, Protokolle, Vermerke, Korrespondenz, also das meiste, wofür RTF
tatsächlich benutzt wird — ist Text die bessere Ausgabe. Das ist es, was Volltextindizes wollen, was
Embedding-Pipelines standardmäßig chunken, was grep liest und was ein Klassifikator erwartet.
Die Sternchen und Pipes von Markdown wären nur Zeichen, die Sie im nächsten Schritt wieder herausschneiden.
Wie Sie einen großen Stapel durchbekommen
- Packen Sie den Ordner in ein Zip. ZIP zu Text konvertiert jede unterstützte Datei in einem Archiv in einem Durchgang, was deutlich besser ist, als sie einzeln hochzuladen. Achten Sie auf die 50-MB-Grenze — RTF ist unkomprimiert, und Dateien mit eingebetteten Bildern sind weit größer, als ihre Wortzahl vermuten lässt.
- Stichprobe vor dem Durchlauf. Konvertieren Sie zuerst fünf Dateien aus verschiedenen Jahren. Kodierungsprobleme treten nach Epoche und erzeugendem Werkzeug gebündelt auf, und eine Stichprobe zeigt Ihnen das Muster, bevor Sie dreitausend Dateien verarbeiten.
- Behalten Sie Dateinamen als Metadaten. Sobald es flacher Text ist, ist der Dateiname womöglich die einzige Herkunftsangabe, die Ihnen bleibt. Speichern Sie ihn zu jedem Datensatz mit.
- Rechnen Sie mit Textbausteinen. Briefköpfe, Fußzeilen und Standard-Grußformeln wiederholen sich über jede Datei eines Korpus. In jeder Häufigkeits- oder Themenanalyse werden sie zu trügerisch häufigem Vokabular — schneiden Sie sie heraus, sobald Sie das Muster erkennen.
- Achten Sie auf Abbrüche. Viele Werkzeuge erzeugen leicht spezifikationswidriges RTF mit unausgeglichenen Klammern. Bricht eine konvertierte Datei mitten im Satz ab, ist die Quelle fehlerhaft und nicht die Konvertierung stillschweigend gescheitert — öffnen Sie das Original in einem Texteditor und Sie sehen meist genau, wo es schiefgeht.
- Schauen Sie auf die Tokenzahl. Der Zähler unter der Ausgabe sagt Ihnen, was ein Dokument kostet, bevor Sie es irgendwo einfügen — praktisch, wenn Sie entscheiden, wie viel von einem Archiv in einen Prompt passt.
RTF, DOCX und welches Sie konvertieren sollten
Gibt es ein Dokument in beiden Formaten, nehmen Sie das DOCX. Es trägt eine ordentliche Formatvorlagen- Hierarchie und reichere Semantik, und Word zu Text ist das nähere moderne Gegenstück zu dieser Seite.
Aber RTF hat für die Massenextraktion von Text einen echten Vorteil, und der heißt nicht Nostalgie: Es ist ein einziger linearer Datenstrom ohne Kompressionsschicht. Kein Zip-Container, der beschädigt sein kann, keine XML-Teile, die aufeinander verweisen. Geht etwas schief, öffnen Sie die Datei in einem beliebigen Editor und sehen die Ursache mit eigenen Augen. Über ein paar tausend Dateien unbekannter Herkunft hinweg ist diese Berechenbarkeit erstaunlich viel wert.
Häufige Fragen
Wie extrahiere ich Text aus einer RTF-Datei?
Ziehen Sie die .rtf in den Konverter oben. Die Steuerwörter werden sauber geparst und Sie bekommen den Fließtext in Lesereihenfolge, ohne jedes Markup. Kostenlos, ohne Anmeldung, 50 MB pro Datei, nichts wird gespeichert. Als .txt herunterladen oder herauskopieren.
Warum kann ich die RTF nicht einfach im Texteditor öffnen?
Können Sie, und Sie sehen dann {\rtf1\ansi\deff0{\fonttbl{\f0\froman Times New Roman;}} und danach mehrere Kilobyte weiteren Ballast, bevor der zweite Satz des Briefes kommt. RTF ist ASCII, aber ASCII, das in eine Auszeichnungssprache eingewickelt ist. Die Wörter stecken darin, verschachtelt mit Fonttabellen, Farbtabellen und Steuerwörtern, die geparst und nicht per Mustersuche weggeworfen werden müssen.
Warum produziert das eigene Entfernen der Backslashes kaputte Ausgaben?
Weil Steuerwörter nicht einheitlich begrenzt sind und manche Daten tragen, die Sie behalten müssen. Eine Regex, die alles nach einem Backslash löscht, löscht auch \'e9 — genau so kodiert RTF ein akzentuiertes Zeichen. Jeder Name mit Diakritikum verliert dadurch klammheimlich Buchstaben. Bei den ersten drei Dateien klappt es, den Rest ruiniert es leise.
Überleben Umlaute und nicht-englische Zeichen?
Ja, sofern die Datei ihre Kodierung korrekt deklariert, was die meisten tun. RTF kodiert Nicht-ASCII-Zeichen als Hex-Sequenzen, die an eine deklarierte Codepage gebunden sind, und sauberes Parsen löst sie zurück in echtes Unicode auf. Das ist der mit Abstand häufigste Fehler selbstgebauter Filter — und der, der einem Datenbestand aus Namen oder Adressen den größten Schaden zufügt.
Werden Tabellen in einem RTF-Dokument konvertiert?
Die Zellinhalte kommen mit, aber als Fließtext und nicht als Raster — reiner Text kann eine Spalte nicht ausdrücken. Ist das Dokument ein Bericht, der um Tabellen herum gebaut ist, behält RTF zu Markdown Zeilen und Spalten stattdessen als Pipe-Tabellen.
Der Rest des Werkzeugkastens
RTF ist eines von dreizehn unterstützten Formaten. File2Txt nimmt sie alle aus einem einzigen Upload, wenn Sie sich nicht für eine Seite entscheiden wollen. In der Nachbarschaft: PDF zu Text für Dokumente mit festem Layout, EPUB zu Text für E-Books, HTML zu Text für gespeicherte Seiten und XML zu Text für die andere Sorte altgedientes Austauschformat.
Sie arbeiten mit Code oder dem lebenden Web? Es gibt den GitHub-Repository-zu-Text-Konverter, eine GitLab-Variante, einen Konverter für lokale Ordner und Web2Txt zum Auslesen von URLs. Der Leitfaden zur Aufbereitung von Dokumenten für LLMs behandelt die allgemeine Fassung davon.
Repo2Txt wird entwickelt und gepflegt von v12hero, einem unabhängigen Entwickler, der native und Web-Apps mit Fokus auf Datenschutz baut.