HTML in Text umwandeln: nur die Wörter aus einer Webseiten-Datei holen
Manchmal wollen Sie kein Dokument, sondern eine Wand aus Sätzen. Trainingsdaten für einen Klassifikator,
ein Korpus fürs Topic Modelling, Chunks für einen Embedding-Index, Eingabe für eine Zusammenfassung, die
Formatierung ohnehin ignoriert — in all diesen Fällen ist jedes #, jedes | und
jedes ** ein Zeichen, das Sie etwas kostet und Ihnen nichts einbringt.
Genau dafür ist diese Seite da. Werfen Sie eine .html- oder .htm-Datei hinein und
Sie bekommen den lesbaren Fließtext zurück, die Auszeichnung ist weg — keine Tags, keine Attribute, keine
Syntax. Kostenlos, ohne Anmeldung, 50 MB Limit, und die Datei wird danach nirgends gespeichert. Sollen
Überschriftenhierarchie und Tabellen stattdessen erhalten bleiben, ist
HTML in Markdown die
Schwesterseite, und der Formatumschalter oben nimmt Ihre Datei ohne erneuten Upload mit hinüber.
Text aus HTML extrahieren: was das Entfernen der Tags leisten muss
Naiv alles zwischen spitzen Klammern zu löschen, produziert Müll, und es lohnt sich zu verstehen, warum — daran hängt der Unterschied zwischen brauchbarem Text und Zeichensalat.
HTML kennt Block- und Inline-Elemente, und beide brauchen die genau entgegengesetzte Behandlung. Schließt
ein </p> und öffnet direkt danach das nächste <p>, dann ist das eine
Absatzgrenze und muss zu einem Zeilenumbruch werden. Schließt mitten im Satz ein
</strong>, ist das überhaupt keine Grenze — ein Umbruch an dieser Stelle würde den Satz
in zwei Hälften zerschneiden. Macht man das falsch, landet the quick brown fox als vier
einzelne Zeilen in der Ausgabe, nur weil jemand zwei der Wörter fett gesetzt hat.
Die andere Hälfte der Arbeit ist der Leerraum. Beim Rendern fasst HTML jede Folge aus Leerzeichen, Tabs und
Zeilenumbrüchen zu einem einzigen Leerzeichen zusammen; ein hübsch eingerückter Seitenquelltext enthält
deshalb Unmengen an Leerraum, der nie sichtbar sein sollte. Eine saubere Umwandlung von
HTML in Text fasst ihn genauso zusammen wie der Browser — deshalb liest sich die Ausgabe
so, wie die Seite aussah, und nicht so, wie die Datei aufgebaut war. Listenpunkte bekommen eigene Zeilen,
<br> wird zum Umbruch, und Tabellenzellen stehen getrennt statt aneinandergeklebt.
Entities, typografische Apostrophe und rätselhafte Zeichen
HTML kodiert bestimmte Zeichen, damit sie nicht mit der Auszeichnung kollidieren. &
ist ein kaufmännisches Und. < ist ein Kleiner-als-Zeichen. ist
ein geschütztes Leerzeichen, ’ ein typografisches Apostroph,
— ein Geviertstrich. Im Browser sehen Sie diese Codes nie — Sie sehen die Zeichen.
Im extrahierten Text sind unaufgelöste Entities pures Gift. Ein Tokenizer macht aus
’ mehrere Tokens Rauschen, die Stichwortsuche scheitert an
don’t, und jeder nachgelagerte Vergleich von Zeichenketten geht still und leise
kaputt. Deshalb werden Entities auf dem Weg nach draußen aufgelöst. Die heimtückischsten sind die
geschützten Leerzeichen: auf dem Bildschirm von normalen Leerzeichen nicht zu unterscheiden, scheitern sie
an jedem split(" "), den Sie schreiben. Hier kommen sie als echte Leerzeichen an.
Ein Blick auf die Zeichenkodierung lohnt ebenfalls. Die meisten neueren Dateien deklarieren
<meta charset="utf-8">, aber ältere Seiten und CMS-Exporte sind gelegentlich verkapptes
Latin-1 oder Windows-1252. Steht in Ihrer Ausgabe ’, wo ein Apostroph hingehört, dann hat
die Quelldatei über ihre Kodierung gelogen — im Editor als UTF-8 neu speichern und noch einmal umwandeln.
Text, den nie jemand lesen sollte
Eine Seite enthält mehr Wörter, als sie Ihnen zeigt, und ein Teil davon taucht bei der Extraktion wieder auf:
- Navigationsleiste und Fußbereich. Menübeschriftungen, Brotkrumenpfade, „nach oben“, die achtzig Links lange Sitemap ganz unten. Legitimer Text, semantisch wertlos. Bei einem gespeicherten Nachrichtenartikel kann das mehr Gewicht haben als der Artikel selbst.
- Cookie-Banner und Einwilligungstexte. Zweihundert Wörter juristisches Boilerplate, die auf jeder Seite auftauchen, die Sie von dieser Domain speichern — wer ein Korpus aufbaut, dupliziert sie also gleich tausendfach.
- Alt-Texte und ARIA-Labels. Mal wertvoll (der Alt-Text eines Diagramms ist womöglich die einzige Beschreibung der Daten), mal einfach vierzigmal „Bild“.
- Versteckte Elemente. Spans nur für Screenreader, zugeklappte Akkordeon-Panels und
<noscript>-Fallbacks enthalten im Quelltext allesamt echten Text, obwohl Sie ihn gerendert nie zu sehen bekommen haben.
Wenn es auf die Quelle ankommt, hat sich eines bewährt: die Seite aus dem Lesemodus des Browsers heraus speichern, der den größten Teil des Beiwerks entfernt, bevor es überhaupt in der Datei landet. Ansonsten erst umwandeln und dann Kopf und Fuß der Ausgabe abschneiden. Wiederkehrendes Boilerplate erkennt man schnell, sobald man weiß, wonach man sucht, und dieses Wegschneiden ist die lohnendste Minute der ganzen Pipeline.
Warum reiner Text bei NLP-Arbeit besser abschneidet als Markdown
Das ist nicht bloß „Markdown, nur schlichter“ — für viele Pipelines ist reiner Text die richtige Wahl und Markdown aktiv im Weg.
- Embeddings. Ein Embedding-Modell kodiert alles, was Sie ihm geben, Syntax inklusive. Senkrechte Striche und Rauten verschieben Vektoren, ohne Bedeutung beizusteuern, und sie zehren am Eingabelimit des Modells. Sauberer Fließtext lässt sich sauberer einbetten.
- Klassifikatoren und Themenmodelle. Bag-of-Words- und TF-IDF-Verfahren halten
**word**undwordfür zwei verschiedene Tokens, solange Sie nicht vorher aufräumen. Ersparen Sie sich das Problem komplett. - Suchindex. Die meisten Index-Pipelines wollen Sätze. Füttert man sie mit Markdown, schreibt man einen Bereinigungsschritt, den es nicht gebraucht hätte.
- Satzsegmentierung. Splitter wie spaCy oder NLTK arbeiten auf Fließtext. Tabellensyntax bringt sie durcheinander, und heraus fallen Fragmente.
- Token-Budget. Auf einer langen Seite senkt der Verzicht auf die Auszeichnung die Tokenzahl spürbar — der Zähler unter der Ausgabe zeigt Ihnen genau, um wie viel, und der Vergleich beider Formate an derselben Datei ist ein einziger Klick.
Eine Datei, die Sie haben, gegen eine Seite, die Sie nicht haben
Dieses Werkzeug wandelt eine HTML-Datei um, die Sie hochladen. Es ruft keine URL ab. Dieser Unterschied wiegt schwerer, als er klingt, denn die beiden Situationen scheitern auf unterschiedliche Weise.
Stammt Ihre Datei aus „Seite speichern unter“ auf einer JavaScript-lastigen Site, enthält sie womöglich fast keinen Text — nur ein leeres Container-Div und ein Bundle-Skript, während der eigentliche Inhalt erst zur Laufzeit erzeugt und nie auf die Platte geschrieben wurde. Zurück kommt ein nahezu leeres Ergebnis, und es sieht aus, als sei der Konverter kaputt. Ist er nicht; die Wörter stehen schlicht nicht in der Datei. Suchen Sie im Quelltext nach einem Satz, an den Sie sich erinnern — das klärt die Frage sofort.
In dem Fall nehmen Sie Web2Txt — es bekommt eine Live-URL, rendert die Seite und extrahiert aus dem Ergebnis. Diese Seite hier nutzen Sie, wenn Sie die Datei bereits haben: einen E-Mail-Export, einen Dokumentations-Build, einen CMS-Dump, einen als HTML erzeugten Bericht, eine vor Jahren archivierte Seite.
Typische Aufgaben
- Aufbau eines Trainings- oder Evaluationskorpus aus einem Ordner archivierter Seiten, wenn Sie rohen Fließtext und über tausende Dokumente hinweg eine einheitliche Form brauchen.
- Lesbarkeits- und Content-Audits — Wortzahlen, Lesbarkeitsniveau, Häufigkeit einzelner Stichwörter. Dafür brauchen Sie den Text, ohne dass die Auszeichnung die Zahlen verzerrt.
- Weiterreichen an Skripte. Reiner Text geht ohne Escaping-Drama in
grep,wc, einen Diff oder einen Python-Einzeiler. - Zusammenfassen einer langen Seite, bei der die Struktur egal ist und Sie die Tokens lieber in Inhalt investieren.
- Text aus einer HTML-Datei extrahieren für Übersetzung oder Transkription, wo die übersetzende Person Sätze will und sonst nichts.
Häufige Fragen
Wie wandle ich eine HTML-Datei in Text um?
Legen Sie die .html- oder .htm-Datei oben ab, und zurück kommt der lesbare Text, aus dem jedes Tag, jedes Skript und jeder Style-Block entfernt wurde. Kostenlos, ohne Anmeldung, 50 MB pro Datei. Laden Sie ihn als .txt herunter oder kopieren Sie ihn direkt dorthin, wo die Wörter gebraucht wurden und nicht die Auszeichnung.
Kann ich eine Live-Webseite per URL umwandeln?
Auf dieser Seite nicht — hier geht es um eine Datei, die Sie bereits besitzen. Für eine URL holt Web2Txt die Seite und extrahiert sie direkt, was den Umweg über Speichern und Hochladen erspart. Diese Seite ist für früher gespeicherte Seiten, exportierte E-Mail-Texte oder lokal erzeugtes HTML.
Entfernt der Konverter Navigation, Werbung und Cookie-Banner?
Boilerplate ist eine bekannte Gefahr, kein gelöstes Problem. Skripte, Styles und Tags fliegen immer raus; ob eine Seitenleiste oder ein Cookie-Hinweis als Inhalt zählt, ist Ermessenssache, und eine gespeicherte Seite trägt alles im selben DOM. Überfliegen Sie Anfang und Ende der Ausgabe — dort sammelt sich der Navigationsschutt.
Was passiert mit den Links in der Seite?
Der Linktext überlebt als Wörter, die dahinterliegenden URLs nicht. Ein Satz wie „siehe die Installationsanleitung“ wird genau dazu, ohne jeden Hinweis, wohin er zeigte. Zählen die Ziele — Linkkarte bauen, ausgehende Verweise prüfen —, dann nehmen Sie HTML in Markdown, wo die hrefs in Klammersyntax erhalten bleiben.
Warum ist meine Ausgabe voller Leerzeilen und versprengter Zeichen?
Meist steckt eine Seite dahinter, die mit vollständigem DOM gespeichert wurde — versteckte Template-Blöcke, JSON-LD-Payloads, eingebettetes SVG und Analytics-Fragmente stehen alle in dieser Auszeichnung und enthalten alle Text irgendeiner Art. Eine einzeilige Regex räumt das wiederkehrende Muster weg, sobald Sie es erkannt haben; alternativ speichern Sie die Seite aus der Leseansicht des Browsers neu und wandeln diese um.
Der Rest des Werkzeugkastens
File2Txt verarbeitet jedes unterstützte Format aus einem einzigen Upload-Feld, falls Sie sich nicht festlegen mögen. Oder direkt: PDF in Text für Dokumente, Word in Text für DOCX, EPUB in Text für E-Books und CSV in Text für Daten mit Trennzeichen.
Sie arbeiten mit Code? Der GitHub-in-Text-Konverter, der GitLab-Konverter und der Konverter für lokale Verzeichnisse plätten ein ganzes Projekt in eine einzige Datei. Und dieser Leitfaden behandelt die größere Frage, wie man Dokumente für ein LLM vorbereitet.
Repo2Txt wird entwickelt und gepflegt von v12hero, einem unabhängigen Entwickler, der native Apps und Web-Apps mit Datenschutz an erster Stelle baut.