Konvertieren Sie HTML in Markdown online kostenlos

Konvertieren Sie HTML-Dateien kostenlos online in Markdown. Datei hochladen und sofort eine saubere, für LLMs geeignete Ausgabe erhalten. Ohne Anmeldung, bis 50 MB, nichts wird gespeichert.

HTML in Markdown umwandeln: aus einer gespeicherten Seite etwas Lesbares machen

Öffnen Sie irgendeine .html-Datei, die Sie aus dem Web gespeichert haben, in einem Editor. Das Erste, was auffällt: wie wenig davon der Artikel ist. Fünfzehnhundert Zeilen Navigationsmenüs, Cookie-Banner, Tracking-Pixel, eingebettete <style>-Blöcke und <div class="wrapper-outer-container">-Verschachtelungen sechs Ebenen tief — drumherum vielleicht vierzig Absätze mit echtem Text. Kippen Sie das in einen Chat-Assistenten, verheizen Sie den Großteil Ihres Kontextfensters für Auszeichnung, die dem Modell nichts sagt.

HTML in Markdown umwandeln dreht dieses Verhältnis um. Tags, die Bedeutung tragen, werden übersetzt; Tags, die nur Layout tragen, fallen weg. Heraus kommt ein Dokument mit derselben Gestalt wie die ursprüngliche Seite — Überschriften, Listen, Tabellen, Links, Codeblöcke — bei etwa einem Zehntel der Zeichen. Laden Sie oben eine Datei hoch, nach ein paar Sekunden liegt das Ergebnis vor. Kostenlos, ohne Anmeldung, nichts wird gespeichert.

HTML in Markdown umwandeln: wie die Tags abgebildet werden

Markdown wurde als Kurzschrift für eine Teilmenge von HTML entworfen, deshalb verläuft die Übersetzung weitgehend eins zu eins. Wer die Zuordnung kennt, weiß genau, was in der Ausgabe zu erwarten ist:

  • <h1> bis <h6> werden zu # bis ######. Die Überschriftentiefe bleibt buchstäblich erhalten, was mehr wiegt, als es klingt — ein Modell, das Abschnitt für Abschnitt zusammenfassen soll, muss wissen, welche Überschriften Geschwister sind.
  • <ul>, <ol> und verschachtelte <li> werden zu Strich- und Nummernlisten, wobei die Einrückung die Verschachtelung trägt.
  • <table> wird zur Pipe-Tabelle, sofern es sich um eine echte Datentabelle handelt. Tabellen, die rein dem Layout dienen — in E-Mail-HTML und auf älteren Seiten noch immer verbreitet —, ergeben etwas strukturell Gültiges, aber semantisch Nutzloses.
  • <a href> wird zu [text](url), die Ziele überleben also, statt dass Ihnen verwaister Linktext übrig bleibt.
  • <code> und <pre> werden zu Backticks und eingezäunten Blöcken. Das ist der wichtigste Grund, warum Entwickler Doku-Seiten auf diesem Weg umwandeln — Schnipsel bleiben Schnipsel.
  • <strong>, <em> und <blockquote> landen bei den naheliegenden Entsprechungen.
  • <script>, <style>, <meta>, eingebettete style=-Attribute, Klassennamen, Data-Attribute — alles verworfen. Nichts davon überlebt, und nichts davon sollte.

Eine gespeicherte Seite ist nicht dasselbe wie sauberes HTML

Zwischen einer HTML-Datei, die ein Mensch geschrieben hat, und einer, die ein Browser ausgekippt hat, liegen Welten — und man sieht es der Ausgabe sofort an.

Von Hand geschriebenes HTML — ein Static-Site-Export, ein Dokumentations-Build, eine E-Mail-Vorlage, ein aus einem Reporting-Werkzeug erzeugter Bericht — ist meist aufgeräumt und semantisch. Überschriften sind Überschriften. Absätze sind Absätze. So etwas wandelt sich nahezu perfekt um.

Eine mit Strg+S von einer modernen Site gespeicherte Seite ist ein anderes Kaliber. Sie bekommen das DOM nach dem JavaScript-Durchlauf, samt Sticky-Header, der Leiste mit verwandten Artikeln, drei Newsletter-Aufforderungen und einer Fußzeilen-Sitemap mit achtzig Links. Das ist alles legitimes HTML, also wird es auch alles umgewandelt. Die Ausgabe ist korrekt — sie schleppt eben das Seitenmobiliar mit. Zwei Angewohnheiten helfen: aus dem Lesemodus des Browsers heraus speichern, oder erst umwandeln und dann Anfang und Ende des Markdowns löschen, bevor Sie es weiterverwenden. Überfliegen und Kürzen dauert keine Minute und verbessert spürbar alles, was danach kommt.

Wenn von der Datei fast nichts übrig bleibt

Gelegentlich wandeln Sie eine gespeicherte Seite um und bekommen einen Titel und zwei Zeilen zurück. Das ist kein Versagen des Konverters — das ist eine Single-Page-Anwendung.

Mit React, Vue, Angular und Verwandten gebaute Seiten liefern oft eine HTML-Hülle aus, die tatsächlich leer ist: ein <div id="root"></div> und ein Script-Tag. Der Inhalt, den Sie im Browser gesehen haben, wurde zur Laufzeit von JavaScript zusammengebaut und existierte nie in der Datei. Je nachdem, wie Sie gespeichert haben, halten Sie die Hülle statt des gerenderten Ergebnisses in der Hand. Öffnen Sie die Datei im Editor und suchen Sie nach einem Satz, an den Sie sich erinnern — steht er nicht drin, kann der Konverter ihn auch nicht erfinden.

Der Ausweg: stattdessen das gerenderte DOM sichern (in den Chrome DevTools mit Rechtsklick auf den <html>-Knoten das äußere HTML kopieren und in eine neue Datei legen), oder die Datei ganz überspringen und Web2Txt nehmen, das eine Live-URL entgegennimmt, die Seite ordentlich lädt und Markdown zurückgibt. Diesen Unterschied sollte man im Kopf behalten: Diese Seite wandelt eine HTML-Datei um, die Sie schon haben, Web2Txt holt eine Seite, die Sie nicht haben.

Das Problem mit den relativen Links

Darüber stolpern viele. Eine Seite, die auf /docs/getting-started oder ../api/reference.html verweist, verlässt sich darauf, dass der Browser Domain und Verzeichnis kennt, aus denen sie stammt. Sobald die Datei von ihrem Server getrennt ist, ist dieser Kontext weg. Das erzeugte Markdown enthält brav [Getting Started](/docs/getting-started) — einen Link, der nun nirgendwo mehr richtig hinzeigt.

Für LLM-Arbeit spielt das meist keine Rolle, weil es Ihnen um den Fließtext und die Linkbeschriftung geht und nicht darum, ob die URLs auflösen. Bauen Sie dagegen Dokumentation, die veröffentlicht werden soll, oder eine Wissensdatenbank, in der Querverweise funktionieren müssen, dann prüfen Sie die Ausgabe und schreiben die Pfade entweder um oder entfernen die Links ganz. Bei den src-Attributen von Bildern ist es dasselbe, weshalb die Bilder einer Offline-Seite in der Regel als kaputte Verweise ankommen.

Markdown oder reiner Text für eine HTML-Datei?

Markdown, wenn die Struktur der Seite Teil dessen ist, was Sie brauchen. Dokumentation mit Codebeispielen und Überschriftenhierarchie. Ein Tutorial mit nummerierten Schritten. Ein Vergleichsartikel, der um eine Tabelle herum gebaut ist. Ein Newsletter mit Abschnitten. In all diesen Fällen tragen die #, die Pipes und die eingezäunten Blöcke echte Information, und ein HTML-in-Markdown-Konverter für LLM-Workflows tut genau das, was Sie erwarten.

HTML in reinen Text, wenn Sie ausschließlich die Wörter wollen — ein Korpus aufbauen, einen Klassifikator füttern, für die Suche indexieren oder irgendeine Pipeline fahren, in der Syntaxzeichen nur Rauschen sind. Oben auf dieser Seite wechselt ein Formatumschalter zwischen beiden und nimmt Ihre ausgewählte Datei mit, sodass Sie dieselbe Seite für einen Vergleich nur ein einziges Mal hochladen müssen.

Wofür das in der Praxis eingesetzt wird

  • Doku an einen Coding-Assistenten verfüttern. Die Seiten der Bibliotheksdokumentation speichern, nach Markdown umwandeln und zusammen mit Ihrem GitHub-Repository als Text einfügen. Das Modell sieht die API-Oberfläche und Ihre Verwendung davon, und die Codeblöcke bleiben auf beiden Seiten intakt.
  • Eine Website migrieren. Static-Site-Generatoren fressen Markdown. Alte HTML-Seiten umzuwandeln ist oft der schnellste erste Durchgang einer CMS-Migration, auch wenn Sie danach nacharbeiten.
  • Artikel für die spätere Auswertung archivieren. Markdown-Dateien sind klein, diff-bar und greppbar — ein Ordner voller gespeicherter HTML-Dateien ist das nie.
  • E-Mail-Vorlagen in lesbaren Inhalt verwandeln. Marketing-HTML ist Tabellensuppe; die Markdown-Fassung ist die eigentliche Botschaft.
  • Prompt-Bibliotheken aufbauen. Referenzmaterial in Markdown wandert ohne weitere Verarbeitung direkt in einen System-Prompt oder einen RAG-Index.

Der praktische Teil ist hier der Token-Zähler unter der Ausgabe. Eine Doku-Seite, die im Browser kurz wirkte, kann mit Tabellen und Codeblöcken überraschend schwer werden, und die Zahl vorher zu kennen ist besser, als sie aus einem Abbruch wegen Überlänge zu erfahren.

Häufige Fragen

Wie wandle ich eine HTML-Datei in Markdown um?

Laden Sie oben die .html- oder .htm-Datei hoch, und zurück kommt Markdown, herunterladbar als .md. Kostenlos, 50 MB pro Datei, kein Konto. Überschriften werden auf #-Ebenen abgebildet, Listen bleiben verschachtelt, Links behalten ihre URLs in der Form [text](url), und Codeblöcke bleiben eingezäunt.

Bleiben die Links samt URL erhalten?

Ja — das ist der Hauptgrund, hier Markdown statt reinem Text zu nehmen. Jeder Anker wird zu [label](href), die Ziele überleben also. Wer Dokumentation archiviert oder prüft, wohin eine Seite verweist, hält damit einen brauchbaren Nachweis in der Hand statt einer Umschreibung.

Kann ich statt einer gespeicherten Datei eine Live-URL umwandeln?

Von dieser Seite aus nicht. Web2Txt nimmt eine URL entgegen, holt die Seite und liefert in einem Schritt Markdown. Diese Seite ist für HTML gedacht, das schon auf der Platte liegt — gespeicherte Artikel, exportierte Newsletter, erzeugte Berichte oder die Ausgabe eines lokalen Builds.

Taugt das, um eine Website auf einen Static-Site-Generator zu migrieren?

Für die Inhalte ja. Fließtext, Überschriften, Listen, Tabellen und Codeblöcke werden sauber genug umgewandelt, um sie zu committen und weiterzubearbeiten. Was dabei nicht passiert: Ihre Informationsarchitektur wird nicht neu gebaut, interne Links werden nicht auf neue Pfade umgeschrieben, Front Matter entsteht keines — das sind die Teile einer Migration, die unabhängig vom Konverter Handarbeit bleiben.

Was passiert mit Tabellen und Codeblöcken?

Tabellen werden zu Pipe-Tabellen, eingezäunte Codeblöcke bleiben eingezäunt; beides übersteht die Umwandlung meist gut, weil das Quell-HTML sie ausdrücklich ausgezeichnet hat. Der übliche Verlust ist die Syntaxhervorhebung, die über <span>-Klassen pro Token ausgedrückt war — der Code stimmt, aber der Sprachhinweis hinter der Einfärbung lässt sich oft nicht rekonstruieren, also tragen Sie ihn bei Bedarf von Hand nach.

Weitere Formate und Werkzeuge

HTML ist eines der Formate, die File2Txt beherrscht — laden Sie irgendetwas hoch, es findet selbst heraus, was zu tun ist. Wissen Sie, was Sie haben, gehen Sie direkt zu PDF in Markdown, Word in Markdown, JSON in Markdown oder XML in Markdown. Für tabellarische Exporte baut CSV in Markdown Pipe-Tabellen aus Daten mit Trennzeichen.

Für Code gibt es den GitHub-in-Text-Konverter, eine GitLab-Variante und einen Konverter für lokale Ordner, der nie etwas hochlädt. Dazu kommt ein längerer Text darüber, wie man Dokumente für LLMs vorbereitet, falls Sie die allgemeine Argumentation statt der HTML-spezifischen suchen.

Repo2Txt wird entwickelt und gepflegt von v12hero, einem unabhängigen Entwickler, der native Apps und Web-Apps mit Datenschutz an erster Stelle baut.