Konvertieren Sie EPUB in Markdown online kostenlos

Konvertieren Sie EPUB-Dateien kostenlos online in Markdown. Datei hochladen und sofort eine saubere, für LLMs geeignete Ausgabe erhalten. Ohne Anmeldung, bis 50 MB, nichts wird gespeichert.

EPUB in Markdown umwandeln: ein Buch, das seine Kapitel behält

Benennen Sie eine .epub in .zip um und entpacken Sie sie. Sie finden einen Ordner mit XHTML-Dateien, ein oder zwei Stylesheets, ein paar Bilder und ein Manifest namens content.opf, das jedes Einzelteil auflistet und die Lesereihenfolge festlegt. Das ist das ganze Format. Ein EPUB ist kein rätselhafter Binärklumpen — es ist eine kleine Website in einer Tüte, mit eingebautem Inhaltsverzeichnis.

Genau das macht es zu ungewöhnlich gutem Ausgangsmaterial. Wenn Sie EPUB in Markdown umwandeln, raten Sie nicht die Struktur zusammen, wie Sie es bei einem PDF müssten. Die Überschriften waren schon Überschriften. Kapitel eins war schon ein eigenes Dokument. Die Lesereihenfolge war deklariert, nicht erschlossen. Werfen Sie oben eine Datei in den Konverter und Sie bekommen eine Markdown-Fassung des Buchs mit intakter Hierarchie — kostenlos, ohne Anmeldung, 50 MB Limit, bei uns bleibt nichts liegen.

Warum die Struktur so gut überlebt

Drei Dinge im Container erledigen die eigentliche Arbeit, und es lohnt sich zu wissen, was jedes davon beiträgt:

  • Die XHTML-Inhaltsdateien. Echtes semantisches Markup — <h1>, <h2>, <blockquote>, <ol>. Das bildet sich nahezu eins zu eins auf Markdown ab. Aus einer Kapitelüberschrift wird #, aus einem Abschnitt ##, aus einem herausgestellten Zitat >, und kursiv gesetzte Buchtitel bleiben kursiv.
  • Die Spine. Die OPF-Datei listet die Dokumente in Lesereihenfolge, sodass Kapitel auch dann korrekt sortiert herauskommen, wenn die internen Dateinamen so nichtssagend heißen wie part0009.xhtml.
  • Das Navigationsdokument. Das Inhaltsverzeichnis des Buchs selbst. Ihm verdanken Sie es, dass Kapiteltitel als Titel überleben, statt als anonyme Zeile Fettschrift anzukommen.

Praktisch heißt das: Das Markdown, das Sie zurückbekommen, ist navigierbar. Sie können zu Kapitel 12 scrollen, es herausschneiden und nur das in ein Modell einfügen. Versuchen Sie dasselbe mit 400 Seiten flachem Text und Sie arbeiten mit grep und viel Hoffnung.

Die Stellen, die einen zweiten Blick brauchen

Nichts davon ist ein K.-o.-Kriterium, aber die Ausgabe eine Minute lang darauf zu überfliegen erspart später Verwirrung.

  • Titelei und Anhang fahren mit. Impressum, Widmung, „vom selben Autor“, Danksagung, Registerreste. In einem Lern-Workflow sind das ein paar tausend Tokens Nichts. Löschen Sie sie, bevor Sie einfügen.
  • Fuß- und Endnoten wandern. Im Original sind es Links auf eine Notendatei am Ende des Buchs. Im fließenden Markdown häufen sie sich entweder am Kapitelende oder erscheinen als nackte Zahlen dort, wo die Referenz stand. Bei Belletristik egal. Bei einer wissenschaftlichen Monografie, in der die halbe Argumentation in den Anmerkungen steckt, prüfen Sie erst, wo sie gelandet sind, bevor Sie darauf aufbauen.
  • Bilder werden nicht zu Text. Titelbild, Diagramme und Karten sind Dateien im Archiv, keine Wörter. Hier gibt es keine OCR, die Beschriftungen eines Diagramms tauchen also nicht auf. Trägt eine Abbildung die Erklärung, brauchen Sie das Original daneben.
  • Überschriftenebenen können uneinheitlich sein. Manche Verlage markieren jedes Kapitel als <h1>, andere nehmen <h1> für Teile und <h2> für Kapitel, und ein paar verwenden gestylte <p>-Tags und gar keine echten Überschriften. Der letzte Fall ist selten, aber genau der, bei dem ein Buch mit offensichtlichen Kapiteln flach konvertiert herauskommt.
  • Initialen und Kapitälchen am Kapitelanfang. Ein Kapitel, das mit einem großen dekorativen „I“ beginnt, kann als versprengtes Zeichen auf eigener Zeile auftauchen. Kosmetisch, leicht zu erkennen.

DRM stoppt das komplett — lesen Sie das vor dem Upload

Die meisten EPUBs aus einem kommerziellen Shop tragen ein Digital-Rights-Management. Die Inhaltsdateien im Container sind verschlüsselt, und neben dem Manifest liegt eine encryption.xml, die genau das festhält. Kein Konverter kann sie lesen, dieser auch nicht. Laden Sie ein DRM-geschütztes Buch hoch, bekommen Sie eine Fehlermeldung oder ein leeres Ergebnis — die Ursache ist die Datei, nicht das Werkzeug.

DRM-freie EPUBs gibt es aber überall. Project Gutenberg, Standard Ebooks, die meisten Fachverlage, Universitätsverlage, Creative-Commons-Veröffentlichungen, alles, was Sie selbst aus einem Schreibprogramm exportiert haben, und ein guter Teil unabhängiger Shops, die aus Prinzip unverschlüsselte Dateien verkaufen. Das konvertiert alles ohne Murren.

Zur naheliegenden Frage: Ein Buch, das Ihnen gehört, zum Selbststudium zu konvertieren, ist normale private Nutzung; den urheberrechtlich geschützten Text eines anderen neu zu veröffentlichen, ist etwas völlig anderes. Das ist der ganze Rat.

Ein ganzes Buch passt nicht — arbeiten Sie kapitelweise

Ein Roman in voller Länge liegt bei rund 100.000 Wörtern, ein dichtes Sachbuch kann das Doppelte haben. In Tokens umgerechnet ist das weit mehr, als die meisten Modelle auf einmal nehmen, und selbst die Long-Context-Modelle werden merklich unschärfer, je voller sie sind. Die Aufmerksamkeit verteilt sich dünn. Details in der Mitte fallen unter den Tisch.

Genau hier verdient sich Markdown seinen Vorsprung vor flachem Text. Weil die Kapitelüberschriften überleben, können Sie die Datei sauber zerteilen und Kapitel für Kapitel arbeiten:

  • Jedes Kapitel einzeln zusammenfassen, die Zusammenfassungen dann als ein kurzes Dokument wieder einspeisen und nach dem roten Faden des ganzen Buchs fragen.
  • Pro Kapitel einen Lernleitfaden bauen — Kernthesen, Begriffe, Fragen — und alles zu einer Referenz zusammennähen.
  • Gezielte Fragen an ein einzelnes Kapitel stellen, sodass die Antwort des Modells aus 6.000 Wörtern kommt, statt sich über 150.000 zu verdünnen.
  • Zuerst den Überschriftenbaum in eine Gliederung verwandeln. Das ist ein schneller Weg zu entscheiden, welche drei Kapitel für Ihren Zweck wirklich zählen.

Der Token-Zähler unter der Ausgabe ist hier das nützliche Signal. Er sagt Ihnen vor dem Einfügen, ob Sie es mit einer Kapitel- oder einer Ganzbuch-Aufgabe zu tun haben.

EPUB gegen das PDF desselben Buchs

Wenn Sie beides haben, nehmen Sie das EPUB. Jedes Mal. Die zwei Formate lösen gegensätzliche Probleme, und man sieht es dem Ergebnis an.

Ein PDF hat ein festes Layout — Glyphen, die an Koordinaten auf einer Seite festgenagelt sind, deren Größe sich nie ändert. Extraktion heißt dort, Sätze aus Positionen zu rekonstruieren, Überschriften aus Schriftgrößen abzuleiten und zu raten, ob zwei Spalten verschränkt gelesen werden müssen. Kolumnentitel und Seitenzahlen landen mitten in Absätzen. PDF zu Markdown macht das gut, aber es bleibt Rekonstruktionsarbeit.

EPUB ist fließend. Es gibt keine Seiten, also kein Seitenmobiliar zum Entfernen und keine Spaltengeometrie zum Entwirren. Die Struktur ist ausgesprochen statt angedeutet. Das Einzige, was PDF besser festhält, ist präzise Typografie — komplexe Tabellen, exakt platzierte Marginalien, alles, wo die Anordnung auf der Seite Teil der Bedeutung ist. Für Fließtext gewinnt EPUB deutlich.

Wofür Leute das einsetzen

  • Ein Fachbuch durcharbeiten. Einen Titel im O'Reilly-Stil konvertieren, das Kapitel behalten, an dem Sie gerade sitzen, und es mit Ihrem GitHub-Repository als Text kombinieren, damit ein Assistent Theorie und Ihren echten Code zugleich sieht.
  • Eine persönliche Referenz aufbauen. Die Überschriftenhierarchie macht konvertierte Bücher in Obsidian, einem Wiki oder einem schlichten Ordner voller .md-Dateien durchsuchbar — und zwar auf eine Art, wie es eine E-Reader-Bibliothek nicht ist.
  • Eine Leseliste aus einem Kurs abarbeiten. Zusammenfassungen auf Kapitelebene und generierte Übungsfragen, rückverfolgbar bis zu dem Abschnitt, aus dem sie stammen.
  • Arbeit am Manuskript. Autorinnen und Lektoren exportieren aus Scrivener oder Vellum ein EPUB, konvertieren es und haben eine diff- und versionierbare Fassung des Entwurfs.

Wenn Sie stattdessen das ganze Buch als einen ununterbrochenen Textfluss wollen — für Embeddings, Lesbarkeitswerte oder um ein ganzes Regal auf einmal zu indizieren — passt EPUB zu Text besser. Der Format-Umschalter oben auf dieser Seite wechselt zwischen beiden und behält die bereits gewählte Datei, sodass der Vergleich beider Ausgaben einen Klick statt eines zweiten Uploads kostet.

Häufige Fragen

Wie wandle ich ein EPUB in Markdown um?

Laden Sie die .epub oben hoch, und das Buch kommt als Markdown mit intakter Überschriftenstruktur zurück, herunterladbar als .md. Kostenlos, 50 MB pro Datei, ohne Anmeldung. EPUB ist unter der Haube XHTML, also ist das eine strukturerhaltende Konvertierung und keine verlustbehaftete Extraktion — es konvertiert besser als fast jedes andere Format hier.

Warum lässt sich EPUB so sauber nach Markdown konvertieren?

Weil die Quelle bereits semantisches Markup ist. Ein EPUB ist ein Zip aus XHTML-Dateien, in denen ein Kapiteltitel tatsächlich ein <h1> ist und Hervorhebung tatsächlich ein <em> — die Struktur ist festgehalten, nicht aus dem Aussehen abgeleitet. Die Abbildung auf Markdown ist fast eine direkte Übersetzung, und deshalb überleben Überschriften, Listen, Blockzitate und Kursivsatz allesamt.

Werden Kapitelüberschriften zu Markdown-Überschriften?

Ja, auf der Ebene, die das Buch selbst deklariert hat. Ein Buch mit Teilen und Kapiteln ergibt also eine verschachtelte statt einer flachen Gliederung. Damit wird die Ausgabe wirklich navigierbar — Sie können sie im Editor einklappen, auf einen Abschnitt verlinken oder ein Modell zu einem bestimmten Kapitel befragen und es findet die richtige Stelle.

Werden DRM-geschützte Bücher unterstützt?

Nein. Verschlüsselte Dateien von Kindle oder Apple Books enthalten keinen lesbaren Inhalt, solange die Lese-App, der sie gehören, sie nicht entschlüsselt hat — die Konvertierung liefert also nichts. DRM-freie EPUBs — Gutenberg, Standard Ebooks, die meisten Fachverlage, Ihre eigenen Manuskripte — funktionieren ohne Sonderbehandlung.

Taugt das, um aus Büchern ein RAG-Korpus zu bauen?

Von den beiden Formaten ist es der bessere Ausgangspunkt. Die Überschriftenstruktur gibt Ihnen natürliche Chunk-Grenzen, sodass Sie an Kapiteln oder Abschnitten trennen können statt an einer willkürlichen Zeichenzahl, die mitten in ein Argument schneidet. Will Ihr Chunker lieber nackten Fließtext, spart EPUB zu Text die Syntax ein.

Der Rest des Werkzeugkastens

EPUB ist eines von dreizehn Formaten, die hier behandelt werden. File2Txt nimmt jedes davon aus einem einzigen Upload, wenn Sie sich nicht für eine Seite entscheiden wollen. Für Manuskripte und Berichte gibt es Word zu Markdown, für ältere Rich-Text-Dokumente RTF zu Markdown und für gespeicherte Webseiten HTML zu Markdown. Ein ganzes Regal Bücher, zusammen gezippt, läuft in einem Durchgang durch ZIP zu Markdown.

Sie arbeiten mit Code oder dem lebenden Web? Konvertieren Sie ein GitLab-Projekt oder einen Ordner auf Ihrem Rechner, oder richten Sie Web2Txt auf eine URL. Der Leitfaden zur Aufbereitung von Dokumenten für LLMs umreißt das Ganze im Zusammenhang.

Repo2Txt wird entwickelt und gepflegt von v12hero, einem unabhängigen Entwickler, der native und Web-Apps mit Fokus auf Datenschutz baut.