Konvertieren Sie EPUB in Text online kostenlos

Konvertieren Sie EPUB-Dateien kostenlos online in Text. Datei hochladen und sofort eine saubere, für LLMs geeignete Ausgabe erhalten. Ohne Anmeldung, bis 50 MB, nichts wird gespeichert.

EPUB in Text umwandeln: aus einem Bücherregal etwas machen, mit dem man rechnen kann

Bücher sind der am besten redigierte Langtext, den es gibt. Professionell geschrieben, professionell lektoriert, tausende Wörter in konsistenter Stimme, ohne dazwischengemischte Navigationsmenüs, Cookie-Banner oder Kommentarspalten. Als Rohmaterial für alles Sprachförmige — Embeddings, Stilanalyse, Retrieval, das Training eines Klassifikators auf Tonfall — ist das schwer zu schlagen.

Das Problem: Es steckt in einem gezippten Bündel aus XHTML-Dateien. Ein EPUB-zu-Text-Konverter holt es heraus: ein durchgehender Textfluss, keine Tags, keine Auszeichnungszeichen, nichts, was Ihrem Tokenizer erst beigebracht werden muss zu ignorieren. Oben hochladen, Sekunden später ist es zurück. Kostenlos, ohne Anmeldung, 50 MB Limit, nichts wird gespeichert.

Warum reiner Text hier die richtige Form ist

Reiner Text ist hier nicht die Sparvariante. Für das meiste, was man mit Büchern in größerem Maßstab macht, ist es das Format, das die Werkzeuge tatsächlich erwarten:

  • Embeddings und semantisches Retrieval. Text in Chunks schneiden, jeden Chunk einbetten, über Ähnlichkeit wiederfinden. Markdown-Rauten und Sternchen belegen Token-Positionen und tragen nichts zur Bedeutung bei — sie verwässern den Vektor. Saubere Absätze werden besser gefunden, und jede Chunking-Bibliothek dieser Welt nimmt standardmäßig Text.
  • Lesbarkeit und Stilometrie. Flesch-Kincaid, durchschnittliche Satzlänge, Type-Token-Ratio, Wortschatzreichtum, Interpunktionsrhythmus. Das sind Maße auf Wort- und Satzebene, und Formatierungstokens verfälschen jedes einzelne davon.
  • Suchindizierung über eine ganze Bibliothek. Postgres-tsvector, SQLite FTS5, Elasticsearch oder schlicht ein Ordner, den Sie mit grep durchgehen. Alle wollen rohen Text in einem Feld. Fünfzig konvertierte Bücher ergeben eine wirklich schnelle persönliche Suchmaschine.
  • Korpuslinguistik und NLP-Pipelines. Konkordanzen, Kollokationsanalyse, Eigennamenerkennung, Topic Modeling. spaCy und NLTK nehmen Strings, kein Markup.
  • Sprachausgabe und Barrierefreiheit. Geben Sie einer TTS-Engine Markdown, liest sie bereitwillig „Raute Raute Kapitel vier“ vor.
  • Ausgaben vergleichen. Zwei Auflagen desselben Titels, zu Text extrahiert, durch ein Diff auf Wortebene geschickt — so finden Sie heraus, was eine zweite Auflage wirklich geändert hat.

Was Sie beim Plattmachen aufgeben

Kapitelgrenzen. Das ist der eigentliche Preis, und bei Büchern wiegt er schwerer als bei den meisten anderen Dokumenttypen, weil ein Buch lang genug ist, dass „wo bin ich gerade“ eine Rolle spielt.

Im EPUB-Original ist jedes Kapitel eine eigene XHTML-Datei mit einem Überschriften-Tag und einem Eintrag im Navigationsdokument. Flachgeklopft wird aus einem Kapiteltitel eine kurze Textzeile über einer langen Textzeile, ohne dass irgendetwas sie als anders markiert. Bitten Sie ein Modell, „Kapitel sieben zusammenzufassen“, muss es allein aus dem Wortlaut herausfinden, wo sieben anfängt. Meistens klappt das. Manchmal setzt es einen Absatz zu spät an und fasst still und leise das Falsche zusammen.

Auch Blockzitate heben sich nicht mehr sichtbar von der Erzählung ab, was bei Sachbüchern zählt, wo zitiertes Quellenmaterial und die eigene Argumentation des Autors nebeneinanderstehen. Wenn irgendetwas davon für Ihren Zweck tragend ist, nehmen Sie stattdessen EPUB zu Markdown — dort überlebt der Überschriftenbaum und Sie können die Datei sauber nach Kapiteln zerlegen. Der Format-Umschalter oben auf dieser Seite wechselt zwischen beiden und nimmt Ihre ausgewählte Datei mit, sodass Sie beide Ausgaben erzeugen und vergleichen können, ohne zweimal hochzuladen.

Typografie-Artefakte, die eine Bereinigung lohnen

Verlage setzen ordentlich, was zum Lesen großartig und zum Rechnen leicht lästig ist. Eine Handvoll Dinge taucht in extrahiertem Buchtext zuverlässig auf, und ein einziger Durchgang mit Suchen-und-Ersetzen erledigt die meisten davon:

  • Typografische Anführungszeichen und Apostrophe. Bücher verwenden echte Anführungszeichen, nicht " und '. Tokenizer kommen damit meist klar, naive Regex und String-Vergleiche nicht — suchen Sie in einem Roman nach don't und Sie finden womöglich nichts, während die Seite voll ist mit don’t.
  • Geviert- und Halbgeviertstriche. Oft ohne Leerzeichen gesetzt, weshalb Satzerkennungen gelegentlich zwei Sätze zusammenkleben oder einen an der falschen Stelle auseinanderreißen.
  • Weiche Trennstriche und geschützte Leerzeichen. Auf dem Bildschirm unsichtbar, im Bytestrom vorhanden — und klammheimlich dafür verantwortlich, dass Wortzählungen zu nichts passen.
  • Ligaturen. „fi“ und „fl“ sind manchmal einzelne Glyphen. Normalerweise werden sie sauber extrahiert, aber eine ungewöhnliche eingebettete Schrift kann in einzelnen Wörtern seltsame Zeichen erzeugen.
  • Titelei und Anhang. Titelseite, Copyright-Vermerk, Widmung, Danksagung, „über den Autor“, Registerreste. Standardtext, der in jedem konvertierten Buch auftaucht und deshalb über ein Korpus hinweg zu einem trügerisch häufigen Vokabular wird. Schneiden Sie ihn weg, wenn Sie mit Häufigkeiten arbeiten.

Nichts davon ist Schlamperei des Konverters. Es steht tatsächlich so in der Datei, und zu wissen, wonach man suchen muss, ist der halbe Weg.

DRM — und woher konvertierbare Bücher kommen

Ein bei einem großen Händler gekauftes Buch ist in der Regel verschlüsselt. Das XHTML im Container ist verwürfelt und eine encryption.xml deklariert das, sodass kein Konverter — dieser eingeschlossen — auch nur ein Wort davon lesen kann. Laden Sie so eine Datei hoch, bekommen Sie eine Fehlermeldung oder eine leere Ausgabe. Gut zu wissen, bevor Sie zehn Minuten rätseln, was schiefgelaufen ist.

Viele gute Quellen sind von Haus aus DRM-frei. Der gemeinfreie Katalog von Project Gutenberg ist riesig und ideal für Korpusarbeit. Standard Ebooks produziert sorgfältig gesetzte gemeinfreie Ausgaben mit ungewöhnlich sauberem Markup. Die meisten Fachverlage, arXiv-nahe Publikationen, Creative-Commons-Titel und alles, was Sie selbst exportiert haben, konvertieren klaglos. Bücher, die Ihnen gehören, für Ihr eigenes Studium zu konvertieren, ist normaler Gebrauch; den extrahierten Text eines urheberrechtlich geschützten Buchs zu verbreiten, nicht. Mehr muss man dazu nicht sagen.

Das Ganze über eine komplette Bibliothek

Ein Buch zu konvertieren ist eine Zwei-Sekunden-Sache. Interessant wird es, wenn Sie vierzig konvertieren und das Ergebnis als Datensatz behandeln. Ein paar Dinge, die das reibungslos machen:

  • Packen Sie den Stapel in ein Zip. ZIP zu Text nimmt ein Archiv und konvertiert jede unterstützte Datei darin in einem Durchgang, was vierzig einzelne Uploads schlägt. Achten Sie auf die 50-MB-Grenze — EPUBs sind klein, illustrierte nicht.
  • Normalisieren Sie, bevor Sie chunken. Anführungszeichen geradeziehen, weiche Trennstriche entfernen, mehrfache Leerzeilen zusammenfassen. Einmal beim Einlesen erledigt, und jeder folgende Schritt wird einfacher.
  • Chunken Sie an Absatzgrenzen, nicht nach fester Zeichenzahl. Bücher haben echte Absätze, und die sind natürliche semantische Einheiten. Blinde Schnitte alle 1.000 Zeichen zerteilen Sätze und erzeugen Embeddings von Fragmenten.
  • Behalten Sie den Dateinamen als Metadatum. Sobald alles ein einziger Textstrom ist, sind Titel und Autor die einzige Herkunftsangabe, die Sie noch haben. Speichern Sie sie neben jedem Chunk, sonst finden Sie eine großartige Passage und wissen nicht, aus welchem Buch sie stammt.
  • Schauen Sie auf die Tokenzahl. Der Zähler unter der Ausgabe gibt Ihnen die echte Zahl für einen konkreten Titel — das ist der Unterschied zwischen eine Pipeline planen und eine Pipeline raten.

EPUB ist besseres Ausgangsmaterial als die PDF-Fassung

Gibt es denselben Titel in beiden Formaten, liefert das EPUB mit weniger Aufwand saubereren Text. Ein PDF hat ein festes Layout: Jede sichtbare Zeile ist eine eigene Folge von Glyphen, Absätze kommen also in kurze Zeilen zerhackt an, über den Zeilenumbruch getrennte Wörter bleiben getrennt, und alle paar hundert Wörter landen Kolumnentitel und Seitenzahl mitten in Ihrem Text. PDF zu Text geht mit all dem um, aber Sie werden hinterher aufräumen.

EPUB ist fließend. Es gibt keine Seiten, also auch kein Seitenmobiliar, und Absätze sind im Markup echte Absätze — sie kommen als durchgehende Zeilen heraus, über die eine Regex-Suche hinweg greifen kann. Für alles, was mit Phrasensuche, Satzsegmentierung oder Embeddings zu tun hat, lohnt allein dieser Unterschied den Wechsel.

Häufige Fragen

Wie kann ich ein EPUB in Text umwandeln?

Ziehen Sie die .epub in den Konverter oben, und der Text des Buchs kommt als reiner Text zurück, den Sie als .txt herunterladen können. Kostenlos, ohne Anmeldung, 50 MB pro Datei — deutlich mehr, als ein fließendes E-Book je braucht, denn EPUB ist komprimiertes HTML und selbst lange Bücher überschreiten selten ein paar Megabyte.

Funktioniert das mit bei Kindle oder Apple Books gekauften Büchern?

Nur wenn sie DRM-frei sind. Ein gekauftes Buch ist meist verschlüsselt und an das Konto gebunden, das es erworben hat, und in einer verschlüsselten Datei steckt kein lesbarer Text, an den irgendein Konverter herankäme. Gemeinfreie Titel von Project Gutenberg, Standard Ebooks, Fachbücher von Verlagen, die unverschlüsselte Dateien verkaufen, und Ihre eigenen Exporte konvertieren ganz normal.

Bleiben Kapitel in der Ausgabe getrennt?

Kapitelgrenzen überleben als Umbrüche im Textfluss, aber Kapiteltitel kommen als gewöhnliche Zeilen an, ohne dass sie als Überschrift markiert wären — das liegt in der Natur des Plattmachens. Wenn Sie hinterher nach Kapiteln navigieren oder chunken wollen, behält EPUB zu Markdown die Überschriftenebenen, die das ermöglichen.

Und was ist mit Fuß- und Endnoten?

Die kommen mit, in der Regel gesammelt am Ende des Abschnitts, zu dem sie gehörten, statt inline dort, wo die Marke stand. Bei wissenschaftlichen Texten heißt das: Zwischen den Kapiteln steht ein Block mit Notentexten. Leicht zu überlesen, aber gut zu wissen, wenn Sie die Ausgabe für Embeddings chunken und sich fragen, warum ein Chunk nur aus Belegstellen besteht.

Kann ich so ein ganzes Buch an ein LLM geben?

Konvertieren können Sie es in einem Rutsch, aber prüfen Sie die Tokenzahl, bevor Sie einfügen. Ein Roman mit 300 Seiten liegt bei etwa 120.000 Tokens — passt in ein 200K-Kontextfenster und liegt deutlich über dem, was eine Chat-Oberfläche in einer einzelnen Nachricht akzeptiert. Der Zähler unter der Ausgabe nennt Ihnen die Zahl, bevor Sie es auf die harte Tour erfahren.

Der Rest des Werkzeugkastens

EPUB ist eines von dreizehn unterstützten Formaten. File2Txt nimmt sie alle aus einem einzigen Upload. Für Manuskripte gibt es Word zu Text, für alte Rich-Text-Dokumente RTF zu Text und für gespeicherte Artikel HTML zu Text. Eigene strukturierte Daten laufen über CSV zu Text oder JSON zu Text.

Über Dokumente hinaus: Konvertieren Sie ein GitHub-Repository zu Text, ein GitLab-Projekt oder einen lokalen Ordner, und holen Sie mit Web2Txt Live-Seiten als Text herunter. Es gibt einen ausführlicheren Leitfaden zur Aufbereitung von Dokumenten für LLMs, wenn Sie das größere Bild wollen.

Repo2Txt wird entwickelt und gepflegt von v12hero, einem unabhängigen Entwickler, der native und Web-Apps mit Fokus auf Datenschutz baut.