Converteer EPUB gratis online naar Tekst

Converteer EPUB bestanden gratis naar Tekst. Upload uw bestand en ontvang direct een schone, LLM-ready uitvoer. Geen aanmelding, 50 MB per bestand, niets opgeslagen.

EPUB naar tekst omzetten: van een boekenplank iets maken waar je op kunt rekenen

Boeken zijn het best geredigeerde lange proza dat we hebben. Professioneel geschreven, professioneel gecorrigeerd, duizenden woorden in een consistente stem zonder navigatiemenu's, cookiebanners of commentaarsecties ertussendoor. Als grondstof voor alles wat met taal te maken heeft — embeddings, stijlanalyse, retrieval, een classifier trainen om toon te herkennen — is dat moeilijk te verslaan.

Het probleem is dat het in een gezipte bundel XHTML-bestanden zit. Een EPUB naar tekst converter haalt het eruit: één doorlopende prozastroom, geen tags, geen opmaaktekens, niets wat je tokenizer moet leren negeren. Upload hierboven en het komt binnen enkele seconden terug. Gratis, geen account nodig, limiet van 50 MB, er wordt niets bewaard.

Waarom platte tekst de juiste vorm is voor dit werk

Platte tekst is hier niet de budgetoptie. Voor de meeste dingen die je op schaal met een boek doet, is het het formaat dat de tooling daadwerkelijk verwacht:

  • Embeddings en semantische retrieval. Chunk het proza, embed elke chunk, haal op via similariteit. Markdown-hekjes en sterretjes bezetten tokenposities en dragen niets bij aan de betekenis — ze verdunnen de vector. Schone alinea's worden beter teruggevonden, en elke chunking-library ter wereld neemt standaard tekst aan.
  • Leesbaarheid en stylometrie. Flesch-Kincaid, gemiddelde zinslengte, type-token-ratio, woordenschatrijkdom, interpunctieritme. Dit zijn metingen op woord- en zinsniveau, en opmaaktokens verpesten ze stuk voor stuk.
  • Zoekindexering over een bibliotheek. Postgres tsvector, SQLite FTS5, Elasticsearch, of gewoon een map waar je doorheen grept. Ze willen allemaal ruwe tekst in een veld. Vijftig geconverteerde boeken vormen een oprecht snelle persoonlijke zoekmachine.
  • Corpuslinguïstiek en NLP-pipelines. Concordanties, collocatie-analyse, named entity extraction, topic modelling. spaCy en NLTK nemen strings aan, geen markup.
  • Tekst-naar-spraak en toegankelijkheid. Een TTS-engine die Markdown krijgt leest vrolijk "hekje hekje Hoofdstuk Vier" hardop voor.
  • Edities diffen. Twee drukken van dezelfde titel, naar tekst geëxtraheerd, door een diff op woordniveau — zo vind je wat een tweede druk werkelijk heeft veranderd.

Wat je opgeeft door plat te slaan

Hoofdstukgrenzen. Dat is de echte prijs, en die weegt bij boeken zwaarder dan bij de meeste documenttypes, omdat een boek lang genoeg is dat "waar ben ik" ertoe doet.

In de bron-EPUB is elk hoofdstuk een apart XHTML-bestand met een koptag en een vermelding in het navigatiedocument. Platgeslagen wordt een hoofdstuktitel een korte tekstregel boven een lange tekstregel, zonder iets wat hem als anders markeert. Vraag een model om "hoofdstuk zeven samen te vatten" en het moet puur uit de bewoording afleiden waar zeven begint. Meestal lukt dat. Soms begint het een alinea te laat en vat het stilletjes het verkeerde samen.

Ook blockquotes zijn niet langer visueel te onderscheiden van de lopende tekst, wat uitmaakt bij non-fictie waar geciteerd bronmateriaal en het eigen betoog van de auteur naast elkaar staan. Is iets daarvan dragend voor wat je doet, kies dan EPUB naar Markdown — daar overleeft de koppenboom en kun je het bestand netjes per hoofdstuk opdelen. De formaat-schakelaar bovenaan deze pagina wisselt ertussen en neemt je gekozen bestand mee, zodat je beide kunt maken en vergelijken zonder twee keer te uploaden.

Typografische artefacten die het opruimen waard zijn

Uitgevers zetten netjes op, wat heerlijk is om te lezen en licht irritant om op te rekenen. Een handjevol dingen duikt betrouwbaar op in geëxtraheerde boektekst, en één ronde zoeken-en-vervangen lost het meeste op:

  • Gekrulde aanhalingstekens en apostrofs. Boeken gebruiken typografische aanhalingstekens, niet " en '. Tokenizers redden zich meestal, maar naïeve regex en stringmatching niet — zoek in een roman naar z'n en je vindt mogelijk niets, terwijl de pagina vol staat met z’n.
  • Em-dashes en en-dashes. Vaak zonder spaties eromheen, waardoor zinssplitsers af en toe twee zinnen aan elkaar plakken of er een op de verkeerde plek breken.
  • Zachte afbreekstreepjes en harde spaties. Onzichtbaar op het scherm, aanwezig in de bytestream, en stilletjes verantwoordelijk voor woordtellingen die nergens mee kloppen.
  • Ligaturen. "fi" en "fl" zijn soms één glyph. Ze extraheren doorgaans prima, maar een ongebruikelijk ingebed lettertype kan in een enkel woord vreemde tekens opleveren.
  • Voor- en nawerk. Titelpagina, copyrightvermelding, opdracht, dankwoord, "over de auteur", restanten van het register. Boilerplate die in elk boek dat je converteert terugkomt en zo in een corpus onterecht veelvoorkomend vocabulaire wordt. Knip het weg als je frequentiewerk doet.

Niets hiervan is slordigheid van de converter. Het zit echt zo in het bestand, en weten waar je op moet letten is het halve werk.

DRM, en waar converteerbare boeken vandaan komen

Een boek gekocht bij een grote retailer is meestal versleuteld. De XHTML in de container is onleesbaar gemaakt en een encryption.xml-bestand declareert dat, dus geen enkele converter — deze incluis — kan er een woord van lezen. Upload er een en je krijgt een foutmelding of lege uitvoer. Goed om te weten voordat je tien minuten zit te puzzelen wat er misging.

Genoeg goede bronnen zijn bewust DRM-vrij. De publiek-domeincatalogus van Project Gutenberg is enorm en ideaal voor corpuswerk. Standard Ebooks maakt zorgvuldig opgemaakte publiek-domeinedities met ongewoon schone markup. De meeste technische uitgevers, aan arXiv verwante persen, Creative Commons-titels en alles wat je zelf hebt geëxporteerd converteren zonder morren. Boeken die je bezit converteren voor eigen studie is gewoon gebruik; de geëxtraheerde tekst van een auteursrechtelijk beschermd boek verspreiden niet. Genoeg gezegd.

Dit doen over een hele bibliotheek

Eén boek converteren is een klus van twee seconden. De interessante variant is er veertig converteren en het resultaat als dataset behandelen. Een paar dingen die dat soepel laten verlopen:

  • Zip de batch. ZIP naar tekst neemt een archief en converteert elk ondersteund bestand erin in één keer, wat veertig aparte uploads verslaat. Let op het plafond van 50 MB — EPUB's zijn klein, maar geïllustreerde niet.
  • Normaliseer voordat je chunkt. Zet aanhalingstekens recht, strip zachte afbreekstreepjes, vouw herhaalde lege regels samen. Doe het één keer bij het inlezen en elke stap verderop wordt eenvoudiger.
  • Chunk op alineagrenzen, niet op vaste tekenaantallen. Boeken hebben echte alinea's en dat zijn natuurlijke semantische eenheden. Blind splitsen op 1.000 tekens hakt zinnen doormidden en levert embeddings van fragmenten op.
  • Bewaar de bestandsnaam als metadata. Zodra alles één tekststroom is, zijn titel en auteur de enige herkomst die je nog hebt. Sla ze op naast elke chunk, anders haal je straks een prachtige passage op zonder enig idee uit welk boek die kwam.
  • Controleer het tokenaantal. De teller onder de uitvoer geeft je het echte getal voor een titel, en dat is het verschil tussen een pipeline plannen en ernaar gokken.

EPUB is beter bronmateriaal dan de PDF-versie

Bestaat dezelfde titel in beide formaten, dan geeft de EPUB je schonere tekst met minder werk. Een PDF heeft een vaste lay-out: elke visuele regel is een aparte reeks glyphs, dus alinea's komen binnen als korte losse regels, woorden die over een regeleinde zijn afgebroken blijven afgebroken, en de koptekst en het paginanummer belanden om de paar honderd woorden midden in je proza. PDF naar tekst handelt dat allemaal af, maar je bent daarna wel aan het poetsen.

EPUB is reflowable. Er zijn geen pagina's, dus ook geen paginameubilair, en alinea's zijn in de markup echte alinea's — ze komen er dus uit als doorlopende regels waar een regex-zoekopdracht overheen kan matchen. Voor alles met een frasezoekopdracht, zinssplitsing of embeddings is dat verschil alleen al de wissel waard.

Veelgestelde vragen

Hoe zet ik een EPUB om naar tekst?

Sleep de .epub in de converter hierboven en de tekst van het boek komt terug als platte tekst die je als .txt kunt downloaden. Gratis, geen account nodig, 50 MB per bestand — ruimschoots meer dan enig reflowable e-boek nodig heeft, want EPUB is gecomprimeerde HTML en zelfs lange boeken komen zelden boven een paar megabyte uit.

Werkt het met boeken gekocht via Kindle of Apple Books?

Alleen als ze DRM-vrij zijn. Een gekocht boek is meestal versleuteld en gebonden aan het account dat het kocht, en een versleuteld bestand bevat voor geen enkele converter leesbare tekst. Publiek-domeintitels van Project Gutenberg en Standard Ebooks, technische boeken van uitgevers die onversleutelde bestanden verkopen, en je eigen exports converteren allemaal gewoon.

Blijven hoofdstukken gescheiden in de uitvoer?

Hoofdstukgrenzen overleven als onderbrekingen in de stroom, maar hoofdstuktitels komen binnen als gewone regels zonder iets wat ze als kop markeert — dat is de aard van platslaan naar tekst. Moet je daarna per hoofdstuk navigeren of chunken, dan behoudt EPUB naar Markdown de kopniveaus die dat mogelijk maken.

Wat gebeurt er met voet- en eindnoten?

Die komen mee, doorgaans verzameld aan het einde van de sectie waar ze bij hoorden in plaats van inline waar het nootcijfer stond. Bij wetenschappelijke teksten betekent dit dat tussen hoofdstukken een reeks noten verschijnt. Makkelijk overheen te lezen, maar goed om te weten als je de uitvoer chunkt voor embeddings en je afvraagt waarom één chunk louter citaties is.

Kan ik zo een heel boek aan een LLM voeren?

Je kunt het in één keer converteren, maar controleer het tokenaantal voordat je plakt. Een roman van 300 pagina's komt op grofweg 120.000 tokens — binnen een contextvenster van 200K, en ruim boven wat een chatinterface in één bericht accepteert. De teller onder de uitvoer vertelt je het getal voordat je er op de harde manier achter komt.

De rest van de gereedschapskist

EPUB is een van de dertien ondersteunde formaten. File2Txt behandelt ze allemaal vanuit één upload. Voor manuscripten is er Word naar tekst, voor oude rich-text-documenten RTF naar tekst, en voor opgeslagen artikelen HTML naar tekst. Je eigen gestructureerde data gaat door CSV naar tekst of JSON naar tekst.

Voorbij documenten: converteer een GitHub repository naar tekst, een GitLab-project of een lokale map, en gebruik Web2Txt om live pagina's als tekst binnen te halen. Er is een langere gids voor het voorbereiden van documenten voor LLM's als je het bredere plaatje wilt.

Repo2Txt wordt gebouwd en onderhouden door v12hero, een onafhankelijke ontwikkelaar die privacy-first native en webapps maakt.