EPUB tot Markdown: een boek dat zijn hoofdstukken behoudt
Hernoem een .epub aan .zip en rits het uit. U vindt een map met XHTML-bestanden, a
stylesheet of twee, enkele afbeeldingen en een manifest genaamd content.opf waarin elk stuk wordt vermeld en
geeft de volgorde aan waarin ze worden gelezen. Dat is het hele formaat. Een EPUB is geen mysterieuze binaire klodder, maar dat is het wel
een kleine website in een tas, met een inhoudsopgave erin.
Dat maakt het een ongewoon goede grondstof. Wanneer jij converteer EPUB naar Markdown, dat ben je niet structuur raden zoals je moet doen met een pdf. De kopjes waren al kopjes. Hoofdstuk één was al een apart document. De leesvolgorde werd verklaard, niet afgeleid. Plaats een bestand in de bovenstaande converter en je krijgt een Markdown versie van het boek met de hiërarchie intact — gratis, geen aanmelding, limiet van 50 MB, niets bleef aan onze kant.
Waarom de structuur zo goed overleeft
Drie dingen in de container doen het zware werk, en het is de moeite waard om te weten wat elk daarvan bijdraagt:
- De XHTML-inhoudsbestanden. Echte semantische opmaak —
<h1>,<h2>,<blockquote>,<ol>. Deze komen in kaart Markdown bijna één op één. Er wordt een hoofdstukkop gemaakt#, een sectie wordt##, wordt een pull-quote>, cursief voor een boektitel blijft cursief. - De wervelkolom. Het OPF-bestand vermeldt de documenten in leesvolgorde, zodat er hoofdstukken verschijnen
correct geordend, zelfs als de interne bestandsnamen betekenisloze zaken zijn, zoals
part0009.xhtml. - Het navigatiedocument. De eigen inhoudsopgave van het boek. Het is het hoofdstuk Reden titels overleven als titels in plaats van als een anonieme regel vetgedrukte tekst.
Het praktische resultaat: de Markdown die u terugkrijgt, is bevaarbaar. Je kunt naar hoofdstuk 12 scrollen, het uitknippen,
en plak dat in een model. Probeer hetzelfde te doen met een platte tekstdump van 400 pagina's die u gebruikt
grep en veel hoop.
De stukjes die een tweede blik nodig hebben
Niets hier is een dealbreaker, maar het afromen van de uitvoer hiervan duurt een minuut en bespaart later verwarring.
- Voor- en achterkant komen mee voor de rit. Copyrightpagina, toewijding, "ook door deze auteur", dankwoord, indexstrookjes. In een studieworkflow zijn dat een paar duizend tokens van niets. Verwijder het voordat je plakt.
- Voetnoten en eindnoten worden verplaatst. In de bron staan links naar een notitiebestand op het einde van het boek. In vloeiende Markdown clusteren ze aan het einde van het hoofdstuk of verschijnen ze als kale cijfers waar de referentie stond. Voor fictie, irrelevant. Voor een academische monografie waar de helft het argument leeft in de aantekeningen, controleer waar ze terecht zijn gekomen voordat je er iets bovenop bouwt.
- Afbeeldingen worden geen tekst. Omslagafbeeldingen, diagrammen en kaarten zijn bestanden in het archief, geen woorden. Er is hier geen OCR, dus de labels van een diagram verschijnen niet. Als een figuur de uitleg, je hebt het origineel ernaast nodig.
- Kopniveaus kunnen inconsistent zijn. Sommige uitgevers markeren elk hoofdstuk als
<h1>, anderen gebruiken<h1>voor onderdelen en<h2>voor hoofdstukken, en een paar gebruiken stijl<p>tags en helemaal geen echte kopjes. Dat laatste geval is zeldzaam, maar het is degene die een plat ogende conversie oplevert van een boek dat duidelijk hoofdstukken bevat. - Drop-caps en small-caps-openingen. Een hoofdstuk dat begint met een groot decoratief 'I'-blikje oppervlak als een verdwaald personage op zijn eigen lijn. Cosmetisch, gemakkelijk te herkennen.
DRM stopt deze kou - Lees dit voordat u uploadt
De meeste EPUB's die in een commerciële winkel worden gekocht, bevatten digitaal rechtenbeheer. De inhoudsbestanden in het
container zijn gecodeerd, en er is een encryption.xml zit naast het manifest waarop staat
zo. Geen enkele converter kan ze lezen, en deze ook niet. Als u een DRM-beveiligd boek uploadt, krijgt u dit
een fout of een leeg resultaat, en het bestand is de reden, niet de tool.
DRM-vrije EPUB's zijn echter overal. Project Gutenberg, Standard Ebooks, de meeste technische uitgevers, universiteitspersen, Creative Commons-releases, alles wat u zelf vanuit een schrijfhulpmiddel hebt geëxporteerd, en a flink stuk onafhankelijke winkels die in principe onbezwaarde dossiers verkopen. Die converteren zonder gedoe.
Over de voor de hand liggende vraag: het omzetten van een boek dat je bezit, zodat je het kunt bestuderen, is gewoon persoonlijk gebruik; het opnieuw publiceren van iemands auteursrechtelijk beschermde tekst is iets heel anders. Dat is het hele advies.
Een heel boek past niet – werk hoofdstuk voor hoofdstuk
Een volledige roman telt ongeveer 100.000 woorden, en een dikke non-fictietitel kan het dubbele zijn. Omgerekend naar tokens is dat ruimschoots voorbij wat de meeste modellen in één keer zullen verwerken, en zelfs de modellen met een lange context worden merkbaar vager naarmate u ze invult. De aandacht verspreidt zich dun. Details in het midden worden overgeslagen.
Dit is precies waar Markdown zijn plaats verdient boven platte tekst. Omdat de hoofdstukkoppen overleven, jij kan het bestand netjes opdelen en hoofdstuk voor hoofdstuk bewerken:
- Vat elk hoofdstuk afzonderlijk samen, voer de samenvattingen vervolgens in als één kort document en vraag ernaar de doorlopende lijn van het hele boek.
- Stel een studiegids samen per hoofdstuk – belangrijke beweringen, termen, vragen – en voeg ze samen tot één referentie.
- Stel gerichte vragen over een enkel hoofdstuk, zodat het antwoord van het model eerder uit 6000 woorden komt dan verwaterd over 150.000.
- Verander de koptekstboom eerst in een schets. Het is een snelle manier om te beslissen welke drie hoofdstukken eigenlijk zijn maakt uit wat je doet.
De tokenteller onder de uitgang is hier het nuttige signaal. Het vertelt je voordat je plakt of je dat bent kijkend naar een taak ter grootte van een hoofdstuk of een taak van een heel boek.
EPUB versus de pdf van hetzelfde boek
Als je beide hebt, neem dan de EPUB. Elke keer. De twee formaten lossen tegengestelde problemen op en dat blijkt uit de uitgang.
Een PDF heeft een vaste lay-out: glyphs die zijn vastgemaakt aan coördinaten op een pagina en die nooit van formaat veranderen. Extractie betekent zinnen reconstrueren op basis van posities, koppen afleiden uit lettergroottes en raden of er twee zijn kolommen moeten tussen elkaar liggen. Lopende kopteksten en paginanummers komen in het midden van alinea's terecht. PDF naar Markdown regelt alles Dat is goed, maar het is wederopbouwwerk.
EPUB is reflowbaar. Er zijn geen pagina's, dus er is geen paginameubilair dat moet worden verwijderd en geen kolomgeometrie ontwarren. De structuur wordt eerder vermeld dan geïmpliceerd. Het enige waar PDF beter aan vasthoudt, is nauwkeurig typografische lay-out - complexe tabellen, zijbalken die precies zo zijn gepositioneerd, alles waar de indeling op staat pagina maakt deel uit van de betekenis. Voor proza wint EPUB comfortabel.
Waar mensen dit voor gebruiken
- Een technisch boek bestuderen. Converteer een titel in O'Reilly-stijl en behoud het hoofdstuk waar u naar op zoek bent doorwerken en koppelen met uw GitHub opslagplaats als tekst dus een assistent kunt de theorie en uw daadwerkelijke code samen zien.
- Een persoonlijke referentie opbouwen. De kophiërarchie maakt geconverteerde boeken doorzoekbaar
in Obsidian, een wiki, of een gewone map van
.mdbestanden – doorzoekbaar op een manier zoals een e-reader bibliotheek niet. - Werken met een cursusleeslijst. Samenvattingen op hoofdstukniveau en gegenereerde praktijk vragen, terug te voeren op de sectie waar ze vandaan kwamen.
- Manuscriptwerk. Auteurs en redacteuren exporteren een EPUB vanuit Scrivener of Vellum, converteren en verkrijg een variabele, versiebeheersbare kopie van het concept.
Als je het hele boek als één ononderbroken prozastroom wilt hebben – voor insluitingen, leesbaarheidsscores, of een plank vol titels in één keer indexeren — EPUB naar tekst past beter. De formaatschakelaar bovenaan deze pagina schakelt tussen de twee en behoudt het bestand dat u al hebt geselecteerd, dus het vergelijken van beide outputs kost één klik in plaats van een tweede upload.
Veelgestelde vragen
Hoe converteer ik een EPUB naar Markdown?
Upload de .epub hierboven en het boek komt terug als Markdown met de kopstructuur intact, te downloaden als .md. Gratis, 50 MB per bestand, geen aanmelding. EPUB is XHTML daaronder, dus dit is een structuurbehoudende conversie in plaats van een lossy-extractie; het converteert beter dan bijna elk ander formaat hier.
Waarom wordt EPUB zo netjes geconverteerd naar Markdown?
Omdat de bron al semantische markup is. Een EPUB is een zip-bestand van XHTML-bestanden waarbij de titel van een hoofdstuk echt een <h1> en de nadruk is echt een <em> — de structuur wordt vastgelegd, niet geïmpliceerd door hoe iets eruit ziet. Dat in kaart brengen met Markdown komt dicht in de buurt van een directe vertaling, en dat is de reden waarom koppen, lijsten, blokcitaten en cursief allemaal overleven.
Worden hoofdstukkoppen Markdown koppen?
Ja, op het niveau dat het boek aangeeft, dus een boek met delen en hoofdstukken produceert een geneste omtrek in plaats van een platte. Dat maakt de uitvoer echt navigeerbaar: u kunt deze in een editor samenvouwen, naar een sectie linken, of een model naar een specifiek hoofdstuk vragen en hem de juiste plaats laten vinden.
Worden met DRM beveiligde boeken ondersteund?
Nee. Gecodeerde bestanden van Kindle of Apple Books hebben geen leesbare inhoud totdat ze worden gedecodeerd door de reader-app waarvan ze eigenaar zijn, dus conversie levert niets op. DRM-vrije EPUB's – Gutenberg, standaard e-boeken, de meeste technische uitgevers, uw eigen manuscripten – werken zonder enige speciale behandeling.
Is dit nuttig voor het samenstellen van een RAG-corpus uit boeken?
Het is het betere startpunt van de twee formaten. De kopstructuur geeft je natuurlijke deelgrenzen, zodat je kunt opsplitsen in hoofdstukken of secties in plaats van op een willekeurig aantal tekens dat midden in het betoog wordt afgekapt. Als jouw chunker in plaats daarvan kaal proza wil, EPUB naar tekst slaat de syntaxis over.
De rest van de gereedschapskist
EPUB is een van de dertien formaten die hier worden behandeld. File2Txt neemt een van hen over van a enkele upload als u liever geen pagina kiest. Voor manuscripten en rapporten wel Woord naar Markdown, voor ouder rich-text-documenten RTF naar Markdown, en voor opgeslagen webpagina's HTML naar Markdown. Er gaat een plank met aan elkaar geritste boeken doorheen ZIP naar Markdown in één doorgang.
Werken met code of het live web? Converteer een GitLab-project of een map op uw machine, of punt Web2Txt op een URL. De gids voor het voorbereiden van documenten voor LLM's omvat de algemene vorm van dit alles.
Repo2Txt is gebouwd en onderhouden door v12hero, een onafhankelijke ontwikkelaar die native- en web-apps bouwt die privacy voorop stellen.