EPUB 转 Markdown:一本章节还在的书
把 .epub 改名成 .zip 解压看看。里面是一个装满 XHTML 文件的文件夹、
一两个样式表、几张图片,外加一份叫 content.opf 的清单,列出每个部件并声明阅读
顺序。这就是整个格式。EPUB 不是什么神秘的二进制团块——它是装在袋子里的一个小网站,还自带
接好线的目录。
这让它成了异常优质的原料。把 EPUB 转成 Markdown 时,你不用像对付 PDF 那样去 猜结构。标题本来就是标题。第一章本来就是独立文档。阅读顺序是声明出来的,不是推断出来的。把 文件拖进上方的转换器,你会得到一份层级完好的 Markdown 版书稿——免费、免注册、上限 50 MB, 我们这边什么都不留。
结构为什么能保存得这么好
容器里有三样东西在干重活,值得知道各自的贡献:
- XHTML 内容文件。货真价实的语义标记——
<h1>、<h2>、<blockquote>、<ol>。它们和 Markdown 几乎一一对应。章标题变成#,小节变成##,抽出的引文变成>,书名的斜体保持斜体。 - spine(书脊)。OPF 文件按阅读顺序列出各文档,所以哪怕内部文件名是
part0009.xhtml这种毫无意义的东西,章节顺序照样正确。 - 导航文档。书自己的目录。正是因为它,章节标题才能以标题的身份活下来, 而不是变成一行不知来历的粗体字。
实际的好处是:拿回来的 Markdown 是可导航的。你可以滚到第 12 章,把它剪出来,只贴这一章给
模型。换成 400 页的扁平文本转储试试同样的事,你能靠的只有 grep 和运气。
需要回头看一眼的地方
下面这些都不是硬伤,但花一分钟扫一遍输出,能省掉之后的困惑。
- 前言后记会跟着一起来。版权页、题献、"同一作者的其他作品"、致谢、索引 残根。在学习类工作流里,这就是几千个白花的 token。贴之前删掉。
- 脚注和尾注会被挪位置。源文件里它们是指向书末注释文件的链接。转成顺排的 Markdown 后,要么聚在本章末尾,要么在原引用处只剩一个光秃秃的数字。小说无所谓;学术 专著有一半论证住在注释里,在此之上盖楼之前,先确认它们落在了哪儿。
- 图片不会变成文字。封面、图表、地图是归档里的文件,不是文字。这里没有 OCR,所以图上的标注不会出现。如果解释全在图里,你得把原书放在手边。
- 标题级别可能不一致。有的出版社把每一章都标成
<h1>,有的用<h1>标部、<h2>标章,还有少数完全不用真标题,只用加了样式的<p>。最后一种少见,但 明明有章节的书转出来一片扁平,就是它干的。 - 首字下沉和小型大写开头。以一个装饰性大字开头的章节,那个字可能单独 冒在一行上。纯外观问题,一眼就能看出来。
DRM 会让一切直接停摆——上传前先读这段
从商业书店买的 EPUB 大多带数字版权管理。容器里的内容文件是加密的,清单旁边的
encryption.xml 写得明明白白。没有任何转换器能读它们,这一个也不例外。传一本带
DRM 的书上来,你会得到报错或空结果——原因在文件,不在工具。
不过无 DRM 的 EPUB 到处都是。Project Gutenberg、Standard Ebooks、多数技术出版社、大学出版社、 知识共享授权的发行版、你自己从写作工具导出的任何东西,还有相当一批坚持出售无加密文件的独立 书店。这些都能顺顺当当转完。
至于那个明摆着的问题:把自己拥有的书转出来供自己研读是正常的个人使用;把别人有版权的文字 重新发布完全是另一回事。要说的就这么多。
整本书塞不下——按章来
一部长篇小说大约 10 万词,扎实的非虚构可以翻倍。换算成 token,远超多数模型一口气能吃的量, 就连长上下文的模型,填得越满答得越含糊。注意力被摊薄,中段的细节被跳过。
这正是 Markdown 相对扁平文本的价值所在。章节标题都在,你就能把文件切得干干净净,一章一章地干:
- 先逐章总结,再把这些总结当成一份短文档喂回去,让模型讲全书的主线。
- 逐章做学习笔记——核心论点、术语、问题——再拼成一份完整参考。
- 只针对某一章提问,模型的答案来自 6000 词,而不是被 15 万词稀释。
- 先把标题树抽成大纲。判断哪三章才真正与你要做的事有关,这是最快的办法。
输出下方的 token 计数器是这里最有用的信号。贴之前它就告诉你,眼前是一份"一章的活儿"还是 "一本书的活儿"。
EPUB 对上同一本书的 PDF
两种都有的话,选 EPUB。每次都选。这两种格式解决的是相反的问题,差别会直接体现在输出上。
PDF 是固定版式——字形钉在永不改变尺寸的页面坐标上。提取意味着从位置重建句子、靠字号推断 标题、猜两栏该不该交错合并。页眉和页码会落在段落中间。 PDF 转 Markdown 这些都处理得不错,但那终究是重建工作。
EPUB 是可重排的。没有页面,就没有页面家具要剥,没有分栏几何要理。结构是写明的,不是暗示的。 PDF 唯一占优的地方是精确的排版布局——复杂表格、位置讲究的边栏,一切"页面上的摆放本身就是 含义"的东西。就散文而言,EPUB 赢得轻松。
大家拿它做什么
- 啃技术书。把一本 O'Reilly 风格的书转出来,留下正在学的那一章,再配上你的 GitHub 仓库文本,让助手同时看到 理论和你的真实代码。
- 搭建私人参考库。有了标题层级,转好的书在 Obsidian、wiki 或一个装满
.md文件的普通文件夹里都能搜索——电子书阅读器的书库可做不到这种搜索。 - 过一遍课程书单。逐章总结、生成练习题,而且都能追溯回出处的小节。
- 书稿工作。作者和编辑从 Scrivener 或 Vellum 导出 EPUB,转换之后就有了 一份可 diff、可进版本控制的草稿副本。
如果你想要的是全书一条不间断的散文流——做 embedding、算可读性评分,或者一次性索引一整架 书——EPUB 转文本更合适。 本页顶部的格式切换按钮在两者之间切换,并保留你已选好的文件,两种输出对比只花一次点击, 不用二次上传。
常见问题
怎么把 EPUB 转成 Markdown?
把 .epub 传到上方,书稿就会以标题结构完好的 Markdown 返回,可下载为 .md。免费,单文件 50 MB,免注册。EPUB 的底子是 XHTML,所以这是一次保结构的转换而非有损提取——它比这里几乎所有其他格式都转得好。
为什么 EPUB 转 Markdown 转得这么干净?
因为源文件本来就是语义标记。EPUB 是一包 XHTML,章标题真的是 <h1>,强调真的是 <em>——结构是记录在案的,不是靠外观暗示的。把它映射到 Markdown 近乎直译,标题、列表、引文块和斜体因此都能活下来。
章节标题会变成 Markdown 标题吗?
会,级别就用书里声明的级别,所以分部又分章的书会产出嵌套的大纲,而不是扁平的一层。这让输出真正可导航——可以在编辑器里折叠、链接到某一节,或者问模型某一章的问题,它能找到对的位置。
支持带 DRM 保护的书吗?
不支持。Kindle 或 Apple Books 的加密文件在被所属阅读应用解密之前没有任何可读内容,转换只会一无所获。无 DRM 的 EPUB——Gutenberg、Standard Ebooks、多数技术出版社的书、你自己的书稿——无需任何特殊处理就能用。
拿书搭 RAG 语料库,用它合适吗?
两种格式里它是更好的起点。标题结构给了你天然的切块边界,可以按章或按节切,而不是按会把论证拦腰截断的任意字符数切。如果你的切块器只吃裸散文,EPUB 转文本直接跳过语法。
工具箱的其余部分
EPUB 是这里处理的十三种格式之一。懒得挑页面的话, File2Txt 一次上传通吃。 书稿和报告有 Word 转 Markdown, 老式富文本文档有 RTF 转 Markdown, 存下来的网页有 HTML 转 Markdown。 打包成 zip 的一书架书,走 ZIP 转 Markdown 一趟搞定。
在弄代码或抓网页?转 GitLab 项目或 本机的文件夹,或者把 Web2Txt 指向一个网址。 为 LLM 准备文档的指南 讲的是这一整套的通用思路。
Repo2Txt 由 v12hero 开发和维护,那是一位独立开发者,专做隐私优先的原生应用和 Web 应用。