免费在线将 Word 转换为 文字

免费在线将 Word 文件转换为 文字。上传后立即获得干净、适合 LLM 使用的结果。无需注册,单个文件最大 50 MB,不会存储文件。

Word 转文本:把文档扒回到只剩文字

从 Word 里复制粘贴,就是格式偷渡进各种不该去的地方的经典路径。粘进 CMS,字体声明和多余的 span 一起被拖进去;粘进代码注释,引号变成弯的,字符串再也匹配不上;粘进终端,破折号变成脚本没料到的 字符。文档看着没毛病,可字节从来就不"纯"。

Word 转纯文本从源头掐断这条路。出来的就是按阅读顺序排列的正文——没有样式、没有颜色、 没有修订痕迹,也没有看不见的排版脚手架。当你需要从 Word 文档提取文字去做分析、检索, 或者交给任何把格式字符当数据来解析的程序时,要的正是它。免费、免注册、单文件上限 50 MB,我们这边 什么都不留。

具体剥掉了哪些东西

一个 .docx 装的远不止文字。以下这些都进了剪辑室的地板:

  • 所有视觉格式——加粗、斜体、字体、字号、荧光标注,还有某人留下的那段 Comic Sans。 强调没了,原来强调过的位置也没有任何记号。
  • 标题层级——一个"标题 1"和它下面那句话,变成毫无区别的相邻两行。
  • 表格塌成一行行文字。单元格的值都在,但每个值原本属于哪一列没了。文档表格多的话, 这就是改用Word 转 Markdown 的最大理由。
  • 内嵌图片彻底消失。它们是压缩包里 word/media/ 下的像素,而这个转换器 不跑 OCR——粘贴进文档的截图里的文字永远不会出现在输出里。那部分内容重要的话,把图片单独提出来, 走一遍图片转文字
  • 页眉、页脚、页码、水印——全部丢弃。文本没有"页"这个概念。
  • 批注——存在文件的独立部分里,不属于正文,所以不会出现。

Word 留下的那些隐形字符

纯文本的意思是没有标记,不是只有 ASCII。Word 的自动更正多年来一直在悄悄把你敲的字符换成排版上 更漂亮的版本。这些字符会原样活过转换——因为它们确实是文本的一部分:

  • 智能引号——直引号 "' 变成弯的 U+201C / U+201D 和 U+2018 / U+2019。正则、CSV 导入或复制的代码片段悄无声息失败,经典原因就是它。
  • 长短破折号——手敲的两个连字符会被换成一个长破折号。放在散文里没事,出现在 标识符或命令里就是惊吓。
  • 不间断空格(U+00A0)——看起来和普通空格一模一样,但在一些老式正则方言里不匹配 \s,用 ' ' 简单切分也切不到。
  • 软连字符和可选断行符——藏在单词里的零宽字符,直到某次字符串比较莫名其妙失败前 都是隐形的。
  • 省略号——手敲的三个点会被合并成单个字符 U+2026。

这些都不是转换的 bug,而是忠实的输出。但如果你的处理流程比较挑剔,转换之后跑一遍 Unicode 归一化。 知道要去找它们,这仗就赢了大半。

修订记录:转换前先"接受所有修订"

Word 把修订内联存储——新插入的文字包在 w:ins 里,删掉的文字留在 w:del 里 以便恢复。转换会把文档解析成"已接受"的状态:插入保留,删除消失。这几乎总是你想要的,但"几乎"两个字 在这句话里是有分量的——尤其是一份改得密密麻麻的法律草稿,你可能根本不清楚它当前处于什么状态。

所以要做就做明确的:在副本上执行"审阅 → 接受所有修订",保存,再转换。这样拿到的文本毫无疑义就是 你亲眼看过的那份。如果你真正想知道的是两版草稿之间改了什么,更好的做法是把两版各转成文本再 diff—— 纯文本 diff 起来漂亮极了,这种格式存在的意义正在于此。

什么时候该选文本而不是 Markdown

结构携带信息时 Markdown 赢;标记会成为下游噪音时文本赢:

  • 分类器与文本分析。TF-IDF、主题模型、情感打分、关键词提取——骨子里都是词袋, 只要你不提前剥掉,它们都会把 ** 当词汇来分词。
  • 向量化。切块、embedding、召回。语法字符占了向量的位置却不添半点语义,干净的 散文块召回得更准。
  • 搜索索引。Postgres 全文检索、SQLite FTS、Elasticsearch——每一个要的都是裸文本列。 上 Markdown 就意味着入库前多一道清洗。
  • diff 与版本管理。按行 diff 对散文很清晰;Markdown 表格恰恰相反——改一个单元格 整行重写,diff 什么都告诉不了你。
  • 管道进脚本。wcgrepawk、一句 Python 单行——文本是这一切的通用交换格式。
  • token 最省。上下文预算吃紧时,每根竖线每个井号都是花出去却没有回报的钱。输出 下方的 token 计数器立刻让你看到差距。

本页顶部的格式切换按钮能在文本和 Markdown 之间来回切,并把你已选的文件一起带过去——两种都转出来 对比只要一次点击,不用二次上传。这套逻辑在整个工具族里通用—— PDF 转文本HTML 转文本存在的理由是一样的。

.doc、.docx,以及怎样拿到干净的结果

老的 .doc 是 2007 年之前的二进制复合文件——一个由数据流组成的小型内部文件系统,布局 还随 Word 版本变来变去。.docx 则是 Open XML:一个装着规范 XML 的 zip 包。从 .docx 提取 很可靠,从 .doc 提取只能尽力而为。老文件转出来不对劲的话,用 Word 或 LibreOffice 打开,另存为 .docx, 再转那份。RTF 文档同理。

还有两个值得养成的习惯。用之前先扫一眼输出的前一百行——发现一张塌得很难看的表格只要十秒钟,能省掉 之后和模型的一场糊涂对话。源文件特别大就先拆开:400 页的手册能转,但塞不进上下文窗口,只喂你真正 关心的那一章,答案会更锐利。

常见问题

怎么把 Word 文档转成纯文本文件?

.docx.doc 拖到上方,文本就出现在下面,可下载为 .txt。免费、免注册、单文件上限 50 MB。两种格式都支持——现代的 zip 封装 XML 格式,和 2007 年之前 Word 用的老式二进制格式。

能批量把多个 DOCX 转成 TXT 吗?

本页不行——一次只收一个文件。要处理一整个文件夹,把文档放进目录,用本地文件夹转换器,它会遍历整棵目录树,让你一次勾选所有想要的文件。命令行上的标准答案是 Pandoc 套一层 shell 循环。

修订记录和批注会怎么处理?

你拿到的是文档当前读起来的样子——修订标记被解析掉,而不是被复述出来。页边的批注不属于正文,不会出现在输出里。如果这件事的目的本来就是审两版草稿之间的改动,那就把两版各转成文本,跑一次词级 diff——它呈现修改远比侧边栏清楚。

页眉、页脚和脚注会被包含吗?

脚注正文一般会保留,对带引注的文档这正是你想要的。重复出现的页眉页脚属于页面装饰而非内容,所以不会像 PDF 提取那样反复插进正文——这是从 DOCX 转换而不是从同一份文档导出的 PDF 转换的实打实的优势之一。

该用 Word 转文本还是 Word 转 Markdown?

只要文字、别的都不要时用文本——统计字数、扫关键词、切 embedding 块、喂语音合成引擎。文档是用真正的标题样式写的、你希望这份大纲活到输出里时,用 Word 转 Markdown

工具箱里的其他家伙

Word 只是这里支持的十三种格式之一。File2Txt 一次上传什么都收,也可以直接去 PowerPoint 转文本处理演示文稿、 Excel 转文本处理电子表格,或者 MSG 转文本处理 Outlook 邮件。 手上是一整个文件夹的草稿?打成 zip 交给 ZIP 转文本,里面的东西一次全转。

代码这边有 GitHub 转文本工具GitLab 版本,还有 本地目录转换器。网页则交给 Web2Txt,直接把网址抓成文本。 想看通用版而不是 Word 专属版的论证,还有一篇更长的 为 LLM 准备文档的指南

Repo2Txt 由 v12hero 开发和维护,那是一位独立开发者,专做隐私优先的原生应用和 Web 应用。