免费在线将 Excel 转换为 文字

免费在线将 Excel 文件转换为 文字。上传后立即获得干净、适合 LLM 使用的结果。无需注册,单个文件最大 50 MB,不会存储文件。

Excel 转文本:只要内容,不要表格

并非每个关于电子表格的问题都是"表格问题"。有时工作簿只是个容器——一份客服导出,有用的部分是 4,000 条自由填写的投诉描述;一份产品目录,你要的是文案而不是 SKU;一份问卷数据,所有有意思的回答都挤在 一列长长的文字里。把这种东西渲染成表格,是在添没人要的结构,还照 token 收费。

Excel 转纯文本给你的只有值,别无其他。没有竖线、没有分隔行、没有对齐用的空白填充。 只有单元格的内容,一张表接一张表,可以直接 grep、切块、做 embedding、diff,或者不经任何清洗就管道 进脚本。把 .xlsx 或 .xls 传到上方——免费、免注册、上限 50 MB、什么都不留。

token 账,也是最主要的一笔账

Markdown 表格是按单元格收税的。每个值都要裹上分隔符和空白,这笔开销还按行数翻倍。十二行的小结上 看不见;到了 20 列、8,000 行的导出上,它就是输出里相当可观的一块——一堆标点占着你更想留给数据的 上下文。

纯文本把这层开销整个抹掉。同样的值,token 明显更少——实践中这就是"一张表塞得进一条提示词"和 "塞不进"的区别。输出下方的 token 计数器让对比变得具体:同一个文件两种方式各转一遍,差距立刻可见。 本页顶部的格式切换按钮会把你的文件直接带去 Excel 转 Markdown,不用 重新上传,这个对比大约只花你五秒钟。

你放弃了什么——得说实话

扁平文本失去的是可靠的列身份。分隔符一没,一行里的第三个值就只是"隐含地"属于"地区"字段,模型回答 "北区的平均营收"时,得在几千行里一直把这套对应关系记在脑子里。它多半能撑住,但也时不时会跑偏—— 尤其是某个单元格为空、后面的位置整体错位的时候。

所以规则很直接。你的问题是按列的——筛选、比较、聚合、两个字段交叉核对——就用 Markdown 版, 认下 token 的成本。你的问题是按内容的——大家在说什么、出现了哪些主题、某个短语在不在、把 关于物流延误的行都找出来——纯文本是更好的工具,也是更便宜的那个。

扁平化的表格文本在哪里挣饭吃

  • 向量化与检索。把目录或知识库导出切成段落再向量化。块里的表格语法是噪音,改变 向量却不携带语义,还在固定长度的 embedding 输入里占位置。
  • 批量文本分析。对客户反馈做情感分析、对开放式问卷回答做主题聚类、从一列工单记录 里抽实体。分析的单位是段落,不是行。
  • 搜索索引。多数搜索引擎要的是每个文档一团干净的文本。喂竖线表格只会让分词更糟, 换不来任何好处。
  • 喂给脚本。正则、字数统计、语言检测器和随手写的 Python 单行,预期的都是按行组织 的文本。没有解析步骤,没有转义边角。
  • diff 两份导出。把上个月和这个月的工作簿都转成文本再 diff,改动一目了然;表格 形式下,插入一列就让每一行都变了,diff 直接报废。
  • 特别大的表。有时候扁平文本干脆就是唯一塞得进去的版本。

专在文本输出里现形的 Excel 怪癖

Excel 的一些习惯在屏幕上看不见,格式层一剥就原形毕露:

  • 前导零早就没了。邮编、电话号、账号 ID 要是被敲进了"常规"格式的单元格,早在你 来之前,Excel 就已经把 01204 存成了数字 1204。文本输出只是忠实汇报文件里存的东西。ID 重要的话, 拿样本对一下源系统。
  • 长数字变科学计数法。十六位的编号和一些条形码会被存成浮点数,显示成 1.23457E+15,尾部数字是真丢了。解药在上游:保存前先在 Excel 里把那些列设成文本。
  • 格式只是面具。显示 15/03/2024 的单元格里存的是天数序列号;显示 12.5% 的存的是 0.125;显示 £1,250 的存的是 1250。没有表格版式提示每列是什么,文本流中间蹦出来的裸序列号格外 让人摸不着头脑。导出前用 =TEXT(A2,"yyyy-mm-dd") 把日期列转成 ISO 文本是可靠的 对策。
  • 合并单元格留窟窿。合并内容只存在于区域左上角的那个单元格,其余是真空的——一个 向下合并了八行的分类标签只出现一次,后面七条记录看起来没有标签。
  • 隐藏的行、列、工作表照转不误。提取不理会可见性。那个古老的"草稿"标签页,以及 某人隐藏而非删除的那几列,都会出现在你的输出里。分享结果前值得扫一眼——隐藏工作表是意外泄露 的真实来源。
  • 你拿到的是值,不是逻辑。公式单元格贡献的是最后一次缓存的结果,输出是工作簿的 一张快照,而不是它如何计算的说明。由脚本生成、从未在 Excel 里打开过的文件可能根本没有缓存值, 转出来可能是空的。

多个工作表,但没有表格脚手架

工作簿很少只有一个标签页。提取会遍历工作簿里的每一张表,并给每张标上它的标签名——这在扁平文本里 依然有用:"原始数据"、"2023 存档"、"备注"告诉你和模型该对后面的内容抱多大信任,切块的时候也给了你 现成的分割点。

一个实用招数:只有一个标签页有用的话,把它复制进一个新工作簿再转。输出量大幅缩减,不会拖进一打 查找表和数据透视缓存,还顺手绕开了隐藏工作表的问题。

.xls、.xlsx,和 CSV 这条捷径

两种都支持。老式二进制 .xls 至今还源源不断地从银行门户和老 ERP 系统里冒出来;它最多只能装 65,536 行,更大的数据一定已经在上游某处被截断了——行数看起来圆得可疑时值得查一查。现代 .xlsx 是 ZIP 里的 XML,解析可预测得多,所以转换前重新另存一次是个合理的习惯。

如果这份数据在被人用 Excel 打开之前本来是 CSV,请对原件用 CSV 转文本。Excel 在导入时会 不声不响地重新解释内容——把编码当日期、削掉前导零——一旦覆盖保存,这些损伤就焊死在文件里了。

常见问题

怎么把 Excel 文件转成 txt 文件?

.xlsx.xls 拖进上方的转换器,表格内容以纯文本返回,可下载为 .txt。免费、免注册、单文件 50 MB。现代 XML 格式和老式二进制 .xls 都支持,接手来的旧文件不用先另存。

Excel 变成纯文本后,我的列会怎么样?

它们就不再是列了。值按阅读顺序、以空白分隔地排出来,每个值原本属于哪个表头不再有任何编码。对一列名字或 SKU 的清单来说,这正是你想要的;对一个十二列的财务模型来说,这毁掉的恰恰是让它成为模型的东西——请改用 Excel 转 Markdown

我拿到的是公式还是算出来的值?

是值。装着 =SUM(B2:B40) 的单元格转出来是 1,284,不是产生它的公式。这对分析来说是正确的默认行为,但对审计表格逻辑来说几乎永远不是你想要的——如果公式才是重点,任何文本转换都帮不了你,你需要的是工作簿本身。

是所有工作表都包含,还是只有当前那张?

工作簿里的每一张表都会被处理,而不只是保存时恰好打开的那个标签页。带着隐藏的"假设"或"原始数据"标签页的文件要记住这一点——那些内容同样会出现在输出里,做分析时很方便,分享输出前则需要检查。

该把 Excel 转成文本,还是先转成 CSV?

目的地读的是表格数据的话,直接从 Excel 导出 CSV、跳过本页——分隔符和列结构都能保住。纯文本管的是另一种情况:下游要的是散文形状的输入,比如 embedding 管线,或者对一文件夹工作簿做关键词扫描。

这套工具里的其他一切

不想挑的话,File2Txt 在一个页面 接收所有支持的格式。相关的入口还有:处理同一份数据的 API 导出的 JSON 转文本、处理数字最终发表 所在报告的 PDF 转文本,以及处理 汇报它们的演示文稿的 PowerPoint 转文本

代码和网页来源这边有 GitHub 转文本工具GitLab 转换器,以及抓取网页的 Web2Txt文件转文本指南 讲的是在各种格式之间怎么取舍的通用方法。

Repo2Txt 由 v12hero 开发和维护,那是一位独立开发者,专做隐私优先的原生应用和 Web 应用。