免费在线将 图片 转换为 Markdown

免费在线将 图片 文件转换为 Markdown。上传后立即获得干净、适合 LLM 使用的结果。无需注册,单个文件最大 50 MB,不会存储文件。

图片转 Markdown:当你拍下的东西"长什么样"也很重要时

有些图片就是图片。另一些其实是被困在图片里的文档——别人拍照发来的发票、你从一份永远拿不到原件的 幻灯片里截下的一页、手工填写的表单、桌上摊开的一页书、写满了某个再没人记录过的决定的白板。这些图片 里的文字才是重点,文字的排布同样是重点。

把它传上来,文字会被识别出来,以 Markdown 的形式交还给你。是真正跑在像素上的光学字符识别。一张拍照 的发票转回来带着发票号、公司名、日期、每一条明细及金额,还有合计——是真实内容,不是对图片的描述。 JPG、JPEG、PNG、GIF、BMP、TIFF、TIF 和 WebP 都支持。免费、免注册、单文件 50 MB,转换结束后什么 都不留。

你拿回来的,精确说是什么

输出就是识别出的文字,别无其他。没有相机参数、没有文件属性、没有一段要先滚过去才能到正文的技术 开场白。你上传一张文档的照片,拿到的就是文档的文字。如果你期待的是一段描述图片本身的头信息,那不是 它干的事——它读的是图片里面的东西。

识别质量跟着图片质量走,这是最诚实的说法。清晰的截图或干净的导出图读得非常好。匆忙斜拍的笔记本 屏幕、上面还映着一个窗口的照片,就是更难的问题,偶尔会认错字符。手写、花体和装饰性字体,以及叠在 杂乱背景上的文字,都是实打实的难点。这些不会让工具在烂图上变得没用——只是意味着输出该读一遍, 而不是想当然。

Markdown 还是纯文本?真正的区别

这是多数转换器页面不会告诉你的:对简单图片——一段文字的截图、一张手写便条的照片、一块招牌—— Markdown 和纯文本给你的结果基本相同。识别出的文字按行返回,一段散文里没有什么结构是 Markdown 能表示 而纯文本会丢的。简单图片就算选"错"了,你也毫无损失。

选择开始起作用,是在画面里的东西有"形状"的时候。一张表格、带标签和取值的表单、按列排着品项和价格的 收据、有标题分节的文档页。这才是 Markdown 挣得一席之地的地方,因为竖线和井号能承载纯文本只能靠空格 暗示的网格和层级。你想把截图转成 Markdown 表格的话,这个页面就是为你准备的。只需要 文字去填搜索框的话,图片转文字 是兄弟页面,简单的活儿配简单的工具。

顶部的格式切换按钮能在两种格式间来回切,并把你已经选好的文件一起带过去——同一张图两种方式各跑 一遍,眼见为实,不用光听我说。

值得把镜头对准的东西

  • 发票和收据。经典场景。供应商发来的是发票照片而不是文件,你需要把明细放进一个 能算数的地方。转换,对着图核一遍合计,贴进表格,或者把 Markdown 交给模型让它逐项拆。
  • 表单和申请表。填好的印刷表单会转成真正可用的"标签—取值"对。打印填写的比手写的 识别得好得多——扫两百份之前值得知道这一点。
  • 只有图片版的幻灯片。会场里拍的一页 slide,或者录播讲座的截图。手上有原始文件的话, 请改用PowerPoint 转 Markdown—— 永远优先选源头。没有的时候,这就是把内容取出来的办法。
  • 书页和文章页。你想引用、总结或者反驳的一页书的照片。标题和分段能活着走完全程, 结果是可读的文章而不是一堵墙。
  • 白板和挂纸板。正对着拍、光线过得去、字迹清楚,就能得到一份可用的会议记录。 歪着拍的抖动马克笔字迹只能得到半份。但还是比你自己誊一遍快。
  • 截图形式的仪表盘和报表。网格里的数字变成可以和上个月对比的表格。底层数据有文件 版的话,Excel 转 MarkdownCSV 转 Markdown 会碾压任何 OCR——因为什么都不用猜。

容器法则:帮你省下一次注定失败的上传

这部分值得刻进脑子里,因为它一次性解释了三个各自独立的"意外"。这里的 OCR 跑在你上传的图片文件上, 不跑在包在其他文件里的图片上。图片只是搭在更大容器里的乘客时,被读的是容器,图片会被跳过。

  • 扫描版 PDF 转出来是空的。本质是纸张照片的 PDF 里面没有文字,OCR 也不会穿过 PDF 外壳伸进去。先对它执行"识别文本"——Acrobat、macOS 的"预览"和多数现代 PDF 阅读器都有——把它变成 可检索的 PDF,然后走 PDF 转 MarkdownPDF 转文本。一分钟的绕路, 却是扫描文档的正道。
  • ZIP 里的图片不会被识别。压缩包转换列出图片文件名就往下走了。 ZIP 转 Markdown 处理一文件夹的文档和表格非常好用;文档的照片请解压出来,一张一张单独上传。
  • 嵌在 Word、PowerPoint、RTF、EPUB 或邮件里的图片同样不会被识别。它们在输出里 只是一个图片占位符,不是文字。所以一份用截图拼成的 DOCX 走 Word 转 Markdown, 得到的是周围的文字加一串窟窿。把图片从文档里取出来,以图片文件的身份到这里转。

一句话版本:你要的字在图片里,那你上传的文件就必须是图片本身。

难搞的图片,怎么读得更准

  • 只要有得选,就截屏而不是拍屏。截图对比度完美、无反光、无梯形畸变、无手抖。这是你手上最大的一项 质量杠杆。
  • 裁剪到只剩文字。一张宽照片里只占五分之一的表格,每个字符的像素比占满画面的同一张表少得多, 结果上看得出来。
  • 图片摆正、正对拍摄。斜着拍页面会把文字行拍弯,弯的行更难切分成表格行——而这恰恰对你来转的表格 影响最大。
  • 光打匀。收据中间一道硬阴影、过塑表单上一块反光,盖住哪里哪里就没了。
  • 依赖输出之前先读一遍。数字是错了最疼的地方,合计和编号要对着图核。输出下方的 token 计数器会告诉 你即将贴给模型的量有多大,把好几页叠进一个提示词时很有用。

常见问题

怎么把图片转成 Markdown?

把图片传到上方,识别出的文字会带着 Markdown 结构返回。支持 JPG、JPEG、PNG、GIF、BMP、TIFF、TIF 和 WebP,上限 50 MB,免费且无需账号。输出是 .md,可以直接贴进 README、文档站点或模型提示词。

对图片来说,Markdown 什么时候真的比纯文本好?

画面有"形状"的时候。一段文字的截图两种方式转出来一模一样——散文里没有隐藏结构可供 Markdown 标注。但一张表格、一份表单、一个价格网格或一页带标题的文档,其排布值得保留,而只有 Markdown 能承载。平铺的散文选图片转文字更简单。

截图里的表格能识别出来吗?

它会尝试输出竖线表格,效果跟着原图的整洁程度走。带可见网格线、列距一致的真实表格截图,通常能正确重建。只靠大段空白分列,或者单元格折成两行的表格,列边界就会被猜错——信数字之前先核一下表头那行。

代码截图能处理吗?

字符能出来,但结果只能当草稿。OCR 没有语法概念,把源码里的 O 认成 0、把 Python 代码块弄丢一级缩进,它都不会察觉。拿来搜一段堆栈信息没问题;直接贴进文件里运行就不行了。

图片本身会被嵌进 Markdown 吗?

不会——输出是图片里找到的文字,不是指向图片的 ![](...) 引用。不会往任何 CDN 上传东西,也不会生成图片链接,所以这份 Markdown 是自包含的纯文本,没有任何外部依赖。

工具箱里的其他家伙

图片只是这里支持的十三种格式之一。不想先挑页面的话, File2Txt 什么都收。代码这边有 GitHub 仓库转文本工具,还有处理你本机 文件夹的本地目录转换器为 LLM 准备文件的指南 把通用场景讲得更深。

Repo2Txt 由 v12hero 开发和维护,那是一位独立开发者,专做隐私优先的原生应用和 Web 应用。