浏览器内解析 · 文件不上传

PDF 转 MD 转换器

在你的浏览器里跑完。不上传、不注册、不限次数,单个文件最多 1,000 页。

手边没有 PDF?
  • 表格还是表格293 页年报转出 2,469 行表格。pdf2md.net 是 0 行。
  • 中文是整段的同一份文件,我们每段 221.1 字,pdf2md.net 是 28.9 字。
  • 长文档一次转完单个文件最多 1,000 页 —— 152 页年报一次转完。iLovePDF 30 页就拦你。
  • 文件不出浏览器不上传、不注册、没有每日额度。
先说清楚

PDF 转 Markdown 转换器是做什么的?

PDF 固定的是版面。每一页都是一堆带坐标的字形:文件记录的是「某个字符在某个位置、某个字号」,而不是「这是标题」「这是表格单元格」「这是列表的第三项」。这对打印来说恰到好处,也正是从 PDF 里复制文字会得到一团浆糊的原因。

Markdown 记录的正好相反。它承载结构,几乎不承载版面——标题就是标题,表格就是表格——而且它是纯文本,可以编辑、可以 diff、可以进版本库,也可以直接喂给语言模型,中间不需要任何东西。它的文件以 .md 结尾,所以同一件事有两个叫法:PDF 转 MD 和 PDF 转 Markdown 说的是一回事。

转换器的工作,是把 PDF 只是「暗示」出来的结构还原回来:读字号推标题层级,读横向位置推分栏,读对齐关系推表格行,然后把这些一并写成 Markdown。

如何运作

怎么把 PDF 转成 MD

三步,不用注册,文件不出这个标签页。

  1. pdf2md.me 页面顶部的拖拽区,等待一份 PDF
    1

    把 PDF 拖进来

    拖到页面顶部那个框里,或者点一下自己选。鼠标一挪到框上引擎就开始下载了,等你松手时它已经就位。

  2. 转换进行中,计时器在往上走
    2

    在你的浏览器里转换

    转换器是一段 WebAssembly,跑在你自己机器的后台线程上。没有上传这一步,所以不用排队、没有每日额度,也不需要为文件大小讨价还价。

  3. 转换完成的界面,渲染出的文档以及复制和下载按钮
    3

    看一眼、复制、下载

    结果默认是渲染视图,标题层级和表格有没有活下来你自己看得见。切到原文标签拿 Markdown 本身,然后复制,或者存成 .md 文件。

什么活下来了

pdf2md 保留了什么?

对着十二份样本实测出来的,不是断言。有两行带警告,因为测量结果配得上这个警告。

PDF 里的Markdown 里的pdf2md 保留了什么?
标题# · ## · ###保留层级是从文档里的字号重新推出来的,所以六级大纲还是六级大纲,不会塌成一级。
段落普通文本保留被版面切断的行会重新拼回它原本所属的那一段,中文字符之间的伪空格一并剔除。
链接[文字](地址)保留整套样本里 68 个链接,60 个是完整的 http(s) 地址,没有一个是死锚点。
表格| a | b |基本保留行和列出得来。密集财报排版里有些单元格会落错列——转换器会测量这一点,空格率超过 25% 时主动提醒你。
列表- 条目 · 1. 条目基本保留真列表能转。但财报表格里表示「无」的短横线可能被当成项目符号;最糟的样本上这占 12.5%。
图片丢弃不保留。文字和结构会转过来,图片则是直接丢掉——而不是留下一堆指向不存在文件的引用。
同一份 PDF,三家转换器

PDF 转 MD 实例

前两份用的是中国信通院《数据要素白皮书》,第三份是论文 Attention Is All You Need——两份都能公开下载,你可以自己复核。左边是别家转出来的,右边是这里今天转出来的。

中文是整段的

版权声明那一句在原文里就是一段。pdf2md.net 把它按 PDF 的换行切成四截,「受法律保」和「护。」被从词中间劈开。

pdf2md.net
本白皮书版权属于中国信息通信研究院,并受法律保

护。转载、摘编或利用其它方式使用本白皮书文字或者观

点的,应注明“来源:中国信息通信研究院”。违反上述

声明者,本院将追究其相关法律责任。

1,070 个非空行,平均每段 28.9 字

pdf2md.me
本白皮书版权属于中国信息通信研究院,并受法律保护。转载、摘编或利用其它方式使用本白皮书文字或者观点的,应注明"来源:中国信息通信研究院" 。违反上述声明者,本院将追究其相关法律责任。

170 个非空行,平均每段 221.1 字,伪空格 0 处

标题还是标题

PDF.ai 把这份 53 页白皮书里的 1,584 行标成了二级标题,一级标题一个都没有——正文被逐行切成标题,目录彻底失效。

PDF.ai
## 更好发挥数据要素作用的意见》(下称 “数据二十条”),这是我国
## 首部从生产要素高度系统部署数据要素价值释放的国家级专项政策
## 文件 。“数据二十条”确立了数据基础制度体系的“四梁八柱   ”,在
## 数据要素发展进程中具有重大意义。

1,584 个二级标题,零个一级标题

pdf2md.me
# 数据要素白皮书
## 前言
## 目录
## 一、数据要素再认识
## (一)国家战略全方位布局数据要素发展
## 二、资源:分类推进数据要素探索已成为共识

29 个标题,是一份能用的目录

表格还是表格

论文里的 Table 1 有四列四行。pdf2md.net 把它压成一行流水账——整份文件里一个表格都没有。

pdf2md.net
Layer Type Complexity per Layer Sequential Maximum Path Length Operations Self-Attention O(n 2 · d) O(1) O(1) Recurrent O(n · d 2 ) O(n) O(n) Convolutional O(k · n · d 2 ) O(1) O(logk(n)) Self-Attention (restricted) O(r · n · d) O(1) O(n/r)

整份文件 0 行表格

pdf2md.me
| Layer Type | Complexity per Layer | Sequential Operations | Maximum Path Length |
|---|---|---|---|
| Self-Attention | O(n2 · d) | O(1) | O(1) |
| Recurrent | O(n · d2 ) | O(n) | O(n) |
| Convolutional | O(k · n · d ) | O(1) | O(logk(n)) |

10 张表、103 行;293 页中文年报上是 2,469 行

竞品输出抓取于 2026 年 8 月。下载下来,数字你自己数一遍

转换一份 PDF
拿它做什么

PDF 转 Markdown 能用来做什么?

AI 与 RAG 工作流

模型拿到 PDF 原始文字时,每张表都是一行流水账数字,它会按错误的列作答。Markdown 让行还是行;标题层级又天然就是切块边界,切出来的每一块都记得自己属于哪一节。

Obsidian 与 Notion

挂在库里或页面里的 PDF 是个黑盒:跟其它笔记一起搜不到,同事还得先下载才能读。两边都直接支持导入 Markdown——标题变标题,表格变表格。

把规范纳入版本管理

仓库里的 PDF 是个不透明的二进制块,每改一版就是一个新文件,评审的人看不出改了什么。Markdown 可以逐行 diff,像任何其它文件一样在 PR 里评审。

改别人发来的东西

PDF 编辑器为了改一个段落能跟你较劲半天,重排文字本来就不是这个格式该干的事。转一次,然后用任何一个你已经打开着的编辑器改。

诚实的那部分

PDF 转换的限制

下面每一条都是它不会替你做的事。写在这里,是为了让你现在就知道,而不是转到一半才发现。

  • 扫描件

    整页是照片,没有文字层可读。会识别并告知,而不是丢给你一个空文件。

  • OCR

    没有。从图片里认字和读文字层是两件事。

    OCR 正在做。留个邮箱,做好了通知你一次。

    只用于那一封通知。想删除,写信到 hello@pdf2md.me。

  • 密码保护的文件

    能识别并告知,但打不开。请先在 PDF 阅读器里解锁。

  • 公式

    不识别。数学记号会按 PDF 里恰好存着的字符出来。

  • 图片

    丢弃,不提取。你拿到的是文字和它的结构。

  • 页数

    单个文件最多 1,000 页。更长的文档会转前 1,000 页,并明确告知。

  • 文件大小

    不限。超过 50 MB 会提示可能要等几秒。

  • 多栏排版

    正文阅读顺序是对的。跨栏的宽表和图注可能落错位置。

  • 复杂表格

    行和列活得下来,密集财报排版里的单元格位置不一定。

  • 批量转换

    一次一个文件。没有队列,也没有什么要排队的。

隐私

我的 PDF 会被存起来吗?

文件会到服务器上去吗?
不会。转换器是跑在这个标签页里的 WebAssembly。你的 PDF 由运行在你自己机器上的代码读取,从不构成一次网络请求。
会拿去训练什么吗?
不会。它压根到不了这里,没有可训练的东西。
我怎么删除自己的文件?
这里没有属于你的东西可删。
常见问题

你大概想问这些。

还是没解决?写信给 我们 —— 一个工作日内回复。

完全免费。没有账号要注册,没有每日次数上限,也没有任何东西可买——单个文件最多 1,000 页。转换是在你自己机器上跑的,对我们零成本,所以你想转多少次都行。

标题能:层级是从文档字号重新推算的,所以一篇五十多页的白皮书出来是有大纲的,而不是一整片同级标题。列表基本能:真正的项目符号和编号列表能转,但财报表格里表示「无」的短横线可能被误判成项目符号。

能。行和列会转成 Markdown 管道表——一份 293 页的年报转出了 2,469 行表格。密集财报排版里有些单元格会落错列;转换器会测量这一点,空单元格率超过 25% 时主动提醒你,而不是等你自己发现。

单个文件 1,000 页。在这之下没有任何限制——152 页的年报一次转完。超过的话,转换器会处理前 1,000 页并明说,而不是悄悄截断。

因为 PDF 里根本没有「表格」这个东西——它记录的是带坐标的文字,转换器要靠横向对齐关系反推列。会计排版里货币符号单占一格、数值为空时写一个短横线,正好把这套推断打乱。当超过四分之一的单元格是空的,结果会主动告诉你。

不能。扫描页是没有文字层的照片,读它需要 OCR,而这个转换器没有。它会识别出这种情况并告诉你,而不是返回一个空文档。你可以留个邮箱,等这一点改变时通知你一次。

这正是大多数人转换的原因。模型拿到 PDF 原始文字时,表格是一行流水账,它会按错误的数字作答;拿到 Markdown 时,行是行,标题是结构。

没有上传这一步,所以没有东西被存。转换器在你的浏览器里跑,你的 PDF 从不构成一次网络请求。你可以自己验证:页面加载完之后断网,再转换一个文件试试。

不用注册,不会上传。
也没有别的花招

翻回页面顶部,丢一个 PDF 进去。结果对不对,大约一秒之后你自己就看得见——这正是重点。

免费 · 不注册 · 单个文件最多 1,000 页