PDF 转 Markdown 在线转换
把 PDF 变成结构清晰的 Markdown 文本:还原标题、段落、列表、表格和链接,去掉页眉和页码。非常适合把文档交给 ChatGPT、Claude 或放进你的知识库。
- 免费
- 标题、列表、表格
- token 计数
- 不上传
100% 隐私保护 — 一切均在您的浏览器中直接处理:您的文件、语音和图像永远不会发送到 Chatzam 的服务器。
如何把 PDF 转换成 Markdown?
-
导入 PDF
拖入文件:页面会直接在你的浏览器中读取。
-
设置转换选项
转换整份文档或部分页面,并选择是否去掉页眉、标记分页或标出图片。
-
复制或下载
以 Markdown 源码或预览方式检查结果,然后复制,或下载 .md 文件。
忠实还原 PDF 结构的 Markdown
标题与格式
不同的字号会变成 #、## 和 ### 标题,粗体和斜体都会保留。
分栏与段落
双栏排版按正确顺序读取,断开的行重新合并成段落,行尾被连字符拆开的单词也会拼回。
列表、表格和链接
项目符号、编号列表、简单表格和可点击的链接都会转换成 Markdown 语法。
为 AI 而设计
重复出现的页眉、页脚和页码会被去掉,还有一个计数器估算 token 数量。
为什么要把 PDF 转成 Markdown?
Markdown 是加了少量符号的纯文本:井号表示标题,短横线表示列表项,竖线表示表格。它不需要专门的软件就能阅读,任何编辑器都能修改,在 GitHub、Notion、Obsidian、语雀或企业知识库中都能整齐显示。它也是 AI 助手最容易理解的格式:把一份报告粘贴给 ChatGPT 或 Claude 时,标题层级和表格能帮助它总结、比较或回答具体问题。直接从 PDF 阅读器复制粘贴,常常会把分栏混在一起,每行都把句子截断,还会重复页眉;转换成 Markdown 可以避免这些问题。
结构是怎样还原的?
PDF 里没有标题和段落,只有放在精确坐标上的一段段文字。工具先找出正文的字号,再给更大的字号排序:最大的成为一级标题,其次是二级标题,依此类推。它通过分隔各栏的空白识别分栏,把同一段落的各行重新合并,并去掉断词用的连字符。排成多个单元格的行会组成表格,项目符号和编号会开始一个列表。在大多数页面顶部或底部重复出现的文字,比如报告名称或“第 3 页,共 12 页”,都会被去掉。
token、限制和扫描版 PDF
AI 用 token(词语片段)来衡量文本长度。计数器给出的是一个大致数量,按约每四个字符一个 token 估算(中文文本的实际 token 数通常更高):方便判断一份文档能否放进一次对话,还是只发送部分页面更好。图片不会被转换,但可以标出它们的位置。图形化程度很高的排版,比如宣传册或含合并单元格的表格,有时需要人工校对。最后,扫描版 PDF 只包含页面图片:工具会提示你,并建议先用 OCR 让它可读。文件在浏览器中处理,绝不会上传。
常见问题
怎样把 PDF 交给 ChatGPT 又不丢失格式?
先把它转成 Markdown:标题、列表和表格对 AI 来说依然清晰。把结果粘贴到对话中,或者上传 .md 文件。
PDF 里的表格会保留吗?
列对齐整齐的简单表格会变成 Markdown 表格。含合并单元格或图形化很强的表格可能需要手动调整。
我的 PDF 会上传到服务器吗?
不会。PDF 完全在你的浏览器中读取和转换,始终留在你的设备上。
为什么结果是空的?
你的 PDF 很可能是扫描件:页面都是图片,没有文字。请先用“PDF OCR 文字识别”工具让它可以搜索,再进行转换。
显示的 token 数是什么意思?
这是按 AI 的计数方式对文本长度的估算,以大约每四个字符一个 token 为基础。确切数字取决于所用的模型。