把 PDF 转成 Markdown(喂给 AI)
最快且相对可靠的做法
Section titled “最快且相对可靠的做法”先试着在 PDF 里选中并复制一小段正文。
- 能选中文字,复制出来的顺序也正常:先用普通的 PDF 转 Markdown 提取工具。
- 能选中文字,但分栏、表格或脚注顺序混乱:改用能识别页面布局的工具,并预留人工整理时间。
- 整页像一张图片,无法选中文字:先做 OCR(光学字符识别),再重建 Markdown 结构。
无论使用哪种方法,都要把转换结果看作从 PDF 派生的草稿,而不是经过核验的新原件。保留原 PDF,用来核对标题、阅读顺序、数字、表格和引用。
根据 PDF 类型选择方法
Section titled “根据 PDF 类型选择方法”| PDF 类型 | 怎么判断 | 建议起点 | 主要风险 |
|---|---|---|---|
| 简单文字版 | 文字可选、单栏、图片较少 | 普通文本提取 | 标题和列表结构丢失 |
| 多栏报告或宣传册 | 复制时文字会在栏、侧边框之间跳转 | 布局感知提取 | 阅读顺序错误 |
| 表格密集型文件 | 网格多、合并表头多、单位复杂 | 表格感知提取;有原始表格时优先用原文件 | 列错位、单位脱离数值 |
| 扫描件或照片 | 无法选择文字,或整页被当成图片 | 设置正确语言的 OCR | 字符误识别、漏字 |
| 带公式、图片和脚注的论文 | 双栏、公式、引用、图注较多 | 结构感知提取后人工复核 | 公式、引文和图注次序损坏 |
| 表单、幻灯片或设计稿 | 含义依赖方框、箭头和位置 | 对照页面图片人工重组 | 视觉关系被压平成连续文字 |
如果能拿到 Markdown、HTML、DOCX、CSV 或电子表格等源文件,通常应优先用源文件。PDF 是固定版面的交付格式,源文件往往保留了更清楚的结构。
PDF 转 Markdown 的完整流程
Section titled “PDF 转 Markdown 的完整流程”1. 保留原件并记录来源
Section titled “1. 保留原件并记录来源”保存一份没有修改的 PDF,记录标题、发布方、日期、URL 或文件名、版本和获取日期。
---title: "年度报告示例"source_file: "annual-report-2026.pdf"source_url: "https://example.com/annual-report-2026.pdf"retrieved: 2026-08-13---这些信息让转换内容可以追溯,但不会让 Markdown 变成权威原件。
2. 先测试有代表性的页面
Section titled “2. 先测试有代表性的页面”不要一上来转换几百页。先挑一页普通正文、一页表格、一页带图或脚注的内容,以及任何版式发生变化的页面。一款工具可能把第一页处理得很好,却在后面的双栏页面失效。
3. 提取文字或运行 OCR
Section titled “3. 提取文字或运行 OCR”文字版 PDF 用直接提取,只有图像的页面用 OCR。有些 PDF 两种页面混在一起,需要分别处理。正确设置文档语言;多语言文档应开启相应语言。保留页面图片,以便核对识别不确定的字符。
4. 重建语义结构
Section titled “4. 重建语义结构”- 真正的文档标题只用一个
#。 - 主要章节用
##,真实的下级章节用###。 - 把项目符号和步骤恢复成 Markdown 列表。
- 合并只因页面宽度而产生的断行,但保留真实段落边界。
- 让图注、表注和脚注留在对应内容附近。
- 删除无意义的重复页眉、页脚、页码和水印。
PDF 里的粗体不一定是标题。转换器无法只凭字号和外观可靠判断全部标题层级,必须对照目录和正文检查。
5. 必要时保留页码定位
Section titled “5. 必要时保留页码定位”如果后续回答需要回到特定页面核验,可以在对应内容前加轻量标记:
[PDF 第 12 页]
## 收入确认如果印刷页码和阅读器显示的文件页码不同,要说明采用哪一套。重新排列内容后,不要凭印象补页码。
6. 渲染并对照原文
Section titled “6. 渲染并对照原文”既要看 Markdown 预览,也要读原始文本。一份看起来整洁的预览,仍可能藏着章节重复、整行缺失,或数字与标签错配等问题。
表格和标题不能保证完整保留
Section titled “表格和标题不能保证完整保留”表格通常是转换中的高风险内容。逐项核对表头、行名、数值、单位、时间范围和注释之间的关系。遇到合并表头,应展开成明确列名,或拆成几个较小的表格。
| 指标 | 2025 | 2026 | 单位 ||---|---:|---:|---|| 收入 | 120 | 148 | 百万元 || 留存率 | 91 | 95 | 百分比 |语法正确的 Markdown 表格也可能在事实层面出错:OCR 可能把 8.0 识别成 80,漏掉负号,或把单位推到下一行。重要总数应独立计算核对。如果有原始电子表格,应直接使用,不要从 PDF 重新拼数据。
标题也不能自动保证:工具可能把每段粗体都变成标题、丢掉层级,或把页眉塞进章节中间。把转换后的标题顺序与原目录和正文逐项比较。
转换结果校验清单
Section titled “转换结果校验清单”完整性与顺序
Section titled “完整性与顺序”- 开头、中间和结尾应有的章节都在。
- 多栏文字按原定阅读顺序排列。
- 侧栏、图注和脚注没有插进无关段落。
- 没有漏页,也没有重复内容块。
标题、段落与列表
Section titled “标题、段落与列表”- 标题级别反映真实层级,而不是字体大小。
- 页面造成的断行已经连接,真实段落仍然分开。
- 列表项目完整,有序步骤没有换序。
- 表格列数一致,表注仍与正确表格相连。
- 人名、日期、金额、小数点、正负号、币种和单位与 PDF 一致。
- 公式和符号已经与渲染页面比对。
- 重要图表有文字说明,或附有底层数据。
- 引文、脚注、链接和页码仍指向正确内容。
- 原 PDF 和转换日期已经保留。
- 无法辨认的内容明确标注,没有擅自猜测。
- 上传前删除了不必要的秘密和个人信息。
- 所用 AI 服务符合文档的保密要求。
可以直接把 PDF 交给 AI 吗?
Section titled “可以直接把 PDF 交给 AI 吗?”很多时候可以,尤其是文件较短、以文字为主,而且所用工具支持 PDF 输入时。需要修正 OCR 和顺序、复用章节、追踪变更、移除敏感部分、补充元数据,或为搜索拆分长文档时,再转换成 Markdown。
视觉信息复杂的资料可能需要两者并用:Markdown 负责可搜索文字,原 PDF 页面负责图表、布局和最终核验。完成转换后,可参考给 AI 用的 Markdown,把指令、资料和输出格式分开。
- 给 AI 用的 Markdown — 整理转换后的资料和任务说明。
- Markdown 表格 — 修复行、列、表头和单位。
- Markdown 换行 — 清理提取产生的硬换行。
- 把 Markdown 转成 PDF — 导出已经核验的 Markdown 文档。