# 把 PDF 转成 Markdown（喂给 AI）

> 按文字版、扫描件、表格或复杂排版选择 PDF 转 Markdown 方法，并在交给 AI 前校验结构、数字和来源。

## 最快且相对可靠的做法

先试着在 PDF 里选中并复制一小段正文。

- 能选中文字，复制出来的顺序也正常：先用普通的 PDF 转 Markdown 提取工具。
- 能选中文字，但分栏、表格或脚注顺序混乱：改用能识别页面布局的工具，并预留人工整理时间。
- 整页像一张图片，无法选中文字：先做 OCR（光学字符识别），再重建 Markdown 结构。

无论使用哪种方法，都要把转换结果看作**从 PDF 派生的草稿**，而不是经过核验的新原件。保留原 PDF，用来核对标题、阅读顺序、数字、表格和引用。

## 根据 PDF 类型选择方法

| PDF 类型 | 怎么判断 | 建议起点 | 主要风险 |
|---|---|---|---|
| 简单文字版 | 文字可选、单栏、图片较少 | 普通文本提取 | 标题和列表结构丢失 |
| 多栏报告或宣传册 | 复制时文字会在栏、侧边框之间跳转 | 布局感知提取 | 阅读顺序错误 |
| 表格密集型文件 | 网格多、合并表头多、单位复杂 | 表格感知提取；有原始表格时优先用原文件 | 列错位、单位脱离数值 |
| 扫描件或照片 | 无法选择文字，或整页被当成图片 | 设置正确语言的 OCR | 字符误识别、漏字 |
| 带公式、图片和脚注的论文 | 双栏、公式、引用、图注较多 | 结构感知提取后人工复核 | 公式、引文和图注次序损坏 |
| 表单、幻灯片或设计稿 | 含义依赖方框、箭头和位置 | 对照页面图片人工重组 | 视觉关系被压平成连续文字 |

如果能拿到 Markdown、HTML、DOCX、CSV 或电子表格等源文件，通常应优先用源文件。PDF 是固定版面的交付格式，源文件往往保留了更清楚的结构。

## PDF 转 Markdown 的完整流程

### 1. 保留原件并记录来源

保存一份没有修改的 PDF，记录标题、发布方、日期、URL 或文件名、版本和获取日期。

```markdown
---
title: "年度报告示例"
source_file: "annual-report-2026.pdf"
source_url: "https://example.com/annual-report-2026.pdf"
retrieved: 2026-08-13
---
```

这些信息让转换内容可以追溯，但不会让 Markdown 变成权威原件。

### 2. 先测试有代表性的页面

不要一上来转换几百页。先挑一页普通正文、一页表格、一页带图或脚注的内容，以及任何版式发生变化的页面。一款工具可能把第一页处理得很好，却在后面的双栏页面失效。

### 3. 提取文字或运行 OCR

文字版 PDF 用直接提取，只有图像的页面用 OCR。有些 PDF 两种页面混在一起，需要分别处理。正确设置文档语言；多语言文档应开启相应语言。保留页面图片，以便核对识别不确定的字符。

### 4. 重建语义结构

- 真正的文档标题只用一个 `#`。
- 主要章节用 `##`，真实的下级章节用 `###`。
- 把项目符号和步骤恢复成 Markdown 列表。
- 合并只因页面宽度而产生的断行，但保留真实段落边界。
- 让图注、表注和脚注留在对应内容附近。
- 删除无意义的重复页眉、页脚、页码和水印。

PDF 里的粗体不一定是标题。转换器无法只凭字号和外观可靠判断全部标题层级，必须对照目录和正文检查。

### 5. 必要时保留页码定位

如果后续回答需要回到特定页面核验，可以在对应内容前加轻量标记：

```markdown
[PDF 第 12 页]

## 收入确认
```

如果印刷页码和阅读器显示的文件页码不同，要说明采用哪一套。重新排列内容后，不要凭印象补页码。

### 6. 渲染并对照原文

既要看 Markdown 预览，也要读原始文本。一份看起来整洁的预览，仍可能藏着章节重复、整行缺失，或数字与标签错配等问题。

## 表格和标题不能保证完整保留

表格通常是转换中的高风险内容。逐项核对表头、行名、数值、单位、时间范围和注释之间的关系。遇到合并表头，应展开成明确列名，或拆成几个较小的表格。

```markdown
| 指标 | 2025 | 2026 | 单位 |
|---|---:|---:|---|
| 收入 | 120 | 148 | 百万元 |
| 留存率 | 91 | 95 | 百分比 |
```

语法正确的 Markdown 表格也可能在事实层面出错：OCR 可能把 `8.0` 识别成 `80`，漏掉负号，或把单位推到下一行。重要总数应独立计算核对。如果有原始电子表格，应直接使用，不要从 PDF 重新拼数据。

标题也不能自动保证：工具可能把每段粗体都变成标题、丢掉层级，或把页眉塞进章节中间。把转换后的标题顺序与原目录和正文逐项比较。

## 转换结果校验清单

### 完整性与顺序

- 开头、中间和结尾应有的章节都在。
- 多栏文字按原定阅读顺序排列。
- 侧栏、图注和脚注没有插进无关段落。
- 没有漏页，也没有重复内容块。

### 标题、段落与列表

- 标题级别反映真实层级，而不是字体大小。
- 页面造成的断行已经连接，真实段落仍然分开。
- 列表项目完整，有序步骤没有换序。
- 表格列数一致，表注仍与正确表格相连。

### 数据与证据

- 人名、日期、金额、小数点、正负号、币种和单位与 PDF 一致。
- 公式和符号已经与渲染页面比对。
- 重要图表有文字说明，或附有底层数据。
- 引文、脚注、链接和页码仍指向正确内容。

### 来源与安全

- 原 PDF 和转换日期已经保留。
- 无法辨认的内容明确标注，没有擅自猜测。
- 上传前删除了不必要的秘密和个人信息。
- 所用 AI 服务符合文档的保密要求。

:::tip
一种影响很大的错误，是表格看起来合理，实际却把表头、数值或单位错位，而不只是排版难看。重要行要逐格与原 PDF 对照。
:::

## 可以直接把 PDF 交给 AI 吗？

很多时候可以，尤其是文件较短、以文字为主，而且所用工具支持 PDF 输入时。需要修正 OCR 和顺序、复用章节、追踪变更、移除敏感部分、补充元数据，或为搜索拆分长文档时，再转换成 Markdown。

视觉信息复杂的资料可能需要两者并用：Markdown 负责可搜索文字，原 PDF 页面负责图表、布局和最终核验。完成转换后，可参考[给 AI 用的 Markdown](/zh-cn/markdown-for-ai/)，把指令、资料和输出格式分开。

## 下一步

- [给 AI 用的 Markdown](/zh-cn/markdown-for-ai/) — 整理转换后的资料和任务说明。
- [Markdown 表格](/zh-cn/tables/) — 修复行、列、表头和单位。
- [Markdown 换行](/zh-cn/line-breaks/) — 清理提取产生的硬换行。
- [把 Markdown 转成 PDF](/zh-cn/md-to-pdf/) — 导出已经核验的 Markdown 文档。
