# 把 PDF 轉成 Markdown（餵給 AI）

> 依文字版、掃描檔、表格或複雜版面選擇 PDF 轉 Markdown 方法，並在交給 AI 前檢查結構、數字與來源。

## 最快且相對可靠的做法

先試著在 PDF 裡選取並複製一小段正文。

- 可以選取文字，複製後順序也正常：先用一般的 PDF 轉 Markdown 擷取工具。
- 可以選取文字，但分欄、表格或註腳順序混亂：改用能辨識頁面配置的工具，並預留人工整理時間。
- 整頁像一張圖片，無法選取文字：先做 OCR（光學字元辨識），再重建 Markdown 結構。

無論使用哪種方法，都要把轉換結果視為**從 PDF 衍生的草稿**，而不是已經驗證的新原件。保留原始 PDF，以便核對標題、閱讀順序、數字、表格與引用。

## 依 PDF 類型選擇方法

| PDF 類型 | 如何判斷 | 建議起點 | 主要風險 |
|---|---|---|---|
| 簡單文字版 | 文字可選取、單欄、圖片較少 | 一般文字擷取 | 標題與清單結構遺失 |
| 多欄報告或手冊 | 複製時文字會在欄、側邊框之間跳動 | 版面感知擷取 | 閱讀順序錯誤 |
| 表格密集的文件 | 網格、合併表頭與單位很多 | 表格感知擷取；有原始試算表時優先使用 | 欄位錯置、單位脫離數值 |
| 掃描檔或照片 | 無法選取文字，或整頁被視為圖片 | 設定正確語言的 OCR | 字元誤辨識與漏字 |
| 含公式、圖片與註腳的論文 | 雙欄、公式、引用、圖說較多 | 結構感知擷取後人工複核 | 公式、引文與圖說順序損壞 |
| 表單、投影片或設計稿 | 含義依賴方框、箭頭與位置 | 對照頁面圖片人工重組 | 視覺關係被攤平成連續文字 |

若能取得 Markdown、HTML、DOCX、CSV 或試算表等來源檔，通常應優先使用來源檔。PDF 是固定版面的交付格式，來源檔往往保留較清楚的結構。

## PDF 轉 Markdown 的完整流程

### 1. 保留原件並記錄來源

保存一份未修改的 PDF，記下標題、發布者、日期、URL 或檔名、版本與取得日期。

```markdown
---
title: "年度報告範例"
source_file: "annual-report-2026.pdf"
source_url: "https://example.com/annual-report-2026.pdf"
retrieved: 2026-08-13
---
```

這些資訊讓轉換內容可以追溯，但不會讓 Markdown 成為官方原件。

### 2. 先測試有代表性的頁面

不要一開始就轉換數百頁。先挑一頁一般正文、一頁表格、一頁含圖片或註腳的內容，以及任何版面改變的頁面。某個工具可能把首頁處理得很好，卻在後面的雙欄頁面失效。

### 3. 擷取文字或執行 OCR

文字版 PDF 使用直接擷取，只有影像的頁面使用 OCR。有些 PDF 會混合兩種類型，需要分別處理。正確設定文件語言；多語言文件應啟用相應語言。保留頁面影像，以便核對辨識不確定的字元。

### 4. 重建語意結構

- 真正的文件標題只使用一個 `#`。
- 主要章節使用 `##`，實際的下級章節使用 `###`。
- 把項目符號與步驟還原成 Markdown 清單。
- 合併只因頁面寬度產生的斷行，但保留真正的段落界線。
- 讓圖說、表註和註腳留在對應內容附近。
- 移除沒有意義的重複頁首、頁尾、頁碼與浮水印。

PDF 裡的粗體不一定是標題。轉換工具無法只憑字級與外觀可靠判斷所有標題層級，必須對照目錄與正文檢查。

### 5. 必要時保留頁碼位置

如果後續回答需要回到特定頁面驗證，可以在對應內容前加上簡單標記：

```markdown
[PDF 第 12 頁]

## 收入認列
```

若印刷頁碼與閱讀器顯示的檔案頁碼不同，要說明採用哪一套。重新排列內容後，不要憑印象補上頁碼。

### 6. 轉譯並對照原文

除了看 Markdown 預覽，也要讀原始文字。一份看起來整齊的預覽，仍可能藏有章節重複、整列遺失，或數字與標籤錯置等問題。

## 表格和標題無法保證完整保留

表格通常是轉換中的高風險內容。逐項核對表頭、列名、數值、單位、期間與註解之間的關係。遇到合併表頭，應展開為明確欄名，或拆成幾個較小的表格。

```markdown
| 指標 | 2025 | 2026 | 單位 |
|---|---:|---:|---|
| 收入 | 120 | 148 | 百萬元 |
| 留存率 | 91 | 95 | 百分比 |
```

語法正確的 Markdown 表格仍可能在事實上出錯：OCR 可能把 `8.0` 辨識成 `80`、漏掉負號，或把單位推到下一列。重要總數應獨立計算核對。若有原始試算表，應直接使用，不要從 PDF 重新拼資料。

標題也不能自動保證：工具可能把每段粗體都變成標題、遺失層級，或把頁首插進章節中間。將轉換後的標題順序與原目錄和正文逐項比較。

## 轉換結果檢查清單

### 完整性與順序

- 開頭、中間與結尾應有的章節都存在。
- 多欄文字按照原定閱讀順序排列。
- 側欄、圖說與註腳沒有插入無關段落。
- 沒有漏頁，也沒有重複內容區塊。

### 標題、段落與清單

- 標題層級反映真正階層，而不是字體大小。
- 頁面造成的斷行已經連接，真正段落仍然分開。
- 清單項目完整，編號步驟沒有換序。
- 表格欄數一致，表註仍與正確表格相連。

### 資料與證據

- 人名、日期、金額、小數點、正負號、幣別與單位和 PDF 一致。
- 公式與符號已經和轉譯頁面比對。
- 重要圖表有文字說明，或附上底層資料。
- 引文、註腳、連結與頁碼仍指向正確內容。

### 來源與安全

- 原始 PDF 與轉換日期已經保留。
- 無法辨認的內容已明確標記，沒有自行猜測。
- 上傳前已移除不必要的機密與個人資料。
- 所用 AI 服務符合文件的保密要求。

:::tip
一種影響很大的錯誤，是表格看起來合理，實際卻把表頭、數值或單位錯置，而不只是版面難看。重要資料列要逐格與原 PDF 比對。
:::

## 可以直接把 PDF 交給 AI 嗎？

很多時候可以，尤其是檔案較短、以文字為主，而且所用工具支援 PDF 輸入時。需要修正 OCR 與順序、重複使用章節、追蹤變更、移除敏感部分、補充詮釋資料，或為搜尋拆分長文件時，再轉換成 Markdown。

視覺資訊複雜的資料可能需要兩者並用：Markdown 負責可搜尋文字，原始 PDF 頁面負責圖表、版面與最終驗證。完成轉換後，可參考[給 AI 用的 Markdown](/zh-tw/markdown-for-ai/)，把指示、資料與輸出格式分開。

## 下一步

- [給 AI 用的 Markdown](/zh-tw/markdown-for-ai/) — 整理轉換後的資料與任務說明。
- [Markdown 表格](/zh-tw/tables/) — 修復列、欄、表頭與單位。
- [Markdown 換行](/zh-tw/line-breaks/) — 清理擷取產生的強制換行。
- [把 Markdown 轉成 PDF](/zh-tw/md-to-pdf/) — 匯出已經驗證的 Markdown 文件。
