把 PDF 轉成 Markdown(餵給 AI)
最快且相對可靠的做法
Section titled “最快且相對可靠的做法”先試著在 PDF 裡選取並複製一小段正文。
- 可以選取文字,複製後順序也正常:先用一般的 PDF 轉 Markdown 擷取工具。
- 可以選取文字,但分欄、表格或註腳順序混亂:改用能辨識頁面配置的工具,並預留人工整理時間。
- 整頁像一張圖片,無法選取文字:先做 OCR(光學字元辨識),再重建 Markdown 結構。
無論使用哪種方法,都要把轉換結果視為從 PDF 衍生的草稿,而不是已經驗證的新原件。保留原始 PDF,以便核對標題、閱讀順序、數字、表格與引用。
依 PDF 類型選擇方法
Section titled “依 PDF 類型選擇方法”| PDF 類型 | 如何判斷 | 建議起點 | 主要風險 |
|---|---|---|---|
| 簡單文字版 | 文字可選取、單欄、圖片較少 | 一般文字擷取 | 標題與清單結構遺失 |
| 多欄報告或手冊 | 複製時文字會在欄、側邊框之間跳動 | 版面感知擷取 | 閱讀順序錯誤 |
| 表格密集的文件 | 網格、合併表頭與單位很多 | 表格感知擷取;有原始試算表時優先使用 | 欄位錯置、單位脫離數值 |
| 掃描檔或照片 | 無法選取文字,或整頁被視為圖片 | 設定正確語言的 OCR | 字元誤辨識與漏字 |
| 含公式、圖片與註腳的論文 | 雙欄、公式、引用、圖說較多 | 結構感知擷取後人工複核 | 公式、引文與圖說順序損壞 |
| 表單、投影片或設計稿 | 含義依賴方框、箭頭與位置 | 對照頁面圖片人工重組 | 視覺關係被攤平成連續文字 |
若能取得 Markdown、HTML、DOCX、CSV 或試算表等來源檔,通常應優先使用來源檔。PDF 是固定版面的交付格式,來源檔往往保留較清楚的結構。
PDF 轉 Markdown 的完整流程
Section titled “PDF 轉 Markdown 的完整流程”1. 保留原件並記錄來源
Section titled “1. 保留原件並記錄來源”保存一份未修改的 PDF,記下標題、發布者、日期、URL 或檔名、版本與取得日期。
---title: "年度報告範例"source_file: "annual-report-2026.pdf"source_url: "https://example.com/annual-report-2026.pdf"retrieved: 2026-08-13---這些資訊讓轉換內容可以追溯,但不會讓 Markdown 成為官方原件。
2. 先測試有代表性的頁面
Section titled “2. 先測試有代表性的頁面”不要一開始就轉換數百頁。先挑一頁一般正文、一頁表格、一頁含圖片或註腳的內容,以及任何版面改變的頁面。某個工具可能把首頁處理得很好,卻在後面的雙欄頁面失效。
3. 擷取文字或執行 OCR
Section titled “3. 擷取文字或執行 OCR”文字版 PDF 使用直接擷取,只有影像的頁面使用 OCR。有些 PDF 會混合兩種類型,需要分別處理。正確設定文件語言;多語言文件應啟用相應語言。保留頁面影像,以便核對辨識不確定的字元。
4. 重建語意結構
Section titled “4. 重建語意結構”- 真正的文件標題只使用一個
#。 - 主要章節使用
##,實際的下級章節使用###。 - 把項目符號與步驟還原成 Markdown 清單。
- 合併只因頁面寬度產生的斷行,但保留真正的段落界線。
- 讓圖說、表註和註腳留在對應內容附近。
- 移除沒有意義的重複頁首、頁尾、頁碼與浮水印。
PDF 裡的粗體不一定是標題。轉換工具無法只憑字級與外觀可靠判斷所有標題層級,必須對照目錄與正文檢查。
5. 必要時保留頁碼位置
Section titled “5. 必要時保留頁碼位置”如果後續回答需要回到特定頁面驗證,可以在對應內容前加上簡單標記:
[PDF 第 12 頁]
## 收入認列若印刷頁碼與閱讀器顯示的檔案頁碼不同,要說明採用哪一套。重新排列內容後,不要憑印象補上頁碼。
6. 轉譯並對照原文
Section titled “6. 轉譯並對照原文”除了看 Markdown 預覽,也要讀原始文字。一份看起來整齊的預覽,仍可能藏有章節重複、整列遺失,或數字與標籤錯置等問題。
表格和標題無法保證完整保留
Section titled “表格和標題無法保證完整保留”表格通常是轉換中的高風險內容。逐項核對表頭、列名、數值、單位、期間與註解之間的關係。遇到合併表頭,應展開為明確欄名,或拆成幾個較小的表格。
| 指標 | 2025 | 2026 | 單位 ||---|---:|---:|---|| 收入 | 120 | 148 | 百萬元 || 留存率 | 91 | 95 | 百分比 |語法正確的 Markdown 表格仍可能在事實上出錯:OCR 可能把 8.0 辨識成 80、漏掉負號,或把單位推到下一列。重要總數應獨立計算核對。若有原始試算表,應直接使用,不要從 PDF 重新拼資料。
標題也不能自動保證:工具可能把每段粗體都變成標題、遺失層級,或把頁首插進章節中間。將轉換後的標題順序與原目錄和正文逐項比較。
轉換結果檢查清單
Section titled “轉換結果檢查清單”完整性與順序
Section titled “完整性與順序”- 開頭、中間與結尾應有的章節都存在。
- 多欄文字按照原定閱讀順序排列。
- 側欄、圖說與註腳沒有插入無關段落。
- 沒有漏頁,也沒有重複內容區塊。
標題、段落與清單
Section titled “標題、段落與清單”- 標題層級反映真正階層,而不是字體大小。
- 頁面造成的斷行已經連接,真正段落仍然分開。
- 清單項目完整,編號步驟沒有換序。
- 表格欄數一致,表註仍與正確表格相連。
- 人名、日期、金額、小數點、正負號、幣別與單位和 PDF 一致。
- 公式與符號已經和轉譯頁面比對。
- 重要圖表有文字說明,或附上底層資料。
- 引文、註腳、連結與頁碼仍指向正確內容。
- 原始 PDF 與轉換日期已經保留。
- 無法辨認的內容已明確標記,沒有自行猜測。
- 上傳前已移除不必要的機密與個人資料。
- 所用 AI 服務符合文件的保密要求。
可以直接把 PDF 交給 AI 嗎?
Section titled “可以直接把 PDF 交給 AI 嗎?”很多時候可以,尤其是檔案較短、以文字為主,而且所用工具支援 PDF 輸入時。需要修正 OCR 與順序、重複使用章節、追蹤變更、移除敏感部分、補充詮釋資料,或為搜尋拆分長文件時,再轉換成 Markdown。
視覺資訊複雜的資料可能需要兩者並用:Markdown 負責可搜尋文字,原始 PDF 頁面負責圖表、版面與最終驗證。完成轉換後,可參考給 AI 用的 Markdown,把指示、資料與輸出格式分開。
- 給 AI 用的 Markdown — 整理轉換後的資料與任務說明。
- Markdown 表格 — 修復列、欄、表頭與單位。
- Markdown 換行 — 清理擷取產生的強制換行。
- 把 Markdown 轉成 PDF — 匯出已經驗證的 Markdown 文件。