跳到內容

把 PDF 轉成 Markdown(餵給 AI)

先試著在 PDF 裡選取並複製一小段正文。

  • 可以選取文字,複製後順序也正常:先用一般的 PDF 轉 Markdown 擷取工具。
  • 可以選取文字,但分欄、表格或註腳順序混亂:改用能辨識頁面配置的工具,並預留人工整理時間。
  • 整頁像一張圖片,無法選取文字:先做 OCR(光學字元辨識),再重建 Markdown 結構。

無論使用哪種方法,都要把轉換結果視為從 PDF 衍生的草稿,而不是已經驗證的新原件。保留原始 PDF,以便核對標題、閱讀順序、數字、表格與引用。

PDF 類型 如何判斷 建議起點 主要風險
簡單文字版 文字可選取、單欄、圖片較少 一般文字擷取 標題與清單結構遺失
多欄報告或手冊 複製時文字會在欄、側邊框之間跳動 版面感知擷取 閱讀順序錯誤
表格密集的文件 網格、合併表頭與單位很多 表格感知擷取;有原始試算表時優先使用 欄位錯置、單位脫離數值
掃描檔或照片 無法選取文字,或整頁被視為圖片 設定正確語言的 OCR 字元誤辨識與漏字
含公式、圖片與註腳的論文 雙欄、公式、引用、圖說較多 結構感知擷取後人工複核 公式、引文與圖說順序損壞
表單、投影片或設計稿 含義依賴方框、箭頭與位置 對照頁面圖片人工重組 視覺關係被攤平成連續文字

若能取得 Markdown、HTML、DOCX、CSV 或試算表等來源檔,通常應優先使用來源檔。PDF 是固定版面的交付格式,來源檔往往保留較清楚的結構。

保存一份未修改的 PDF,記下標題、發布者、日期、URL 或檔名、版本與取得日期。

---
title: "年度報告範例"
source_file: "annual-report-2026.pdf"
source_url: "https://example.com/annual-report-2026.pdf"
retrieved: 2026-08-13
---

這些資訊讓轉換內容可以追溯,但不會讓 Markdown 成為官方原件。

不要一開始就轉換數百頁。先挑一頁一般正文、一頁表格、一頁含圖片或註腳的內容,以及任何版面改變的頁面。某個工具可能把首頁處理得很好,卻在後面的雙欄頁面失效。

文字版 PDF 使用直接擷取,只有影像的頁面使用 OCR。有些 PDF 會混合兩種類型,需要分別處理。正確設定文件語言;多語言文件應啟用相應語言。保留頁面影像,以便核對辨識不確定的字元。

  • 真正的文件標題只使用一個 #
  • 主要章節使用 ##,實際的下級章節使用 ###
  • 把項目符號與步驟還原成 Markdown 清單。
  • 合併只因頁面寬度產生的斷行,但保留真正的段落界線。
  • 讓圖說、表註和註腳留在對應內容附近。
  • 移除沒有意義的重複頁首、頁尾、頁碼與浮水印。

PDF 裡的粗體不一定是標題。轉換工具無法只憑字級與外觀可靠判斷所有標題層級,必須對照目錄與正文檢查。

如果後續回答需要回到特定頁面驗證,可以在對應內容前加上簡單標記:

[PDF 第 12 頁]
## 收入認列

若印刷頁碼與閱讀器顯示的檔案頁碼不同,要說明採用哪一套。重新排列內容後,不要憑印象補上頁碼。

除了看 Markdown 預覽,也要讀原始文字。一份看起來整齊的預覽,仍可能藏有章節重複、整列遺失,或數字與標籤錯置等問題。

表格通常是轉換中的高風險內容。逐項核對表頭、列名、數值、單位、期間與註解之間的關係。遇到合併表頭,應展開為明確欄名,或拆成幾個較小的表格。

| 指標 | 2025 | 2026 | 單位 |
|---|---:|---:|---|
| 收入 | 120 | 148 | 百萬元 |
| 留存率 | 91 | 95 | 百分比 |

語法正確的 Markdown 表格仍可能在事實上出錯:OCR 可能把 8.0 辨識成 80、漏掉負號,或把單位推到下一列。重要總數應獨立計算核對。若有原始試算表,應直接使用,不要從 PDF 重新拼資料。

標題也不能自動保證:工具可能把每段粗體都變成標題、遺失層級,或把頁首插進章節中間。將轉換後的標題順序與原目錄和正文逐項比較。

  • 開頭、中間與結尾應有的章節都存在。
  • 多欄文字按照原定閱讀順序排列。
  • 側欄、圖說與註腳沒有插入無關段落。
  • 沒有漏頁,也沒有重複內容區塊。
  • 標題層級反映真正階層,而不是字體大小。
  • 頁面造成的斷行已經連接,真正段落仍然分開。
  • 清單項目完整,編號步驟沒有換序。
  • 表格欄數一致,表註仍與正確表格相連。
  • 人名、日期、金額、小數點、正負號、幣別與單位和 PDF 一致。
  • 公式與符號已經和轉譯頁面比對。
  • 重要圖表有文字說明,或附上底層資料。
  • 引文、註腳、連結與頁碼仍指向正確內容。
  • 原始 PDF 與轉換日期已經保留。
  • 無法辨認的內容已明確標記,沒有自行猜測。
  • 上傳前已移除不必要的機密與個人資料。
  • 所用 AI 服務符合文件的保密要求。

很多時候可以,尤其是檔案較短、以文字為主,而且所用工具支援 PDF 輸入時。需要修正 OCR 與順序、重複使用章節、追蹤變更、移除敏感部分、補充詮釋資料,或為搜尋拆分長文件時,再轉換成 Markdown。

視覺資訊複雜的資料可能需要兩者並用:Markdown 負責可搜尋文字,原始 PDF 頁面負責圖表、版面與最終驗證。完成轉換後,可參考給 AI 用的 Markdown,把指示、資料與輸出格式分開。