콘텐츠로 이동

PDF를 Markdown으로 변환하기 (AI용)

빠르고 신뢰할 수 있는 시작 방법

섹션 제목: “빠르고 신뢰할 수 있는 시작 방법”

먼저 PDF에서 문단 하나를 선택해 복사해 보세요.

  • 텍스트를 선택할 수 있고 올바른 순서로 복사되면 일반 PDF-to-Markdown 추출기로 시작합니다.
  • 선택은 되지만 단, 표, 각주 순서가 뒤섞이면 레이아웃을 인식하는 도구를 사용하고 수동 교정을 계획합니다.
  • 페이지 전체가 한 장의 이미지처럼 동작하면 OCR(광학 문자 인식)을 먼저 실행한 뒤 Markdown 구조를 복원합니다.

어떤 방법을 쓰든 Markdown은 PDF에서 만든 초안입니다. 검증된 대체 원본이 아닙니다. 원본을 보관하고 제목, 읽기 순서, 숫자, 표, 인용을 대조하세요.

PDF 유형 알아보는 방법 권장 시작 방법 주요 위험
단순 텍스트 문서 텍스트 선택 가능, 한 단, 그림이 적음 일반 텍스트 추출 제목과 목록 구조 손실
여러 단으로 된 보고서 복사하면 단이나 사이드바 사이를 건너뜀 레이아웃 인식 추출 잘못된 읽기 순서
표가 많은 문서 복잡한 격자, 병합 헤더, 다양한 단위 표 인식 추출, 가능하면 원본 스프레드시트 열이 밀리고 단위가 분리됨
스캔 또는 촬영본 텍스트를 선택할 수 없거나 페이지 전체가 이미지 문서 언어를 지정한 OCR 문자 오인식과 누락
수식·그림·각주가 많은 문서 수식, 참고 문헌, 그림 설명, 두 단 구성 구조 인식 추출 후 수동 검토 수식, 인용, 캡션 손상
양식·슬라이드·디자인 문서 상자, 화살표, 위치가 의미를 결정 페이지 이미지를 보며 수동 재구성 시각적 관계 손실

원본 Markdown, HTML, DOCX, CSV 또는 스프레드시트가 있다면 PDF 대신 그 파일을 요청하는 편이 좋습니다. PDF는 고정된 화면을 전달하는 형식이라 원본 파일이 구조를 더 잘 보존하는 경우가 많습니다.

수정하지 않은 PDF를 보관하고 제목, 발행 기관, 날짜, URL이나 파일명, 버전, 확인 날짜를 기록합니다.

---
title: "예시 연례 보고서"
source_file: "annual-report-2026.pdf"
source_url: "https://example.com/annual-report-2026.pdf"
retrieved: 2026-08-13
---

이 정보는 변환본이 어디에서 왔는지 추적하게 해 주지만, 변환본 자체를 공식 원본으로 만들지는 않습니다.

전체를 변환하기 전에 일반 본문, 표가 있는 페이지, 그림이나 각주가 있는 페이지, 레이아웃이 바뀌는 페이지를 골라 시험합니다. 첫 페이지만 잘 처리하는 도구도 중간의 다른 형식에서는 실패할 수 있습니다.

3. 텍스트 추출 또는 OCR 실행하기

섹션 제목: “3. 텍스트 추출 또는 OCR 실행하기”

텍스트가 내장된 PDF에는 직접 추출을, 이미지뿐인 페이지에는 OCR을 사용합니다. 한 파일 안에 두 유형이 섞여 있을 수도 있습니다. OCR 언어를 정확히 지정하고, 불확실한 문자를 확인할 수 있도록 페이지 이미지를 남겨 두세요.

  • 문서 제목 하나에만 #를 사용합니다.
  • 실제 계층에 따라 주요 섹션은 ##, 하위 섹션은 ###로 만듭니다.
  • 글머리표와 순서가 있는 절차를 Markdown 목록으로 복원합니다.
  • 지면 폭 때문에 끊긴 줄은 잇되 실제 문단 구분은 남깁니다.
  • 표와 그림 설명, 각주와 해당 표시를 서로 가까이 둡니다.
  • 반복 머리글, 바닥글, 페이지 번호는 의미가 없을 때 제거합니다.

PDF에서 굵게 보인다고 반드시 제목인 것은 아닙니다. 변환 도구가 시각적 모양만으로 제목 계층을 완벽하게 판단한다고 기대하지 마세요.

5. 필요하면 페이지 위치 보존하기

섹션 제목: “5. 필요하면 페이지 위치 보존하기”

답변을 특정 페이지에서 확인해야 한다면 해당 내용 앞에 표시를 추가합니다.

[PDF 12쪽]
## 수익 인식

문서에 인쇄된 쪽수와 PDF 뷰어의 파일 쪽수가 다르면 어느 쪽을 썼는지 밝힙니다. 내용을 재배열한 뒤 페이지 번호를 추정해서 넣지 마세요.

Markdown 미리 보기를 확인하되 원시 텍스트도 읽어 보세요. 화면이 깔끔해도 섹션이 중복되거나 행이 빠졌거나 숫자가 다른 항목에 붙어 있을 수 있습니다.

표와 제목은 자동 보존되지 않습니다

섹션 제목: “표와 제목은 자동 보존되지 않습니다”

표는 변환 시 위험이 큰 부분입니다. 헤더, 행 이름, 값, 단위, 기간, 주석 사이의 관계를 하나씩 확인하세요. 병합 헤더는 명시적인 열 이름으로 풀거나 작은 표로 나누는 편이 안전합니다.

| 지표 | 2025 | 2026 | 단위 |
|---|---:|---:|---|
| 매출 | 120 | 148 | 백만 원 |
| 유지율 | 91 | 95 | 퍼센트 |

문법이 완벽한 표도 사실은 틀릴 수 있습니다. OCR이 8.080으로 읽거나 음수 기호가 사라지거나 단위가 옆 행으로 밀릴 수 있기 때문입니다. 합계를 별도로 계산해 확인하고, 원본 스프레드시트가 있으면 PDF에서 표를 재구성하는 대신 그것을 사용하세요.

제목도 마찬가지입니다. 모든 굵은 문장이 제목으로 바뀌거나, 제목 단계가 사라지거나, 페이지 머리글이 섹션 사이에 들어갈 수 있습니다. 원본 목차와 변환된 제목 순서를 비교해야 합니다.

  • 문서 앞부분, 중간, 마지막의 예상 섹션이 모두 있습니다.
  • 여러 단의 텍스트가 의도한 순서로 이어집니다.
  • 사이드바와 캡션이 무관한 문단에 끼어들지 않았습니다.
  • 빠진 페이지나 중복 블록이 없습니다.
  • 제목 단계가 글자 크기가 아니라 실제 계층을 나타냅니다.
  • 지면 줄바꿈은 합쳤지만 문단 경계는 유지했습니다.
  • 목록의 항목과 순서가 완전합니다.
  • 표의 열 수가 맞고 주석이 올바른 표에 붙어 있습니다.
  • 이름, 날짜, 금액, 소수점, 부호, 통화, 단위가 PDF와 일치합니다.
  • 수식과 기호를 렌더링된 페이지와 비교했습니다.
  • 중요한 그림에는 설명이나 원자료가 있습니다.
  • 인용, 각주, 링크, 페이지 표시가 올바른 내용을 가리킵니다.
  • 원본 PDF와 변환 날짜를 보존했습니다.
  • 읽을 수 없는 부분을 추측하지 않고 표시했습니다.
  • 불필요한 비밀 정보와 개인정보를 제거했습니다.
  • 문서의 기밀 수준에 맞는 AI 서비스를 선택했습니다.

짧고 텍스트 중심이며 사용하는 도구가 PDF 입력을 지원한다면 직접 넣어도 되는 경우가 많습니다. OCR이나 순서를 교정해야 할 때, 섹션을 재사용할 때, 변경 이력을 관리할 때, 민감한 부분을 제거할 때, 검색용으로 문서를 나눌 때는 Markdown 변환이 유용합니다.

시각적으로 복잡한 자료는 두 형식을 함께 쓰는 것이 좋을 수 있습니다. 검색할 텍스트는 Markdown으로 만들고, 그림·레이아웃·최종 검증에는 원본 PDF를 사용합니다. 변환 후에는 AI를 위한 Markdown에서 지시, 자료, 출력 형식을 분리하는 방법을 확인하세요.