# Converter um PDF para Markdown (para IA)

> Como converter para Markdown PDFs de texto, digitalizados, com tabelas ou layouts complexos e validar o resultado.

## O caminho mais rápido e confiável

Primeiro, tente selecionar e copiar um parágrafo do PDF.

- Se o texto for selecionável e aparecer na ordem correta, comece com um extrator comum de PDF para Markdown.
- Se for selecionável, mas colunas, tabelas ou notas saírem fora de ordem, use uma ferramenta sensível ao layout e planeje uma revisão manual.
- Se a página se comportar como uma única imagem, faça OCR (reconhecimento óptico de caracteres) antes de reconstruir o Markdown.

Em qualquer caso, trate o Markdown como um **rascunho derivado do PDF**, não como substituto verificado. Guarde o original para conferir títulos, ordem de leitura, números, tabelas e citações.

## Escolha pelo tipo de PDF

| Tipo de PDF | Como reconhecer | Melhor ponto de partida | Principal risco |
|---|---|---|---|
| Documento de texto simples | Texto selecionável, uma coluna, poucas figuras | Extração comum de texto | Perda de títulos e listas |
| Relatório com várias colunas | Ao copiar, o texto salta entre colunas ou caixas | Extração sensível ao layout | Ordem de leitura incorreta |
| Documento com muitas tabelas | Grades densas, cabeçalhos mesclados, várias unidades | Extração de tabelas; de preferência, a planilha original | Colunas deslocadas e unidades separadas |
| Página digitalizada ou fotografada | O texto não pode ser selecionado ou a página inteira é uma imagem | OCR configurado no idioma correto | Caracteres trocados ou ausentes |
| Artigo com fórmulas e notas | Equações, referências, legendas, duas colunas | Extração especializada mais revisão manual | Fórmulas, citações e legendas danificadas |
| Formulário, slide ou página diagramada | O sentido depende de caixas, setas ou posição | Reestruturação manual com referência à imagem | Relações visuais achatadas |

Se existir o arquivo-fonte em Markdown, HTML, DOCX, CSV ou planilha, costuma ser melhor pedir esse arquivo. O PDF fixa uma apresentação; a fonte geralmente mantém uma estrutura mais limpa.

## Fluxo de conversão passo a passo

### 1. Guarde o original e registre a fonte

Mantenha uma cópia inalterada. Anote título, organização autora, data, URL ou nome do arquivo, versão e data de consulta.

```markdown
---
title: "Relatório anual de exemplo"
source_file: "relatorio-2026.pdf"
source_url: "https://example.com/relatorio-2026.pdf"
retrieved: 2026-08-13
---
```

Esses dados tornam a conversão rastreável, mas não transformam o Markdown no documento oficial.

### 2. Teste páginas representativas

Antes de converter centenas de páginas, teste uma página comum, uma com tabela, outra com figura ou nota e qualquer página onde o layout mude. Uma ferramenta que acerta a capa pode falhar no meio do arquivo.

### 3. Extraia o texto ou execute OCR

Use extração direta em PDF com texto nativo e OCR em páginas que contêm apenas imagens. Alguns arquivos misturam os dois tipos. Configure todos os idiomas do documento e preserve as imagens das páginas para revisar caracteres incertos.

### 4. Reconstrua a estrutura semântica

- Use um único `#` para o título real do documento.
- Transforme seções principais em `##` e subseções reais em `###`.
- Refaça marcadores e passos como listas Markdown.
- Una linhas quebradas apenas pela largura da página, sem apagar separações de parágrafo.
- Mantenha legendas junto às figuras ou tabelas e notas junto às suas chamadas.
- Remova cabeçalhos, rodapés e números repetidos quando não tiverem significado.

Nem todo texto em negrito é um título. Um conversor não consegue deduzir com certeza a hierarquia apenas pela aparência do PDF.

### 5. Preserve referências de página quando necessário

Se as respostas precisarem ser conferidas em uma página específica, adicione marcadores antes do trecho correspondente:

```markdown
[Página 12 do PDF]

## Reconhecimento de receita
```

Quando a numeração impressa e a contagem do visualizador forem diferentes, explique qual delas você usou. Não invente páginas depois de reordenar o conteúdo.

### 6. Renderize e compare

Veja uma prévia do Markdown, mas leia também o texto-fonte. Uma página visualmente limpa ainda pode ter trechos duplicados, linhas ausentes ou números ligados ao rótulo errado.

## Tabelas e títulos não são preservados por garantia

Tabelas são uma parte de alto risco. Confira a relação entre cada cabeçalho, rótulo de linha, valor, unidade, período e nota. Abra cabeçalhos mesclados em nomes de coluna explícitos ou divida a tabela.

```markdown
| Métrica | 2025 | 2026 | Unidade |
|---|---:|---:|---|
| Receita | 120 | 148 | Milhões de BRL |
| Retenção | 91 | 95 | Percentual |
```

Uma tabela pode ter Markdown válido e ainda estar factualmente errada: o OCR pode transformar `8,0` em `80`, perder um sinal negativo ou mover uma unidade. Confira totais separadamente. Se houver uma planilha original, use-a em vez de reconstruir os dados pelo PDF.

Títulos também exigem revisão. O conversor pode tratar todo negrito como título, perder níveis ou inserir um cabeçalho de página entre seções. Compare o sumário e a sequência de títulos com o original.

## Lista de validação

### Integridade e ordem

- As seções esperadas do começo, meio e fim estão presentes.
- O texto em várias colunas segue a ordem pretendida.
- Caixas, legendas e notas não interrompem parágrafos sem relação.
- Não há páginas ausentes nem blocos duplicados.

### Estrutura

- Os níveis de título representam hierarquia, não tamanho de fonte.
- Linhas visuais foram unidas sem apagar limites de parágrafo.
- Listas mantêm todos os itens e sua ordem.
- Tabelas têm as colunas esperadas e suas notas continuam associadas.

### Dados e evidências

- Nomes, datas, valores, casas decimais, sinais, moedas e unidades batem com o PDF.
- Fórmulas e símbolos foram comparados com a página renderizada.
- Figuras relevantes têm descrição ou dados de origem.
- Citações, notas, links e páginas apontam para o conteúdo correto.

### Origem e segurança

- O PDF original e a data de conversão foram preservados.
- Trechos ilegíveis foram marcados, não adivinhados.
- Segredos e dados pessoais desnecessários foram removidos.
- O serviço de IA é adequado ao nível de confidencialidade do documento.

:::tip
Uma falha de alto impacto pode ser uma tabela convincente com cabeçalhos, valores ou unidades deslocados, não apenas um layout feio. Compare as linhas importantes célula por célula.
:::

## Posso enviar o PDF diretamente para uma IA?

Muitas vezes, sim — principalmente quando o documento é curto, textual e a ferramenta aceita PDF. Converta para Markdown quando precisar corrigir OCR ou ordem, reutilizar seções, acompanhar mudanças, retirar partes sensíveis, adicionar metadados ou dividir um arquivo para busca.

Em documentos visualmente complexos, pode ser melhor usar os dois formatos: Markdown para texto pesquisável e o PDF original para figuras, layout e verificação final. Depois da conversão, veja [Markdown para IA](/pt/markdown-for-ai/) para separar instruções, fonte e formato da resposta.

## Próximos passos

- [Markdown para IA](/pt/markdown-for-ai/) — organize a fonte convertida e as instruções.
- [Tabelas em Markdown](/pt/tables/) — repare linhas, colunas, cabeçalhos e unidades.
- [Quebras de linha](/pt/line-breaks/) — corrija linhas quebradas durante a extração.
- [Converter Markdown para PDF](/pt/md-to-pdf/) — exporte uma fonte Markdown já revisada.
