# Convertir un PDF a Markdown (para IA)

> Cómo convertir a Markdown PDF con texto, escaneados, con tablas o con diseños complejos, y verificar el resultado antes de usarlo con una IA.

## La forma rápida y fiable

Primero intenta seleccionar y copiar un párrafo del PDF.

- Si el texto se puede seleccionar y aparece en el orden correcto, empieza con un extractor normal de PDF a Markdown.
- Si se puede seleccionar pero las columnas, tablas o notas quedan desordenadas, usa una herramienta que tenga en cuenta el diseño y reserva tiempo para corregirlo.
- Si la página se comporta como una sola imagen, aplica OCR (reconocimiento óptico de caracteres) antes de reconstruir el Markdown.

En todos los casos, considera el Markdown un **borrador derivado del PDF**, no un sustituto ya verificado. Conserva el original para revisar orden, títulos, cifras, tablas y citas.

## Elige el método según el tipo de PDF

| Tipo de PDF | Cómo reconocerlo | Punto de partida | Riesgo principal |
|---|---|---|---|
| Texto sencillo | Texto seleccionable, una columna, pocas figuras | Extracción de texto a Markdown | Pérdida de títulos y listas |
| Informe con varias columnas | Al copiar, el texto salta entre columnas o recuadros | Extracción sensible al diseño | Orden de lectura incorrecto |
| Documento con muchas tablas | Cuadrículas densas, cabeceras combinadas, muchas unidades | Extracción de tablas; mejor aún, la hoja de cálculo original | Valores desplazados a otra columna |
| Escaneo o fotografía | No se puede seleccionar texto o toda la página se selecciona como imagen | OCR configurado con el idioma correcto | Caracteres mal leídos u omitidos |
| Fórmulas, figuras o notas | Ecuaciones, pies de figura, referencias o dos columnas | Extracción especializada y revisión manual | Fórmulas, citas y pies dañados |
| Formularios o páginas diseñadas | El significado depende de cajas, flechas o posición | Reestructuración manual con referencia a la imagen | Relaciones visuales aplanadas |

Si existe el archivo fuente —Markdown, HTML, DOCX, CSV o una hoja de cálculo— suele ser mejor partir de él. El PDF fija una presentación; el archivo original normalmente conserva más estructura.

## Flujo de conversión paso a paso

### 1. Guarda el original y registra la fuente

Mantén una copia sin cambios. Anota título, entidad autora, fecha, URL o nombre de archivo, versión y fecha de consulta. El Markdown convertido debe poder rastrearse hasta el PDF.

```markdown
---
title: "Informe anual de ejemplo"
source_file: "informe-2026.pdf"
source_url: "https://example.com/informe-2026.pdf"
retrieved: 2026-08-13
---
```

### 2. Prueba páginas representativas

Antes de convertir cien páginas, prueba una página normal, otra con tabla, una con figura o nota al pie y cualquier página donde cambie el diseño. Una herramienta que funciona en la portada puede fallar más adelante.

### 3. Extrae el texto o ejecuta OCR

Usa extracción directa en PDF con texto nativo y OCR en páginas que solo contienen imágenes. Algunos archivos mezclan ambos tipos. Configura todos los idiomas presentes y conserva las imágenes de página para comprobar caracteres dudosos.

### 4. Reconstruye la estructura semántica

- Usa un único `#` para el título real del documento.
- Convierte secciones y subsecciones en `##` y `###` según su jerarquía, no según el tamaño de letra.
- Convierte viñetas y pasos en listas Markdown reales.
- Une líneas cortadas solo por el ancho de la página, sin borrar los límites de párrafo.
- Mantén pies junto a sus figuras o tablas y notas junto a su referencia.
- Elimina encabezados, pies y números repetidos, salvo que aporten información.

El texto en negrita no siempre es un título. Ningún conversor puede deducir con certeza la jerarquía solo a partir del aspecto visual.

### 5. Conserva referencias de página cuando importen

Si la respuesta debe poder comprobarse en el PDF, añade marcadores antes del contenido correspondiente:

```markdown
[Página 12 del PDF]

## Reconocimiento de ingresos
```

Aclara si usas la numeración impresa o la del visor cuando no coincidan. No inventes referencias después de reordenar el contenido.

### 6. Renderiza y compara

Mira una vista previa del Markdown, pero lee también el texto fuente. Una página que se ve limpia todavía puede contener secciones duplicadas, filas ausentes o cifras asociadas a la etiqueta equivocada.

## Tablas y títulos: lo que no se conserva automáticamente

Las tablas son una parte de alto riesgo. Comprueba cada relación entre cabecera, etiqueta de fila, valor, unidad, periodo y nota. Si hay cabeceras combinadas, conviértelas en nombres de columna explícitos o divide la tabla.

```markdown
| Métrica | 2025 | 2026 | Unidad |
|---|---:|---:|---|
| Ingresos | 120 | 148 | Millones de EUR |
| Retención | 91 | 95 | Porcentaje |
```

Una tabla puede ser Markdown válido y estar factualmente mal porque `8,0` se convirtió en `80`, un signo menos desapareció o una unidad pasó a otra fila. Comprueba los totales de manera independiente. Si existe la hoja de cálculo original, úsala en lugar de reconstruir datos desde el PDF.

Los títulos tampoco están garantizados: un conversor puede convertir toda negrita en título, perder un nivel o insertar un pie de página en medio de una sección. Revisa el índice y la secuencia de títulos contra el original.

## Lista de verificación

### Integridad y orden

- Están presentes las secciones iniciales, centrales y finales.
- El texto de varias columnas sigue el orden previsto.
- Recuadros, leyendas y notas no interrumpen párrafos ajenos.
- No faltan páginas ni aparecen bloques duplicados.

### Estructura

- Los niveles de título representan una jerarquía real.
- Los párrafos cortados por salto de línea se han unido correctamente.
- Las listas conservan todos sus elementos y su orden.
- Las tablas tienen las columnas esperadas y sus notas siguen asociadas.

### Datos y evidencia

- Nombres, fechas, importes, decimales, signos, monedas y unidades coinciden con el PDF.
- Las fórmulas y símbolos se han comparado con la página renderizada.
- Las figuras importantes tienen descripción o datos subyacentes.
- Las citas, notas al pie, enlaces y páginas siguen apuntando al contenido correcto.

### Procedencia y seguridad

- Se conserva el PDF original y se registra la fecha de conversión.
- Los pasajes ilegibles están marcados, no adivinados.
- Se han eliminado secretos y datos personales innecesarios.
- El servicio de IA elegido es adecuado para la confidencialidad del documento.

:::tip
Un fallo de gran impacto puede ser una tabla convincente con cabeceras, cifras o unidades desplazadas, no solo una página fea. Revisa las filas importantes celda por celda.
:::

## ¿Se puede dar el PDF directamente a una IA?

A menudo sí, sobre todo si es corto, contiene texto nativo y la herramienta admite PDF. Convierte a Markdown cuando necesites corregir OCR u orden, reutilizar secciones, controlar versiones, retirar partes sensibles, añadir metadatos o dividir un documento para búsqueda.

En materiales visuales complejos puede convenir usar ambos: Markdown para texto buscable y las páginas originales para figuras, diseño y verificación final. Después, consulta [Markdown para IA](/es/markdown-for-ai/) para separar instrucciones, fuente y formato de salida.

## Siguiente paso

- [Markdown para IA](/es/markdown-for-ai/) — prepara la fuente convertida y tus instrucciones.
- [Tablas en Markdown](/es/tables/) — repara filas, columnas, cabeceras y unidades.
- [Saltos de línea](/es/line-breaks/) — corrige líneas partidas durante la extracción.
- [Convertir Markdown a PDF](/es/md-to-pdf/) — exporta una fuente Markdown ya revisada.
