Convertir un PDF a Markdown (para IA)
La forma rápida y fiable
Sección titulada «La forma rápida y fiable»Primero intenta seleccionar y copiar un párrafo del PDF.
- Si el texto se puede seleccionar y aparece en el orden correcto, empieza con un extractor normal de PDF a Markdown.
- Si se puede seleccionar pero las columnas, tablas o notas quedan desordenadas, usa una herramienta que tenga en cuenta el diseño y reserva tiempo para corregirlo.
- Si la página se comporta como una sola imagen, aplica OCR (reconocimiento óptico de caracteres) antes de reconstruir el Markdown.
En todos los casos, considera el Markdown un borrador derivado del PDF, no un sustituto ya verificado. Conserva el original para revisar orden, títulos, cifras, tablas y citas.
Elige el método según el tipo de PDF
Sección titulada «Elige el método según el tipo de PDF»| Tipo de PDF | Cómo reconocerlo | Punto de partida | Riesgo principal |
|---|---|---|---|
| Texto sencillo | Texto seleccionable, una columna, pocas figuras | Extracción de texto a Markdown | Pérdida de títulos y listas |
| Informe con varias columnas | Al copiar, el texto salta entre columnas o recuadros | Extracción sensible al diseño | Orden de lectura incorrecto |
| Documento con muchas tablas | Cuadrículas densas, cabeceras combinadas, muchas unidades | Extracción de tablas; mejor aún, la hoja de cálculo original | Valores desplazados a otra columna |
| Escaneo o fotografía | No se puede seleccionar texto o toda la página se selecciona como imagen | OCR configurado con el idioma correcto | Caracteres mal leídos u omitidos |
| Fórmulas, figuras o notas | Ecuaciones, pies de figura, referencias o dos columnas | Extracción especializada y revisión manual | Fórmulas, citas y pies dañados |
| Formularios o páginas diseñadas | El significado depende de cajas, flechas o posición | Reestructuración manual con referencia a la imagen | Relaciones visuales aplanadas |
Si existe el archivo fuente —Markdown, HTML, DOCX, CSV o una hoja de cálculo— suele ser mejor partir de él. El PDF fija una presentación; el archivo original normalmente conserva más estructura.
Flujo de conversión paso a paso
Sección titulada «Flujo de conversión paso a paso»1. Guarda el original y registra la fuente
Sección titulada «1. Guarda el original y registra la fuente»Mantén una copia sin cambios. Anota título, entidad autora, fecha, URL o nombre de archivo, versión y fecha de consulta. El Markdown convertido debe poder rastrearse hasta el PDF.
---title: "Informe anual de ejemplo"source_file: "informe-2026.pdf"source_url: "https://example.com/informe-2026.pdf"retrieved: 2026-08-13---2. Prueba páginas representativas
Sección titulada «2. Prueba páginas representativas»Antes de convertir cien páginas, prueba una página normal, otra con tabla, una con figura o nota al pie y cualquier página donde cambie el diseño. Una herramienta que funciona en la portada puede fallar más adelante.
3. Extrae el texto o ejecuta OCR
Sección titulada «3. Extrae el texto o ejecuta OCR»Usa extracción directa en PDF con texto nativo y OCR en páginas que solo contienen imágenes. Algunos archivos mezclan ambos tipos. Configura todos los idiomas presentes y conserva las imágenes de página para comprobar caracteres dudosos.
4. Reconstruye la estructura semántica
Sección titulada «4. Reconstruye la estructura semántica»- Usa un único
#para el título real del documento. - Convierte secciones y subsecciones en
##y###según su jerarquía, no según el tamaño de letra. - Convierte viñetas y pasos en listas Markdown reales.
- Une líneas cortadas solo por el ancho de la página, sin borrar los límites de párrafo.
- Mantén pies junto a sus figuras o tablas y notas junto a su referencia.
- Elimina encabezados, pies y números repetidos, salvo que aporten información.
El texto en negrita no siempre es un título. Ningún conversor puede deducir con certeza la jerarquía solo a partir del aspecto visual.
5. Conserva referencias de página cuando importen
Sección titulada «5. Conserva referencias de página cuando importen»Si la respuesta debe poder comprobarse en el PDF, añade marcadores antes del contenido correspondiente:
[Página 12 del PDF]
## Reconocimiento de ingresosAclara si usas la numeración impresa o la del visor cuando no coincidan. No inventes referencias después de reordenar el contenido.
6. Renderiza y compara
Sección titulada «6. Renderiza y compara»Mira una vista previa del Markdown, pero lee también el texto fuente. Una página que se ve limpia todavía puede contener secciones duplicadas, filas ausentes o cifras asociadas a la etiqueta equivocada.
Tablas y títulos: lo que no se conserva automáticamente
Sección titulada «Tablas y títulos: lo que no se conserva automáticamente»Las tablas son una parte de alto riesgo. Comprueba cada relación entre cabecera, etiqueta de fila, valor, unidad, periodo y nota. Si hay cabeceras combinadas, conviértelas en nombres de columna explícitos o divide la tabla.
| Métrica | 2025 | 2026 | Unidad ||---|---:|---:|---|| Ingresos | 120 | 148 | Millones de EUR || Retención | 91 | 95 | Porcentaje |Una tabla puede ser Markdown válido y estar factualmente mal porque 8,0 se convirtió en 80, un signo menos desapareció o una unidad pasó a otra fila. Comprueba los totales de manera independiente. Si existe la hoja de cálculo original, úsala en lugar de reconstruir datos desde el PDF.
Los títulos tampoco están garantizados: un conversor puede convertir toda negrita en título, perder un nivel o insertar un pie de página en medio de una sección. Revisa el índice y la secuencia de títulos contra el original.
Lista de verificación
Sección titulada «Lista de verificación»Integridad y orden
Sección titulada «Integridad y orden»- Están presentes las secciones iniciales, centrales y finales.
- El texto de varias columnas sigue el orden previsto.
- Recuadros, leyendas y notas no interrumpen párrafos ajenos.
- No faltan páginas ni aparecen bloques duplicados.
Estructura
Sección titulada «Estructura»- Los niveles de título representan una jerarquía real.
- Los párrafos cortados por salto de línea se han unido correctamente.
- Las listas conservan todos sus elementos y su orden.
- Las tablas tienen las columnas esperadas y sus notas siguen asociadas.
Datos y evidencia
Sección titulada «Datos y evidencia»- Nombres, fechas, importes, decimales, signos, monedas y unidades coinciden con el PDF.
- Las fórmulas y símbolos se han comparado con la página renderizada.
- Las figuras importantes tienen descripción o datos subyacentes.
- Las citas, notas al pie, enlaces y páginas siguen apuntando al contenido correcto.
Procedencia y seguridad
Sección titulada «Procedencia y seguridad»- Se conserva el PDF original y se registra la fecha de conversión.
- Los pasajes ilegibles están marcados, no adivinados.
- Se han eliminado secretos y datos personales innecesarios.
- El servicio de IA elegido es adecuado para la confidencialidad del documento.
¿Se puede dar el PDF directamente a una IA?
Sección titulada «¿Se puede dar el PDF directamente a una IA?»A menudo sí, sobre todo si es corto, contiene texto nativo y la herramienta admite PDF. Convierte a Markdown cuando necesites corregir OCR u orden, reutilizar secciones, controlar versiones, retirar partes sensibles, añadir metadatos o dividir un documento para búsqueda.
En materiales visuales complejos puede convenir usar ambos: Markdown para texto buscable y las páginas originales para figuras, diseño y verificación final. Después, consulta Markdown para IA para separar instrucciones, fuente y formato de salida.
Siguiente paso
Sección titulada «Siguiente paso»- Markdown para IA — prepara la fuente convertida y tus instrucciones.
- Tablas en Markdown — repara filas, columnas, cabeceras y unidades.
- Saltos de línea — corrige líneas partidas durante la extracción.
- Convertir Markdown a PDF — exporta una fuente Markdown ya revisada.