Convertir PDF a Markdown en línea gratis

Convierta archivos PDF a Markdown en línea de forma gratuita. Cargue su archivo y obtenga una salida limpia y lista para LLM al instante. Sin registro, 50 MB por archivo, nada almacenado.

Convertir un PDF a Markdown: conserva la estructura, tira la basura de maquetación

Un PDF es una descripción de dónde va la tinta sobre la página. Literalmente no es nada más que eso. En el archivo no hay ningún «esto es un encabezado» ni «esto es una tabla»: solo glifos en coordenadas y un motor de renderizado que hace que a ti te parezca ordenado. Por eso copiar y pegar un PDF en ChatGPT da tan a menudo un resultado pastoso: el modelo recibe un chorro de caracteres al que le han arrancado toda la jerarquía visual.

Convertir un PDF a Markdown consiste en reconstruir esa jerarquía. Los tamaños y grosores de fuente pasan a ser encabezados # y ##. Las rejillas de celdas alineadas pasan a ser tablas de barras verticales. Los glifos de viñeta pasan a ser elementos de lista. Acabas con un documento por el que un LLM puede navegar de verdad, en lugar de uno que tiene que adivinar. Arrastra un archivo a la herramienta de arriba y lo tienes en unos segundos: gratis, sin registro, sin guardar nada.

Qué sobrevive realmente a la conversión

Conviene saberlo antes de convertir, porque marca lo que puedes esperar al otro lado:

  • Encabezados: se deducen del tamaño y el grosor relativos de la fuente. Un informe con una escala tipográfica coherente se convierte de maravilla. Un PDF muy de diseñador, donde cada sección lleva su propio estilo, sale más sucio.
  • Tablas: se reconstruyen como tablas de barras verticales cuando el original tiene filas y columnas realmente alineadas. Esta es la mayor razón para elegir Markdown en vez de texto plano en informes financieros, hojas de especificaciones y anexos de datos.
  • Listas: las viñetas y los elementos numerados conservan su anidamiento, así que los procedimientos y las listas de requisitos siguen siendo legibles.
  • Orden de lectura: los artículos académicos a dos columnas se linealizan en un solo flujo. Suele salir correcto, y de vez en cuando se entremezcla si el original tiene recuadros flotantes o destacados.
  • Lo que no sobrevive: el mobiliario de página. Los encabezados, los pies y los números de página son ruido en un contexto de IA, y quitarlos es una ventaja, no una pérdida.

¿Markdown o texto plano? Respuesta directa

Elige Markdown cuando la forma del documento aporte significado. Artículos de investigación con la argumentación repartida por secciones, contratos con cláusulas numeradas, memorias anuales llenas de tablas, documentación técnica con bloques de código: en todos ellos la estructura es información. Un LLM al que le preguntas «qué dice la cláusula 7.3» necesita saber que la cláusula 7.3 es una unidad propia.

Elige PDF a texto plano cuando solo quieras la prosa: alimentar un corpus para un clasificador, hacer análisis de palabras clave o meterlo en algo que se atraganta con los caracteres de sintaxis. Ahí las barras y las almohadillas de Markdown son puro lastre.

El selector de arriba alterna entre los dos y se lleva consigo el archivo que ya hayas elegido, así que puedes convertir una vez en cada formato y comparar sin volver a subirlo.

PDF nativos frente a escaneos: por qué tu salida puede salir vacía

Hay dos tipos de PDF que comparten la misma extensión de archivo, y se comportan de forma completamente distinta.

Un PDF nativo —exportado desde Word, LaTeX, InDesign o el diálogo de impresión del navegador— lleva texto incrustado de verdad. La conversión es prácticamente sin pérdida, y es rápida. Un PDF escaneado es una fotografía de papel metida en un contenedor PDF. Dentro no hay texto que extraer, solo píxeles.

Prueba rápida: abre el PDF e intenta seleccionar una frase con el cursor. Si el texto se resalta, es nativo y la conversión saldrá limpia. Si en cambio te sale un recuadro de selección sobre la página entera, es un escaneo. Para escaneos, pasa primero un OCR —casi todos los lectores de PDF traen «reconocer texto»— y luego convierte. Te cuesta un minuto más y la diferencia de calidad en la salida es abismal.

¿Por qué convertir un PDF a Markdown en vez de subir el PDF y ya?

Hoy casi todos los asistentes de chat aceptan PDF, así que la pregunta es justa. Tres razones por las que convertir antes sigue ganando:

  • Ves lo mismo que ve el modelo. Cuando un PDF subido da una mala respuesta, no puedes saber si el modelo razonó mal o si la extracción destrozó el original. Con el Markdown delante, esa ambigüedad desaparece.
  • Puedes editar antes de enviar. Borra las 40 páginas de relleno legal y quédate con las tres que importan. Más barato, más rápido y con respuestas bastante más precisas.
  • Se compone con todo lo demás. Un texto en Markdown entra tal cual en un system prompt, en una cadena RAG, en un conjunto de fine-tuning o en un repositorio git. Un PDF adjunto, no.

El contador de tokens que hay bajo la salida es la parte práctica de esto. Un informe de 60 páginas puede rondar los 40.000 tokens: correcto para un modelo de contexto largo, fuera de presupuesto para uno más pequeño. Saberlo antes de pegarlo es mejor que descubrirlo por un mensaje de error.

Dónde se usa esto de verdad

  • Revisiones bibliográficas. Convierte un montón de artículos, concatena el Markdown y pídele a un modelo que busque discrepancias metodológicas entre ellos. Los encabezados de sección sobreviven, así que puedes rastrear cualquier afirmación hasta su origen.
  • Revisión de contratos. Las cláusulas numeradas siguen numeradas, lo que significa que puedes preguntar por obligaciones concretas y obtener respuestas que citan números de cláusula reales en vez de paráfrasis.
  • Documentación de API y de proveedores. Un montón de SDK empresariales siguen publicando su documentación de referencia en PDF. Conviértelos y júntalos con tu repositorio de GitHub en texto para que un asistente de código vea a la vez la especificación y tu implementación.
  • Estados financieros. La reconstrucción de tablas es lo que hace que esto funcione: un modelo puede comparar cifras entre trimestres cuando las filas y las columnas siguen intactas.
  • Apuntes de clase y libros de texto. Convierte el capítulo, pide un resumen y genera después preguntas de práctica a partir de la misma fuente.

Cómo conseguir una salida más limpia

  • Si el PDF tiene un hermano en formato de texto —la versión HTML de un artículo, el DOCX del que se exportó el informe—, convierte ese. Menos pasos de inferencia y mejor estructura. Prueba Word a Markdown o HTML a Markdown.
  • Parte los PDF enormes antes de convertirlos. Un manual de 500 páginas se convierte sin problema, pero no cabe entero en ninguna ventana de contexto, y obtendrás mejores respuestas del capítulo que de verdad te interesa.
  • Las tablas dibujadas como imagen en lugar de maquetadas como texto no se reconstruyen: nada puede leerlas sin OCR. Revisa la salida si las tablas te importan.
  • Échale un vistazo a los primeros cientos de líneas antes de pegar nada. Detectar un nivel de encabezado roto lleva diez segundos y te ahorra una conversación confusa con un modelo.

Preguntas frecuentes

¿Cómo convertir un PDF a Markdown en línea?

Sube el PDF arriba y el Markdown aparece justo debajo, listo para copiar o descargar como .md. Gratis, sin registro, 50 MB por archivo. Los encabezados vuelven como niveles de #, las listas como viñetas - y las tablas como tablas de barras verticales, así que la estructura sobrevive hasta lo que sea que la lea después.

¿Convertir un PDF a Markdown conserva las tablas?

Sí, y es la razón principal para elegir Markdown en vez de texto plano. Una tabla pasa a ser una tabla de barras verticales con las relaciones de fila y columna intactas, así que un modelo al que le preguntas «cuáles fueron los ingresos del tercer trimestre» todavía puede saber qué número va bajo qué encabezado. Aplana esa misma tabla a texto plano y esa correspondencia ya no se recupera.

¿Qué pasa con las imágenes que hay dentro del PDF?

Las ilustraciones, los gráficos y las fotografías no se llevan al Markdown: la salida es la capa de texto, no un paquete de recursos. Si el sentido de una página vive en un diagrama, exporta esa página como imagen aparte y pásala por imagen a Markdown, que sí lee las palabras dibujadas dentro de la imagen.

¿Existe alguna biblioteca de Python que haga PDF a Markdown?

Varias: pymupdf4llm, marker y docling son las habituales, y son la respuesta correcta para procesar diez mil archivos en una cadena automatizada. También piden un virtualenv, pesos de modelo y tiempo de GPU. Para un único documento que necesitas convertido antes de tu próximo mensaje a Claude o ChatGPT, gana una pestaña del navegador.

¿Qué es mejor para alimentar un LLM, PDF a Markdown o PDF a texto?

Markdown, cuando el documento está estructurado. Los modelos se entrenan con cantidades enormes de Markdown y leen sus convenciones de encabezados y tablas de forma nativa, así que «resume la sección 4» funciona porque la sección 4 está literalmente marcada. Tira de texto plano solo cuando quieras que desaparezcan los caracteres de sintaxis: sobre todo, para trocear de cara a embeddings.

¿Se conservan el orden de las páginas y el flujo de lectura?

Los documentos a una sola columna salen en orden de lectura de forma fiable. Las maquetaciones académicas a dos columnas suelen linealizarse bien, pero los destacados, los recuadros flotantes y los bloques de notas al pie caen de vez en cuando en mitad de un párrafo, porque en las coordenadas del original están a media página. Merece la pena repasar la salida antes de fiarte de ella para algo preciso.

El resto de la caja de herramientas

PDF es uno de los trece formatos que se manejan aquí. File2Txt acepta cualquiera de ellos si prefieres no elegir una página concreta, o ve directo a Excel a Markdown para hojas de cálculo, PowerPoint a Markdown para presentaciones, o EPUB a Markdown para libros electrónicos.

¿Trabajas más bien con código o con la web? Convierte un repositorio con el conversor de GitHub a texto, un proyecto de GitLab o una carpeta de tu máquina. Para páginas web, Web2Txt extrae una URL a Markdown. También hay un artículo más largo sobre cómo preparar documentos para LLM por si quieres la versión general de este argumento.

Repo2Txt está creado y mantenido por v12hero, un desarrollador independiente que crea aplicaciones nativas y web centradas en la privacidad.