Convertir HTML a Markdown en línea gratis

Convierta archivos HTML a Markdown en línea de forma gratuita. Cargue su archivo y obtenga una salida limpia y lista para LLM al instante. Sin registro, 50 MB por archivo, nada almacenado.

Convertir HTML a Markdown: de una página guardada a algo que se pueda leer

Abre en un editor de texto cualquier archivo .html que hayas guardado de la web y lo primero que notas es lo poco que hay de artículo ahí dentro. Mil quinientas líneas de menús de navegación, avisos de cookies, píxeles de rastreo, bloques <style> en línea y <div class="wrapper-outer-container"> anidados seis niveles, envolviendo unos cuarenta párrafos de escritura real. Pega eso en un asistente de chat y quemarás casi toda la ventana de contexto en marcado que al modelo no le dice nada.

Convertir HTML a Markdown le da la vuelta a esa proporción. Las etiquetas que llevan significado se traducen; las que solo llevan maquetación se tiran. Lo que sale es un documento con la misma forma que la página original —encabezados, listas, tablas, enlaces, bloques de código— en aproximadamente una décima parte de los caracteres. Sube un archivo aquí arriba y lo tendrás en un par de segundos. Gratis, sin registro, no guardamos nada.

Qué pasa al convertir HTML a Markdown, etiqueta por etiqueta

Markdown se diseñó como una taquigrafía para un subconjunto de HTML, así que casi toda la traducción es prácticamente uno a uno. Conocer la correspondencia te dice exactamente qué esperar en la salida:

  • <h1> hasta <h6> pasan a # hasta ######. La profundidad del encabezado se conserva tal cual, y eso importa más de lo que suena: un modelo al que le pides un resumen sección por sección necesita saber qué encabezados son hermanos entre sí.
  • <ul>, <ol> y los <li> anidados pasan a listas con guion y listas numeradas, con la indentación llevando el anidamiento.
  • <table> pasa a una tabla de barras verticales, siempre que sea una tabla de datos de verdad. Las tablas usadas solo para maquetar —todavía habituales en el HTML de correo y en sitios antiguos— se convierten en algo estructuralmente válido pero semánticamente inútil.
  • <a href> pasa a [text](url), así que los destinos sobreviven en vez de dejarte con un texto de enlace huérfano.
  • <code> y <pre> pasan a comillas invertidas y bloques cercados. Esta es la razón principal por la que la gente que programa convierte así las páginas de documentación: los fragmentos de código siguen siendo fragmentos de código.
  • <strong>, <em> y <blockquote> van a sus equivalentes obvios.
  • <script>, <style>, <meta>, los atributos style= en línea, los nombres de clase, los atributos de datos: todo eso se descarta. Nada de ello sobrevive, y nada de ello debería.

Una página guardada no es lo mismo que HTML limpio

Hay una diferencia real entre un archivo HTML que escribió una persona y un archivo HTML que volcó un navegador, y se nota de inmediato en la salida.

El HTML escrito a mano —la exportación de un sitio estático, una compilación de documentación, una plantilla de correo, un informe generado por una herramienta de reportes— suele ser ordenado y semántico. Los encabezados son encabezados. Los párrafos son párrafos. Estos se convierten casi a la perfección.

Una página guardada con Ctrl+S desde un sitio moderno es otra historia. Te llevas el DOM posterior a JavaScript, con su cabecera fija, el carril de artículos relacionados, tres invitaciones a suscribirte al boletín y un mapa del sitio en el pie con ochenta enlaces. Todo eso es HTML legítimo, así que todo eso se convierte. La salida es correcta; simplemente lleva dentro el mobiliario de la página. Ayudan dos costumbres: usar el modo lectura del navegador y guardar desde ahí, o convertir primero y borrar el principio y el final del Markdown antes de usarlo. Revisar y recortar lleva menos de un minuto y mejora bastante lo que hagas después.

Cuando el archivo se convierte en casi nada

De vez en cuando conviertes una página guardada y recuperas un título y dos líneas. Eso no es un fallo del conversor: es una aplicación de página única.

Los sitios hechos con React, Vue, Angular y compañía suelen servir un esqueleto HTML genuinamente vacío: un <div id="root"></div> y una etiqueta de script. El contenido que viste en el navegador lo ensambló JavaScript en tiempo de ejecución y nunca existió en el archivo. Según cómo lo hayas guardado, puede que te lleves el esqueleto en lugar del resultado renderizado. Abre el archivo en un editor de texto y busca una frase que recuerdes haber leído: si no está ahí, el conversor no puede inventarla.

La solución es guardar el DOM renderizado (en las herramientas de desarrollo de Chrome, haz clic derecho sobre el nodo <html> y copia el HTML exterior en un archivo nuevo), o saltarte el archivo por completo y usar Web2Txt, que toma una URL en vivo, carga la página como es debido y devuelve Markdown. Vale la pena quedarse con esa distinción: esta página convierte un archivo HTML que ya tienes, mientras que Web2Txt va a buscar una página que no tienes.

El problema de los enlaces relativos

Este pilla a mucha gente. Una página que enlaza a /docs/getting-started o a ../api/reference.html cuenta con que el navegador sepa de qué dominio y de qué directorio venía. En cuanto el archivo sale de su servidor, ese contexto desaparece. El Markdown convertido contendrá fielmente [Getting Started](/docs/getting-started): un enlace que ya no apunta a ningún lado concreto.

Para trabajar con un LLM esto normalmente da igual, porque lo que te importa es la prosa y el texto del enlace, no si las URL resuelven. Pero si estás armando documentación que piensas publicar, o una base de conocimiento donde las referencias cruzadas tienen que funcionar, revisa la salida y reescribe las rutas o quita los enlaces. Los atributos src de las imágenes tienen el mismo problema, y por eso las imágenes de una página sin conexión suelen salir como referencias rotas.

¿Markdown o texto plano para un archivo HTML?

Elige Markdown cuando la estructura de la página sea parte de lo que buscas. Documentación con ejemplos de código y una jerarquía de encabezados. Un tutorial con pasos numerados. Un artículo comparativo montado alrededor de una tabla. Un boletín por correo dividido en secciones. En todos esos casos, las #, las barras verticales y los bloques cercados llevan información real, y un conversor de HTML a Markdown para flujos de trabajo con LLM hace exactamente lo que necesitas.

Elige HTML a texto plano cuando solo quieras las palabras: armar un corpus, alimentar un clasificador, indexar para búsqueda o ejecutar cualquier cadena de procesamiento donde los caracteres de sintaxis son ruido. Arriba de esta página hay un selector de formato que alterna entre los dos y se lleva el archivo que ya seleccionaste, así que convertir la misma página en ambos formatos y compararlos te cuesta una sola subida.

Para qué se usa esto en la práctica

  • Darle documentación a un asistente de programación. Guarda las páginas de la documentación de una biblioteca, conviértelas a Markdown y pégalas junto a tu repositorio de GitHub en texto. El modelo ve a la vez la superficie de la API y cómo la usas tú, y los bloques de código se mantienen intactos en ambos lados.
  • Migrar un sitio. Los generadores de sitios estáticos comen Markdown. Convertir páginas HTML heredadas suele ser la primera pasada más rápida de una migración de CMS, aunque después haya que retocar.
  • Archivar artículos para analizarlos después. Los archivos Markdown son pequeños, se comparan bien con diff y se pueden rastrear con grep como jamás podrás hacer con una carpeta de HTML guardado.
  • Convertir plantillas de correo en contenido legible. El HTML de marketing es una sopa de tablas; la versión en Markdown es el mensaje de verdad.
  • Construir bibliotecas de prompts. El material de referencia en Markdown entra directo en un prompt de sistema o en un índice RAG sin más procesamiento.

Lo práctico aquí es el contador de tokens que hay debajo de la salida. Una página de documentación que en el navegador parecía corta puede resultar sorprendentemente pesada una vez que cuentas tablas y bloques de código, y saber el número antes de pegarla es mejor que enterarte por un error de truncamiento.

Preguntas frecuentes

¿Cómo convierto un archivo HTML a Markdown?

Sube el archivo .html o .htm aquí arriba y vuelve convertido en Markdown, descargable como .md. Gratis, 50 MB por archivo, sin cuenta. Los encabezados se asignan a niveles de #, las listas mantienen su anidamiento, los enlaces conservan sus URL en forma [text](url) y los bloques de código siguen cercados.

¿Conserva los enlaces y sus URL?

Sí, y esa es la razón principal para elegir Markdown en lugar de texto plano aquí. Cada ancla se convierte en [label](href), así que los destinos sobreviven. Si estás archivando documentación o auditando a dónde apunta una página, ahí está la diferencia entre un registro útil y una paráfrasis.

¿Puedo convertir una URL en vivo en lugar de un archivo guardado?

Desde esta página no. Web2Txt toma una URL, descarga la página y devuelve Markdown en un solo paso. Esta página es para el HTML que ya tienes en disco: artículos guardados, boletines exportados, informes generados o la salida de una compilación local.

¿Es razonable migrar así un sitio a un generador estático?

Para el contenido, sí. La prosa, los encabezados, las listas, las tablas y los bloques de código se convierten lo bastante limpios como para hacer commit y editar. Lo que no va a hacer es reconstruir tu arquitectura de información, reescribir los enlaces internos a las rutas nuevas ni extraer el front matter: esas son las partes de una migración que siguen siendo manuales, uses el conversor que uses.

¿Qué pasa con las tablas y los bloques de código?

Las tablas pasan a tablas de barras verticales y los bloques cercados siguen cercados; las dos cosas suelen sobrevivir bien porque el HTML de origen las marcaba de forma explícita. La baja habitual es el resaltado de sintaxis expresado con clases <span> por token: el código sale correcto, pero la pista de lenguaje que generaba el coloreado casi nunca se puede recuperar, así que vuelve a ponerla a mano si te importa.

Otros formatos y herramientas

HTML es uno de los formatos que maneja File2Txt: sube lo que sea y él decide qué hacer. Si ya sabes qué tienes, ve directo a PDF a Markdown, Word a Markdown, JSON a Markdown o XML a Markdown. Para exportaciones tabulares, CSV a Markdown arma tablas de barras verticales a partir de datos delimitados.

Para código está el conversor de GitHub a texto, una versión para GitLab y un conversor de carpetas locales que no sube nada a ningún lado. También hay un texto más largo sobre cómo preparar documentos para un LLM si quieres el argumento general en lugar del específico de HTML.

Repo2Txt está creado y mantenido por v12hero, un desarrollador independiente que crea aplicaciones nativas y web centradas en la privacidad.