Convertir HTML a Texto en línea gratis

Convierta archivos HTML a Texto en línea de forma gratuita. Cargue su archivo y obtenga una salida limpia y lista para LLM al instante. Sin registro, 50 MB por archivo, nada almacenado.

Convertir HTML a texto: quedarte solo con las palabras de una página guardada

A veces no quieres un documento. Quieres un muro de frases. Datos de entrenamiento para un clasificador, un corpus para modelado de temas, fragmentos para un índice de embeddings, entrada para un resumidor que va a ignorar el formato de todas formas: en todos esos casos, cada #, cada | y cada ** es un carácter que te cuesta algo y no te aporta nada.

Para eso está esta página. Arrastra un archivo .html o .htm y recuperas la prosa legible sin nada de marcado: sin etiquetas, sin atributos, sin sintaxis. Gratis, sin registro, límite de 50 MB, y el archivo no se guarda en ningún lado después. Si lo que quieres es conservar la jerarquía de encabezados y las tablas, la página hermana es HTML a Markdown, y el selector de formato de arriba se lleva tu archivo hasta allí sin volver a subirlo.

Lo que «quitar las etiquetas» tiene que acertar de verdad

Borrar sin más todo lo que hay entre corchetes angulares produce basura, y vale la pena entender por qué: ahí está la diferencia entre un texto usable y un desastre.

HTML tiene elementos de bloque y elementos en línea, y cada tipo pide el tratamiento contrario. Cuando se cierra un </p> y se abre el siguiente <p>, eso es un límite de párrafo y tiene que convertirse en un salto de línea. Cuando se cierra un </strong> a mitad de frase, ahí no hay límite ninguno: meter un salto de línea partiría la frase en dos. Si esto se hace mal, acabas con un texto donde the quick brown fox llega en cuatro líneas sueltas porque alguien puso dos de esas palabras en negrita.

La otra mitad del trabajo son los espacios en blanco. Al renderizar, HTML colapsa cualquier serie de espacios, tabulaciones y saltos de línea en uno solo, así que un código fuente indentado y formateado arrastra cantidades enormes de espacio en blanco que nunca se pensó que fuera visible. Al convertir HTML a texto como es debido se colapsa igual que lo hace el navegador, y por eso la salida se lee como se veía la página y no como estaba el archivo. Cada elemento de lista va en su línea, <br> pasa a ser un salto y las celdas de una tabla salen separadas en lugar de pegadas unas a otras.

Entidades, comillas tipográficas y caracteres misteriosos

HTML codifica ciertos caracteres para que no choquen con el marcado. &amp; es un ampersand. &lt; es un signo de menor que. &nbsp; es un espacio de no separación, &#8217; es un apóstrofo tipográfico, &mdash; es una raya. En el navegador nunca ves los códigos: ves los caracteres.

En un texto extraído, las entidades sin decodificar son veneno. Un tokenizador ve &#8217; como varios tokens de ruido, la búsqueda por palabra clave falla con don&#8217;t y cualquier comparación de cadenas posterior se rompe sin avisar. Por eso aquí las entidades se decodifican a la salida. Los espacios de no separación son los traicioneros, justamente porque en pantalla son idénticos a un espacio normal mientras hacen fallar todos los split(" ") que escribas; aquí salen como espacios de verdad.

La codificación también merece un vistazo. La mayoría de los archivos modernos declaran <meta charset="utf-8">, pero las páginas viejas y las exportaciones de CMS a veces son Latin-1 o Windows-1252 disfrazados. Si en tu salida aparece ’ donde debería haber un apóstrofo, el archivo de origen mintió sobre su codificación: vuelve a guardarlo como UTF-8 desde un editor de texto y conviértelo otra vez.

Texto que nunca estuvo pensado para leerse

Una página contiene más palabras de las que te enseña, y algunas aparecen en la extracción:

  • Texto de navegación y de pie de página. Etiquetas de menú, migas de pan, «volver arriba», el mapa del sitio de ochenta enlaces del final. Texto legítimo, semánticamente inútil. En un artículo de prensa guardado puede pesar más que el propio artículo.
  • Avisos de cookies y textos de consentimiento. Doscientas palabras de relleno legal que aparecen en cada página que guardes de ese dominio, o sea que si estás armando un corpus estás a punto de duplicarlas mil veces.
  • Texto alternativo y etiquetas ARIA. A veces valioso (el texto alternativo de un gráfico puede ser la única descripción de los datos), a veces solo «imagen» repetido cuarenta veces.
  • Elementos ocultos. Bloques visibles solo para lectores de pantalla, paneles de acordeón plegados y alternativas dentro de <noscript> llevan texto real en el código fuente aunque nunca los hayas visto renderizados.

Si el origen importa, lo mejor es guardar la página desde el modo lectura del navegador, que descarta casi todo el mobiliario antes de que llegue siquiera al archivo. Si no, convierte y después recorta la cabeza y la cola de la salida. El relleno repetitivo se detecta rápido en cuanto sabes que hay que buscarlo, y quitarlo es el minuto más rentable de toda la cadena de procesamiento.

Por qué extraer texto de HTML sin marcado le gana al Markdown en trabajo de PLN

Esto no es «Markdown pero más simple»: en muchas cadenas de procesamiento el texto plano es la opción correcta y el Markdown es directamente peor.

  • Embeddings. Un modelo de embeddings codifica todo lo que le des, sintaxis incluida. Las barras verticales y las almohadillas de los encabezados mueven el vector sin aportar significado, y encima se comen parte del límite de entrada del modelo. La prosa limpia se vectoriza más limpio.
  • Clasificadores y modelos temáticos. Los enfoques de bolsa de palabras y TF-IDF tratan **word** y word como tokens distintos salvo que limpies antes. Ahórrate el problema entero.
  • Indexación de texto completo. Casi todas las cadenas de indexación quieren frases. Darles Markdown significa escribir un paso de limpieza que no necesitabas.
  • Segmentación en frases. Separadores como spaCy o NLTK trabajan sobre prosa. La sintaxis de tablas los confunde y acaban produciendo fragmentos sueltos.
  • Presupuesto de tokens. En una página larga, tirar el marcado reduce el recuento de tokens de forma apreciable: el contador que hay debajo de la salida te dice exactamente cuánto, y comparar los dos formatos sobre el mismo archivo es un experimento de un clic.

Un archivo que ya tienes frente a una página que no

Esta herramienta convierte un archivo HTML que subes tú. No sale a buscar una URL. La distinción importa más de lo que parece, porque las dos situaciones fallan de maneras distintas.

Si tu archivo salió de un «Guardar como» del navegador en un sitio cargado de JavaScript, puede que no contenga casi texto: solo un div contenedor vacío y un script de bundle, con el contenido real generado en tiempo de ejecución y nunca escrito en disco. Te saldrá un resultado casi vacío y parecerá que el conversor se rompió. No se rompió: las palabras no están en el archivo. Busca en el código fuente una frase que recuerdes y sales de dudas.

Cuando pase eso, usa Web2Txt: toma una URL en vivo, renderiza la página y extrae el resultado. Esta página es para cuando ya tienes el archivo: una exportación de correo, una compilación de documentación, un volcado de CMS, un informe generado en HTML, una página archivada hace años.

Trabajos típicos

  • Armar un corpus de entrenamiento o de evaluación a partir de una carpeta de páginas archivadas, cuando quieres prosa en bruto y un formato uniforme en miles de documentos.
  • Auditorías de legibilidad y de contenido: recuento de palabras, nivel de lectura, frecuencia de términos. Todo eso necesita el texto sin que el marcado distorsione los números.
  • Pasarlo por scripts. El texto plano entra en grep, wc, un diff o una línea suelta de Python sin dramas de escapado.
  • Resumir una página larga cuando la estructura te da igual y prefieres gastar los tokens en contenido.
  • Extraer texto de un archivo HTML para trabajo de traducción o transcripción, donde quien traduce quiere frases y nada más.

Preguntas frecuentes

¿Cómo convierto un archivo HTML a texto?

Arrastra el archivo .html o .htm aquí arriba y recuperas el texto legible con todas las etiquetas, scripts y bloques de estilo fuera. Gratis, sin registro, 50 MB por archivo. Descárgalo como .txt o cópialo directo a lo que necesitaba las palabras y no el marcado.

¿Puedo convertir una página en vivo pegando una URL?

En esta página no: esta toma un archivo que ya tienes. Para una URL, Web2Txt descarga la página y la extrae directamente, lo que te ahorra la ida y vuelta de guardar y volver a subir. Usa esta página para páginas que guardaste antes, cuerpos de correo exportados o HTML generado por algo local.

¿Quita la navegación, los anuncios y los avisos de cookies?

El contenido de relleno es un riesgo conocido, no un problema resuelto. Los scripts, los estilos y las etiquetas se van siempre; que una barra lateral o un aviso de cookies cuente como contenido es un juicio de valor, y una página guardada lo lleva todo dentro del mismo DOM. Revisa por encima el principio y el final de la salida: ahí es donde se acumulan los restos de navegación.

¿Qué pasa con los enlaces de la página?

El texto del enlace sobrevive como palabras y las URL de detrás no. Una frase que dice «consulta la guía de instalación» se convierte en exactamente eso, sin ninguna pista de a dónde apuntaba. Si los destinos importan (armar un mapa de enlaces, revisar referencias externas), usa HTML a Markdown, que conserva los href en sintaxis de corchetes.

¿Por qué mi salida está llena de líneas en blanco y caracteres sueltos?

Normalmente es una página guardada con el DOM completo: bloques de plantilla ocultos, cargas útiles JSON-LD, SVG en línea y fragmentos de analítica viven en ese marcado y todos contienen texto de algún tipo. Una regex de una línea limpia el patrón repetido en cuanto lo identificas, o vuelve a guardar la página desde la vista de lectura del navegador y convierte esa.

El resto del conjunto de herramientas

File2Txt maneja todos los formatos compatibles desde una sola caja de subida si prefieres no elegir. O ve directo: PDF a texto para documentos, Word a texto para DOCX, EPUB a texto para libros electrónicos y CSV a texto para datos delimitados.

¿Trabajas con código? El conversor de GitHub a texto, el conversor de GitLab y el conversor de carpetas locales aplanan un proyecto entero en un solo archivo. Y esta guía cubre la cuestión más amplia de dejar los documentos listos para un LLM.

Repo2Txt está creado y mantenido por v12hero, un desarrollador independiente que crea aplicaciones nativas y web centradas en la privacidad.