Convertir EPUB a Texto en línea gratis

Convierta archivos EPUB a Texto en línea de forma gratuita. Cargue su archivo y obtenga una salida limpia y lista para LLM al instante. Sin registro, 50 MB por archivo, nada almacenado.

Convertir EPUB a texto: pasar una estantería de libros a algo con lo que puedas computar

Los libros son la prosa larga mejor editada que existe. Escritos por profesionales, corregidos por profesionales, miles de palabras con una voz coherente y sin menús de navegación, avisos de cookies ni secciones de comentarios de por medio. Como materia prima para cualquier cosa que tenga que ver con el lenguaje — embeddings, análisis de estilo, recuperación de información, entrenar un clasificador para reconocer el tono — es difícil de superar.

El problema es que está dentro de un paquete comprimido de archivos XHTML. Un conversor de EPUB a texto lo saca: un flujo continuo de prosa, sin etiquetas, sin caracteres de marcado, sin nada que tu tokenizador tenga que aprender a ignorar. Sube el archivo arriba y lo tienes en segundos. Gratis, sin registro, límite de 50 MB, nada se almacena.

Por qué el texto plano es la forma correcta para este trabajo

El texto plano no es aquí la opción barata. Para casi todo lo que harías con un libro a escala, es el formato que las herramientas esperan de verdad:

  • Embeddings y recuperación semántica. Trocear la prosa, generar el embedding de cada fragmento, recuperar por similitud. Las almohadillas y los asteriscos de Markdown ocupan posiciones de token y no aportan nada al significado: diluyen el vector. Los párrafos limpios recuperan mejor, y todas las bibliotecas de troceado del planeta aceptan texto por defecto.
  • Legibilidad y estilometría. Flesch-Kincaid, longitud media de frase, proporción type-token, riqueza léxica, ritmo de puntuación. Son medidas a nivel de palabra y de frase, y los tokens de formato corrompen todas y cada una.
  • Indexado de búsqueda sobre una biblioteca. El tsvector de Postgres, FTS5 de SQLite, Elasticsearch, o una carpeta a secas sobre la que hagas grep. Todos quieren texto en bruto en un campo. Cincuenta libros convertidos hacen un buscador personal genuinamente rápido.
  • Lingüística de corpus y pipelines de PLN. Concordancias, análisis de colocaciones, extracción de entidades nombradas, modelado de temas. spaCy y NLTK aceptan cadenas, no marcado.
  • Síntesis de voz y accesibilidad. A un motor de TTS le das Markdown y te leerá en voz alta, tan feliz, «almohadilla almohadilla Capítulo cuatro».
  • Comparar ediciones. Dos tiradas del mismo título, extraídas a texto, pasadas por un diff a nivel de palabra: así es como descubres qué cambió de verdad una segunda edición.

Qué pierdes al aplanar

Los límites de capítulo. Ese es el coste real, y pesa más en un libro que en la mayoría de tipos de documento, porque un libro es lo bastante largo como para que «dónde estoy» importe.

En el EPUB original cada capítulo es un archivo XHTML aparte, con una etiqueta de encabezado y una entrada en el documento de navegación. Una vez aplanado, el título del capítulo pasa a ser una línea corta de texto encima de una línea larga de texto, sin nada que la marque como distinta. Pídele a un modelo que «resuma el capítulo siete» y tendrá que deducir dónde empieza el siete solo por lo que dicen las palabras. Casi siempre lo consigue. A veces empieza un párrafo tarde y resume otra cosa sin decírtelo.

Las citas en bloque también dejan de distinguirse visualmente de la narración, lo que importa en no ficción, donde el material citado y el argumento del propio autor conviven. Si algo de eso es esencial para lo que haces, tira mejor de EPUB a Markdown: allí el árbol de encabezados sobrevive y puedes cortar el archivo limpiamente por capítulos. El selector de formato de arriba alterna entre los dos y se lleva el archivo seleccionado, así que puedes generar ambas salidas y compararlas sin subirlo dos veces.

Restos tipográficos que conviene limpiar

Las editoriales componen bien, lo cual es estupendo para leer y algo molesto para computar. Hay un puñado de cosas que aparecen sin falta en el texto extraído de un libro, y una sola pasada de buscar y reemplazar resuelve casi todas:

  • Comillas tipográficas y apóstrofos curvos. Los libros usan comillas de imprenta — «» y “ ” — no " ni '. Los tokenizadores suelen apañárselas, pero las regex ingenuas y la comparación de cadenas no: busca "Hola" en una novela y puede que no encuentres nada mientras la página está llena de «Hola».
  • Rayas y guiones medios. En español la raya de diálogo va pegada a la primera palabra de la intervención, así que los segmentadores de frases a veces pegan dos oraciones o cortan una donde no toca.
  • Guiones blandos y espacios de no separación. Invisibles en pantalla, presentes en el flujo de bytes, y responsables silenciosos de recuentos de palabras que no cuadran con nada.
  • Ligaduras. «fi» y «fl» son a veces un único glifo. Normalmente se extraen bien, pero una fuente incrustada rara puede producir caracteres extraños en alguna palabra suelta.
  • Preliminares y páginas finales. Portada, aviso de copyright, dedicatoria, agradecimientos, «sobre el autor», restos de índice. Texto de relleno que aparece en todos los libros que conviertas y que acaba siendo vocabulario falsamente frecuente en el corpus. Recórtalo si vas a trabajar con frecuencias.

Nada de esto es descuido del conversor. Es lo que hay realmente en el archivo, y saber que hay que buscarlo es casi toda la batalla.

El DRM, y de dónde salen los libros convertibles

Un libro comprado en una tienda grande suele estar cifrado. El XHTML dentro del contenedor está revuelto y un archivo encryption.xml lo declara, así que ningún conversor — este incluido — puede leer ni una palabra. Sube uno y obtendrás un error o una salida vacía. Conviene saberlo antes de pasar diez minutos preguntándote qué falló.

Hay muchas fuentes buenas que son libres de DRM por diseño. El catálogo de dominio público de Project Gutenberg es enorme e ideal para trabajo de corpus. Standard Ebooks publica ediciones de dominio público cuidadosamente compuestas y con un marcado inusualmente limpio. La mayoría de editoriales técnicas, los títulos con licencia Creative Commons y cualquier cosa que hayas exportado tú mismo se convierten sin rechistar. Convertir libros que has comprado para estudiarlos tú es uso corriente; redistribuir el texto extraído de un libro con derechos de autor no lo es. Dicho queda.

Hacer esto con una biblioteca entera

Convertir un libro es cosa de dos segundos. La versión interesante es convertir cuarenta y tratar el resultado como un conjunto de datos. Unas cuantas cosas que hacen que eso vaya rodado:

  • Comprime el lote. ZIP a texto toma un archivo comprimido y convierte de una pasada todos los archivos compatibles que haya dentro, lo cual es mejor que cuarenta subidas sueltas. Vigila el tope de 50 MB: los EPUB son pequeños, pero los ilustrados no.
  • Normaliza antes de trocear. Endereza las comillas, quita los guiones blandos, colapsa las líneas en blanco repetidas. Hazlo una vez al ingerir y todos los pasos posteriores se simplifican.
  • Trocea por límites de párrafo, no por número fijo de caracteres. Los libros tienen párrafos de verdad y son unidades semánticas naturales. Los cortes ciegos cada 1.000 caracteres parten frases por la mitad y generan embeddings de fragmentos.
  • Guarda el nombre de archivo como metadato. Una vez que todo es un flujo de texto, el título y el autor son la única procedencia que tienes. Almacénalos junto a cada fragmento o recuperarás un pasaje estupendo sin idea de qué libro salió.
  • Mira el recuento de tokens. El contador bajo la salida te da el número real de un título concreto, que es la diferencia entre planificar un pipeline y adivinarlo.

El EPUB es mejor materia prima que la versión en PDF

Si el mismo título existe en los dos formatos, el EPUB te da texto más limpio con menos trabajo. Un PDF tiene maquetación fija: cada línea visual es una secuencia de glifos independiente, así que los párrafos llegan partidos en líneas cortas, las palabras cortadas con guion al final de línea siguen cortadas, y la cabecera y el número de página aterrizan en tu prosa cada pocos cientos de palabras. PDF a texto lidia con todo eso, pero después te tocará fregar.

El EPUB es reflowable. No hay páginas, luego no hay mobiliario de página, y los párrafos son párrafos de verdad en el marcado, así que salen como líneas continuas sobre las que una búsqueda con regex puede casar. Para cualquier cosa que implique buscar una frase, segmentar oraciones o generar embeddings, esa diferencia por sí sola justifica el cambio.

Preguntas frecuentes

¿Cómo convierto un EPUB a texto?

Arrastra el .epub al conversor de arriba y el texto del libro vuelve como texto plano que puedes descargar en .txt. Gratis, sin registro, 50 MB por archivo: de sobra para cualquier libro reflowable, porque un EPUB es HTML comprimido y hasta las obras largas rara vez pasan de unos pocos megabytes.

¿Funciona con libros comprados en Kindle o Apple Books?

Solo si están libres de DRM. Un libro comprado suele estar cifrado y ligado a la cuenta que lo adquirió, y un archivo cifrado no tiene dentro texto legible al que ningún conversor pueda llegar. Los títulos de dominio público de Project Gutenberg y Standard Ebooks, los libros técnicos de editoriales que venden archivos sin cifrar y tus propias exportaciones se convierten con normalidad.

¿Los capítulos siguen separados en la salida?

Los límites de capítulo sobreviven como cortes en el flujo, pero los títulos de capítulo llegan como líneas normales, sin nada que las marque como encabezados: es la naturaleza de aplanar a texto. Si después necesitas navegar o trocear por capítulos, EPUB a Markdown conserva los niveles de encabezado que lo hacen posible.

¿Y las notas al pie y las notas finales?

Salen, por lo general agrupadas al final de la sección a la que pertenecían y no en línea, donde estaba la llamada. En textos académicos eso significa que aparece una tanda de notas entre capítulos. Es fácil pasarlas de largo al leer, pero conviene saberlo si estás troceando la salida para embeddings y te preguntas por qué un fragmento es todo citas.

¿Puedo darle un libro entero a un LLM así?

Puedes convertirlo de una pasada, pero mira el recuento de tokens antes de pegarlo. Una novela de 300 páginas ronda los 120.000 tokens: cabe en una ventana de contexto de 200K y se pasa con holgura de lo que acepta una interfaz de chat en un solo mensaje. El contador bajo la salida te da el número antes de que lo descubras por las malas.

El resto de la caja de herramientas

EPUB es uno de trece formatos compatibles. File2Txt los maneja todos desde una sola subida. Para manuscritos está Word a texto, para documentos de texto enriquecido antiguos RTF a texto, y para artículos guardados HTML a texto. Tus propios datos estructurados pasan por CSV a texto o JSON a texto.

Más allá de los documentos: convierte un repositorio de GitHub a texto, un proyecto de GitLab o una carpeta local, y usa Web2Txt para bajarte páginas en vivo como texto. Hay una guía más larga sobre cómo preparar documentos para LLM si quieres la panorámica completa.

Repo2Txt está desarrollado y mantenido por v12hero, un desarrollador independiente que crea aplicaciones nativas y web centradas en la privacidad.