Convertir PDF a Texto en línea gratis

Convierta archivos PDF a Texto en línea de forma gratuita. Cargue su archivo y obtenga una salida limpia y lista para LLM al instante. Sin registro, 50 MB por archivo, nada almacenado.

Convertir un PDF a texto plano: para cuando el problema es el formato

Prueba a ejecutar diff sobre dos PDF. No puedes: son binarios, y hasta un documento «idéntico» reexportado desde la misma fuente diferirá byte a byte por las marcas de tiempo y el orden de los objetos. Extrae ahora el texto de ambos y compara eso: en dos segundos sabes exactamente qué tres frases cambiaron entre la revisión 11 y la revisión 14 del contrato.

Ese es, en una frase, el argumento a favor del PDF a texto plano. No es «Markdown, pero peor»: es otra herramienta para otro trabajo. El texto es lo que le das a un clasificador, lo que indexas en un motor de búsqueda, lo que incrustas en una base de datos vectorial, lo que pasas por grep, aquello sobre lo que cuentas palabras, o lo que entregas a cualquier cosa que trate # y | como caracteres que hay que parsear en lugar de ignorar. Arrastra un archivo al conversor de arriba y lo tienes en segundos. Gratis, sin registro, límite de 50 MB y no guardamos nada por nuestra parte.

Lo que ganas cuando tiras el marcado a la basura

Una extracción en texto plano son las palabras en orden de lectura y nada más. Sin caracteres de sintaxis, sin reglas de escapado, sin ambigüedad sobre si un asterisco es énfasis o un asterisco literal. Para un número sorprendente de cadenas de procesamiento eso no es un compromiso: es el requisito de partida.

  • Embeddings y búsqueda semántica. Trocea el documento, genera el embedding de cada fragmento, recupera por similitud. Las barras verticales y las almohadillas de Markdown no aportan nada al significado, pero sí ocupan posiciones en el vector: son dilución. Los fragmentos de prosa limpia recuperan mejor.
  • Clasificadores y modelos de temas. Cualquier cosa que haga bolsa de palabras, TF-IDF o análisis de n-gramas tratará tan campante ### como un token si no lo quitas antes. Ahórrate ese paso no introduciéndolo nunca.
  • Indexación de texto completo. Elasticsearch, SQLite FTS, el tsvector de Postgres: todos quieren texto crudo en una columna. Markdown significa una pasada extra de saneado.
  • Comparación de versiones. Los diffs por líneas funcionan bien con prosa y mal con tablas, porque cambiar una sola celda de una tabla Markdown reajusta y reescribe la fila entera.
  • Economía de tokens. Si pegas un documento largo en un modelo con la ventana de contexto justa, cada barra vertical es un token que pagaste y del que no sacaste nada.

Y lo que pierdes: mejor saberlo de antemano

Aplanar es destructivo, y a propósito. Dos pérdidas importan más que el resto.

Las tablas se desmoronan. Una tabla financiera se convierte en una ristra de números separados por espacios. Los valores están todos, pero la columna a la que pertenecía cada uno, no, y ningún prompt la va a recuperar. Si la tabla es el meollo del documento, quieres PDF a Markdown, donde las tablas de barras verticales conservan filas y columnas intactas.

La jerarquía desaparece. Un título de sección y la frase que va debajo acaban siendo dos líneas contiguas sin nada que las distinga. Pídele a un modelo que «resuma la sección 4» y tendrá que deducir dónde empieza la sección 4 solo por la redacción. En documentos largos y estructurados —especificaciones, normas, contratos con cláusulas numeradas— ahí es justo donde las respuestas se tuercen.

El selector de formato de arriba alterna entre texto y Markdown conservando el archivo que ya elegiste, así que convertir en los dos sentidos para comparar te cuesta un clic y no un envío nuevo.

Extraer texto de un PDF: rarezas que asoman en la salida

PDF es un lenguaje de descripción de página. Guarda glifos en coordenadas, y extraer consiste en reconstruir frases a partir de eso. De ahí salen unos cuantos artefactos, y conocerlos te ahorra media hora de desconcierto:

  • Saltos de línea duros a mitad de frase. El PDF no tiene noción de párrafo que se reajuste: cada línea visual es un bloque de texto aparte. Así que un párrafo te llega en seis líneas cortas. Este es el mayor tropiezo cuando trabajas con grep y expresiones regulares: busca una frase que quedó a caballo de un salto de línea y obtendrás cero coincidencias de un texto que está ahí a la vista.
  • La partición de palabras sobrevive. Una palabra cortada entre líneas como «ges-» / «tión» suele seguir cortada. Conviene un buscar y reemplazar antes de contar palabras o extraer palabras clave.
  • Los encabezados de página y la numeración se cuelan. El nombre de la empresa y «Página 14 de 88» aterrizan en mitad de tu prosa cada dos mil caracteres. Inofensivo al leer, algo molesto para el troceado y fácil de quitar con una regex de una línea en cuanto detectas el patrón.
  • El orden de las columnas puede mezclarse. Las maquetaciones académicas a dos columnas suelen linealizarse bien, pero los recuadros flotantes, los destacados y los bloques de notas al pie caen a veces en mitad de un párrafo.
  • Ligaduras y glifos raros. En los PDF compuestos profesionalmente, «fi» y «fl» son a menudo un único glifo. La mayoría se extraen sin problema. Un PDF hecho con una fuente incrustada como subconjunto y sin una tabla de correspondencia Unicode decente puede salir como un galimatías: es raro, pero cuando pasa el problema es el archivo, no el conversor.

Un PDF escaneado no tiene texto que extraer

Un PDF escaneado es una fotografía de papel dentro de un envoltorio PDF. No hay nada que sacar de ahí salvo píxeles, y el reconocimiento de texto no entra dentro de un PDF: un archivo que es solo imagen vuelve vacío. (Sube esa misma página como JPG o PNG y se leería perfectamente; mira imagen a texto. Es el envoltorio PDF el que estorba.) La prueba tarda dos segundos: abre el archivo e intenta seleccionar una frase con el cursor. Si el texto se resalta, todo bien. Si te sale un rectángulo sobre la página entera, es un escaneo.

Para escaneos, pasa primero un OCR —Acrobat, Vista Previa en macOS y casi cualquier lector de PDF moderno tienen un comando «reconocer texto»— y vuelve luego a convertir. La diferencia de calidad en la salida no es sutil.

Trabajos reales que esto resuelve

  • Montar un corpus RAG. Cientos de PDF de normativa interna pasados a texto, partidos por límites de párrafo y vectorizados. El texto es el formato que toda biblioteca de troceado espera por defecto.
  • Revisar cambios en un contrato. Extrae las dos versiones, lanza un diff a nivel de palabra y lee los cambios reales en vez de fiarte de un correo con el resumen.
  • Cumplimiento y barridos de palabras clave. Grepea una carpeta de informes extraídos buscando un término definido, el nombre de un proveedor o una frase que no debería estar ahí. Instantáneo, sin conexión y sin más herramienta que el shell.
  • Análisis de legibilidad y estilo. Distribución de la longitud de frase, densidad de jerga, índices de legibilidad: todo eso pide prosa limpia, sin marcas de formato en el flujo.
  • Alimentar una síntesis de voz. Un lector de pantalla o un motor de TTS te leerá encantado «almohadilla almohadilla Introducción» si le pasas Markdown.
  • Comprobar rápido el coste en tokens. El contador que hay bajo la salida te dice lo que cuesta un documento antes de pegarlo en ningún sitio, que es más útil que enterarte por un error de truncamiento.

Preguntas frecuentes

¿Cómo convertir un PDF a texto gratis?

Arrastra el archivo al conversor de arriba y el texto extraído aparece justo debajo. Sin cuenta, sin correo, sin marca de agua en el resultado. El límite es de 50 MB por archivo y no se guarda nada una vez que tienes tu texto. Cópialo directamente o descárgalo como .txt.

¿Por qué el texto que extraigo de mi PDF sale ilegible?

Casi siempre es la fuente, no el conversor. Un PDF hecho con una fuente incrustada como subconjunto que no trae tabla de correspondencia Unicode guarda índices de glifos sin decir a qué caracteres corresponden, así que la extracción devuelve esos índices como letras sin sentido. Si además el texto no se puede seleccionar en tu lector de PDF, el problema es el archivo en sí: reexpórtalo desde el documento original.

¿Se puede convertir un PDF escaneado a texto?

Directamente no. Un escaneo es una foto envuelta en un PDF y dentro no hay caracteres que sacar, así que vuelve vacío. Dos maneras de sortearlo: ejecuta «reconocer texto» en Acrobat o en Vista Previa de macOS y convierte aquí después, o exporta la página como PNG y usa imagen a texto, que sí aplica OCR sobre los píxeles.

¿Por qué el texto extraído se parte a mitad de frase?

El PDF no tiene párrafos que se reajusten: cada línea visual se guarda como su propio bloque de texto, así que un párrafo llega en seis líneas cortas. Donde más duele es con grep y las regex: una frase que quedaba a caballo de un salto de línea devuelve cero coincidencias. Une las líneas que no terminen en signo de puntuación de cierre antes de ponerte a buscar.

¿Convierto mi PDF a txt o a Markdown?

A texto si el destino analiza palabras crudas: embeddings, índices de búsqueda, clasificadores, diffs. A Markdown si la forma del documento aporta significado, porque las tablas de barras verticales sobreviven y los encabezados siguen marcados. Las tablas son el factor decisivo: aplana una tabla financiera a texto y la columna a la que pertenecía cada número se pierde para siempre.

¿Mi PDF se sube a un servidor?

El archivo se envía al servicio de conversión, se procesa y se descarta: no se almacena, ni se registra, ni se indexa, y no queda nada una vez devuelta la respuesta. Si necesitas una conversión en la que el archivo no salga nunca de la máquina, el conversor de carpetas locales lee los archivos en el propio navegador.

El resto de la caja de herramientas

PDF es uno de los trece formatos admitidos. File2Txt los maneja todos desde un solo envío, o ve directo a Word a texto para archivos DOCX, HTML a texto para páginas web guardadas, EPUB a texto para libros electrónicos, o imagen a texto para capturas de pantalla. ¿Trabajas con código? Convierte un repositorio de GitHub a texto, un proyecto de GitLab o una carpeta local. Para páginas web en vivo, Web2Txt extrae una URL directamente. La guía para preparar documentos para LLM cubre la versión general de todo esto.

Repo2Txt está creado y mantenido por v12hero, un desarrollador independiente que crea aplicaciones nativas y web centradas en la privacidad.