Convertir RTF a Texto en línea gratis

Convierta archivos RTF a Texto en línea de forma gratuita. Cargue su archivo y obtenga una salida limpia y lista para LLM al instante. Sin registro, 50 MB por archivo, nada almacenado.

Convertir RTF a texto: fuera las palabras de control, dentro las palabras

Mucha gente descubre el RTF por las malas. Tienes una carpeta con archivos .rtf, necesitas el contenido en una base de datos y, como técnicamente el formato es ASCII, das por hecho que basta con leer el archivo y listo. Luego miras lo que has cargado y es {\rtf1\ansi\deff0{\fonttbl{\f0\froman Times New Roman;}}{\colortbl;\red0\green0\blue0;}\viewkind4\uc1\pard\f0\fs24 Dear Sir,\par y unos cuatro kilobytes más de lo mismo antes de la segunda frase de la carta.

El RTF es texto, pero es texto con un lenguaje de marcado envolviéndolo, y sacar las palabras de ahí exige analizar de verdad las palabras de control, no lanzar regex esperanzadas contra las barras invertidas. Eso es lo que hace esta página. Extrae el texto de un archivo RTF y obtienes la prosa en orden de lectura y nada más. Gratis, sin registro, límite de 50 MB, no guardamos nada de nuestro lado.

Por qué el borrado ingenuo sale mal

Es tentador escribir una función de veinte líneas que borre todo lo que empiece por barra invertida. Funciona con los tres primeros archivos y luego arruina el resto en silencio. Las formas concretas en que se rompe merecen conocerse aunque nunca escribas esa función, porque son lo mismo que un parser de verdad tiene que resolver:

  • Los grupos de cabecera no son contenido. La tabla de fuentes, la de colores, la hoja de estilos y la tabla de revisiones están al principio del archivo, entre llaves. Si borras las palabras de control pero te quedas con el texto de dentro de esos grupos, tu salida empieza con una lista de nombres de tipografías.
  • Las llaves significan algo. Los grupos se anidan y delimitan el alcance del formato. Algunos grupos — \*\generator, \info, los datos de objetos incrustados — hay que descartarlos enteros, no desenvolverlos.
  • Los escapes parecen contenido. \'92 es un carácter real, no una palabra de control que borrar. Quítalo y todos los apóstrofos del documento desaparecen a mitad de palabra.
  • Hay binario escondido dentro. Las imágenes viven en grupos \pict como largas tiradas de dígitos hexadecimales que, para un filtro tonto, se parecen exactamente a texto normal. Así es como acabas con 40.000 caracteres de 0100090000 en medio de una carta.
  • Las marcas de párrafo importan. \par tiene que convertirse en un salto de línea, no en nada, o el documento entero llega como un párrafo interminable.

Dónde aparece el RTF a montones

Nadie tiene tres archivos RTF. La gente tiene tres mil, porque hay algún sistema que lleva escupiéndolos sin parar desde 2004. Los sospechosos habituales:

  • Expedientes judiciales y prueba documental. Transcripciones, escritos y correspondencia exportados de sistemas de gestión de casos, a menudo en un único directorio plano con nombres crípticos.
  • Documentación clínica. Notas dictadas, informes de alta y cartas de derivación guardadas como blobs RTF en tablas de la historia clínica electrónica, normalmente porque el proveedor lo eligió en 2003 y desde entonces nada ha forzado el cambio.
  • Registros de la administración pública. Elegido por la misma razón que lo eligieron los juzgados: una especificación abierta y estable que seguirá abriéndose dentro de treinta años.
  • Archivos de correo antiguos. El modo de texto enriquecido de Outlook es RTF por debajo, así que sale constantemente de la extracción de correos MSG.
  • Exportaciones de aplicaciones heredadas. Cualquier CRM, sistema de tickets o herramienta de gestión con un campo de texto enriquecido anterior a la era de los editores web está casi con seguridad guardando RTF en una columna.
  • Documentos de WordPad. Décadas de notas y procedimientos informales guardados por gente que usó lo que Windows abría por defecto.

El hilo común: son archivos que quieres buscar, indexar o interrogar, que es exactamente para lo que sirve el texto plano.

La codificación es lo que muerde de verdad

La mayoría de los problemas reales con RTF son problemas de codificación de caracteres, no estructurales. El formato se diseñó antes de que Unicode estuviera asentado, y los archivos antiguos llevan esa historia dentro.

La cabecera declara una página de códigos: \ansicpg1252 para el Windows europeo occidental es la habitual, pero te encontrarás \ansicpg1251 para cirílico, \ansicpg1250 para Europa central y \mac en archivos que nacieron en un Macintosh clásico. Los caracteres no ASCII aparecen entonces como escapes hexadecimales tipo \'92 o \'e9, cuyo significado depende por completo de esa declaración. Si te equivocas, la é se vuelve una letra cirílica o un apóstrofo tipográfico se convierte en un cuadradito.

Los archivos más nuevos usan \uN?: un punto de código Unicode seguido de un carácter de respaldo para lectores demasiado viejos para manejarlo. Bien analizado obtienes el carácter real; mal analizado obtienes el respaldo, que suele ser un signo de interrogación literal. De ahí vienen esos documentos donde cada raya y cada comilla tipográfica se han convertido en ?.

Así que, antes de meter un lote en una base de datos, abre dos o tres archivos convertidos y fíjate específicamente en los apóstrofos, las comillas, las rayas y cualquier nombre con tildes o eñes. Esas cuatro cosas te dicen si la codificación se leyó bien. Si están mal, están mal de forma consistente, y un buscar y reemplazar sobre todo el lote lo arregla de una vez.

¿Texto o Markdown? La pregunta que decide

Se reduce a si el documento tiene tablas que te importen.

Las tablas RTF se definen explícitamente con \trowd y \cellx, así que se reconstruyen limpiamente como tablas de barras si pides Markdown. Si las aplanas a texto, todos los valores sobreviven pero la columna a la que pertenecía cada uno no: una tabla de facturación se convierte en una ristra de números separados por espacios, y no hay prompt que devuelva las columnas. Si ese es tu documento, usa RTF a Markdown. El selector de formato de arriba cambia de página y conserva el archivo que ya habías seleccionado.

Para todo lo demás — cartas, notas, transcripciones, circulares, correspondencia, casi todo aquello para lo que se usa realmente el RTF — el texto es la mejor salida. Es lo que quieren los índices de búsqueda de texto completo, lo que trocean por defecto los pipelines de embeddings, lo que lee grep y lo que espera un clasificador. Los asteriscos y las barras de Markdown solo serían caracteres que volverías a quitar en el paso siguiente.

Cómo salir de un lote grande

  • Comprime la carpeta. ZIP a texto convierte de una pasada todos los archivos compatibles que haya dentro de un comprimido, que es bastante mejor que subirlos uno a uno. Ojo con el tope de 50 MB: el RTF no está comprimido, y los archivos con imágenes incrustadas son muchísimo más grandes de lo que su número de palabras sugiere.
  • Haz un muestreo antes de comprometerte. Convierte primero cinco archivos de años distintos. Los problemas de codificación se agrupan por época y por la herramienta que los produjo, y una muestra te enseña el patrón antes de procesar tres mil.
  • Conserva los nombres de archivo como metadatos. Una vez que todo es texto plano, el nombre puede ser la única procedencia que te quede. Guárdalo junto a cada registro.
  • Cuenta con el texto de plantilla. Membretes, pies y despedidas estándar se repiten en todos los archivos de un corpus. Se convierten en vocabulario falsamente frecuente en cualquier análisis de frecuencias o de temas, así que quítalos en cuanto detectes el patrón.
  • Vigila los truncamientos. Hay bastantes herramientas que emiten RTF ligeramente fuera de norma, con llaves descompensadas. Si un archivo convertido se corta a mitad de frase, es que el original está mal formado y no que la conversión falle en silencio: abre el original en un editor de texto y casi siempre verás dónde se tuerce.
  • Mira el recuento de tokens. El contador bajo la salida te dice lo que cuesta un documento antes de pegarlo en ningún sitio, lo que viene bien cuando estás decidiendo cuánto archivo cabe en un solo prompt.

RTF, DOCX y cuál conviene convertir

Si un documento existe en los dos formatos, quédate con el DOCX. Lleva una jerarquía de estilos en condiciones y una semántica más rica, y Word a texto es el equivalente moderno más cercano a esta página.

Pero el RTF tiene una ventaja real para la extracción masiva de texto, y no es la nostalgia: es un único flujo lineal sin capa de compresión. No hay contenedor zip que se pueda corromper ni partes XML referenciándose entre sí. Cuando algo va mal puedes abrir el archivo en cualquier editor y leer la causa con tus propios ojos. Repartido entre unos cuantos miles de archivos de procedencia desconocida, esa previsibilidad vale sorprendentemente mucho.

Preguntas frecuentes

¿Cómo extraigo el texto de un archivo RTF?

Arrastra el .rtf al conversor de arriba. Las palabras de control se analizan como es debido y obtienes la prosa en orden de lectura, sin nada de marcado. Gratis, sin registro, 50 MB por archivo, sin almacenar nada. Descárgalo como .txt o cópialo.

¿Por qué no puedo abrir el RTF en un editor de texto y ya?

Puedes, y verás {\rtf1\ansi\deff0{\fonttbl{\f0\froman Times New Roman;}} seguido de varios kilobytes más antes de la segunda frase de la carta. El RTF es ASCII, pero es ASCII envuelto en un lenguaje de marcado. Las palabras están ahí, entremezcladas con tablas de fuentes, tablas de colores y palabras de control que hay que analizar, no eliminar por coincidencia de patrones.

¿Por qué quitar yo las barras invertidas produce una salida rota?

Porque las palabras de control no están delimitadas de forma uniforme y algunas llevan datos que hay que conservar. Una regex que borra todo lo que va después de una barra invertida borra también \'e9, que es como el RTF codifica un carácter acentuado, así que cualquier nombre con tilde pierde letras sin avisar. Funciona con los tres primeros archivos y arruina el resto en silencio.

¿Sobreviven las tildes, las eñes y los caracteres no ingleses?

Sí, cuando el archivo declara bien su codificación, cosa que hace la mayoría. El RTF escapa los caracteres no ASCII como secuencias hexadecimales ligadas a una página de códigos declarada, y un análisis correcto las resuelve a Unicode real. Este es el fallo más habitual del borrado casero, y el que más daño hace a un conjunto de datos de nombres o direcciones.

¿Se convierten las tablas de un documento RTF?

El contenido de las celdas sale, pero como texto corrido y no como una cuadrícula: el texto plano no tiene forma de expresar una columna. Si el documento es un informe construido alrededor de tablas, RTF a Markdown conserva las filas y columnas como tablas de barras.

El resto de la caja de herramientas

RTF es uno de trece formatos compatibles. File2Txt los maneja todos desde una sola subida si prefieres no elegir página. Cerca de aquí: PDF a texto para documentos de maquetación fija, EPUB a texto para libros electrónicos, HTML a texto para páginas guardadas y XML a texto para el otro formato heredado de intercambio.

¿Trabajas con código o con la web en vivo? Tienes el conversor de repositorios de GitHub a texto, una versión para GitLab, un conversor de carpetas locales y Web2Txt para extraer URL. La guía para preparar documentos para LLM cubre la versión general de todo esto.

Repo2Txt está desarrollado y mantenido por v12hero, un desarrollador independiente que crea aplicaciones nativas y web centradas en la privacidad.