Конвертировать Word в текст: раздеть документ до слов
Копипаст из Word — вот как форматирование протаскивается туда, где ему не место. Вставите в CMS — и тащите за собой объявления шрифтов и бесхозные span'ы. Вставите в комментарий к коду — кавычки станут фигурными, и строка перестанет совпадать. Вставите в терминал — длинные тире приедут символами, которых ваш скрипт не ждал. Документ выглядел нормально. Но байты никогда не были простыми.
Преобразование Word в обычный текст обрубает это у самого источника. На выходе — проза в порядке чтения: без стилей, без цветов, без следов рецензирования, без невидимых строительных лесов вёрстки. Именно это нужно, когда требуется извлечь текст из документа Word для анализа, поиска или чего угодно, что воспринимает символы форматирования как данные для разбора. Бесплатно, без регистрации, лимит 50 МБ, у нас ничего не остаётся.
Что именно вырезается
В .docx лежит куда больше, чем слова. Вот что остаётся на полу монтажной:
- Всё визуальное форматирование — жирный, курсив, шрифты, размеры, цвета выделения, тот самый абзац, который кто-то оставил в Comic Sans. Акценты исчезают, и никакой отметки, где они были, не остаётся.
- Иерархия заголовков — «Заголовок 1» и предложение под ним становятся двумя обычными соседними строками. Их ничто не различает.
- Таблицы схлопываются в строки текста. Значения ячеек выживают; к какой колонке относилось каждое — нет. Это главная причина взять вместо этого Word в Markdown, когда документ набит таблицами.
- Встроенные изображения исчезают полностью. Это пиксели в
word/media/внутри архива, а этот конвертер OCR не запускает — так что текст со вставленного скриншота в выводе не появится никогда. Если этот контент важен, вытащите картинку и прогоните её отдельно через картинка в текст. - Колонтитулы, номера страниц, водяные знаки — отбрасываются. У текста нет страниц.
- Комментарии — хранятся в отдельной части файла, это не текст тела документа, поэтому они не проходят.
Невидимые символы, которые Word оставляет после себя
Обычный текст — значит без разметки. Но это не значит ASCII, а автозамена Word годами тихо подменяла набранные вами символы типографски более красивыми. Они переживают конвертацию, потому что они — полноправная часть текста:
- «Умные» кавычки — прямые
"и'превращаются в фигурные U+201C / U+201D и U+2018 / U+2019. Классическая причина, по которой регулярка, импорт CSV или скопированный кусок кода молча ломается. - Длинные и средние тире — набранный двойной дефис становится длинным тире. В прозе нормально, в идентификаторе или команде — сюрприз.
- Неразрывные пробелы (U+00A0) — выглядят в точности как пробелы и не совпадают с
\sв некоторых старых диалектах регулярок или с' 'при наивном разбиении. - Мягкие переносы и необязательные разрывы — символы нулевой ширины внутри слов, невидимые до тех пор, пока сравнение строк не провалится без видимой причины.
- Многоточие — три набранные точки схлопываются в один символ U+2026.
Всё это не баг конвертации, а честный вывод. Но если ваш конвейер привередлив, прогоните после конвертации нормализацию Unicode. Знать, где искать, — уже половина дела.
Режим правок: примите их до конвертации
Word хранит правки прямо в тексте — вставленное обёрнуто в w:ins, удалённое лежит в
w:del, чтобы его можно было вернуть. Конвертация приводит документ к принятому состоянию:
вставки остаются, удаления исчезают. Почти всегда это то, что нужно, но «почти всегда» в этой фразе несёт
нагрузку — особенно с юридическим черновиком, испещрённым правками, когда вы можете не знать, в каком
состоянии находился документ.
Сделайте это явно. «Рецензирование» → «Принять все исправления» на копии, сохранить, конвертировать. Теперь полученный текст — однозначно тот текст, на который вы смотрели. А если вам как раз нужно узнать, что изменилось между черновиками, лучше сконвертировать каждую версию в текст и запустить diff — обычный текст сравнивается прекрасно, именно для этого этот формат и существует.
Когда текст — правильный ответ, а Markdown — нет
Markdown выигрывает, когда структура несёт смысл. Текст выигрывает всякий раз, когда разметка станет шумом для того, кто будет её потреблять дальше:
- Классификаторы и текстовая аналитика. TF-IDF, тематическое моделирование, оценка
тональности, извлечение ключевых слов — в основе всё это мешок слов, и всё это токенизирует
**как будто это слово из словаря, если заранее не вычистить. - Эмбеддинги. Нарезать, векторизовать, находить. Синтаксические символы добавляют вектору позиции, не добавляя смысла. Фрагменты прозы находятся точнее, чем размеченные.
- Поисковые индексы. Полнотекстовый поиск Postgres, SQLite FTS, Elasticsearch — все хотят колонку с сырым текстом. Markdown означает лишь шаг очистки перед вставкой.
- Diff и системы контроля версий. Построчные диффы на прозе читаются чисто. Таблицы Markdown — наоборот: измените одну ячейку, и вся строка перезаписывается, так что diff не говорит ничего полезного.
- Передача в скрипты.
wc,grep,awk, быстрый однострочник на Python — текст здесь универсальный обменный формат для всего. - Минимум токенов. При тесном бюджете контекста каждая черта и решётка — расход без отдачи. Счётчик токенов под выводом покажет разницу сразу.
Переключатель формата вверху страницы переводит между текстом и Markdown и переносит выбранный файл с собой — получить оба варианта и сравнить стоит один клик, а не вторую загрузку. Та же логика работает и в остальных инструментах — PDF в обычный текст и HTML в текст существуют по тем же причинам.
.doc, .docx и как получить чистый результат
Старый формат .doc — бинарный составной файл времён до 2007 года: маленькая внутренняя
файловая система из потоков, устройство которой менялось от версии к версии Word. .docx —
это Open XML: zip-архив с хорошо специфицированным XML. Извлечение из .docx надёжно; извлечение из .doc —
по мере возможностей. Если старый файл даёт странный вывод, откройте его в Word или LibreOffice,
сохраните как .docx и конвертируйте уже его. Тот же совет применим к
документам RTF.
Ещё две полезные привычки. Пробегитесь по первой сотне строк вывода, прежде чем им пользоваться — заметить плохо расплющившуюся таблицу занимает десять секунд, а избавляет от сбивающего с толку разговора с моделью потом. И если исходник огромен, режьте его: руководство на 400 страниц сконвертируется нормально, но в контекстное окно не влезет, а по нужной вам главе ответы будут точнее.
Частые вопросы
Как перевести документ Word в текстовый файл?
Перетащите .docx или .doc выше — текст появится ниже и скачается как .txt. Бесплатно, без регистрации, 50 МБ на файл. Работают оба формата — современный на упакованном XML и старый бинарный, который Word использовал до 2007 года.
Можно ли конвертировать несколько файлов DOCX в TXT разом?
Здесь — нет: эта страница принимает по одному файлу. Для целой папки сложите документы в каталог и воспользуйтесь конвертером локальной папки — он обходит всё дерево и даёт отметить нужные файлы за один проход. В командной строке стандартный ответ — Pandoc в шелл-цикле.
Что происходит с исправлениями и комментариями?
Вы получаете документ таким, каким он читается сейчас: пометки правок разрешены, а не воспроизведены. Комментарии на полях не относятся к тексту тела и не проходят. Если весь смысл упражнения — посмотреть, что изменилось между двумя черновиками, сконвертируйте обе версии в текст и запустите diff по словам — он покажет правки куда разборчивее, чем боковая панель.
Попадают ли в вывод колонтитулы и сноски?
Тела сносок, как правило, проходят — для документа с цитированием это то, что нужно. Повторяющиеся колонтитулы — это страничная обвязка, а не содержание, поэтому они не должны вклиниваться в текст, как это бывает при извлечении из PDF. Одно из настоящих преимуществ конвертации из DOCX, а не из экспортированного PDF того же документа.
Что выбрать — Word в текст или Word в Markdown?
Текст — когда нужны слова и ничего больше: подсчёт слов, прогон по ключевым словам, нарезка под эмбеддинги, озвучка через TTS. Word в Markdown — когда документ писался с настоящими стилями заголовков и вы хотите, чтобы эта структура дожила до вывода.
Остальной инструментарий
Word — один из тринадцати форматов здесь. File2Txt принимает любой из них через одну загрузку, либо идите прямиком в PowerPoint в текст для презентаций, Excel в текст для таблиц или MSG в текст для писем Outlook. Целая папка черновиков? Заархивируйте её и прогоните через ZIP в текст, чтобы сконвертировать всё содержимое разом.
Для кода есть конвертер GitHub в текст, версия для GitLab и конвертер локального каталога. Для веб-страниц Web2Txt вытаскивает текст по URL. Есть и более длинное руководство по подготовке документов для LLM, если нужен общий разбор, а не только про Word.
Repo2Txt разрабатывает и поддерживает v12hero — независимый разработчик, создающий нативные и веб-приложения с приоритетом приватности.