Конвертировать Word в Markdown: точное отображение, а не догадки
Переименуйте любой .docx в .zip и откройте его. Внутри — дерево папок:
word/document.xml хранит содержимое, word/styles.xml определяет стили,
word/media/ содержит все встроенные изображения, а рядом лежат footnotes.xml и
comments.xml. .docx — это не картинка страницы. Это структурированный XML-документ в
zip-контейнере.
Для качества конвертации это критично. Превратить PDF в Markdown — значит угадывать структуру по
размерам шрифтов и координатам. Превратить Word в Markdown — значит читать структуру, которая
уже объявлена. Абзац с меткой w:pStyle="Heading2" становится ##, потому что
файл буквально говорит: это заголовок второго уровня. Поэтому конвертер docx в Markdown,
как правило, даёт более чистый вывод, чем тот же документ, экспортированный в PDF и сконвертированный
оттуда. Загрузите файл выше и убедитесь — бесплатно, без регистрации, лимит 50 МБ, ничего не
сохраняется.
Стили против ручного форматирования: единственное, что решает судьбу вывода
Сделать текст похожим на заголовок в Word можно двумя способами, и они не равнозначны.
Применить стиль — щёлкнуть «Заголовок 1» на ленте — записывает в XML семантическую
метку. Конвертер читает её и выдаёт #. Ручное форматирование — выделить
строку, увеличить до 16 пунктов, нажать «жирный» — записывает только визуальные свойства. Пометки «это
заголовок» в файле нет нигде, потому что с точки зрения Word это обычный абзац, который просто большой и
жирный. Он конвертируется в жирную строку основного текста, и ваш документ приезжает в Markdown одной
плоской стеной без разделов.
Если вывод выглядит структурно пустым, причина почти всегда в этом, и лечится она в исходном документе. Откройте панель стилей, назначьте заголовкам разделов настоящие стили заголовков, сохраните, конвертируйте заново. Пять минут работы преображают результат — и сам документ Word тоже становится лучше: начинают работать панель навигации и автоматическое оглавление.
Правки, комментарии и сноски
Большинство реальных документов Word прошло через несколько рук — и несёт на себе следы. Вот что происходит с каждым слоем:
- Отслеживаемые правки живут в XML как блоки
w:insиw:del, обёрнутые вокруг затронутого текста. Конвертация приводит документ к принятому состоянию: вставки остаются, удаления отбрасываются. Если вам важна история правок юристов — этой истории больше нет: сконвертируйте версии «до» и «после» по отдельности и сравните два вывода диффом. - Комментарии лежат в отдельной части архива и привязаны к диапазонам в теле документа. Это не текст тела, поэтому в сконвертированный вывод они не попадают. Удобно, когда болтовня на полях — шум, и проблема, если именно комментарии рецензентов вы и хотели просуммировать.
- Сноски и концевые сноски тоже живут в собственных частях. Как правило, они проходят как текст, но отвязанными от точного места привязки: в базовой спецификации Markdown нет родного синтаксиса сносок. Если цитирование важно, проверьте хвост вывода.
- Колонтитулы и номера страниц отбрасываются. В Markdown нет страниц, а повторяющаяся обвязка в контексте ИИ всё равно шум.
- Поля — автонумерация, перекрёстные ссылки, сгенерированное оглавление — конвертируются в своё последнее отрисованное значение, а не в живые ссылки.
Надёжная привычка: «Рецензирование» → «Принять все исправления», затем «Сохранить как» копию, затем конвертировать. Вы точно знаете, с каким текстом работаете.
Таблицы, картинки и где у Markdown кончаются возможности
Таблицы Word — это настоящие сетки: строки и ячейки, объявленные в XML, а не колонки текста, которые просто визуально выровнены. Поэтому они чисто отображаются в Markdown-таблицы — и это самый сильный аргумент выбрать Markdown вместо плоского текста, если в документе есть хоть что-то табличное.
Исключение — объединённые ячейки. В таблицах Markdown нет rowspan и colspan, так что шапку, растянутую на три колонки, приходится как-то расплющивать, а сложные вложенные таблицы выходят приближением, а не точной копией. Простые сетки конвертируются идеально; макеты в духе счетов-фактур с объединёнными строками-шапками требуют взгляда, прежде чем им доверять.
Встроенные изображения — ограничение пожёстче. Пиксели лежат в word/media/, но текстовая
конвертация даёт текст: ссылку на изображение, а не саму картинку, и уж точно не слова внутри неё. Если
ключевая схема документа — скриншот таблицы, для конвертации этот контент невидим. Экспортируйте
картинку отдельно и прогоните через картинка в Markdown,
а ещё лучше — пересоберите её как настоящую таблицу Word до конвертации.
.doc и .docx — не один и тот же формат
У них общие три буквы и почти ничего больше. .docx появился с Office 2007 и представляет
собой Open XML — тот самый zip с XML, описанный выше, открыто специфицированный и простой в разборе.
Устаревший .doc — бинарный составной файл: миниатюрная файловая система из потоков,
десятилетиями разбиравшаяся реверс-инжинирингом, со структурами, зависящими от версии Word, которая их
записала.
Практический вывод: конвертация .docx надёжна, конвертация .doc — по мере возможностей. Если старый файл даёт странные результаты, откройте его в Word или LibreOffice, сохраните как .docx и конвертируйте уже его. Это тридцать секунд, и целый класс проблем исчезает. То же относится к файлам RTF — они ещё старше и несут ещё меньше семантической структуры.
Markdown или обычный текст? Выбирайте по следующему шагу
Берите Markdown, когда форма документа несёт смысл. Спецификация требований с вложенными нумерованными пунктами, регламент с выстроенной иерархией разделов, коммерческое предложение, полное таблиц с ценами, техническая документация с примерами кода — во всех этих случаях структура и есть информация. Спросите модель про «результаты работ в разделе 3» — и раздел 3 должен существовать как единица.
Берите Word в обычный текст, когда нужны слова и ничего больше — скормить классификатору, строить эмбеддинги, индексировать для поиска или построчно диффать две редакции. В этих конвейерах синтаксис Markdown — мёртвый груз.
Переключатель вверху страницы меняет формат и переносит выбранный файл с собой, так что получить оба варианта и сравнить можно без второй загрузки. Счётчик токенов под выводом заранее показывает, во что результат обойдётся в контекстном окне модели.
Частые вопросы
Как перевести DOCX в Markdown онлайн?
Загрузите файл выше и скопируйте Markdown или скачайте его как .md. Работает с .docx и старым .doc, 50 МБ на файл, бесплатно и без аккаунта. Стили заголовков отображаются в уровни #, жирный и курсив выживают как ** и *, списки сохраняют вложенность.
Мои заголовки правда пройдут?
Только если это были настоящие заголовки. Документ, где автор пользовался стилями «Заголовок 1» и «Заголовок 2», конвертируется в чистую структуру из # и ##. Документ, где текст вручную сделали большим и жирным, не хранит никакой информации о заголовках вообще — в Word он выглядит так же, но конвертируется в обычные абзацы, потому что читать там нечего.
Хватит ли этого, чтобы перенести документы Word на сайт документации?
Большую часть пути это проходит за вас. Проза, заголовки, списки и простые таблицы конвертируются достаточно чисто, чтобы коммитить. Что потребует ручного прохода после: встроенные изображения, сложные таблицы с объединёнными ячейками, формулы и любое нестандартное оформление, которое несло смысл по договорённости, а не по структуре.
Что с формулами и встроенными картинками?
Формулы не выживают ни в LaTeX, ни в MathML, а изображения не извлекаются в папку ассетов — на выходе текст и структура. Для документов, где математика и есть содержание, эти блоки придётся набирать заново. Лучше знать это до того, как вы сконвертируете сотню файлов и обнаружите это на девяностом.
Word в Markdown или Word в текст?
Markdown — если у документа есть структура, которую стоит сохранить, или если он направляется туда, где Markdown рендерится: в репозиторий, вики, промпт для LLM. Обычный текст — если получатель разбирает слова, а не форматирование, а это большинство конвейеров поисковой индексации и эмбеддингов.
Остальной инструментарий
Word — один из тринадцати форматов, которые здесь обрабатываются. File2Txt принимает любой из них через одну загрузку, либо переходите сразу к PDF в Markdown, PowerPoint в Markdown для презентаций или Excel в Markdown для таблиц. Если у вас папка разношёрстных документов, заархивируйте её и используйте ZIP в Markdown, чтобы сконвертировать всё содержимое за один проход.
Для кода и веб-контента есть конвертер GitHub в текст, аналог для GitLab, конвертер локального каталога и Web2Txt для сбора страниц в Markdown. Руководство по подготовке документов для LLM глубже разбирает, зачем всё это вообще нужно.
Repo2Txt разрабатывает и поддерживает v12hero — независимый разработчик, создающий нативные и веб-приложения с приоритетом приватности.