Конвертировать PDF в Markdown: сохранить структуру, выбросить мусор вёрстки
PDF — это описание того, куда на странице ложится краска. И это буквально всё, что он собой представляет. В файле нет пометок «это заголовок» или «это таблица» — только глифы по координатам и движок рендеринга, благодаря которому всё выглядит упорядоченным. Именно поэтому копипаст из PDF в ChatGPT так часто даёт кашу: модель получает поток символов, из которого вся визуальная иерархия выпотрошена.
Преобразование PDF в Markdown — это восстановление этой иерархии. Размеры и насыщенность
шрифта становятся заголовками # и ##. Выровненные сетки ячеек — таблицами с
вертикальными чертами. Маркеры списков — пунктами списков. Вы получаете документ, по которому LLM может
реально ориентироваться, а не гадать. Перетащите файл в инструмент выше — результат будет через несколько
секунд: бесплатно, без регистрации, ничего не сохраняется.
Что на самом деле переживает конвертацию
Это стоит знать до конвертации, потому что от этого зависит, чего ждать на выходе:
- Заголовки — выводятся из относительного размера и насыщенности шрифта. Отчёт с единообразной типографской шкалой конвертируется прекрасно. Дизайнерский PDF, где каждый раздел оформлен по-своему, — заметно грязнее.
- Таблицы — восстанавливаются в Markdown-таблицы, когда в исходнике есть настоящее выравнивание строк и колонок. Это главная причина выбрать Markdown вместо плоского текста для финансовых отчётов, спецификаций и приложений с данными.
- Списки — маркированные и нумерованные пункты сохраняют вложенность, поэтому процедуры и перечни требований остаются читабельными.
- Порядок чтения — двухколоночные научные статьи линеаризуются в единый поток. Обычно правильно, изредка с перемешиванием, если в исходнике есть плавающие врезки или выносные цитаты.
- Что не выживает — страничная обвязка. Колонтитулы и номера страниц в контексте ИИ — это шум, и их удаление — достоинство, а не потеря.
Markdown или обычный текст? Ответ без увиливаний
Выбирайте Markdown, когда форма документа несёт смысл. Научные статьи с аргументацией по разделам, договоры с нумерованными пунктами, годовые отчёты, набитые таблицами, техническая документация с блоками кода — во всех этих случаях структура и есть информация. LLM, которую спросили «что сказано в пункте 7.3», должна знать, что пункт 7.3 — отдельная единица.
Выбирайте PDF в обычный текст, когда вам нужна только проза — скормить корпус классификатору, прогнать анализ ключевых слов или передать во что-то, что давится синтаксическими символами. Вертикальные черты и решётки Markdown там — чистые накладные расходы.
Переключатель вверху страницы переводит между этими двумя режимами и переносит уже выбранный файл с собой — можно сконвертировать по разу в каждый формат и сравнить без повторной загрузки.
Нативные PDF против сканов: почему вывод может оказаться пустым
Под одним и тем же расширением живут два вида PDF, и ведут они себя совершенно по-разному.
Нативный PDF — экспортированный из Word, LaTeX, InDesign или диалога печати браузера — содержит настоящий встроенный текст. Конвертация практически без потерь и быстрая. Отсканированный PDF — это фотография бумаги в PDF-контейнере. Извлекать из него нечего — там нет текста, только пиксели.
Быстрая проверка: откройте PDF и попробуйте выделить предложение курсором. Текст выделяется — файл нативный, конвертация будет чистой. Вместо этого появляется рамка на всю страницу — это скан. Для сканов сначала запустите OCR — команда «распознать текст» есть в большинстве PDF-читалок — и потом конвертируйте. Это лишняя минута, а разница в качестве вывода — как день и ночь.
Зачем возиться, если PDF можно просто загрузить в чат?
Большинство чат-ассистентов теперь принимают PDF напрямую, так что вопрос справедливый. Три причины, почему предварительная конвертация всё равно выигрывает:
- Вы видите то же, что видит модель. Когда загруженный PDF даёт плохой ответ, не поймёшь, модель плохо рассуждала или извлечение искалечило исходник. С Markdown перед глазами эта неопределённость исчезает.
- Можно отредактировать перед отправкой. Удалите 40 страниц юридического шаблона, оставьте три, которые важны. Дешевле, быстрее и заметно точнее ответы.
- Это компонуется. Markdown-текст ложится прямо в системный промпт, RAG-конвейер, датасет для дообучения или git-репозиторий. PDF-вложение — нет.
Практическая часть — счётчик токенов под выводом. Отчёт на 60 страниц может выйти примерно в 40 000 токенов: нормально для модели с длинным контекстом, за пределами бюджета для маленькой. Знать до вставки лучше, чем узнать из сообщения об ошибке.
Где этим реально пользуются
- Обзоры литературы. Сконвертируйте стопку статей, склейте Markdown и попросите модель найти методологические расхождения между ними. Заголовки разделов выживают, так что любое утверждение можно отследить до места, откуда оно взято.
- Проверка договоров. Нумерованные пункты остаются нумерованными, а значит, можно спрашивать о конкретных обязательствах и получать ответы со ссылками на настоящие номера пунктов, а не пересказы.
- Документация к API и вендорским продуктам. Немало корпоративных SDK до сих пор поставляют справочники в PDF. Сконвертируйте их и положите рядом с вашим репозиторием GitHub в виде текста, чтобы кодовый ассистент видел и спецификацию, и вашу реализацию одновременно.
- Финансовая отчётность. Всё держится на восстановлении таблиц — модель может сравнивать показатели по кварталам, когда строки и колонки целы.
- Конспекты лекций и учебники. Сконвертируйте главу, попросите выжимку, а потом сгенерируйте тренировочные вопросы из того же источника.
Как получить вывод почище
- Если у PDF есть текстовый близнец — HTML-версия статьи, DOCX, из которого экспортировали отчёт, — конвертируйте его. Меньше шагов угадывания, лучше структура. Попробуйте Word в Markdown или HTML в Markdown.
- Гигантские PDF режьте до конвертации. Руководство на 500 страниц сконвертируется нормально, но целиком не влезет ни в одно контекстное окно, а по нужной вам главе ответы будут лучше.
- Таблицы, нарисованные картинками, а не свёрстанные текстом, не восстановятся — без OCR их ничто не прочитает. Если таблицы для вас важны, проверьте вывод.
- Пробегитесь по первым нескольким сотням строк перед вставкой. Заметить сломанный уровень заголовка — десять секунд, а сэкономит вам сбивающий с толку разговор с моделью.
Частые вопросы
Как перевести PDF в Markdown онлайн?
Загрузите PDF выше — Markdown появится под ним, готовый к копированию или скачиванию как .md. Бесплатно, без регистрации, 50 МБ на файл. Заголовки возвращаются уровнями #, списки — маркерами -, таблицы — таблицами с вертикальными чертами, так что структура доживает до того, кто будет это читать дальше.
Сохраняются ли таблицы при конвертации PDF в Markdown?
Да, и это главная причина выбрать Markdown вместо плоского текста. Таблица становится Markdown-таблицей с сохранёнными связями строк и колонок, поэтому модель на вопрос «какая была выручка в третьем квартале» всё ещё понимает, какое число стоит под каким заголовком. Сплющите ту же таблицу в обычный текст — и это соответствие уже не восстановить.
Что происходит с картинками внутри PDF?
Иллюстрации, диаграммы и фотографии в Markdown не переносятся — на выходе текстовый слой, а не набор ассетов. Если смысл страницы живёт в диаграмме, сконвертируйте эту страницу отдельно как изображение через картинка в Markdown — этот инструмент читает слова, отрисованные внутри картинки.
А есть Python-библиотека, которая делает PDF в Markdown?
Несколько — обычно называют pymupdf4llm, marker и docling, и для конвейера на десять тысяч файлов это правильный ответ. Правда, им нужны virtualenv, веса моделей и время на GPU. Для одного документа, который надо сконвертировать до следующего сообщения в Claude или ChatGPT, вкладка браузера выигрывает.
Что лучше скормить LLM — PDF в Markdown или PDF в текст?
Markdown — когда документ структурирован. Модели обучены на огромных объёмах Markdown и читают его соглашения о заголовках и таблицах нативно, поэтому «сделай выжимку по разделу 4» работает: раздел 4 буквально размечен. За обычным текстом идите только когда синтаксические символы должны исчезнуть — в основном при нарезке под эмбеддинги.
Сохранится ли порядок страниц и ход чтения?
Одноколоночные документы надёжно проходят в порядке чтения. Двухколоночные академические макеты обычно линеаризуются правильно, но выносные цитаты, плавающие врезки и блоки сносок иногда приземляются посреди абзаца — в исходных координатах они стоят посреди страницы. Стоит пробежаться по выводу, прежде чем доверять ему что-то точное.
Остальной инструментарий
PDF — один из тринадцати форматов, которые здесь обрабатываются. File2Txt принимает любой из них, если не хочется выбирать конкретную страницу, либо идите сразу в Excel в Markdown для таблиц, PowerPoint в Markdown для презентаций или EPUB в Markdown для электронных книг.
Работаете с кодом или вебом? Сконвертируйте репозиторий через конвертер GitHub в текст, проект GitLab или папку на своей машине. Для веб-страниц Web2Txt собирает страницу по URL прямо в Markdown. Есть и более развёрнутый разбор подготовки документов для LLM, если нужна общая версия этого рассуждения.
Repo2Txt разрабатывает и поддерживает v12hero — независимый разработчик, создающий нативные и веб-приложения с приоритетом приватности.