Конвертировать EPUB в Текст онлайн бесплатно

Конвертируйте файлы EPUB в Текст онлайн бесплатно. Загрузите файл и сразу получите чистый результат, готовый для LLM. Без регистрации, до 50 МБ, ничего не сохраняется.

EPUB в текст: превращаем книжную полку в то, с чем можно вычислять

Книги — самая тщательно отредактированная длинная проза, какая у нас есть. Профессионально написанная, профессионально вычитанная, тысячи слов выдержанного стиля без навигационных меню, баннеров про cookie и секций с комментариями. Как сырьё для чего угодно языкового — эмбеддингов, анализа стиля, поиска, обучения классификатора распознавать тон — это трудно превзойти.

Проблема в том, что всё это лежит внутри запакованного набора XHTML-файлов. Конвертер EPUB в текст достаёт его наружу: один непрерывный поток прозы, без тегов, без символов разметки, без ничего, что вашему токенизатору пришлось бы учиться игнорировать. Загрузите файл выше — и через секунды получите результат. Бесплатно, без регистрации, лимит 50 МБ, ничего не сохраняется.

Почему плоский текст — правильная форма для этой работы

Обычный текст здесь не «бюджетный вариант». Для большинства задач, которые делают с книгами в масштабе, это ровно тот формат, которого инструменты и ждут:

  • Эмбеддинги и семантический поиск. Порезать прозу на чанки, векторизовать каждый, искать по близости. Решётки и звёздочки Markdown занимают позиции токенов и не добавляют смысла — они разбавляют вектор. Чистые абзацы ищутся лучше, и каждая библиотека чанкинга на свете по умолчанию принимает текст.
  • Читабельность и стилометрия. Флеш—Кинкейд, средняя длина предложения, отношение типов к токенам, богатство словаря, ритм пунктуации. Всё это метрики уровня слов и предложений, и токены форматирования портят каждую из них.
  • Поисковая индексация по библиотеке. tsvector в Postgres, FTS5 в SQLite, Elasticsearch или обычная папка, по которой вы гоняете grep. Всем им нужен сырой текст в поле. Пятьдесят сконвертированных книг — это по-настоящему быстрый личный поисковик.
  • Корпусная лингвистика и NLP-конвейеры. Конкордансы, анализ коллокаций, извлечение именованных сущностей, тематическое моделирование. spaCy и NLTK принимают строки, а не разметку.
  • Синтез речи и доступность. TTS-движок, которому дали Markdown, с радостью прочитает вслух «решётка решётка Глава четвёртая».
  • Сравнение изданий. Два тиража одной книги, извлечённые в текст и прогнанные через пословный diff, — вот как узнать, что на самом деле изменилось во втором издании.

Чем вы платите за уплощение

Границами глав. Это настоящая цена, и для книг она весомее, чем для большинства типов документов, потому что книга достаточно длинна, чтобы вопрос «где я нахожусь» имел значение.

В исходном EPUB каждая глава — отдельный XHTML-файл с тегом заголовка и записью в навигационном документе. После уплощения название главы становится короткой строкой текста над длинной строкой текста, и ничто не помечает её как особенную. Попросите модель «пересказать седьмую главу» — и ей придётся вычислять, где начинается седьмая, по одним лишь формулировкам. Обычно она справляется. Иногда начинает на абзац позже и тихо пересказывает не то.

Цитатные блоки тоже перестают визуально отличаться от повествования, что важно для нон-фикшена, где цитируемые источники и собственная аргументация автора стоят бок о бок. Если что-то из этого несёт нагрузку в вашей задаче, возьмите вместо этого EPUB в Markdown — там дерево заголовков выживает, и файл можно чисто нарезать по главам. Переключатель формата в верхней части страницы переводит между режимами и переносит выбранный файл, так что можно получить оба варианта и сравнить их без повторной загрузки.

Типографские артефакты, которые стоит вычистить

Издатели верстают как положено — это прекрасно для чтения и слегка раздражает при вычислениях. Несколько вещей стабильно всплывают в извлечённом книжном тексте, и один проход поиска с заменой закрывает большинство из них:

  • Типографские кавычки и апострофы. В книгах стоят «ёлочки» и типографские знаки, а не " и '. Токенизаторы обычно справляются, но наивный regex и сравнение строк — нет: поищите "Привет" в романе — и можете не найти ничего, хотя страница полна «Привет».
  • Длинные и короткие тире. Часто без пробелов вокруг, из-за чего разбивщики предложений иногда склеивают два предложения или рвут одно не в том месте.
  • Мягкие переносы и неразрывные пробелы. Невидимы на экране, присутствуют в байтовом потоке — и тихо отвечают за подсчёты слов, которые ни с чем не сходятся.
  • Лигатуры. «fi» и «fl» иногда представлены одним глифом. Обычно они извлекаются нормально, но необычный встроенный шрифт может дать странные символы в отдельных словах.
  • Служебные части книги. Титульная страница, копирайт, посвящение, благодарности, «об авторе», остатки указателя. Шаблонный текст, который есть в каждой конвертируемой книге, — и в корпусе он превращается в ложно частотную лексику. Обрежьте его, если работаете с частотами.

Ничто из этого не небрежность конвертера. Это то, что действительно лежит в файле, и знать, что это надо искать, — уже половина дела.

DRM, и откуда берутся конвертируемые книги

Книга, купленная у крупного ритейлера, обычно зашифрована. XHTML внутри контейнера перемешан, а файл encryption.xml это декларирует, так что ни один конвертер — включая этот — не прочитает из неё ни слова. Загрузите такую — и получите ошибку или пустой вывод. Полезно знать до того, как потратите десять минут на выяснение, что пошло не так.

Хороших источников без DRM хватает. Каталог общественного достояния Project Gutenberg огромен и идеален для корпусной работы. Standard Ebooks выпускает тщательно свёрстанные издания общественного достояния с необычайно чистой разметкой. Большинство технических издательств, издания вокруг arXiv, книги под Creative Commons и всё, что вы экспортировали сами, конвертируются без нареканий. Конвертировать собственные книги для собственного изучения — обычное дело; распространять извлечённый текст книги под копирайтом — нет. Этим всё сказано.

Как проделать это с целой библиотекой

Сконвертировать одну книгу — дело двух секунд. Интересный вариант — сконвертировать сорок и работать с результатом как с датасетом. Несколько вещей, которые делают это гладким:

  • Запакуйте партию в архив. ZIP в текст принимает архив и конвертирует все поддерживаемые файлы внутри за один проход — это лучше сорока отдельных загрузок. Следите за потолком в 50 МБ: EPUB маленькие, но иллюстрированные — нет.
  • Нормализуйте до чанкинга. Выпрямите кавычки, уберите мягкие переносы, схлопните повторяющиеся пустые строки. Сделайте это один раз на входе — и каждый следующий шаг станет проще.
  • Режьте по границам абзацев, а не по фиксированному числу символов. В книгах настоящие абзацы, и это естественные смысловые единицы. Слепые разрезы по 1 000 символов режут предложения пополам и дают эмбеддинги обрывков.
  • Храните имя файла как метаданные. Когда всё стало одним текстовым потоком, название и автор — единственное происхождение, которое у вас есть. Сохраняйте их рядом с каждым чанком, иначе вы найдёте отличный фрагмент и не будете знать, из какой он книги.
  • Проверяйте число токенов. Счётчик под результатом даёт реальную цифру для конкретной книги — а это разница между планированием конвейера и гаданием.

EPUB — лучшее сырьё, чем PDF-версия

Если книга существует в обоих форматах, EPUB даёт более чистый текст с меньшими усилиями. PDF — формат с фиксированной вёрсткой: каждая видимая строка — отдельный набор глифов, поэтому абзацы приходят разбитыми на короткие строки, слова с переносами так и остаются с переносами, а колонтитул и номер страницы вклиниваются в прозу каждые несколько сотен слов. PDF в текст со всем этим справляется, но потом придётся подчищать.

EPUB перевёрстывается на лету. Страниц нет — значит, нет и страничной обвязки, а абзацы в разметке являются настоящими абзацами, так что на выходе они становятся непрерывными строками, по которым regex-поиск может находить совпадения. Для всего, что связано с поиском фраз, разбиением на предложения или эмбеддингами, одной этой разницы достаточно, чтобы сменить формат.

Часто задаваемые вопросы

Как конвертировать EPUB в текст?

Перетащите .epub в конвертер выше — и текст книги вернётся в виде обычного текста, который можно скачать как .txt. Бесплатно, без регистрации, до 50 МБ на файл — с запасом больше, чем нужно любой перевёрстываемой электронной книге: EPUB — это сжатый HTML, и даже длинные книги редко переваливают за несколько мегабайт.

Сработает ли это с книгами, купленными в Kindle или Apple Books?

Только если они без DRM. Купленная книга обычно зашифрована и привязана к аккаунту покупателя, а в зашифрованном файле нет читаемого текста, до которого мог бы дотянуться хоть какой-то конвертер. Книги общественного достояния с Project Gutenberg и Standard Ebooks, технические книги издательств, продающих файлы без шифрования, и ваши собственные экспорты конвертируются нормально.

Сохраняется ли разделение на главы в выводе?

Границы глав выживают как разрывы в потоке, но названия глав приходят обычными строками, и ничто не помечает их как заголовки — такова природа уплощения в текст. Если после этого вам нужно навигировать или резать по главам, EPUB в Markdown сохраняет уровни заголовков, которые делают это возможным.

Что со сносками и примечаниями?

Они проходят — как правило, собранными в конце раздела, к которому относились, а не в строке, где стоял маркер. Для научных текстов это означает, что между главами появляется вереница тел примечаний. Читать мимо легко; знать об этом стоит, если вы режете вывод на чанки для эмбеддингов и удивляетесь, почему один чанк состоит из одних ссылок на источники.

Можно ли так скормить LLM целую книгу?

Сконвертировать за один проход можно, но проверьте число токенов до вставки. Роман на 300 страниц — это примерно 120 000 токенов: помещается в контекстное окно 200K и заметно превышает то, что чат-интерфейс примет одним сообщением. Счётчик под результатом называет цифру до того, как вы узнаете её тяжёлым путём.

Остальной инструментарий

EPUB — один из тринадцати поддерживаемых форматов. File2Txt обрабатывает их все через одну загрузку. Для рукописей есть Word в текст, для старых rich-text-документов — RTF в текст, а для сохранённых статей — HTML в текст. Собственные структурированные данные проходят через CSV в текст или JSON в текст.

За пределами документов: конвертируйте репозиторий GitHub в текст, проект GitLab или локальную папку, а с помощью Web2Txt стягивайте живые страницы в текст. Есть и более подробное руководство по подготовке документов для LLM, если нужна общая картина.

Repo2Txt создаёт и поддерживает v12hero — независимый разработчик, который делает нативные и веб-приложения с приоритетом приватности.