ToolAct

Конвертер EPUB в TXT

Загрузите электронную книгу EPUB и извлеките весь текст в простой файл .txt в кодировке UTF-8

Загрузить книгу

Перетащите файл EPUB сюда или нажмите для выбора

Поддерживается формат .epub (без DRM), максимум 3 МБ

Что такое EPUB в TXT

EPUB в TXT извлекает читаемый текст из электронной книги EPUB и записывает его в виде обычного текстового файла. EPUB — это контейнерный формат: сами слова находятся в XHTML-документах внутри ZIP-архива, обёрнутых в CSS, шрифты, изображения и файлы навигации. Файл .txt сохраняет только символы — без разметки, без стилей, без вёрстки. На выходе получается чистый сплошной текст, который прочитает любая программа.

Почему это полезно: обычный текст — единственный формат, который понимают все: grep и полнотекстовый поиск, скрипты на Python и R для анализа текста, подсчёт слов, переводческие инструменты, подсказки для языковых моделей, синтез речи и любые устройства или приложения, которые вообще не поддерживают форматы электронных книг. Если нужно искать по целой библиотеке, точно цитировать фрагменты или скормить роман языковой модели, первый шаг почти всегда один — достать текст из контейнера электронной книги.

Но сначала примите компромисс: TXT — формат с потерями. Иллюстрации, обложка, иерархия оглавления, полужирный и курсив, таблицы, связанные сноски и встроенные шрифты исчезают или сливаются в сплошной текст; выживают только символы, разделённые переводами строк и пустыми строками. Номера страниц тоже теряют смысл — в простом тексте нет страниц. Если книга должна и дальше выглядеть как книга, используйте конвертер EPUB в PDF; TXT — правильный выбор, когда нужны слова, а не страницы.

Как пользоваться

Порядок действий

  1. Нажмите на область загрузки или перетащите файл EPUB — поддерживается только .epub, до 3 МБ
  2. Нажмите «Конвертировать в TXT» — сервер извлечёт текст с помощью Calibre за несколько секунд
  3. Когда в панели результата появится изменение размера, нажмите «Скачать TXT»
  4. Нужна ещё одна книга? Нажмите «Конвертировать другой файл», чтобы сбросить панель

Перед конвертацией

  • Обратите внимание на изменение размера в панели результата: сильное уменьшение нормально (изображения и шрифты исчезают), но если осталось всего несколько сотен байт, скорее всего в этом EPUB почти не было текста.
  • Откройте скачанный TXT один раз в редакторе с поддержкой UTF-8. Если диакритика или иероглифы выглядят неправильно, виновато определение кодировки в редакторе — сам файл в UTF-8.
  • Если нужны вёрстка, обложка или иллюстрации книги, конвертируйте в PDF; TXT намеренно отбрасывает всё это.

Сценарии использования

Полнотекстовый поиск по книгеИскать каждое упоминание персонажа, термина или даты в EPUB на 600 страниц через программу-читалку безнадёжно. Конвертируйте в TXT и ищите через grep, редактор или поисковую утилиту: результаты появляются мгновенно с номером строки и контекстом, а сам файл открывается на любой машине без программ для чтения книг.
Подача текста в языковую модель или NLP-конвейерЯзыковые модели, инструменты суммаризации, тематические модели и корпусные утилиты работают с простым текстом. Если сначала убрать XHTML-теги и CSS, вы не зальёте в модель разметочный шум, который зря расходует контекстное окно и искажает подсчёт токенов. Вывод в UTF-8 читается в Python одним вызовом open() — библиотека для разбора EPUB не нужна.
Точное цитированиеКопирование из читалки часто тянет за собой невидимое форматирование, заменённые типографские кавычки и дефисы на переносах строк. Извлечение в TXT возвращает символы в том виде, в каком они хранятся в книге: цитата аккуратно вставляется в работу, статью или файл субтитров, а полноту можно проверить подсчётом слов.
Синтез речи и производство аудиокнигДвижки TTS и инструменты для аудиокниг потребляют текст, а не EPUB. Сначала извлеките TXT, разделите его на главы по пустым строкам или заголовкам и отправьте в синтезатор. Удаление разметки заодно не даёт голосу зачитывать альтернативные тексты картинок или остатки CSS.
Чтение на устройстве без поддержки электронных книгСтарые телефоны, читалки с закрытой прошивкой, терминал, встраиваемое устройство, автомобильная мультимедиа — многие экраны показывают текстовый файл, но не открывают EPUB. Копия в TXT — это самый универсальный формат, который работает всегда, и достаточно малый, чтобы отправить его почтой или синхронизировать куда угодно.
Подготовка материала для перевода или субтитровCAT-инструменты и редакторы субтитров работают с текстовыми сегментами. Механическое извлечение заранее даёт переводчику стабильный файл-источник под контролем версий; сегментация выполняется один раз на простом тексте, а не в борьбе с вложенными XHTML-абзацами внутри EPUB.

Технические детали

Конвертацию выполняет консольная утилита ebook-convert из состава Calibre, которая на сервере вызывается как ebook-convert <вход.epub> <выход.txt> с параметром --txt-output-encoding utf-8, поэтому вывод всегда в UTF-8 независимо от того, какую кодировку декларирует исходный файл. Процесс состоит из трёх этапов.

Первый этап — разбор EPUB. EPUB это ZIP-архив, первая запись которого — несжатый файл mimetype с содержимым application/epub+zip, далее идёт META-INF/container.xml, указывающий на корневой .opf-файл пакета. В .opf три раздела: metadata (название, автор, язык и уникальный идентификатор, описанные элементами Dublin Core), manifest (перечень всех ресурсов пакета) и spine (порядок чтения). Парсер проходит по spine и загружает XHTML-документы по очереди. Именно поэтому текст выходит в порядке чтения, а не в порядке архива: последовательность задаёт spine, а не имена файлов.

Второй этап — сведение XHTML к тексту. Обходится DOM каждого документа, и сохраняются только текстовые узлы: от любого элемента — <p>, <h1>, <em>, <span>, <div> — остаётся только его текст, всё остальное отбрасывается. Блочные элементы превращаются в разделители абзацев, отсюда и пустые строки между абзацами в результате; встроенные стили просто теряются. Элементы без текста, такие как <img> и <hr>, исчезают полностью. Ссылки теряют адрес, но текст ссылки остаётся на месте: URL, написанный видимым текстом, выживает, а слово с гиперссылкой лишается стоящего за ним адреса.

Третий этап — сериализация: пробелы нормализуются, текст записывается в целевой кодировке, работа завершена. Стоит отметить два следствия. Первое: всё, что существует только как изображение, теряется. Отсканированная книга, комикс в EPUB с фиксированной вёрсткой (rendition:layout=pre-paginated) или книжка с картинками практически не содержат текстовых узлов, поэтому результат пустой или почти пустой. Второе: без разметки нет структуры. Правила разрыва страниц CSS, которыми пользуется конвейер PDF для разбиения на страницы, здесь бессмысленны, и границы глав сохраняются лишь как сам текст заголовка.

  • Движок: ebook-convert из Calibre, запускается на сервере как ebook-convert <вход.epub> <выход.txt> --txt-output-encoding utf-8
  • Контейнер EPUB: ZIP с несжатым mimetype (application/epub+zip), META-INF/container.xml указывает на корневой .opf, а сам .opf содержит metadata / manifest / spine
  • Порядок чтения задаёт spine, а не имена файлов и не порядок в ZIP — поэтому извлечённые главы идут в задуманной последовательности
  • Извлечение сохраняет только текстовые узлы: блочные элементы превращаются в разделители абзацев, встроенные стили отбрасываются, а элементы без текста (img, hr) исчезают
  • Потери заложены в саму идею: изображения, обложка, таблицы (ячейки сериализуются в сплошной текст), шрифты, цвета и иерархия оглавления не сохраняются; у ссылок остаётся только текст
  • Источники из одних картинок не проходят: у отсканированного EPUB или комикса с фиксированной вёрсткой нет текстовых узлов, поэтому результат пустой — сервис распознаёт пустой вывод и сообщает об ошибке вместо пустого файла
  • Вывод — обычный текст в UTF-8 с нормализованными пробелами; понятия страницы нет, поэтому номера страниц и настройки разбиения на страницы ни на что не влияют

Примеры

Поиск по всей книге

Конвертируйте EPUB в TXT, затем grep -n "слово" book.txt — и сразу к каждому вхождению с номером строки

Подготовить материал для подсказки языковой модели

Извлеките роман в TXT, разрежьте по пустым строкам и подавайте по главам в подсказку для суммаризации или перевода

Подсчёт слов и оценка времени чтения

wc -w book.txt после извлечения даёт точное число слов — из XHTML с разметкой внутри EPUB такого не получить

Подготовить текст для синтеза речи

Конвертируйте в TXT, чтобы убрать разметку, и отправьте чистый текст в движок TTS для озвучивания

Частые вопросы

Куда попадает мой файл EPUB?

Он загружается на сервер конвертации, обрабатывается утилитой ebook-convert из Calibre и возвращается вам как скачиваемый .txt. После завершения задачи файл не хранится, но относитесь ко всему загружаемому так, будто оно покинуло ваше устройство, и не отправляйте материалы, которыми не вправе делиться. Ссылка на скачивание — это временный идентификатор задачи, а не постоянный адрес.

Сохранятся ли изображения, обложка и оформление?

Нет. TXT в принципе не умеет передавать изображения, цвет, шрифты и выделения, поэтому конвертер сохраняет только символы: полужирный и курсив становятся обычным текстом, обложка и внутренние иллюстрации отбрасываются, стили CSS теряются. Разделители абзацев остаются в виде пустых строк — это единственная структура, которую простой текст может сохранить.

Почему TXT получился пустым или почему конвертация не удалась?

Почти всегда потому, что в книге нет извлекаемого текста. Отсканированные EPUB, комиксы и книжки с картинками в фиксированной вёрстке хранят каждую страницу как изображение, поэтому текстовых узлов для извлечения там нет. Сервис проверяет размер результата и сообщает об ошибке конвертации вместо того, чтобы отдать файл нулевого размера. Если EPUB нормально открывается в читалке, но из него ничего не извлекается, сначала прогоните страницы через OCR.

Почему TXT намного меньше EPUB?

Потому что текст — самая малая часть электронной книги. Типичный EPUB содержит обложку, внутренние иллюстрации и файлы встроенных шрифтов, а это сжатые двоичные данные; собственно слова романа занимают всего несколько сотен килобайт. Уменьшение на 80–95 % совершенно нормально, и точное соотношение показано в панели результата.

Что происходит с оглавлением и заголовками глав?

Оглавление не воссоздаётся как оглавление — в TXT такого понятия нет — но текст заголовков обычно сохраняется на своих местах в порядке чтения. Записи из nav.xhtml или toc.ncx остаются только тогда, когда те же строки встречаются в содержимом как видимый текст. На практике файл разрезают по пустым строкам или по шаблону заголовков, восстанавливая структуру глав вручную.

Можно ли конвертировать EPUB с DRM?

Нет. Книги, зашифрованные Adobe ADEPT, Apple FairPlay или DRM от Amazon, конвертер открыть не может: содержимое зашифровано, и разбор обрывается, не дойдя до текста. Используйте EPUB без DRM, полученный законным путём: самостоятельно сверстанную книгу, произведение в общественном достоянии или файл, на конвертацию которого у вас есть явное разрешение.

Какие ещё форматы электронных книг можно конвертировать в TXT?

Серверная точка входа TXT принимает всего 15 входных форматов: epub, mobi, azw3, azw, fb2, lit, prc, pdb, html, htm, xhtml, rtf, odt, docx и snb. Однако на этом сайте каждому формату отведена отдельная страница — чтобы проверка при загрузке и сообщения об ошибках соответствовали тому, что вы действительно конвертируете. Эта страница работает только с .epub.

Есть ли ограничение на число конвертаций?

Да. Точка входа ограничена двумя запросами в минуту на IP-адрес, счёт общий для всех конвертаций электронных книг. Для обычного использования этого с запасом хватает — ограничение нужно, чтобы скрипт не заваливал сервер, — а при превышении достаточно подождать минуту.

В какой кодировке выводится файл и работает ли текст на китайском и японском?

Вывод всегда в UTF-8: это принудительно задаёт параметр --txt-output-encoding utf-8, поэтому китайский, японский, корейский, кириллица, греческий и латиница с диакритикой проходят без потерь. Если после скачивания символы выглядят как мусор, дело в определении кодировки вашим редактором, а не в файле — переключите его в UTF-8 вручную.

Похожие инструменты

Конвертер EPUB в PDF

Бесплатный онлайн-конвертер EPUB в PDF. Превращает электронные книги EPUB в PDF-документы со стабильной вёрсткой, сохраняя главы, изображения и шрифты.

Конвертер MOBI в EPUB

Бесплатный онлайн-конвертер MOBI в EPUB. Переводит Kindle-книги MOBI в универсальный перекомпонуемый формат EPUB, сохраняя главы, обложку и иллюстрации.

Конвертер MOBI в PDF

Бесплатный онлайн-конвертер MOBI в PDF. Превращает электронные книги MOBI для Kindle в PDF-документы со стабильной вёрсткой, сохраняя главы

Конвертер AZW3 в PDF

Бесплатный онлайн-конвертер AZW3 в PDF. Превращает книги AZW3 (KF8) Kindle в PDF со стабильной вёрсткой, сохраняя главы, изображения и шрифты.

Конвертер PDF в Word

Бесплатный онлайн-конвертер PDF в Word. Выходной формат .docx или .doc, конвертация в один клик, сохранение макета и изображений.

Конвертер Word в PDF

Бесплатный онлайн-конвертер Word в PDF. Поддерживает форматы .docx и .doc с конвертацией в один клик