ToolAct

EPUB to TXT 変換ツール

EPUB 電子書籍をアップロードして、本文全文を UTF-8 のプレーンテキスト(.txt)として抽出

電子書籍をアップロード

EPUB ファイルをここにドロップ、またはクリックして選択

対応形式:.epub(DRM なし)、最大 3MB

EPUB to TXT とは

EPUB to TXT は、EPUB 電子書籍から本文だけを取り出し、プレーンテキストファイルとして書き出すツールです。EPUB は本質的に圧縮アーカイブで、実際の文章はその中の XHTML 文書に入っており、さらに CSS・フォント・画像・目次などのリソースに包まれています。一方 .txt は文字そのものだけを保持します。マークアップもスタイルもレイアウトもありません。手に入るのは、どんなプログラムでもそのまま読める、飾りのない連続したテキストです。

これが役立つのは、プレーンテキストが「何にでも通じる」唯一の形式だからです。grep や全文検索、Python や R によるテキストマイニング、文字数カウント、翻訳ツール、大規模言語モデルのプロンプト、音声合成、そして電子書籍形式にまったく対応していない端末やアプリ。書庫全体を全文検索したい、一節を正確に引用したい、小説を言語モデルに読ませたい——どの作業でも最初の一歩はほぼ同じで、まず電子書籍のコンテナから文字を取り出すことです。

ただし、変換前にトレードオフを理解しておいてください。TXT は「不可逆な」出力形式です。挿絵、表紙、目次の階層、太字や斜体、表、脚注のリンク、埋め込みフォントはすべて消えるか、流れる本文に溶けてしまいます。残るのは文字だけで、改行と空行で区切られます。ページ番号も意味を持ちません。プレーンテキストに「ページ」という概念はないからです。本としての見た目が必要なら EPUB to PDF を使ってください。TXT が正解になるのは、ページではなく文字が欲しいときです。

使い方

手順

  1. アップロード領域をクリックするか、EPUB ファイルをドラッグ&ドロップします(対応は .epub のみ、最大 3MB)
  2. 「TXT に変換」をクリックすると、サーバー側で Calibre が数秒で本文を抽出します
  3. 結果パネルにサイズ変化が表示されたら、「TXT をダウンロード」をクリックして保存します
  4. 別の本も変換する場合は「別のファイルを変換」でパネルをリセットできます

変換前に確認したいこと

  • 結果パネルのサイズ変化に注目してください。大きく減るのは正常です(画像とフォントが消えるため)。ただし数百バイトしかない場合は、その EPUB にテキストがほとんど含まれていなかったことを意味します。
  • ダウンロード後、まず UTF-8 対応のエディタで一度開いてください。アクセント記号や日本語が化けて見える場合はエディタの文字コード判定の問題で、ファイル自体は UTF-8 です。
  • 本のレイアウト、表紙、挿絵が必要な場合は PDF への変換を使ってください。TXT はそれらを意図的に捨てる形式です。

活用例

1 冊まるごと全文検索する600 ページの EPUB から特定の登場人物名や用語、日付のすべての出現箇所を探すのは、リーダーアプリでは現実的ではありません。TXT に変換すれば grep やエディタ、検索ツールで一発です。行番号と前後の文脈付きで即座に結果が返り、しかもリーダーソフトを一切インストールしていない端末でも開けます。
言語モデルや NLP パイプラインに渡すLLM、要約ツール、トピックモデル、コーパス処理ツールの入力はすべてプレーンテキストです。先に XHTML タグと CSS を落としておけば、マークアップのノイズを混ぜずに済みます。ノイズはコンテキストウィンドウを無駄に消費し、トークン数の見積もりも狂わせます。UTF-8 の出力は Python なら open() ひとつで読め、EPUB パーサのライブラリは不要です。
正確に引用するリーダーアプリからのコピーは、目に見えない書式、置換されたスマートクォート、行末で入ったハイフンなどを一緒に付いてくることがあります。TXT として抽出した文字は本に格納されているそのままの文字なので、論文・ブログ・字幕ファイルに貼っても崩れません。文字数で引用が欠けていないか確認もできます。
音声合成・オーディオブック制作TTS エンジンやオーディオブック制作ツールが食べるのはテキストであって EPUB ではありません。まず TXT に抽出し、空行や見出し記号で章ごとに分割してから合成エンジンに渡します。マークアップを落とす副次的な効果として、読み上げが画像の代替テキストや CSS の残骸を読み上げてしまう事態も防げます。
リーダー非対応の端末で読む古いスマートフォン、ファームウェアが固定された古い電子ペーパー端末、ターミナル、組み込み機器、カーナビ——テキストファイルは表示できても EPUB は開けない画面はたくさんあります。TXT はもっとも敷居が低く、必ず使える形式であり、メール添付や同期ができる程度には小さいサイズに収まります。
翻訳や字幕の素材を整えるCAT ツールや字幕エディタはテキストのセグメント単位で動きます。先に機械的に抽出しておけば、翻訳者には安定していてバージョン管理もしやすいソースファイルを渡せます。文の分割作業もプレーンテキスト上で一度だけ行えばよく、EPUB 内の入れ子になった XHTML 段落と格闘する必要はありません。

技術的な仕組み

変換は Calibre のコマンドラインツール ebook-convert が行います。サーバー側では ebook-convert <入力.epub> <出力.txt> に --txt-output-encoding utf-8 を付けて実行されるため、元のファイルがどの文字コードを宣言していても出力は常に UTF-8 になります。処理は 3 段階です。

第 1 段階は EPUB の解析です。EPUB は ZIP アーカイブで、最初のエントリは非圧縮の mimetype ファイル(中身は application/epub+zip)、続いてアーカイブ直下の .opf を指す META-INF/container.xml が入ります。.opf には 3 つの要素があります。metadata(Dublin Core 要素でタイトル・著者・言語・一意な識別子を記述)、manifest(パッケージ内の全リソースの一覧)、spine(本文の読み順を定義)です。パーサは spine に従って XHTML 本文文書を順に読み込みます。テキストがアーカイブ内の順序ではなく読み順で出てくるのはこのためで、順序を決めるのはファイル名ではなく spine です。

第 2 段階は XHTML からテキストだけを取り出す処理です。各本文文書の DOM を走査し、テキストノードだけを残します。<p>、<h1>、<em>、<span>、<div> などの要素は自分の文字データしか残さず、それ以外はすべて捨てられます。ブロックレベル要素は段落区切りに変換され、これが出力中の段落間の空行になります。インラインのスタイルは単純に捨てられます。文字を持たない要素(<img> や <hr>)は完全に消えます。リンクはリンク先を失いますが、アンカーテキストはその位置に残ります。つまり、URL をそのまま文字として書いてあれば残り、語にリンクが張られている場合はリンク先が失われます。

第 3 段階はシリアライズです。空白文字を正規化し、対象の文字コードでファイルを書き出して完了です。気をつけたい点が 2 つあります。ひとつは、画像としてしか存在しない内容はすべて失われることです。スキャンした書籍、固定レイアウト EPUB(rendition:layout=pre-paginated)のコミック、絵本にはテキストノードがほとんど存在しないため、出力は空かほぼ空になります。もうひとつは、マークアップがなければ構造も残らないという点です。PDF の処理でページ分割に使われる CSS の改ページ指定はここでは無意味で、章の境界は見出しのテキストそのものとしてしか残りません。

  • エンジン:Calibre の ebook-convert。サーバー側で ebook-convert <入力.epub> <出力.txt> --txt-output-encoding utf-8 として実行
  • EPUB コンテナ:非圧縮の mimetype(application/epub+zip)と、ルートの .opf を指す META-INF/container.xml を含む ZIP。.opf は metadata / manifest / spine の 3 要素
  • 読み順を決めるのは spine であり、ファイル名や ZIP 内の順序ではない。抽出した章が本来の順序で並ぶのはこのため
  • テキスト抽出で残るのはテキストノードだけ。ブロック要素は段落区切りになり、インラインのスタイルは捨てられ、文字を持たない要素(img、hr)は消える
  • 設計上不可逆:画像、表紙、表(セルは流れるテキストとして直列化)、フォント、色、目次の階層は残らない。リンクはアンカーテキストだけが残る
  • 画像だけの書籍は失敗する。スキャンした EPUB や固定レイアウトのコミックにはテキストノードがなく出力は空になる。サービスは空の結果を検出し、空ファイルを渡さず失敗として報告する
  • 出力は空白を正規化した UTF-8 プレーンテキスト。ページという概念がないため、ページ番号やページ分割の設定は影響しない

使用例

1 冊を全文検索

EPUB を TXT に変換し、grep -n "キーワード" book.txt で出現箇所と行番号へ一気にジャンプ

LLM プロンプトの素材を作る

小説を TXT に抽出し、空行で分割して章ごとに要約や翻訳のプロンプトへ投入

文字数と読了時間を見積もる

抽出後に wc -w book.txt で正確な語数を取得。マークアップ付きの XHTML を直接数えても正確には出ません

音声合成用のテキストを用意する

TXT に変換してマークアップを落とし、きれいなテキストを TTS エンジンへ渡して音声化

よくある質問

アップロードした EPUB はどこへ送られますか?

変換サーバーへアップロードされ、Calibre の ebook-convert で処理された後、.txt のダウンロードとして返されます。処理終了後にファイルは保持されませんが、アップロードした内容は端末から出たものとして扱い、共有が許されていない資料は送らないでください。ダウンロード用のリンクは一時的なタスク ID であり、恒久的な URL ではありません。

画像・表紙・書式は保持されますか?

保持されません。TXT は画像・色・フォント・強調を表現する手段を持たないため、変換器は文字だけを残します。太字や斜体は普通の文字になり、表紙や挿絵は破棄され、CSS のスタイルもすべて捨てられます。段落の区切りは空行として残りますが、これはプレーンテキストで表現できる唯一の構造です。

TXT が空になった、または変換に失敗するのはなぜですか?

ほとんどの場合、その本に抽出できる文字が入っていないためです。スキャンした EPUB、コミック、固定レイアウトの絵本は各ページを画像として保存しているため、抽出できるテキストノードがありません。サービスは出力サイズを検査し、空の場合は 0 バイトのファイルを返さず変換失敗として報告します。リーダーでは問題なく表示されるのに何も抽出できない場合は、先にページへ OCR をかけてください。

TXT が元の EPUB よりずっと小さいのはなぜですか?

電子書籍の中で文字が占める割合はごくわずかだからです。一般的な EPUB には表紙、挿絵、埋め込みフォントが含まれており、これらは圧縮されたバイナリデータです。小説の本文そのものは数百 KB 程度しかありません。80〜95% の減少は完全に正常で、正確な比率は結果パネルに表示されます。

目次や章の見出しはどうなりますか?

目次は目次として再生成されません(TXT にその概念がないため)が、見出しのテキスト自体は通常その位置に読み順で残ります。nav.xhtml や toc.ncx の項目が残るのは、同じ文字列が本文中にも可視テキストとして現れている場合だけです。実用上は、空行や章見出しのパターンでファイルを分割し、章構造を自分で復元することになります。

DRM で保護された EPUB も変換できますか?

できません。Adobe ADEPT、Apple FairPlay、Amazon の DRM で施錠された本は変換器が開けません。内容が暗号化されているため、文字に到達する前に解析が失敗します。自分で作成した電子書籍、パブリックドメインの作品、変換が明確に許可されているファイルなど、正規に入手した DRM なしの EPUB をご利用ください。

TXT に変換できる電子書籍形式は他にありますか?

サーバー側の TXT エンドポイントは合計 15 形式に対応しています。epub、mobi、azw3、azw、fb2、lit、prc、pdb、html、htm、xhtml、rtf、odt、docx、snb です。ただし本サイトでは形式ごとに専用ページを用意しており、アップロード時の検証とエラーメッセージが実際に変換する形式と一致するようにしています。このページが扱うのは .epub のみです。

変換回数に制限はありますか?

あります。変換エンドポイントは IP 単位で 1 分あたり 2 リクエストに制限されており、電子書籍の変換全体でカウントを共有します。通常利用には十分な上限で、スクリプトによる連打を防ぐためのものです。抵触した場合は 1 分待てば解除されます。

出力の文字コードは?日本語も問題ありませんか?

出力は --txt-output-encoding utf-8 によって常に UTF-8 に固定されるため、日本語・中国語・韓国語・キリル文字・ギリシャ文字・アクセント付きラテン文字もそのまま保持されます。ダウンロード後に文字化けする場合はエディタの文字コード判定の問題で、ファイル自体は正しいので、エディタを手動で UTF-8 に切り替えてください。

関連ツール

EPUB PDF変換ツール

オンラインEPUB PDF変換ツール。電子書籍のEPUBファイルをレイアウトが安定したPDFに変換し、章立て・画像・フォントを保持。印刷やアーカイブに最適、変換後にファイルは自動的に削除されます。

MOBI EPUB変換ツール

オンラインMOBI EPUB変換ツール。KindleのMOBI電子書籍を汎用的なリフロー型EPUB標準形式に変換し、章立て・表紙・画像を保持。KoboやApple Booksなど各種リーダーに直接取り込め、変換後にファイルは自動的に削除されます。

MOBI PDF変換ツール

オンラインMOBI PDF変換ツール。KindleのMOBI電子書籍をレイアウトが安定したPDFに変換し、章立て・画像・テキストを保持。印刷やアーカイブに最適、変換後にファイルは自動的に削除されます。

AZW3 PDF変換ツール

オンラインAZW3 PDF変換ツール。KindleのAZW3(KF8)電子書籍をレイアウトが安定したPDFに変換し、章立て・画像・フォント・書式を保持。印刷やアーカイブに最適、変換後にファイルは自動的に削除されます。

PDF → Word 変換ツール

オンラインPDF→Word変換ツール。.docxまたは.doc形式で出力。ワンクリック変換、レイアウトと画像を保持。変換後にファイルは自動削除されます。

Word → PDF 変換ツール

オンラインWord→PDF変換ツール。.docxと.doc形式に対応。ワンクリック変換、元のレイアウト保持、PDFサイズ自動最適化。変換後にファイルは自動削除されます。