ToolAct

EPUB-zu-TXT-Konverter

Lade ein EPUB-E-Book hoch und extrahiere den vollständigen Text als reine UTF-8-Textdatei (.txt)

E-Book hochladen

EPUB-Datei hierher ziehen oder klicken zum Auswählen

Unterstützt .epub-Format (ohne DRM), maximal 3MB

Was ist EPUB zu TXT?

EPUB zu TXT extrahiert den lesbaren Text aus einem EPUB-E-Book und schreibt ihn als einfache Textdatei heraus. EPUB ist ein Paketformat: Die eigentlichen Wörter stecken in XHTML-Dokumenten innerhalb eines ZIP-Containers, umhüllt von CSS, Schriften, Bildern und Navigationsdateien. Eine .txt-Datei behält nur die Buchstaben - kein Markup, keine Formatierung, kein Layout. Du bekommst einen sauberen, fortlaufenden Text, den jedes Programm lesen kann.

Das ist deshalb so nützlich, weil Klartext das einzige Format ist, das wirklich alles versteht: grep und Volltextsuche, Python- und R-Skripte für Text Mining, Wortzählungen, Übersetzungswerkzeuge, Prompts für Sprachmodelle, Sprachsynthese und jedes Gerät oder Programm, das E-Book-Formate gar nicht unterstützt. Wer eine ganze Bibliothek durchsuchen, Passagen exakt zitieren oder einen Roman in ein Sprachmodell einspeisen will, beginnt immer mit demselben Schritt: den Text zuerst aus dem E-Book-Container herausholen.

Verstehe aber den Kompromiss, bevor du konvertierst: TXT ist ein verlustbehaftetes Zielformat. Bilder, Cover, die Hierarchie des Inhaltsverzeichnisses, Fett- und Kursivschrift, Tabellen, verlinkte Fußnoten und eingebettete Schriften verschwinden oder zerfallen zu fortlaufendem Text; nur die Zeichen überleben, getrennt durch Zeilenumbrüche und Leerzeilen. Seitenzahlen haben ebenfalls keine Bedeutung, denn Klartext kennt keine Seiten. Wenn das Buch wie ein Buch aussehen soll, nimm stattdessen einen EPUB-zu-PDF-Konverter - TXT ist die richtige Wahl, wenn du die Wörter brauchst und nicht die Seiten.

So verwendest du es

Vorgehen

  1. Klicke auf den Upload-Bereich oder ziehe eine EPUB-Datei hinein - nur .epub wird unterstützt, bis 3MB
  2. Klicke auf „Zu TXT konvertieren“, der Server extrahiert den Text mit Calibre in wenigen Sekunden
  3. Sobald das Ergebnis-Panel die Größenänderung zeigt, klicke auf „TXT herunterladen“
  4. Noch ein Buch? Mit „Weitere Datei konvertieren“ setzt du das Panel zurück

Vor der Konvertierung prüfen

  • Achte auf die Größenänderung im Ergebnis-Panel: Eine starke Schrumpfung ist normal (Bilder und Schriften entfallen), aber nur wenige hundert Byte bedeuten meist, dass die EPUB kaum Text enthielt.
  • Öffne die heruntergeladene TXT einmal in einem UTF-8-fähigen Editor. Sehen Akzente oder CJK-Zeichen falsch aus, ist die Kodierungserkennung des Editors schuld - die Datei selbst ist UTF-8.
  • Wenn du Layout, Cover oder Bilder des Buchs brauchst, konvertiere stattdessen zu PDF; TXT verwirft all das bewusst.

Anwendungsfälle

Ein ganzes Buch per Volltextsuche durchsuchenIn einem 600-seitigen EPUB jede Erwähnung einer Figur, eines Fachbegriffs oder Datums zu finden, ist mit einer Lese-App aussichtslos. Als TXT durchsuchst du die Datei mit grep, deinem Editor oder einem Suchwerkzeug: Treffer erscheinen sofort mit Zeilennummer und Kontext, und du kannst dieselbe Datei auf jedem Rechner ohne Reader-Software öffnen.
Text in ein Sprachmodell oder eine NLP-Pipeline einspeisenLLMs, Zusammenfassungsdienste, Topic-Modelle und Korpuswerkzeuge arbeiten alle mit Klartext. Wenn du vorher XHTML-Tags und CSS entfernst, fütterst du das Modell nicht mit Markup-Rauschen, das Kontextfenster verschwendet und die Token-Zählung verfälscht. Die UTF-8-Ausgabe lässt sich in Python mit einem einzigen open() laden - ganz ohne EPUB-Bibliothek.
Exakt zitierenBeim Kopieren aus einer Lese-App wandern oft unsichtbare Formatierungen, ersetzte typografische Anführungszeichen und Trennstriche am Zeilenende mit. Eine TXT-Extraktion liefert die Zeichen so, wie sie im Buch gespeichert sind; Zitate landen sauber in einer Hausarbeit, einem Blogbeitrag oder einer Untertiteldatei, und du kannst die Wortzahl zur Kontrolle nutzen.
Sprachsynthese und HörbuchproduktionTTS-Engines und Hörbuchwerkzeuge verarbeiten Text, nicht EPUB. Extrahiere zuerst die TXT, teile sie an Leerzeilen oder Überschriften in Kapitel und gib sie dann an die Synthese weiter. Das Entfernen des Markups verhindert außerdem, dass die Vorlesestimme Bild-Alt-Texte oder CSS-Reste vorliest.
Auf Geräten ohne E-Book-Unterstützung lesenAlte Handys, E-Ink-Reader mit geschlossener Firmware, ein Terminal, ein eingebettetes Gerät, ein Autoradio - viele Bildschirme zeigen Textdateien an, öffnen aber keine EPUB. Eine TXT-Kopie ist das universellste Format, das immer funktioniert, und klein genug, um sie überallhin zu mailen oder zu synchronisieren.
Material für Übersetzung oder Untertitel vorbereitenCAT-Tools und Untertiteleditoren arbeiten mit Textsegmenten. Eine mechanische Extraktion liefert Übersetzenden eine stabile, versionierbare Quelldatei; die Segmentierung erfolgt dann einmal am Klartext, statt gegen die verschachtelten XHTML-Absätze im EPUB anzukämpfen.

Technischer Hintergrund

Die Konvertierung übernimmt Calibres Kommandozeilenwerkzeug ebook-convert, das serverseitig als ebook-convert <eingabe.epub> <ausgabe.txt> mit --txt-output-encoding utf-8 aufgerufen wird. Die Ausgabe ist damit immer UTF-8, unabhängig davon, welche Kodierung die Originaldatei deklariert. Die Verarbeitung läuft in drei Stufen.

Erstens wird die EPUB geparst. Eine EPUB ist ein ZIP-Archiv, dessen erster Eintrag eine unkomprimierte mimetype-Datei mit dem Inhalt application/epub+zip ist, gefolgt von META-INF/container.xml, das auf die .opf-Paketdatei im Wurzelverzeichnis zeigt. Die .opf enthält drei Abschnitte: metadata (Titel, Autor, Sprache und eine eindeutige Kennung als Dublin-Core-Elemente), manifest (Auflistung aller Ressourcen des Pakets) und spine (Definition der Lesereihenfolge). Der Parser geht den spine durch und lädt jedes XHTML-Inhaltsdokument der Reihe nach. Deshalb erscheint der Text in Lesereihenfolge und nicht in Archivreihenfolge - die Reihenfolge bestimmt der spine, nicht der Dateiname.

Zweitens wird das XHTML auf Text reduziert. Der DOM jedes Inhaltsdokuments wird durchlaufen und nur Textknoten bleiben erhalten. Von jedem Element - <p>, <h1>, <em>, <span>, <div> - bleibt nur sein Text übrig, alles andere entfällt. Blockelemente werden in Absatzumbrüche übersetzt, woraus die Leerzeilen zwischen den Absätzen in der Ausgabe entstehen; Inline-Formatierungen werden schlicht verworfen. Elemente ohne Textinhalt wie <img> und <hr> verschwinden vollständig. Links verlieren ihr Ziel, ihr Ankertext bleibt jedoch an Ort und Stelle. Als sichtbarer Text ausgeschriebene URLs überleben also, während ein verlinktes Wort die Adresse dahinter verliert.

Drittens wird das Ergebnis serialisiert: Leerraum wird normalisiert, der Text in der Zielkodierung geschrieben, fertig. Zwei Konsequenzen sind erwähnenswert. Alles, was nur als Bild existiert, ist verloren: Ein gescanntes Buch, ein Comic im Fixed-Layout-EPUB (rendition:layout=pre-paginated) oder ein Bilderbüchlein hat praktisch keine Textknoten, die Ausgabe ist also leer oder nahezu leer. Und ohne Markup gibt es keine Struktur: Die CSS-Umbruchregeln, mit denen die PDF-Pipeline paginiert, sind hier bedeutungslos, sodass Kapitelgrenzen nur als der Überschriftstext selbst überleben.

  • Engine: Calibres ebook-convert, serverseitig ausgeführt als ebook-convert <eingabe.epub> <ausgabe.txt> --txt-output-encoding utf-8
  • EPUB-Container: ZIP mit unkomprimiertem mimetype (application/epub+zip), META-INF/container.xml auf die Wurzel-.opf zeigend, und die .opf mit metadata / manifest / spine
  • Die Lesereihenfolge bestimmt der spine, nicht Dateinamen oder ZIP-Reihenfolge - deshalb erscheinen die extrahierten Kapitel in der vorgesehenen Abfolge
  • Die Extraktion behält nur Textknoten: Blockelemente werden zu Absatzumbrüchen, Inline-Stile entfallen, und Elemente ohne Zeichendaten (img, hr) verschwinden
  • Verlustbehaftet per Design: Bilder, Cover, Tabellen (Zellen als fortlaufenden Text serialisiert), Schriften, Farben und TOC-Hierarchie überleben nicht; Links behalten nur ihren Ankertext
  • Reine Bildquellen scheitern: Ein gescanntes EPUB oder ein Comic im Fixed-Layout hat keine Textknoten, die Ausgabe bleibt leer - der Dienst erkennt das leere Ergebnis und meldet einen Fehler, statt eine leere Datei auszuliefern
  • Ausgabe ist UTF-8-Klartext mit normalisiertem Leerraum; es gibt keinen Seitenbegriff, daher haben Seitenzahlen und Paginierungseinstellungen keine Wirkung

Beispiele

Ein ganzes Buch durchsuchen

EPUB zu TXT konvertieren, dann grep -n "Schlagwort" book.txt und direkt zu jeder Fundstelle mit Zeilennummer springen

Quellmaterial für einen LLM-Prompt bauen

Einen Roman zu TXT extrahieren, an Leerzeilen teilen und kapitelweise in einen Zusammenfassungs- oder Übersetzungs-Prompt laden

Wörter zählen und Lesezeit schätzen

Nach der Extraktion liefert wc -w book.txt eine saubere Wortzahl - aus dem markierten XHTML der EPUB ist das nicht verlässlich möglich

Text für eine TTS-Engine vorbereiten

Zu TXT konvertieren, um das Markup zu entfernen, und den sauberen Text an eine Sprachsynthese geben

Häufige Fragen

Wohin geht meine EPUB-Datei?

Sie wird auf den Konvertierungsserver hochgeladen, mit Calibres ebook-convert verarbeitet und du bekommst sie als .txt-Download zurück. Nach Abschluss des Auftrags wird die Datei nicht aufbewahrt. Behandle trotzdem alles, was du hochlädst, als hätte es dein Gerät verlassen, und sende kein Material, das du nicht teilen darfst. Der Download-Link ist eine temporäre Task-ID, keine dauerhafte URL.

Bleiben Bilder, Cover und Formatierung erhalten?

Nein. TXT kann Bilder, Farben, Schriften und Betonungen nicht darstellen. Der Konverter behält nur die Zeichen: Fett und Kursiv werden zu normalem Text, Cover und eingebettete Abbildungen entfallen, CSS-Formatierungen werden verworfen. Absatzumbrüche bleiben als Leerzeilen erhalten - die einzige Struktur, die Klartext überhaupt abbilden kann.

Warum ist meine TXT leer oder warum schlägt die Konvertierung fehl?

Fast immer, weil das Buch keinen extrahierbaren Text enthält. Gescannte EPUBs, Comics und Bilderbücher mit festem Layout speichern jede Seite als Bild, es gibt also keine Textknoten zum Extrahieren. Der Dienst prüft die Ausgabegröße und meldet einen Konvertierungsfehler, statt dir eine Datei mit null Bytes zu geben. Wenn deine EPUB im Reader einwandfrei aussieht, aber nichts extrahiert wird, lass die Seiten zuerst per OCR erkennen.

Warum ist die TXT so viel kleiner als die EPUB?

Weil Text der kleinste Teil eines E-Books ist. Eine typische EPUB enthält Cover, eingebettete Abbildungen und Schriftdateien, alles komprimierte Binärdaten. Die eigentlichen Wörter eines Romans machen nur wenige hundert Kilobyte aus. Eine Schrumpfung um 80-95 % ist völlig normal, und das Ergebnis-Panel zeigt das genaue Verhältnis.

Was passiert mit Inhaltsverzeichnis und Kapitelüberschriften?

Das Inhaltsverzeichnis wird nicht als Verzeichnis neu erzeugt - TXT kennt das nicht -, aber der Überschriftstext selbst bleibt meist an seiner Stelle in Lesereihenfolge erhalten. Einträge aus nav.xhtml oder toc.ncx überleben nur, wenn sie auch im Inhalt als sichtbarer Text vorkommen. Praktisch zerlegst du die Datei an Leerzeilen oder an Überschriftenmustern und baust die Kapitelstruktur selbst nach.

Kann ich eine DRM-geschützte EPUB konvertieren?

Nein. Mit Adobe ADEPT, Apple FairPlay oder Amazon-DRM verschlüsselte Bücher kann der Konverter nicht öffnen - der Inhalt ist verschlüsselt und das Parsen scheitert, bevor überhaupt Text gelesen wird. Verwende eine DRM-freie EPUB, die du legal erworben hast: ein selbst erstelltes Buch, ein gemeinfreies Werk oder eine Datei, für die du ausdrücklich eine Konvertierungserlaubnis hast.

Welche anderen E-Book-Formate lassen sich zu TXT konvertieren?

Der serverseitige TXT-Endpunkt akzeptiert insgesamt 15 Eingabeformate: epub, mobi, azw3, azw, fb2, lit, prc, pdb, html, htm, xhtml, rtf, odt, docx und snb. Auf dieser Website bekommt jedes Format jedoch eine eigene Seite, damit Upload-Validierung und Fehlermeldungen zu dem passen, was du tatsächlich konvertierst. Diese Seite verarbeitet nur .epub.

Gibt es ein Limit für die Anzahl der Konvertierungen?

Ja. Der Endpunkt ist auf 2 Anfragen pro Minute pro IP-Adresse begrenzt, gezählt über alle E-Book-Konvertierungen hinweg. Für normale Nutzung ist das großzügig - die Grenze soll verhindern, dass ein Skript den Server belastet - und wer sie erreicht, wartet einfach eine Minute.

Welche Kodierung hat die Ausgabe, und funktioniert CJK-Text?

Die Ausgabe ist immer UTF-8, erzwungen durch das Argument --txt-output-encoding utf-8. Chinesischer, japanischer, koreanischer, kyrillischer, griechischer und akzentuierter lateinischer Text kommt also vollständig durch. Wenn die Zeichen nach dem Download als Kauderwelsch erscheinen, liegt das an der erkannten Kodierung deines Editors, nicht an der Datei - stell sie manuell auf UTF-8.