EPUB-zu-TXT-Konverter
Lade ein EPUB-E-Book hoch und extrahiere den vollständigen Text als reine UTF-8-Textdatei (.txt)
EPUB-Datei hierher ziehen oder klicken zum Auswählen
Unterstützt .epub-Format (ohne DRM), maximal 3MB
Was ist EPUB zu TXT?
EPUB zu TXT extrahiert den lesbaren Text aus einem EPUB-E-Book und schreibt ihn als einfache Textdatei heraus. EPUB ist ein Paketformat: Die eigentlichen Wörter stecken in XHTML-Dokumenten innerhalb eines ZIP-Containers, umhüllt von CSS, Schriften, Bildern und Navigationsdateien. Eine .txt-Datei behält nur die Buchstaben - kein Markup, keine Formatierung, kein Layout. Du bekommst einen sauberen, fortlaufenden Text, den jedes Programm lesen kann.
Das ist deshalb so nützlich, weil Klartext das einzige Format ist, das wirklich alles versteht: grep und Volltextsuche, Python- und R-Skripte für Text Mining, Wortzählungen, Übersetzungswerkzeuge, Prompts für Sprachmodelle, Sprachsynthese und jedes Gerät oder Programm, das E-Book-Formate gar nicht unterstützt. Wer eine ganze Bibliothek durchsuchen, Passagen exakt zitieren oder einen Roman in ein Sprachmodell einspeisen will, beginnt immer mit demselben Schritt: den Text zuerst aus dem E-Book-Container herausholen.
Verstehe aber den Kompromiss, bevor du konvertierst: TXT ist ein verlustbehaftetes Zielformat. Bilder, Cover, die Hierarchie des Inhaltsverzeichnisses, Fett- und Kursivschrift, Tabellen, verlinkte Fußnoten und eingebettete Schriften verschwinden oder zerfallen zu fortlaufendem Text; nur die Zeichen überleben, getrennt durch Zeilenumbrüche und Leerzeilen. Seitenzahlen haben ebenfalls keine Bedeutung, denn Klartext kennt keine Seiten. Wenn das Buch wie ein Buch aussehen soll, nimm stattdessen einen EPUB-zu-PDF-Konverter - TXT ist die richtige Wahl, wenn du die Wörter brauchst und nicht die Seiten.
So verwendest du es
Vorgehen
- Klicke auf den Upload-Bereich oder ziehe eine EPUB-Datei hinein - nur .epub wird unterstützt, bis 3MB
- Klicke auf „Zu TXT konvertieren“, der Server extrahiert den Text mit Calibre in wenigen Sekunden
- Sobald das Ergebnis-Panel die Größenänderung zeigt, klicke auf „TXT herunterladen“
- Noch ein Buch? Mit „Weitere Datei konvertieren“ setzt du das Panel zurück
Vor der Konvertierung prüfen
- Achte auf die Größenänderung im Ergebnis-Panel: Eine starke Schrumpfung ist normal (Bilder und Schriften entfallen), aber nur wenige hundert Byte bedeuten meist, dass die EPUB kaum Text enthielt.
- Öffne die heruntergeladene TXT einmal in einem UTF-8-fähigen Editor. Sehen Akzente oder CJK-Zeichen falsch aus, ist die Kodierungserkennung des Editors schuld - die Datei selbst ist UTF-8.
- Wenn du Layout, Cover oder Bilder des Buchs brauchst, konvertiere stattdessen zu PDF; TXT verwirft all das bewusst.
Anwendungsfälle
Technischer Hintergrund
Die Konvertierung übernimmt Calibres Kommandozeilenwerkzeug ebook-convert, das serverseitig als ebook-convert <eingabe.epub> <ausgabe.txt> mit --txt-output-encoding utf-8 aufgerufen wird. Die Ausgabe ist damit immer UTF-8, unabhängig davon, welche Kodierung die Originaldatei deklariert. Die Verarbeitung läuft in drei Stufen.
Erstens wird die EPUB geparst. Eine EPUB ist ein ZIP-Archiv, dessen erster Eintrag eine unkomprimierte mimetype-Datei mit dem Inhalt application/epub+zip ist, gefolgt von META-INF/container.xml, das auf die .opf-Paketdatei im Wurzelverzeichnis zeigt. Die .opf enthält drei Abschnitte: metadata (Titel, Autor, Sprache und eine eindeutige Kennung als Dublin-Core-Elemente), manifest (Auflistung aller Ressourcen des Pakets) und spine (Definition der Lesereihenfolge). Der Parser geht den spine durch und lädt jedes XHTML-Inhaltsdokument der Reihe nach. Deshalb erscheint der Text in Lesereihenfolge und nicht in Archivreihenfolge - die Reihenfolge bestimmt der spine, nicht der Dateiname.
Zweitens wird das XHTML auf Text reduziert. Der DOM jedes Inhaltsdokuments wird durchlaufen und nur Textknoten bleiben erhalten. Von jedem Element - <p>, <h1>, <em>, <span>, <div> - bleibt nur sein Text übrig, alles andere entfällt. Blockelemente werden in Absatzumbrüche übersetzt, woraus die Leerzeilen zwischen den Absätzen in der Ausgabe entstehen; Inline-Formatierungen werden schlicht verworfen. Elemente ohne Textinhalt wie <img> und <hr> verschwinden vollständig. Links verlieren ihr Ziel, ihr Ankertext bleibt jedoch an Ort und Stelle. Als sichtbarer Text ausgeschriebene URLs überleben also, während ein verlinktes Wort die Adresse dahinter verliert.
Drittens wird das Ergebnis serialisiert: Leerraum wird normalisiert, der Text in der Zielkodierung geschrieben, fertig. Zwei Konsequenzen sind erwähnenswert. Alles, was nur als Bild existiert, ist verloren: Ein gescanntes Buch, ein Comic im Fixed-Layout-EPUB (rendition:layout=pre-paginated) oder ein Bilderbüchlein hat praktisch keine Textknoten, die Ausgabe ist also leer oder nahezu leer. Und ohne Markup gibt es keine Struktur: Die CSS-Umbruchregeln, mit denen die PDF-Pipeline paginiert, sind hier bedeutungslos, sodass Kapitelgrenzen nur als der Überschriftstext selbst überleben.
- Engine: Calibres ebook-convert, serverseitig ausgeführt als ebook-convert <eingabe.epub> <ausgabe.txt> --txt-output-encoding utf-8
- EPUB-Container: ZIP mit unkomprimiertem mimetype (application/epub+zip), META-INF/container.xml auf die Wurzel-.opf zeigend, und die .opf mit metadata / manifest / spine
- Die Lesereihenfolge bestimmt der spine, nicht Dateinamen oder ZIP-Reihenfolge - deshalb erscheinen die extrahierten Kapitel in der vorgesehenen Abfolge
- Die Extraktion behält nur Textknoten: Blockelemente werden zu Absatzumbrüchen, Inline-Stile entfallen, und Elemente ohne Zeichendaten (img, hr) verschwinden
- Verlustbehaftet per Design: Bilder, Cover, Tabellen (Zellen als fortlaufenden Text serialisiert), Schriften, Farben und TOC-Hierarchie überleben nicht; Links behalten nur ihren Ankertext
- Reine Bildquellen scheitern: Ein gescanntes EPUB oder ein Comic im Fixed-Layout hat keine Textknoten, die Ausgabe bleibt leer - der Dienst erkennt das leere Ergebnis und meldet einen Fehler, statt eine leere Datei auszuliefern
- Ausgabe ist UTF-8-Klartext mit normalisiertem Leerraum; es gibt keinen Seitenbegriff, daher haben Seitenzahlen und Paginierungseinstellungen keine Wirkung
Beispiele
Ein ganzes Buch durchsuchen
EPUB zu TXT konvertieren, dann grep -n "Schlagwort" book.txt und direkt zu jeder Fundstelle mit Zeilennummer springenQuellmaterial für einen LLM-Prompt bauen
Einen Roman zu TXT extrahieren, an Leerzeilen teilen und kapitelweise in einen Zusammenfassungs- oder Übersetzungs-Prompt ladenWörter zählen und Lesezeit schätzen
Nach der Extraktion liefert wc -w book.txt eine saubere Wortzahl - aus dem markierten XHTML der EPUB ist das nicht verlässlich möglichText für eine TTS-Engine vorbereiten
Zu TXT konvertieren, um das Markup zu entfernen, und den sauberen Text an eine Sprachsynthese gebenHäufige Fragen
Wohin geht meine EPUB-Datei?
Sie wird auf den Konvertierungsserver hochgeladen, mit Calibres ebook-convert verarbeitet und du bekommst sie als .txt-Download zurück. Nach Abschluss des Auftrags wird die Datei nicht aufbewahrt. Behandle trotzdem alles, was du hochlädst, als hätte es dein Gerät verlassen, und sende kein Material, das du nicht teilen darfst. Der Download-Link ist eine temporäre Task-ID, keine dauerhafte URL.
Bleiben Bilder, Cover und Formatierung erhalten?
Nein. TXT kann Bilder, Farben, Schriften und Betonungen nicht darstellen. Der Konverter behält nur die Zeichen: Fett und Kursiv werden zu normalem Text, Cover und eingebettete Abbildungen entfallen, CSS-Formatierungen werden verworfen. Absatzumbrüche bleiben als Leerzeilen erhalten - die einzige Struktur, die Klartext überhaupt abbilden kann.
Warum ist meine TXT leer oder warum schlägt die Konvertierung fehl?
Fast immer, weil das Buch keinen extrahierbaren Text enthält. Gescannte EPUBs, Comics und Bilderbücher mit festem Layout speichern jede Seite als Bild, es gibt also keine Textknoten zum Extrahieren. Der Dienst prüft die Ausgabegröße und meldet einen Konvertierungsfehler, statt dir eine Datei mit null Bytes zu geben. Wenn deine EPUB im Reader einwandfrei aussieht, aber nichts extrahiert wird, lass die Seiten zuerst per OCR erkennen.
Warum ist die TXT so viel kleiner als die EPUB?
Weil Text der kleinste Teil eines E-Books ist. Eine typische EPUB enthält Cover, eingebettete Abbildungen und Schriftdateien, alles komprimierte Binärdaten. Die eigentlichen Wörter eines Romans machen nur wenige hundert Kilobyte aus. Eine Schrumpfung um 80-95 % ist völlig normal, und das Ergebnis-Panel zeigt das genaue Verhältnis.
Was passiert mit Inhaltsverzeichnis und Kapitelüberschriften?
Das Inhaltsverzeichnis wird nicht als Verzeichnis neu erzeugt - TXT kennt das nicht -, aber der Überschriftstext selbst bleibt meist an seiner Stelle in Lesereihenfolge erhalten. Einträge aus nav.xhtml oder toc.ncx überleben nur, wenn sie auch im Inhalt als sichtbarer Text vorkommen. Praktisch zerlegst du die Datei an Leerzeilen oder an Überschriftenmustern und baust die Kapitelstruktur selbst nach.
Kann ich eine DRM-geschützte EPUB konvertieren?
Nein. Mit Adobe ADEPT, Apple FairPlay oder Amazon-DRM verschlüsselte Bücher kann der Konverter nicht öffnen - der Inhalt ist verschlüsselt und das Parsen scheitert, bevor überhaupt Text gelesen wird. Verwende eine DRM-freie EPUB, die du legal erworben hast: ein selbst erstelltes Buch, ein gemeinfreies Werk oder eine Datei, für die du ausdrücklich eine Konvertierungserlaubnis hast.
Welche anderen E-Book-Formate lassen sich zu TXT konvertieren?
Der serverseitige TXT-Endpunkt akzeptiert insgesamt 15 Eingabeformate: epub, mobi, azw3, azw, fb2, lit, prc, pdb, html, htm, xhtml, rtf, odt, docx und snb. Auf dieser Website bekommt jedes Format jedoch eine eigene Seite, damit Upload-Validierung und Fehlermeldungen zu dem passen, was du tatsächlich konvertierst. Diese Seite verarbeitet nur .epub.
Gibt es ein Limit für die Anzahl der Konvertierungen?
Ja. Der Endpunkt ist auf 2 Anfragen pro Minute pro IP-Adresse begrenzt, gezählt über alle E-Book-Konvertierungen hinweg. Für normale Nutzung ist das großzügig - die Grenze soll verhindern, dass ein Skript den Server belastet - und wer sie erreicht, wartet einfach eine Minute.
Welche Kodierung hat die Ausgabe, und funktioniert CJK-Text?
Die Ausgabe ist immer UTF-8, erzwungen durch das Argument --txt-output-encoding utf-8. Chinesischer, japanischer, koreanischer, kyrillischer, griechischer und akzentuierter lateinischer Text kommt also vollständig durch. Wenn die Zeichen nach dem Download als Kauderwelsch erscheinen, liegt das an der erkannten Kodierung deines Editors, nicht an der Datei - stell sie manuell auf UTF-8.
Ähnliche Werkzeuge
EPUB-zu-PDF-Konverter
Kostenloser Online-Konverter von EPUB zu PDF. Wandelt EPUB-E-Books in layoutstabile PDF-Dokumente um und bewahrt Kapitel, Bilder und Schriften.
MOBI zu EPUB Konverter
Kostenloser Online-Konverter von MOBI zu EPUB. Wandelt Kindle-MOBI-E-Books in das universelle reflowable EPUB-Format um und bewahrt Kapitel, Cover und Bilder.
MOBI-zu-PDF-Konverter
Kostenloser Online-Konverter von MOBI zu PDF. Wandelt Kindle-MOBI-E-Books in layoutstabile PDF-Dokumente um und bewahrt Kapitel, Bilder und Text.
AZW3-zu-PDF-Konverter
Kostenloser Online-Konverter von AZW3 zu PDF. Wandelt Kindle-AZW3/KF8-E-Books in layoutstabile PDF-Dokumente um und bewahrt Kapitel, Bilder und Schriften.
PDF-zu-Word-Konverter
Kostenloser Online-PDF-zu-Word-Konverter. Ausgabe als .docx oder .doc mit Ein-Klick-Konvertierung, Layout- und Bildbeibehaltung.
Word-zu-PDF-Konverter
Kostenloser Online-Word-zu-PDF-Konverter. Unterstützt .docx- und .doc-Formate mit Ein-Klick-Konvertierung
