Convertisseur EPUB en TXT
Importez un livre numérique EPUB et extrayez tout le texte dans un fichier .txt brut en UTF-8
Déposez un fichier EPUB ici, ou cliquez pour le sélectionner
Prend en charge le format .epub (sans DRM), 3 Mo maximum
Qu'est-ce que EPUB vers TXT ?
EPUB vers TXT extrait le texte lisible d'un livre numérique EPUB et l'écrit dans un fichier texte brut. L'EPUB est un format d'archive : les mots eux-mêmes se trouvent dans des documents XHTML à l'intérieur d'une archive ZIP, enveloppés de CSS, de polices, d'images et de fichiers de navigation. Un fichier .txt ne conserve que les caractères : aucun balisage, aucun style, aucune mise en page. Vous obtenez un texte continu, sans superflu, que n'importe quel programme peut lire.
L'avantage ? Le texte brut est le seul format que tout le monde comprend. grep et la recherche plein texte, les scripts Python ou R de fouille de texte, le comptage de mots, les outils de traduction, les invites pour grands modèles de langage, la synthèse vocale, et tout appareil ou logiciel qui ne gère pas du tout les formats de livre numérique. Chercher dans une bibliothèque entière, citer un passage avec exactitude ou fournir un roman à un modèle de langage commence toujours par la même étape : sortir le texte du conteneur du livre.
Comprenez toutefois le compromis avant de convertir : le TXT est un format à perte. Les images, la couverture, la hiérarchie de la table des matières, le gras et l'italique, les tableaux, les notes de bas de page liées et les polices intégrées disparaissent ou se fondent dans le texte courant ; seuls les caractères survivent, séparés par des sauts de ligne et des lignes vides. Les numéros de page n'ont pas davantage de sens, le texte brut n'ayant pas de notion de page. Si vous voulez que le livre ressemble encore à un livre, utilisez plutôt un convertisseur EPUB vers PDF ; le TXT est le bon choix lorsque vous voulez les mots, pas les pages.
Comment l'utiliser
Étapes
- Cliquez sur la zone d'import ou déposez un fichier EPUB — seul le format .epub est accepté, jusqu'à 3 Mo
- Cliquez sur « Convertir en TXT » : le serveur extrait le texte avec Calibre en quelques secondes
- Quand le panneau de résultat affiche la variation de taille, cliquez sur « Télécharger le TXT »
- Un autre livre à traiter ? Cliquez sur « Convertir un autre fichier » pour réinitialiser le panneau
À vérifier avant de convertir
- Regardez la variation de taille dans le panneau de résultat : une forte réduction est normale (images et polices disparaissent), mais quelques centaines d'octets seulement signifient généralement que l'EPUB n'avait presque pas de texte.
- Ouvrez une fois le TXT téléchargé dans un éditeur compatible UTF-8. Si les accents ou les caractères CJK s'affichent mal, c'est la détection d'encodage de l'éditeur qui est en cause : le fichier, lui, est bien en UTF-8.
- Si vous avez besoin de la mise en page, de la couverture ou des images, convertissez plutôt en PDF ; le TXT écarte volontairement tout cela.
Cas d'usage
Fonctionnement technique
La conversion est assurée par l'outil en ligne de commande ebook-convert de Calibre, invoqué côté serveur sous la forme ebook-convert <entrée.epub> <sortie.txt> avec --txt-output-encoding utf-8 : la sortie est donc toujours en UTF-8, quelle que soit l'encodage déclaré par le fichier d'origine. Le traitement comporte trois étapes.
La première est l'analyse de l'EPUB. Une EPUB est une archive ZIP dont la première entrée est un fichier mimetype non compressé contenant application/epub+zip, suivi de META-INF/container.xml qui pointe vers le fichier .opf à la racine du paquet. Ce fichier .opf comprend trois sections : metadata (titre, auteur, langue et identifiant unique décrits par des éléments Dublin Core), manifest (liste de toutes les ressources du paquet) et spine (définition de l'ordre de lecture). L'analyseur parcourt le spine et charge chaque document XHTML dans l'ordre. C'est pourquoi le texte ressort dans l'ordre de lecture et non dans l'ordre de l'archive : c'est le spine qui définit la séquence, pas le nom des fichiers.
La deuxième étape réduit le XHTML en texte. Le DOM de chaque document est parcouru et seuls les nœuds de texte sont conservés : de chaque élément — <p>, <h1>, <em>, <span>, <div> — il ne reste que son texte, le reste est écarté. Les éléments de bloc sont convertis en sauts de paragraphe, ce qui produit les lignes vides entre les paragraphes dans la sortie ; les styles en ligne sont simplement abandonnés. Les éléments sans contenu textuel, comme <img> et <hr>, disparaissent entièrement. Les liens perdent leur cible mais leur texte d'ancre reste en place : une URL écrite en clair survit, tandis qu'un mot hyperlié perd l'adresse qui le sous-tendait.
La troisième étape sérialise le résultat : les espaces sont normalisés, le texte est écrit dans l'encodage cible, et c'est terminé. Deux conséquences méritent d'être signalées. D'abord, tout contenu qui n'existe que sous forme d'image est perdu : un livre numérisé, une bande dessinée en EPUB à mise en page fixe (rendition:layout=pre-paginated) ou un album illustré n'ont pratiquement aucun nœud de texte, la sortie est donc vide ou presque. Ensuite, sans balisage il n'y a pas de structure : les règles CSS de saut de page, que la chaîne PDF utilise pour paginer, n'ont ici aucun sens, et les limites de chapitre ne survivent que sous la forme du texte de titre lui-même.
- Moteur : ebook-convert de Calibre, exécuté côté serveur sous la forme ebook-convert <entrée.epub> <sortie.txt> --txt-output-encoding utf-8
- Conteneur EPUB : une archive ZIP avec un mimetype non compressé (application/epub+zip), META-INF/container.xml pointant vers le .opf racine, et le .opf portant metadata / manifest / spine
- L'ordre de lecture est défini par le spine, non par les noms de fichiers ni l'ordre du ZIP : c'est pourquoi les chapitres extraits ressortent dans la séquence prévue
- L'extraction ne conserve que les nœuds de texte : les éléments de bloc deviennent des sauts de paragraphe, les styles en ligne sont écartés et les éléments sans données de caractères (img, hr) disparaissent
- Avec pertes par conception : images, couverture, tableaux (cellules sérialisées en texte courant), polices, couleurs et hiérarchie du sommaire ne survivent pas ; les liens ne gardent que leur texte d'ancre
- Les sources uniquement composées d'images échouent : un EPUB numérisé ou une BD à mise en page fixe n'ont aucun nœud de texte, la sortie est donc vide — le service détecte ce résultat vide et signale un échec au lieu de livrer un fichier blanc
- La sortie est du texte brut UTF-8 à espaces normalisés ; il n'y a pas de notion de page, donc les numéros de page et les réglages de pagination n'ont aucun effet
Exemples
Rechercher dans tout un livre
Convertir un EPUB en TXT, puis grep -n "mot-clé" book.txt pour sauter directement à chaque occurrence avec son numéro de lignePréparer une invite pour un modèle de langage
Extraire un roman en TXT, le découper sur les lignes vides et charger chapitre par chapitre dans une invite de résumé ou de traductionCompter les mots et estimer le temps de lecture
wc -w book.txt après extraction donne un nombre de mots fiable, impossible à obtenir correctement depuis le XHTML balisé de l'EPUBPréparer du texte pour la synthèse vocale
Convertir en TXT pour retirer le balisage, puis envoyer le texte propre à un moteur de synthèse vocaleQuestions fréquentes
Où va mon fichier EPUB ?
Il est envoyé au serveur de conversion, traité avec ebook-convert de Calibre, puis vous est renvoyé en téléchargement .txt. Le fichier n'est pas conservé après la fin de la tâche, mais considérez tout ce que vous importez comme ayant quitté votre appareil et évitez d'envoyer des documents que vous n'êtes pas autorisé à partager. Le lien de téléchargement est un identifiant de tâche temporaire, pas une URL permanente.
Les images, la couverture et la mise en forme sont-elles conservées ?
Non. Le TXT ne sait pas représenter les images, les couleurs, les polices ni les emphases : le convertisseur ne garde que les caractères. Le gras et l'italique deviennent du texte simple, la couverture et les illustrations intégrées sont abandonnées, et les styles CSS sont écartés. Les sauts de paragraphe subsistent sous forme de lignes vides, la seule structure qu'un texte brut puisse restituer.
Pourquoi mon TXT est-il vide, ou pourquoi la conversion échoue-t-elle ?
Presque toujours parce que le livre ne contient aucun texte exploitable. Les EPUB numérisés, les bandes dessinées et les albums à mise en page fixe stockent chaque page sous forme d'image : il n'y a donc aucun nœud de texte à extraire. Le service contrôle la taille de la sortie et signale un échec de conversion plutôt que de vous remettre un fichier de zéro octet. Si votre EPUB s'affiche correctement dans une liseuse mais ne donne rien à l'extraction, appliquez d'abord une reconnaissance optique de caractères sur les pages.
Pourquoi le TXT est-il tellement plus petit que l'EPUB ?
Parce que le texte est la plus petite partie d'un livre numérique. Un EPUB classique embarque la couverture, les illustrations et les fichiers de polices intégrées, autant de données binaires compressées ; les mots réels d'un roman ne représentent que quelques centaines de kilo-octets. Une réduction de 80 à 95 % est parfaitement normale, et le panneau de résultat affiche le rapport exact.
Qu'en est-il de la table des matières et des titres de chapitre ?
La table des matières n'est pas régénérée en tant que telle — le TXT n'a pas cette notion — mais le texte des titres survit généralement à sa place, dans l'ordre de lecture. Les entrées de nav.xhtml ou toc.ncx ne subsistent que si elles apparaissent aussi comme texte visible dans le contenu. En pratique, découpez le fichier sur les lignes vides ou sur les motifs de titres pour reconstituer les sections.
Puis-je convertir un EPUB protégé par DRM ?
Non. Les livres verrouillés par Adobe ADEPT, Apple FairPlay ou le DRM Amazon ne peuvent pas être ouverts par le convertisseur : le contenu est chiffré et l'analyse échoue avant même d'atteindre le moindre texte. Utilisez un EPUB sans DRM obtenu légalement, par exemple un ouvrage que vous avez composé, une œuvre du domaine public ou un fichier pour lequel vous disposez d'une autorisation explicite.
Quels autres formats de livre numérique peuvent être convertis en TXT ?
Le point d'accès TXT côté serveur accepte 15 formats d'entrée au total : epub, mobi, azw3, azw, fb2, lit, prc, pdb, html, htm, xhtml, rtf, odt, docx et snb. Ce site consacre toutefois une page dédiée à chaque format, afin que la validation à l'import et les messages d'erreur correspondent à ce que vous convertissez réellement. Cette page ne traite que le .epub.
Y a-t-il une limite au nombre de conversions ?
Oui. Le point d'accès est limité à 2 requêtes par minute et par adresse IP, toutes conversions de livres numériques confondues. C'est largement suffisant en usage normal — la limite empêche qu'un script martèle le serveur — et une minute d'attente suffit si vous la dépassez.
Quel est l'encodage de la sortie, et le texte CJK fonctionne-t-il ?
La sortie est toujours en UTF-8, imposé par l'argument --txt-output-encoding utf-8. Le chinois, le japonais, le coréen, le cyrillique, le grec et les caractères latins accentués passent donc intacts. Si les caractères s'affichent en charabia après le téléchargement, le problème vient de l'encodage détecté par votre éditeur, pas du fichier : basculez-le manuellement en UTF-8.
Outils similaires
Convertisseur EPUB en PDF
Convertisseur gratuit EPUB en PDF en ligne. Transforme vos livres EPUB en PDF stables, chapitres, images et polices préservés. Suppression auto.
Convertisseur MOBI en EPUB
Convertisseur gratuit MOBI en EPUB en ligne. Transforme vos livres Kindle MOBI au format EPUB universel et fluide, chapitres, couverture et images préservés.
Convertisseur MOBI en PDF
Convertisseur gratuit MOBI en PDF en ligne. Transforme vos livres Kindle MOBI en PDF stables, chapitres, images et texte préservés.
Convertisseur AZW3 en PDF
Convertisseur gratuit AZW3 en PDF en ligne. Transforme vos livres Kindle AZW3 (KF8) en PDF stables, chapitres et images préservés. Suppression auto.
Convertisseur PDF en Word
Convertisseur PDF en Word gratuit en ligne. Sortie .docx ou .doc, conversion en un clic, mise en page et images préservées.
Convertisseur Word en PDF
Convertisseur Word en PDF en ligne. Prend en charge .docx et .doc, conversion en un clic, mise en page préservée. Fichiers supprimés après.
