ToolAct

Convertisseur EPUB en TXT

Importez un livre numérique EPUB et extrayez tout le texte dans un fichier .txt brut en UTF-8

Importer un livre numérique

Déposez un fichier EPUB ici, ou cliquez pour le sélectionner

Prend en charge le format .epub (sans DRM), 3 Mo maximum

Qu'est-ce que EPUB vers TXT ?

EPUB vers TXT extrait le texte lisible d'un livre numérique EPUB et l'écrit dans un fichier texte brut. L'EPUB est un format d'archive : les mots eux-mêmes se trouvent dans des documents XHTML à l'intérieur d'une archive ZIP, enveloppés de CSS, de polices, d'images et de fichiers de navigation. Un fichier .txt ne conserve que les caractères : aucun balisage, aucun style, aucune mise en page. Vous obtenez un texte continu, sans superflu, que n'importe quel programme peut lire.

L'avantage ? Le texte brut est le seul format que tout le monde comprend. grep et la recherche plein texte, les scripts Python ou R de fouille de texte, le comptage de mots, les outils de traduction, les invites pour grands modèles de langage, la synthèse vocale, et tout appareil ou logiciel qui ne gère pas du tout les formats de livre numérique. Chercher dans une bibliothèque entière, citer un passage avec exactitude ou fournir un roman à un modèle de langage commence toujours par la même étape : sortir le texte du conteneur du livre.

Comprenez toutefois le compromis avant de convertir : le TXT est un format à perte. Les images, la couverture, la hiérarchie de la table des matières, le gras et l'italique, les tableaux, les notes de bas de page liées et les polices intégrées disparaissent ou se fondent dans le texte courant ; seuls les caractères survivent, séparés par des sauts de ligne et des lignes vides. Les numéros de page n'ont pas davantage de sens, le texte brut n'ayant pas de notion de page. Si vous voulez que le livre ressemble encore à un livre, utilisez plutôt un convertisseur EPUB vers PDF ; le TXT est le bon choix lorsque vous voulez les mots, pas les pages.

Comment l'utiliser

Étapes

  1. Cliquez sur la zone d'import ou déposez un fichier EPUB — seul le format .epub est accepté, jusqu'à 3 Mo
  2. Cliquez sur « Convertir en TXT » : le serveur extrait le texte avec Calibre en quelques secondes
  3. Quand le panneau de résultat affiche la variation de taille, cliquez sur « Télécharger le TXT »
  4. Un autre livre à traiter ? Cliquez sur « Convertir un autre fichier » pour réinitialiser le panneau

À vérifier avant de convertir

  • Regardez la variation de taille dans le panneau de résultat : une forte réduction est normale (images et polices disparaissent), mais quelques centaines d'octets seulement signifient généralement que l'EPUB n'avait presque pas de texte.
  • Ouvrez une fois le TXT téléchargé dans un éditeur compatible UTF-8. Si les accents ou les caractères CJK s'affichent mal, c'est la détection d'encodage de l'éditeur qui est en cause : le fichier, lui, est bien en UTF-8.
  • Si vous avez besoin de la mise en page, de la couverture ou des images, convertissez plutôt en PDF ; le TXT écarte volontairement tout cela.

Cas d'usage

Rechercher dans tout un livreRetrouver chaque mention d'un personnage, d'un terme ou d'une date dans un EPUB de 600 pages est illusoire avec une liseuse. Convertissez-le en TXT et cherchez avec grep, votre éditeur ou un moteur de recherche : les résultats arrivent instantanément avec le numéro de ligne et le contexte, et le même fichier s'ouvre sur n'importe quelle machine sans logiciel de lecture.
Alimenter un modèle de langage ou une chaîne de traitement du langageModèles de langage, outils de résumé, modèles thématiques et outils de corpus travaillent tous sur du texte brut. Retirer d'abord les balises XHTML et le CSS évite d'injecter du bruit de balisage qui gaspille la fenêtre de contexte et fausse le décompte des jetons. La sortie UTF-8 se charge en Python d'un simple open(), sans bibliothèque EPUB.
Citer avec exactitudeCopier depuis une application de lecture entraîne souvent des mises en forme invisibles, des guillemets typographiques substitués et des traits d'union de fin de ligne. Une extraction TXT restitue les caractères tels qu'ils sont stockés dans le livre : la citation se colle proprement dans un mémoire, un article ou un fichier de sous-titres, et vous pouvez vérifier son intégralité au nombre de mots.
Synthèse vocale et production audioLes moteurs de synthèse vocale et les outils de livre audio consomment du texte, pas de l'EPUB. Extrayez d'abord le TXT, découpez-le en chapitres sur les lignes vides ou les titres, puis envoyez-le à la synthèse. Supprimer le balisage évite aussi que la voix lise les textes alternatifs des images ou des restes de CSS.
Lire sur un appareil sans prise en charge des livres numériquesVieux téléphones, liseuses à micrologiciel verrouillé, terminal, appareil embarqué, autoradio : nombreux sont les écrans qui affichent un fichier texte mais n'ouvrent pas un EPUB. Une copie TXT est le format le plus universel, qui fonctionne toujours, et assez légère pour être envoyée ou synchronisée partout.
Préparer un corpus pour la traduction ou le sous-titrageLes outils de traduction assistée et les éditeurs de sous-titres travaillent sur des segments de texte. Une extraction mécanique préalable fournit aux traducteurs un fichier source stable et versionnable ; la segmentation se fait alors une seule fois sur du texte brut, sans se battre contre les paragraphes XHTML imbriqués de l'EPUB.

Fonctionnement technique

La conversion est assurée par l'outil en ligne de commande ebook-convert de Calibre, invoqué côté serveur sous la forme ebook-convert <entrée.epub> <sortie.txt> avec --txt-output-encoding utf-8 : la sortie est donc toujours en UTF-8, quelle que soit l'encodage déclaré par le fichier d'origine. Le traitement comporte trois étapes.

La première est l'analyse de l'EPUB. Une EPUB est une archive ZIP dont la première entrée est un fichier mimetype non compressé contenant application/epub+zip, suivi de META-INF/container.xml qui pointe vers le fichier .opf à la racine du paquet. Ce fichier .opf comprend trois sections : metadata (titre, auteur, langue et identifiant unique décrits par des éléments Dublin Core), manifest (liste de toutes les ressources du paquet) et spine (définition de l'ordre de lecture). L'analyseur parcourt le spine et charge chaque document XHTML dans l'ordre. C'est pourquoi le texte ressort dans l'ordre de lecture et non dans l'ordre de l'archive : c'est le spine qui définit la séquence, pas le nom des fichiers.

La deuxième étape réduit le XHTML en texte. Le DOM de chaque document est parcouru et seuls les nœuds de texte sont conservés : de chaque élément — <p>, <h1>, <em>, <span>, <div> — il ne reste que son texte, le reste est écarté. Les éléments de bloc sont convertis en sauts de paragraphe, ce qui produit les lignes vides entre les paragraphes dans la sortie ; les styles en ligne sont simplement abandonnés. Les éléments sans contenu textuel, comme <img> et <hr>, disparaissent entièrement. Les liens perdent leur cible mais leur texte d'ancre reste en place : une URL écrite en clair survit, tandis qu'un mot hyperlié perd l'adresse qui le sous-tendait.

La troisième étape sérialise le résultat : les espaces sont normalisés, le texte est écrit dans l'encodage cible, et c'est terminé. Deux conséquences méritent d'être signalées. D'abord, tout contenu qui n'existe que sous forme d'image est perdu : un livre numérisé, une bande dessinée en EPUB à mise en page fixe (rendition:layout=pre-paginated) ou un album illustré n'ont pratiquement aucun nœud de texte, la sortie est donc vide ou presque. Ensuite, sans balisage il n'y a pas de structure : les règles CSS de saut de page, que la chaîne PDF utilise pour paginer, n'ont ici aucun sens, et les limites de chapitre ne survivent que sous la forme du texte de titre lui-même.

  • Moteur : ebook-convert de Calibre, exécuté côté serveur sous la forme ebook-convert <entrée.epub> <sortie.txt> --txt-output-encoding utf-8
  • Conteneur EPUB : une archive ZIP avec un mimetype non compressé (application/epub+zip), META-INF/container.xml pointant vers le .opf racine, et le .opf portant metadata / manifest / spine
  • L'ordre de lecture est défini par le spine, non par les noms de fichiers ni l'ordre du ZIP : c'est pourquoi les chapitres extraits ressortent dans la séquence prévue
  • L'extraction ne conserve que les nœuds de texte : les éléments de bloc deviennent des sauts de paragraphe, les styles en ligne sont écartés et les éléments sans données de caractères (img, hr) disparaissent
  • Avec pertes par conception : images, couverture, tableaux (cellules sérialisées en texte courant), polices, couleurs et hiérarchie du sommaire ne survivent pas ; les liens ne gardent que leur texte d'ancre
  • Les sources uniquement composées d'images échouent : un EPUB numérisé ou une BD à mise en page fixe n'ont aucun nœud de texte, la sortie est donc vide — le service détecte ce résultat vide et signale un échec au lieu de livrer un fichier blanc
  • La sortie est du texte brut UTF-8 à espaces normalisés ; il n'y a pas de notion de page, donc les numéros de page et les réglages de pagination n'ont aucun effet

Exemples

Rechercher dans tout un livre

Convertir un EPUB en TXT, puis grep -n "mot-clé" book.txt pour sauter directement à chaque occurrence avec son numéro de ligne

Préparer une invite pour un modèle de langage

Extraire un roman en TXT, le découper sur les lignes vides et charger chapitre par chapitre dans une invite de résumé ou de traduction

Compter les mots et estimer le temps de lecture

wc -w book.txt après extraction donne un nombre de mots fiable, impossible à obtenir correctement depuis le XHTML balisé de l'EPUB

Préparer du texte pour la synthèse vocale

Convertir en TXT pour retirer le balisage, puis envoyer le texte propre à un moteur de synthèse vocale

Questions fréquentes

Où va mon fichier EPUB ?

Il est envoyé au serveur de conversion, traité avec ebook-convert de Calibre, puis vous est renvoyé en téléchargement .txt. Le fichier n'est pas conservé après la fin de la tâche, mais considérez tout ce que vous importez comme ayant quitté votre appareil et évitez d'envoyer des documents que vous n'êtes pas autorisé à partager. Le lien de téléchargement est un identifiant de tâche temporaire, pas une URL permanente.

Les images, la couverture et la mise en forme sont-elles conservées ?

Non. Le TXT ne sait pas représenter les images, les couleurs, les polices ni les emphases : le convertisseur ne garde que les caractères. Le gras et l'italique deviennent du texte simple, la couverture et les illustrations intégrées sont abandonnées, et les styles CSS sont écartés. Les sauts de paragraphe subsistent sous forme de lignes vides, la seule structure qu'un texte brut puisse restituer.

Pourquoi mon TXT est-il vide, ou pourquoi la conversion échoue-t-elle ?

Presque toujours parce que le livre ne contient aucun texte exploitable. Les EPUB numérisés, les bandes dessinées et les albums à mise en page fixe stockent chaque page sous forme d'image : il n'y a donc aucun nœud de texte à extraire. Le service contrôle la taille de la sortie et signale un échec de conversion plutôt que de vous remettre un fichier de zéro octet. Si votre EPUB s'affiche correctement dans une liseuse mais ne donne rien à l'extraction, appliquez d'abord une reconnaissance optique de caractères sur les pages.

Pourquoi le TXT est-il tellement plus petit que l'EPUB ?

Parce que le texte est la plus petite partie d'un livre numérique. Un EPUB classique embarque la couverture, les illustrations et les fichiers de polices intégrées, autant de données binaires compressées ; les mots réels d'un roman ne représentent que quelques centaines de kilo-octets. Une réduction de 80 à 95 % est parfaitement normale, et le panneau de résultat affiche le rapport exact.

Qu'en est-il de la table des matières et des titres de chapitre ?

La table des matières n'est pas régénérée en tant que telle — le TXT n'a pas cette notion — mais le texte des titres survit généralement à sa place, dans l'ordre de lecture. Les entrées de nav.xhtml ou toc.ncx ne subsistent que si elles apparaissent aussi comme texte visible dans le contenu. En pratique, découpez le fichier sur les lignes vides ou sur les motifs de titres pour reconstituer les sections.

Puis-je convertir un EPUB protégé par DRM ?

Non. Les livres verrouillés par Adobe ADEPT, Apple FairPlay ou le DRM Amazon ne peuvent pas être ouverts par le convertisseur : le contenu est chiffré et l'analyse échoue avant même d'atteindre le moindre texte. Utilisez un EPUB sans DRM obtenu légalement, par exemple un ouvrage que vous avez composé, une œuvre du domaine public ou un fichier pour lequel vous disposez d'une autorisation explicite.

Quels autres formats de livre numérique peuvent être convertis en TXT ?

Le point d'accès TXT côté serveur accepte 15 formats d'entrée au total : epub, mobi, azw3, azw, fb2, lit, prc, pdb, html, htm, xhtml, rtf, odt, docx et snb. Ce site consacre toutefois une page dédiée à chaque format, afin que la validation à l'import et les messages d'erreur correspondent à ce que vous convertissez réellement. Cette page ne traite que le .epub.

Y a-t-il une limite au nombre de conversions ?

Oui. Le point d'accès est limité à 2 requêtes par minute et par adresse IP, toutes conversions de livres numériques confondues. C'est largement suffisant en usage normal — la limite empêche qu'un script martèle le serveur — et une minute d'attente suffit si vous la dépassez.

Quel est l'encodage de la sortie, et le texte CJK fonctionne-t-il ?

La sortie est toujours en UTF-8, imposé par l'argument --txt-output-encoding utf-8. Le chinois, le japonais, le coréen, le cyrillique, le grec et les caractères latins accentués passent donc intacts. Si les caractères s'affichent en charabia après le téléchargement, le problème vient de l'encodage détecté par votre éditeur, pas du fichier : basculez-le manuellement en UTF-8.