ToolAct

Convertidor de EPUB a TXT

Sube un libro electrónico EPUB y extrae todo su texto a un archivo .txt de texto plano en UTF-8

Subir Libro Electrónico

Suelta un archivo EPUB aquí o haz clic para seleccionarlo

Admite formato .epub (sin DRM), máximo 3MB

¿Qué es EPUB a TXT?

EPUB a TXT extrae el texto legible de un libro electrónico EPUB y lo escribe en un archivo de texto sin formato. El EPUB es un formato contenedor: las palabras reales viven dentro de documentos XHTML en un contenedor ZIP, envueltos en CSS, tipografías, imágenes y archivos de navegación. Un archivo .txt conserva solo los caracteres: sin etiquetas, sin estilos, sin maquetación. Lo que obtienes es un texto continuo y sin adornos que cualquier programa puede leer.

La clave está en que el texto plano es el único formato que todo el mundo entiende: grep y la búsqueda de texto completo, scripts de Python o R para minería de texto, conteo de palabras, herramientas de traducción, prompts para modelos de lenguaje, síntesis de voz y cualquier dispositivo o programa que no soporte formatos de libro electrónico. Si quieres buscar en toda una biblioteca, citar pasajes con precisión o dar una novela a un modelo de lenguaje, el primer paso es casi siempre el mismo: sacar el texto del contenedor del libro.

Entiende el compromiso antes de convertir: TXT es un formato con pérdida. Las imágenes, la portada, la jerarquía del índice, las negritas y cursivas, las tablas, las notas al pie enlazadas y las tipografías incrustadas desaparecen o se funden en texto corrido; solo sobreviven los caracteres, separados por saltos de línea y líneas en blanco. Los números de página tampoco significan nada, porque el texto plano no tiene páginas. Si necesitas que el libro siga pareciendo un libro, usa mejor un convertidor de EPUB a PDF; el TXT es la elección correcta cuando quieres las palabras, no las páginas.

Cómo Usarlo

Pasos

  1. Haz clic en la zona de carga o arrastra un archivo EPUB: solo se admite .epub, hasta 3MB
  2. Haz clic en «Convertir a TXT» y el servidor extraerá el texto con Calibre en unos segundos
  3. Cuando el panel de resultado muestre el cambio de tamaño, haz clic en «Descargar TXT»
  4. ¿Otro libro? Pulsa «Convertir Otro Archivo» para reiniciar el panel

Antes de Convertir

  • Fíjate en el cambio de tamaño del panel de resultado: una reducción grande es normal (las imágenes y las tipografías desaparecen), pero si solo quedan unos cientos de bytes suele significar que ese EPUB casi no tenía texto.
  • Abre una vez el TXT descargado en un editor compatible con UTF-8. Si los acentos o los caracteres CJK se ven mal, el problema es la detección de codificación del editor: el archivo en sí es UTF-8.
  • Si necesitas la maquetación, la portada o las imágenes del libro, convierte a PDF; el TXT descarta todo eso a propósito.

Casos de Uso

Buscar en todo un libroEncontrar cada mención de un personaje, un término o una fecha en un EPUB de 600 páginas es inviable con un lector. Conviértelo a TXT y búscalo con grep, tu editor o una herramienta de búsqueda: los resultados aparecen al instante con el número de línea y el contexto, y puedes abrir el mismo archivo en cualquier equipo sin instalar software de lectura.
Alimentar un modelo de lenguaje o un proceso de PLNLos modelos de lenguaje, las herramientas de resumen, los modelos de temas y las utilidades de corpus trabajan con texto plano. Quitar antes las etiquetas XHTML y el CSS evita inyectar ruido de marcado que desperdicia la ventana de contexto y desvirtúa el conteo de tokens. La salida UTF-8 se carga en Python con un solo open(), sin necesidad de ninguna librería de EPUB.
Citar con exactitudCopiar desde una aplicación de lectura suele arrastrar formato invisible, comillas tipográficas sustituidas y guiones de final de línea. Una extracción TXT devuelve los caracteres tal como están guardados en el libro: la cita se pega limpia en un trabajo, un blog o un archivo de subtítulos, y puedes verificar que está completa contando palabras.
Síntesis de voz y producción de audiolibrosLos motores TTS y las herramientas de audiolibro consumen texto, no EPUB. Extrae primero el TXT, divídelo en capítulos por las líneas en blanco o los títulos y envíalo al sintetizador. Eliminar el marcado también evita que la voz lea los textos alternativos de las imágenes o restos de CSS.
Leer en un dispositivo sin soporte para libros electrónicosMóviles antiguos, lectores de tinta electrónica con firmware bloqueado, una terminal, un dispositivo embebido, un equipo de coche: muchas pantallas muestran un archivo de texto pero no abren un EPUB. Una copia en TXT es el formato más universal, que siempre funciona, y es lo bastante pequeña para enviarla o sincronizarla donde quieras.
Preparar un corpus para traducción o subtituladoLas herramientas TAO y los editores de subtítulos trabajan sobre segmentos de texto. Hacer antes una extracción mecánica proporciona al traductor un archivo fuente estable y versionable; la segmentación se realiza entonces una sola vez sobre texto plano, sin pelearse con los párrafos XHTML anidados del EPUB.

Fundamento Técnico

La conversión la realiza la herramienta de línea de comandos ebook-convert de Calibre, invocada en el servidor como ebook-convert <entrada.epub> <salida.txt> junto con --txt-output-encoding utf-8, de modo que la salida siempre es UTF-8, independientemente de la codificación declarada por el archivo original. El proceso tiene tres fases.

La primera es el análisis del EPUB. Un EPUB es un archivo ZIP cuya primera entrada es un archivo mimetype sin comprimir con el contenido application/epub+zip, seguido de META-INF/container.xml que apunta al archivo .opf raíz del paquete. Ese .opf contiene tres secciones: metadata (título, autor, idioma e identificador único descritos con elementos Dublin Core), manifest (relación de todos los recursos del paquete) y spine (orden de lectura). El analizador recorre el spine y carga cada documento XHTML en orden. Por eso el texto sale en orden de lectura y no en el orden del archivo ZIP: la secuencia la define el spine, no los nombres de archivo.

La segunda fase reduce el XHTML a texto. Se recorre el DOM de cada documento y solo se conservan los nodos de texto, de modo que de cada elemento — <p>, <h1>, <em>, <span>, <div> — solo queda su texto y todo lo demás se descarta. Los elementos de bloque se convierten en saltos de párrafo, que es lo que produce las líneas en blanco entre párrafos en la salida; los estilos en línea simplemente se eliminan. Los elementos sin contenido textual, como <img> y <hr>, desaparecen por completo. Los enlaces pierden su destino, pero su texto ancla permanece en su sitio: una URL escrita como texto visible sobrevive, mientras que una palabra hiperenlazada pierde la dirección que tenía detrás.

La tercera fase serializa el resultado: se normalizan los espacios, se escribe el texto en la codificación de destino y termina. Conviene tener en cuenta dos cosas. La primera es que todo el contenido que solo existe como imagen se pierde: un libro escaneado, un cómic en EPUB de maquetación fija (rendition:layout=pre-paginated) o un álbum ilustrado apenas tienen nodos de texto, así que la salida es vacía o casi vacía. La segunda es que sin marcado no hay estructura: las reglas CSS de salto de página, que la canalización de PDF usa para paginar, aquí no significan nada, y los límites de capítulo solo sobreviven como el propio texto del título.

  • Motor: ebook-convert de Calibre, ejecutado en el servidor como ebook-convert <entrada.epub> <salida.txt> --txt-output-encoding utf-8
  • Contenedor EPUB: ZIP con un mimetype sin comprimir (application/epub+zip), META-INF/container.xml apuntando al .opf raíz, y el .opf con metadata / manifest / spine
  • El orden de lectura lo define el spine, no los nombres de archivo ni el orden del ZIP: por eso los capítulos extraídos salen en la secuencia prevista
  • La extracción conserva solo los nodos de texto: los elementos de bloque se convierten en saltos de párrafo, los estilos en línea se descartan y los elementos sin datos de carácter (img, hr) desaparecen
  • Con pérdidas por diseño: imágenes, portada, tablas (celdas serializadas como texto corrido), tipografías, colores y jerarquía del índice no sobreviven; los enlaces solo conservan su texto ancla
  • Las fuentes solo con imágenes fallan: un EPUB escaneado o un cómic de maquetación fija no tienen nodos de texto, así que la salida queda vacía; el servicio detecta el resultado vacío y notifica un fallo en lugar de entregar un archivo en blanco
  • La salida es texto plano UTF-8 con espacios normalizados; no hay concepto de página, así que los números de página y los ajustes de paginación no influyen

Ejemplos

Buscar en todo un libro

Convierte un EPUB a TXT y luego usa grep -n "palabra" book.txt para saltar a cada aparición con su número de línea

Preparar material para un prompt

Extrae una novela a TXT, divídela por líneas en blanco y carga capítulo a capítulo en un prompt de resumen o traducción

Contar palabras y estimar el tiempo de lectura

wc -w book.txt tras la extracción da un recuento fiable de palabras, imposible de obtener bien desde el XHTML con etiquetas del EPUB

Preparar texto para un motor TTS

Convierte a TXT para eliminar el marcado y envía el texto limpio a un sintetizador de voz

Preguntas Frecuentes

¿A dónde va mi archivo EPUB?

Se sube al servidor de conversión, se procesa con ebook-convert de Calibre y se te devuelve como descarga .txt. El archivo no se conserva cuando termina la tarea, pero trata todo lo que subas como si hubiera salido de tu dispositivo y evita enviar material que no puedas compartir. El enlace de descarga es un identificador de tarea temporal, no una URL permanente.

¿Se conservan las imágenes, la portada y el formato?

No. El TXT no puede representar imágenes, colores, tipografías ni énfasis, así que el convertidor solo conserva los caracteres: las negritas y cursivas pasan a texto normal, la portada y las ilustraciones interiores se descartan y los estilos CSS se eliminan. Los saltos de párrafo se mantienen como líneas en blanco, la única estructura que el texto plano puede conservar.

¿Por qué mi TXT sale vacío o por qué falla la conversión?

Casi siempre porque el libro no contiene texto extraíble. Los EPUB escaneados, los cómics y los álbumes de maquetación fija guardan cada página como una imagen, así que no hay nodos de texto que extraer. El servicio comprueba el tamaño de la salida y notifica un fallo de conversión en lugar de entregarte un archivo de cero bytes. Si tu EPUB se ve bien en un lector pero no extrae nada, aplica primero OCR a las páginas.

¿Por qué el TXT es mucho más pequeño que el EPUB?

Porque el texto es la parte más pequeña de un libro electrónico. Un EPUB típico incluye la portada, las ilustraciones interiores y los archivos de tipografías incrustadas, todos ellos datos binarios comprimidos; las palabras reales de una novela ocupan solo unos cientos de kilobytes. Una reducción del 80 al 95 % es completamente normal, y el panel de resultado muestra la proporción exacta.

¿Qué pasa con el índice y los títulos de capítulo?

El índice no se regenera como índice —el TXT no tiene ese concepto—, pero el texto de los títulos suele sobrevivir en su sitio, en orden de lectura. Las entradas de nav.xhtml o toc.ncx solo se mantienen si también aparecen como texto visible en el contenido. En la práctica, divide el archivo por las líneas en blanco o por patrones de título para reconstruir las secciones.

¿Puedo convertir un EPUB protegido con DRM?

No. Los libros bloqueados con Adobe ADEPT, Apple FairPlay o el DRM de Amazon no pueden abrirse con el convertidor: el contenido está cifrado y el análisis falla antes siquiera de llegar a ningún texto. Usa un EPUB sin DRM obtenido legalmente, como un libro que hayas maquetado tú, una obra de dominio público o un archivo para el que tengas permiso explícito.

¿Qué otros formatos de libro electrónico se pueden convertir a TXT?

El punto de acceso TXT del servidor acepta 15 formatos de entrada en total: epub, mobi, azw3, azw, fb2, lit, prc, pdb, html, htm, xhtml, rtf, odt, docx y snb. Sin embargo, este sitio dedica una página propia a cada formato, para que la validación al subir y los mensajes de error correspondan a lo que realmente conviertes. Esta página solo trata .epub.

¿Hay un límite de conversiones?

Sí. El punto de acceso está limitado a 2 solicitudes por minuto por dirección IP, contando todas las conversiones de libros electrónicos. Es holgado para el uso normal —existe para que un script no machaque el servidor— y basta con esperar un minuto si lo superas.

¿Qué codificación tiene la salida y funciona el texto CJK?

La salida es siempre UTF-8, forzada por el argumento --txt-output-encoding utf-8, así que el chino, el japonés, el coreano, el cirílico, el griego y las letras latinas acentuadas llegan intactos. Si los caracteres se ven como basura tras la descarga, el problema es la codificación que detecta tu editor, no el archivo: cámbiala manualmente a UTF-8.