Convertidor de EPUB a TXT
Sube un libro electrónico EPUB y extrae todo su texto a un archivo .txt de texto plano en UTF-8
Suelta un archivo EPUB aquí o haz clic para seleccionarlo
Admite formato .epub (sin DRM), máximo 3MB
¿Qué es EPUB a TXT?
EPUB a TXT extrae el texto legible de un libro electrónico EPUB y lo escribe en un archivo de texto sin formato. El EPUB es un formato contenedor: las palabras reales viven dentro de documentos XHTML en un contenedor ZIP, envueltos en CSS, tipografías, imágenes y archivos de navegación. Un archivo .txt conserva solo los caracteres: sin etiquetas, sin estilos, sin maquetación. Lo que obtienes es un texto continuo y sin adornos que cualquier programa puede leer.
La clave está en que el texto plano es el único formato que todo el mundo entiende: grep y la búsqueda de texto completo, scripts de Python o R para minería de texto, conteo de palabras, herramientas de traducción, prompts para modelos de lenguaje, síntesis de voz y cualquier dispositivo o programa que no soporte formatos de libro electrónico. Si quieres buscar en toda una biblioteca, citar pasajes con precisión o dar una novela a un modelo de lenguaje, el primer paso es casi siempre el mismo: sacar el texto del contenedor del libro.
Entiende el compromiso antes de convertir: TXT es un formato con pérdida. Las imágenes, la portada, la jerarquía del índice, las negritas y cursivas, las tablas, las notas al pie enlazadas y las tipografías incrustadas desaparecen o se funden en texto corrido; solo sobreviven los caracteres, separados por saltos de línea y líneas en blanco. Los números de página tampoco significan nada, porque el texto plano no tiene páginas. Si necesitas que el libro siga pareciendo un libro, usa mejor un convertidor de EPUB a PDF; el TXT es la elección correcta cuando quieres las palabras, no las páginas.
Cómo Usarlo
Pasos
- Haz clic en la zona de carga o arrastra un archivo EPUB: solo se admite .epub, hasta 3MB
- Haz clic en «Convertir a TXT» y el servidor extraerá el texto con Calibre en unos segundos
- Cuando el panel de resultado muestre el cambio de tamaño, haz clic en «Descargar TXT»
- ¿Otro libro? Pulsa «Convertir Otro Archivo» para reiniciar el panel
Antes de Convertir
- Fíjate en el cambio de tamaño del panel de resultado: una reducción grande es normal (las imágenes y las tipografías desaparecen), pero si solo quedan unos cientos de bytes suele significar que ese EPUB casi no tenía texto.
- Abre una vez el TXT descargado en un editor compatible con UTF-8. Si los acentos o los caracteres CJK se ven mal, el problema es la detección de codificación del editor: el archivo en sí es UTF-8.
- Si necesitas la maquetación, la portada o las imágenes del libro, convierte a PDF; el TXT descarta todo eso a propósito.
Casos de Uso
Fundamento Técnico
La conversión la realiza la herramienta de línea de comandos ebook-convert de Calibre, invocada en el servidor como ebook-convert <entrada.epub> <salida.txt> junto con --txt-output-encoding utf-8, de modo que la salida siempre es UTF-8, independientemente de la codificación declarada por el archivo original. El proceso tiene tres fases.
La primera es el análisis del EPUB. Un EPUB es un archivo ZIP cuya primera entrada es un archivo mimetype sin comprimir con el contenido application/epub+zip, seguido de META-INF/container.xml que apunta al archivo .opf raíz del paquete. Ese .opf contiene tres secciones: metadata (título, autor, idioma e identificador único descritos con elementos Dublin Core), manifest (relación de todos los recursos del paquete) y spine (orden de lectura). El analizador recorre el spine y carga cada documento XHTML en orden. Por eso el texto sale en orden de lectura y no en el orden del archivo ZIP: la secuencia la define el spine, no los nombres de archivo.
La segunda fase reduce el XHTML a texto. Se recorre el DOM de cada documento y solo se conservan los nodos de texto, de modo que de cada elemento — <p>, <h1>, <em>, <span>, <div> — solo queda su texto y todo lo demás se descarta. Los elementos de bloque se convierten en saltos de párrafo, que es lo que produce las líneas en blanco entre párrafos en la salida; los estilos en línea simplemente se eliminan. Los elementos sin contenido textual, como <img> y <hr>, desaparecen por completo. Los enlaces pierden su destino, pero su texto ancla permanece en su sitio: una URL escrita como texto visible sobrevive, mientras que una palabra hiperenlazada pierde la dirección que tenía detrás.
La tercera fase serializa el resultado: se normalizan los espacios, se escribe el texto en la codificación de destino y termina. Conviene tener en cuenta dos cosas. La primera es que todo el contenido que solo existe como imagen se pierde: un libro escaneado, un cómic en EPUB de maquetación fija (rendition:layout=pre-paginated) o un álbum ilustrado apenas tienen nodos de texto, así que la salida es vacía o casi vacía. La segunda es que sin marcado no hay estructura: las reglas CSS de salto de página, que la canalización de PDF usa para paginar, aquí no significan nada, y los límites de capítulo solo sobreviven como el propio texto del título.
- Motor: ebook-convert de Calibre, ejecutado en el servidor como ebook-convert <entrada.epub> <salida.txt> --txt-output-encoding utf-8
- Contenedor EPUB: ZIP con un mimetype sin comprimir (application/epub+zip), META-INF/container.xml apuntando al .opf raíz, y el .opf con metadata / manifest / spine
- El orden de lectura lo define el spine, no los nombres de archivo ni el orden del ZIP: por eso los capítulos extraídos salen en la secuencia prevista
- La extracción conserva solo los nodos de texto: los elementos de bloque se convierten en saltos de párrafo, los estilos en línea se descartan y los elementos sin datos de carácter (img, hr) desaparecen
- Con pérdidas por diseño: imágenes, portada, tablas (celdas serializadas como texto corrido), tipografías, colores y jerarquía del índice no sobreviven; los enlaces solo conservan su texto ancla
- Las fuentes solo con imágenes fallan: un EPUB escaneado o un cómic de maquetación fija no tienen nodos de texto, así que la salida queda vacía; el servicio detecta el resultado vacío y notifica un fallo en lugar de entregar un archivo en blanco
- La salida es texto plano UTF-8 con espacios normalizados; no hay concepto de página, así que los números de página y los ajustes de paginación no influyen
Ejemplos
Buscar en todo un libro
Convierte un EPUB a TXT y luego usa grep -n "palabra" book.txt para saltar a cada aparición con su número de líneaPreparar material para un prompt
Extrae una novela a TXT, divídela por líneas en blanco y carga capítulo a capítulo en un prompt de resumen o traducciónContar palabras y estimar el tiempo de lectura
wc -w book.txt tras la extracción da un recuento fiable de palabras, imposible de obtener bien desde el XHTML con etiquetas del EPUBPreparar texto para un motor TTS
Convierte a TXT para eliminar el marcado y envía el texto limpio a un sintetizador de vozPreguntas Frecuentes
¿A dónde va mi archivo EPUB?
Se sube al servidor de conversión, se procesa con ebook-convert de Calibre y se te devuelve como descarga .txt. El archivo no se conserva cuando termina la tarea, pero trata todo lo que subas como si hubiera salido de tu dispositivo y evita enviar material que no puedas compartir. El enlace de descarga es un identificador de tarea temporal, no una URL permanente.
¿Se conservan las imágenes, la portada y el formato?
No. El TXT no puede representar imágenes, colores, tipografías ni énfasis, así que el convertidor solo conserva los caracteres: las negritas y cursivas pasan a texto normal, la portada y las ilustraciones interiores se descartan y los estilos CSS se eliminan. Los saltos de párrafo se mantienen como líneas en blanco, la única estructura que el texto plano puede conservar.
¿Por qué mi TXT sale vacío o por qué falla la conversión?
Casi siempre porque el libro no contiene texto extraíble. Los EPUB escaneados, los cómics y los álbumes de maquetación fija guardan cada página como una imagen, así que no hay nodos de texto que extraer. El servicio comprueba el tamaño de la salida y notifica un fallo de conversión en lugar de entregarte un archivo de cero bytes. Si tu EPUB se ve bien en un lector pero no extrae nada, aplica primero OCR a las páginas.
¿Por qué el TXT es mucho más pequeño que el EPUB?
Porque el texto es la parte más pequeña de un libro electrónico. Un EPUB típico incluye la portada, las ilustraciones interiores y los archivos de tipografías incrustadas, todos ellos datos binarios comprimidos; las palabras reales de una novela ocupan solo unos cientos de kilobytes. Una reducción del 80 al 95 % es completamente normal, y el panel de resultado muestra la proporción exacta.
¿Qué pasa con el índice y los títulos de capítulo?
El índice no se regenera como índice —el TXT no tiene ese concepto—, pero el texto de los títulos suele sobrevivir en su sitio, en orden de lectura. Las entradas de nav.xhtml o toc.ncx solo se mantienen si también aparecen como texto visible en el contenido. En la práctica, divide el archivo por las líneas en blanco o por patrones de título para reconstruir las secciones.
¿Puedo convertir un EPUB protegido con DRM?
No. Los libros bloqueados con Adobe ADEPT, Apple FairPlay o el DRM de Amazon no pueden abrirse con el convertidor: el contenido está cifrado y el análisis falla antes siquiera de llegar a ningún texto. Usa un EPUB sin DRM obtenido legalmente, como un libro que hayas maquetado tú, una obra de dominio público o un archivo para el que tengas permiso explícito.
¿Qué otros formatos de libro electrónico se pueden convertir a TXT?
El punto de acceso TXT del servidor acepta 15 formatos de entrada en total: epub, mobi, azw3, azw, fb2, lit, prc, pdb, html, htm, xhtml, rtf, odt, docx y snb. Sin embargo, este sitio dedica una página propia a cada formato, para que la validación al subir y los mensajes de error correspondan a lo que realmente conviertes. Esta página solo trata .epub.
¿Hay un límite de conversiones?
Sí. El punto de acceso está limitado a 2 solicitudes por minuto por dirección IP, contando todas las conversiones de libros electrónicos. Es holgado para el uso normal —existe para que un script no machaque el servidor— y basta con esperar un minuto si lo superas.
¿Qué codificación tiene la salida y funciona el texto CJK?
La salida es siempre UTF-8, forzada por el argumento --txt-output-encoding utf-8, así que el chino, el japonés, el coreano, el cirílico, el griego y las letras latinas acentuadas llegan intactos. Si los caracteres se ven como basura tras la descarga, el problema es la codificación que detecta tu editor, no el archivo: cámbiala manualmente a UTF-8.
Herramientas Relacionadas
Convertidor de EPUB a PDF
Convertidor online gratuito de EPUB a PDF. Transforma libros electrónicos EPUB en documentos PDF con diseño estable, conservando capítulos
Convertidor de MOBI a EPUB
Convertidor online gratuito de MOBI a EPUB. Transforma libros MOBI de Kindle en el formato EPUB universal y fluido, conservando capítulos, portada e imágenes.
Convertidor de MOBI a PDF
Convertidor online gratuito de MOBI a PDF. Transforma libros MOBI de Kindle en documentos PDF con diseño estable, conservando capítulos, imágenes y texto.
Convertidor de AZW3 a PDF
Convertidor online gratuito de AZW3 a PDF. Transforma libros Kindle AZW3 (KF8) en PDF estables, conservando capítulos, imágenes y fuentes.
Convertidor de PDF a Word
Convertidor de PDF a Word online gratuito. Salida en formato .docx o .doc con conversión en un clic, conservación del diseño e imágenes.
Convertidor de Word a PDF
Convertidor de Word a PDF online gratuito. Soporta formatos .docx y .doc con conversión en un clic
