Conversor de EPUB para TXT
Envie um livro eletrônico EPUB e extraia todo o texto como um arquivo .txt de texto simples em UTF-8
Solte um arquivo EPUB aqui ou clique para selecionar
Suporta formato .epub (sem DRM), máximo 3MB
O que é EPUB para TXT?
EPUB para TXT extrai o texto legível de um livro eletrônico EPUB e o grava em um arquivo de texto simples. O EPUB é um formato de contêiner: as palavras de verdade ficam dentro de documentos XHTML em um contêiner ZIP, envoltos em CSS, fontes, imagens e arquivos de navegação. Um arquivo .txt mantém apenas os caracteres: sem marcação, sem estilo, sem layout. O que você recebe é um texto contínuo e enxuto que qualquer programa consegue ler.
A vantagem é que texto simples é o único formato que todo mundo entende: grep e busca em texto completo, scripts em Python ou R para mineração de texto, contagem de palavras, ferramentas de tradução, prompts para modelos de linguagem, síntese de voz e qualquer dispositivo ou aplicativo que não suporte formatos de livro eletrônico. Se você quer pesquisar em uma biblioteca inteira, citar trechos com precisão ou alimentar um modelo de linguagem com um romance, o primeiro passo é quase sempre o mesmo: tirar o texto do contêiner do livro.
Entenda o trade-off antes de converter: TXT é um formato com perdas. Imagens, capa, hierarquia do sumário, negrito e itálico, tabelas, notas de rodapé vinculadas e fontes incorporadas desaparecem ou se fundem em texto corrido; só os caracteres sobrevivem, separados por quebras de linha e linhas em branco. Números de página também não significam nada, porque texto simples não tem páginas. Se você precisa que o livro continue parecendo um livro, use um conversor de EPUB para PDF; o TXT é a escolha certa quando você quer as palavras, não as páginas.
Como Usar
Passos
- Clique na área de envio ou arraste um arquivo EPUB — só .epub é aceito, até 3MB
- Clique em «Converter para TXT» e o servidor extrai o texto com o Calibre em poucos segundos
- Quando o painel de resultado mostrar a variação de tamanho, clique em «Baixar TXT»
- Vai converter outro livro? Clique em «Converter Outro Arquivo» para reiniciar o painel
Antes de Converter
- Observe a variação de tamanho no painel de resultado: redução grande é normal (imagens e fontes desaparecem), mas se sobrarem apenas algumas centenas de bytes, normalmente esse EPUB quase não tinha texto.
- Abra uma vez o TXT baixado em um editor compatível com UTF-8. Se acentos ou caracteres CJK aparecerem errados, o problema é a detecção de codificação do editor — o arquivo em si é UTF-8.
- Se você precisa do layout, da capa ou das imagens do livro, converta para PDF; o TXT descarta tudo isso de propósito.
Casos de Uso
Fundamento Técnico
A conversão é feita pela ferramenta de linha de comando ebook-convert do Calibre, chamada no servidor como ebook-convert <entrada.epub> <saída.txt> com --txt-output-encoding utf-8, de modo que a saída é sempre UTF-8, independentemente da codificação declarada pelo arquivo original. O processo tem três etapas.
A primeira é a análise do EPUB. Um EPUB é um arquivo ZIP cuja primeira entrada é um arquivo mimetype não comprimido com o conteúdo application/epub+zip, seguido de META-INF/container.xml, que aponta para o arquivo .opf na raiz do pacote. Esse .opf contém três seções: metadata (título, autor, idioma e identificador único descritos com elementos Dublin Core), manifest (relação de todos os recursos do pacote) e spine (ordem de leitura). O analisador percorre o spine e carrega cada documento XHTML na sequência. É por isso que o texto sai em ordem de leitura e não na ordem do arquivo ZIP: quem define a sequência é o spine, não o nome dos arquivos.
A segunda etapa reduz o XHTML a texto. O DOM de cada documento é percorrido e apenas os nós de texto são preservados, de modo que cada elemento — <p>, <h1>, <em>, <span>, <div> — só sobra o texto, e todo o resto é descartado. Elementos de bloco viram quebras de parágrafo, e é isso que produz as linhas em branco entre os parágrafos na saída; estilos em linha são simplesmente descartados. Elementos sem conteúdo textual, como <img> e <hr>, desaparecem por completo. Os links perdem o destino, mas o texto âncora permanece no lugar: uma URL escrita como texto visível sobrevive, enquanto uma palavra com link perde o endereço para onde aponta.
A terceira etapa serializa o resultado: os espaços são normalizados, o texto é gravado na codificação de destino e a tarefa termina. Vale destacar dois pontos. A primeira é que todo conteúdo que existe apenas como imagem se perde: um livro digitalizado, um quadrinho em EPUB de layout fixo (rendition:layout=pre-paginated) ou um livro ilustrado quase não têm nós de texto, então a saída fica vazia ou quase vazia. A segunda é que, sem marcação, não há estrutura: as regras CSS de quebra de página, que o fluxo de PDF usa para paginar, não significam nada aqui, e os limites de capítulo só sobrevivem como o próprio texto do título.
- Motor: ebook-convert do Calibre, executado no servidor como ebook-convert <entrada.epub> <saída.txt> --txt-output-encoding utf-8
- Contêiner EPUB: ZIP com um mimetype não comprimido (application/epub+zip), META-INF/container.xml apontando para o .opf raiz, e o .opf com metadata / manifest / spine
- A ordem de leitura é definida pelo spine, não pelos nomes de arquivo nem pela ordem do ZIP — é por isso que os capítulos extraídos saem na sequência prevista
- A extração preserva apenas os nós de texto: elementos de bloco viram quebras de parágrafo, estilos em linha são descartados e elementos sem dados de caractere (img, hr) desaparecem
- Com perdas por natureza: imagens, capa, tabelas (células serializadas como texto corrido), fontes, cores e hierarquia do sumário não sobrevivem; os links mantêm só o texto âncora
- Fontes só com imagens falham: um EPUB digitalizado ou um quadrinho de layout fixo não têm nós de texto, então a saída fica vazia — o serviço detecta o resultado vazio e reporta falha em vez de entregar um arquivo em branco
- A saída é texto simples UTF-8 com espaços normalizados; não há conceito de página, então números de página e ajustes de paginação não têm efeito
Exemplos
Pesquisar em um livro inteiro
Converta um EPUB para TXT e use grep -n "palavra" book.txt para pular direto a cada ocorrência com o número da linhaMontar material para um prompt
Extraia um romance para TXT, divida pelas linhas em branco e carregue capítulo a capítulo em um prompt de resumo ou traduçãoContar palavras e estimar tempo de leitura
wc -w book.txt após a extração dá uma contagem confiável — impossível de obter com precisão a partir do XHTML com tags do EPUBPreparar texto para um motor TTS
Converta para TXT para remover a marcação e envie o texto limpo a um sintetizador de vozPerguntas Frequentes
Para onde vai meu arquivo EPUB?
Ele é enviado ao servidor de conversão, processado com o ebook-convert do Calibre e devolvido a você como um arquivo .txt para download. O arquivo não é mantido após o fim da tarefa, mas trate tudo o que você envia como se tivesse saído do seu dispositivo e evite mandar material que você não pode compartilhar. O link de download é um ID de tarefa temporário, não uma URL permanente.
As imagens, a capa e a formatação são mantidas?
Não. O TXT não consegue representar imagens, cores, fontes nem ênfases, então o conversor preserva apenas os caracteres: negrito e itálico viram texto comum, capa e ilustrações internas são descartadas e os estilos CSS são eliminados. As quebras de parágrafo permanecem como linhas em branco, a única estrutura que o texto simples consegue preservar.
Por que meu TXT ficou vazio, ou por que a conversão falhou?
Quase sempre porque o livro não tem texto extraível. EPUBs digitalizados, quadrinhos e livros ilustrados de layout fixo guardam cada página como imagem, então não há nós de texto para extrair. O serviço verifica o tamanho da saída e reporta falha na conversão em vez de entregar um arquivo de zero byte. Se o seu EPUB abre bem no leitor mas não extrai nada, aplique OCR nas páginas primeiro.
Por que o TXT é tão menor que o EPUB?
Porque o texto é a menor parte de um livro eletrônico. Um EPUB comum inclui a capa, ilustrações internas e arquivos de fontes incorporadas, todos dados binários comprimidos; as palavras de verdade de um romance ocupam apenas algumas centenas de kilobytes. Uma redução de 80% a 95% é totalmente normal, e o painel de resultado mostra a proporção exata.
E o sumário e os títulos de capítulo?
O sumário não é regenerado como sumário — o TXT não tem esse conceito —, mas o texto dos títulos costuma sobreviver no lugar, em ordem de leitura. Entradas de nav.xhtml ou toc.ncx só permanecem se também aparecerem como texto visível no conteúdo. Na prática, divida o arquivo pelas linhas em branco ou por padrões de título para reconstruir as seções.
Posso converter um EPUB protegido por DRM?
Não. Livros travados com Adobe ADEPT, Apple FairPlay ou DRM da Amazon não podem ser abertos pelo conversor: o conteúdo é criptografado e a análise falha antes mesmo de chegar a qualquer texto. Use um EPUB sem DRM obtido legalmente, como um livro que você mesmo montou, uma obra em domínio público ou um arquivo para o qual você tem permissão explícita.
Quais outros formatos de livro eletrônico podem ser convertidos para TXT?
O endpoint TXT do servidor aceita 15 formatos de entrada no total: epub, mobi, azw3, azw, fb2, lit, prc, pdb, html, htm, xhtml, rtf, odt, docx e snb. Mas este site dedica uma página própria a cada formato, para que a validação no envio e as mensagens de erro correspondam ao que você está realmente convertendo. Esta página trata apenas de .epub.
Existe limite de conversões?
Sim. O endpoint é limitado a 2 requisições por minuto por endereço IP, contando todas as conversões de livro eletrônico. É folgado para uso normal — existe para que um script não sobrecarregue o servidor — e basta esperar um minuto se você atingir o limite.
Qual é a codificação da saída, e texto CJK funciona?
A saída é sempre UTF-8, forçada pelo argumento --txt-output-encoding utf-8, então chinês, japonês, coreano, cirílico, grego e letras latinas acentuadas chegam intactos. Se os caracteres aparecerem embaralhados após o download, a culpa é da codificação detectada pelo seu editor, não do arquivo — mude manualmente para UTF-8.
Ferramentas Relacionadas
Conversor de EPUB para PDF
Conversor online gratuito de EPUB para PDF. Transforma livros eletrônicos EPUB em documentos PDF com layout estável, preservando capítulos
Conversor de MOBI para EPUB
Conversor online gratuito de MOBI para EPUB. Transforma livros MOBI do Kindle no formato EPUB universal e fluido, preservando capítulos, capa e imagens.
Conversor de MOBI para PDF
Conversor online gratuito de MOBI para PDF. Transforma livros eletrônicos MOBI do Kindle em documentos PDF com layout estável, preservando capítulos
Conversor de AZW3 para PDF
Conversor online gratuito de AZW3 para PDF. Transforma livros Kindle AZW3 (KF8) em PDF estáveis, preservando capítulos, imagens e fontes.
Conversor de PDF para Word
Conversor de PDF para Word online gratuito. Saída em .docx ou .doc com conversão em um clique, preservação do layout e imagens.
Conversor de Word para PDF
Conversor de Word para PDF online gratuito. Suporta formatos .docx e .doc com conversão em um clique
