Pular para o conteúdo
Coverton Blogue
Neste artigo
Documentos e texto

Extraia e limpe texto de DOCX, HWPX e documentos copiados

Salvar um documento como TXT torna suas palavras reutilizáveis, mas não mantém o layout ou a formatação original da página. Selecione a ferramenta para DOCX, PPTX, ODT, EPUB, HWPX ou RTF e compare o texto importante com a fonte.

Use a ferramenta gratuita →

Verifique primeiro o formato do documento coreano

O leitor HWPX lida com parágrafos, tabelas e imagens compatíveis. O HWP legado não é compatível e o leitor não reproduz fontes, formas, equações ou paginação originais. Preservar o original da submissão e utilizar o resultado TXT para reutilização de texto.

Limpe cuidadosamente as quebras de linha e os caracteres invisíveis

A limpeza Copied-PDF une quebras de linha internas, mantendo parágrafos separados por linhas em branco. Revise tabelas, poemas e listas em relação à fonte. A remoção opcional de caracteres invisíveis afeta apenas U+200B e BOM. A normalização NFKC e NFKD também altera os caracteres de compatibilidade.

A conversão é diferente da inspeção de privacidade

Markdown em HTML converte a marcação do documento; HTML-to-TXT descarta tags e layout. O inspetor Office relata informações do autor, comentários, planilhas ocultas e rastreamentos de links externos. Um relatório por si só não significa que esses itens foram removidos do arquivo.

Escolha a ferramenta certa

Exemplos de entradas ilustram o fluxo de trabalho; eles não prometem um tamanho de arquivo específico, precisão de reconhecimento ou compatibilidade.

Converter DOCX para Texto

Extraia texto para pesquisar ou organizar. A cópia TXT não reproduz o layout do documento ou imagens.

Exemplo

documento.docx → texto.txt extraído
  1. Escolha arquivos no formato DOCX. Máximo: 1.
  2. Confira as configurações (Separador de documentos) e inicie o processamento.
  3. Baixe o resultado TXT e confira o conteúdo e a qualidade.
O que verificar

O texto é extraído, não o layout original. Imagens, estilos e objetos incorporados não são mantidos. Não há OCR.

O texto é lido do conteúdo do documento do Word. Confira tabelas e caixas de texto: a disposição visual não é preservada. Arquivos binários antigos .doc não são aceitos.

Abra a ferramenta →

Converter PPTX para Texto

Colete o texto do slide em uma transcrição funcional. Escolha um separador e revise a ordem de extração.

Exemplo

slides.pptx → texto.txt separado por slides
  1. Escolha arquivos no formato PPTX. Máximo: 1.
  2. Confira as configurações (Separador de documentos) e inicie o processamento.
  3. Baixe o resultado TXT e confira o conteúdo e a qualidade.
O que verificar

A ordem pode diferir da posição visual das caixas de texto. Imagens e fala não são transcritas.

Abra a ferramenta →

Converter ODT para Texto

Extraia texto simples de um arquivo OpenDocument. Tabelas, fontes e paginação não são preservadas em TXT.

Exemplo

document.odt → texto.txt extraído
  1. Escolha arquivos no formato ODT. Máximo: 1.
  2. Confira as configurações (Separador de documentos) e inicie o processamento.
  3. Baixe o resultado TXT e confira o conteúdo e a qualidade.
O que verificar

O texto é extraído, não o layout original. Imagens, estilos e objetos incorporados não são mantidos. Não há OCR.

O OpenDocument separa texto e estilos. O TXT não mantém modelos, colunas ou quebras de página como layout fixo. Confira listas e tabelas após a exportação.

Abra a ferramenta →

Converter EPUB para Texto

Colete texto de um EPUB compatível para fluxos de trabalho pessoais. Verifique o suporte para livros protegidos e layouts de leitura complexos.

Exemplo

book.epub → texto de leitura simples.txt
  1. Escolha arquivos no formato EPUB. Máximo: 1.
  2. Confira as configurações (Separador de documentos) e inicie o processamento.
  3. Baixe o resultado TXT e confira o conteúdo e a qualidade.
O que verificar

Livros protegidos por DRM não são aceitos. Navegação, tipografia e ilustrações não são mantidas no TXT.

Abra a ferramenta →

Converter HWPX para Texto

Extraia texto do HWPX. O HWP legado e a reprodução precisa do layout de edição original exigem outros fluxos de trabalho.

Exemplo

documento.hwpx → seção text.txt
  1. Escolha arquivos no formato HWPX. Máximo: 1.
  2. Confira as configurações (Separador de documentos) e inicie o processamento.
  3. Baixe o resultado TXT e confira o conteúdo e a qualidade.
O que verificar

HWPX e o HWP binário antigo são diferentes. Arquivos .hwp não são abertos.

Abra a ferramenta →

Converter RTF para Texto

Remova a formatação de controle RTF compatível para uma cópia de texto. Compare caracteres especiais e tabelas com a fonte.

Exemplo

documento.rtf → texto simples.txt
  1. Escolha arquivos no formato RTF. Máximo: 1.
  2. Confira o formato e a ordem dos arquivos e inicie o processamento.
  3. Baixe o resultado TXT e confira o conteúdo e a qualidade.
O que verificar

O texto é extraído, não o layout original. Imagens, estilos e objetos incorporados não são mantidos. Não há OCR.

Rich Text contém comandos de formatação e codificação que são removidos ou interpretados na extração. Confira caracteres especiais e codificações antigas. Imagens incorporadas não são extraídas.

Abra a ferramenta →

Converter MARKDOWN para HTML

Exporte a escrita Markdown como HTML. Verifique como os títulos, listas e parágrafos suportados são renderizados.

Exemplo

# Título + parágrafos → document.html
  1. Escolha arquivos no formato MD, MARKDOWN. Máximo: 1.
  2. Confira as configurações (Estilo do documento HTML, Abrir links em nova aba) e inicie o processamento.
  3. Baixe o resultado HTML e confira o conteúdo e a qualidade.
O que verificar

Uma sintaxe Markdown limitada é suportada. Tabelas complexas, células multilinha, extensões e scripts não são totalmente preservados.

Abra a ferramenta →

Converter HTML para Texto

Extraia texto de um arquivo HTML. Isso não visita um URL para copiar um site ativo.

Exemplo

página salva.html → texto legível.txt
  1. Escolha arquivos no formato HTML, HTM. Máximo: 1.
  2. Confira o formato e a ordem dos arquivos e inicie o processamento.
  3. Baixe o resultado TXT e confira o conteúdo e a qualidade.
O que verificar

Conteúdo carregado por JavaScript não é buscado nem executado. O layout CSS não é mantido.

Abra a ferramenta →

Leia HWPX

Leia parágrafos, tabelas e imagens compatíveis com HWPX e extraia texto. HWP legado e edição precisa de layout não são suportados.

Exemplo

document.hwpx → visualização de conteúdo compatível + TXTAbra a ferramenta →

Limpar lista de texto

Limpe espaços em branco, duplicatas e espaços em branco em listas de um item por linha. Classifique apenas quando se pretende alterar a ordem.

Exemplo

itens de linha repetidos → lista de linhas limpasAbra a ferramenta →

Normalização Unicode

Normalize Unicode composto de forma diferente, incluindo texto coreano decomposto. A normalização da compatibilidade pode alterar os caracteres.

Exemplo

texto decomposto + NFC → texto compostoAbra a ferramenta →

Personagens invisíveis

Inspecione o texto copiado em busca de caracteres invisíveis e revise as posições e pontos de código antes da remoção.

Exemplo

texto com caracteres invisíveis → relatório de localização/ponto de códigoAbra a ferramenta →

Remover quebras de linha

Junte-se a quebras de linha indesejadas em prosa copiada. Tabelas, poemas e listas podem depender de quebras de linha intencionais.

Exemplo

prosa embrulhada + parágrafos em branco → parágrafos unidosAbra a ferramenta →

Inspecione informações ocultas em arquivos do Office

Inspecione metadados do autor, comentários e rastreamentos de conteúdo oculto antes de compartilhar arquivos do Office e edite-os no aplicativo de origem.

Exemplo

Arquivo Office → relatório de inspeção de informações ocultasAbra a ferramenta →

Este guia descreve as ferramentas públicas da Web e seus limites de suporte. Mantenha o original e verifique o resultado baixado. Coverton · Correções e contato

Esta tradução foi preparada com auxílio de software. Você também pode ler a versão em inglês. Leia em inglês