Saltar al contenido
Coverton Blog
En este artículo
Documentos y texto

Extraer y limpiar texto de documentos DOCX y HWPX

Guardar un documento como TXT hace que sus palabras sean reutilizables, pero no conserva el diseño ni el formato de página original. Seleccione la herramienta para DOCX, PPTX, ODT, EPUB, HWPX o RTF, luego compare el texto importante con la fuente.

Utilice la herramienta gratuita →

Primero verifique el formato del documento coreano.

El lector HWPX maneja párrafos, tablas e imágenes compatibles. Legacy HWP no es compatible y el lector no reproduce fuentes, formas, ecuaciones o paginaciones originales. Conserve el envío original y utilice el resultado TXT para reutilizar el texto.

Limpie cuidadosamente los saltos de línea y los caracteres invisibles.

La limpieza Copied-PDF une saltos de línea internos y conserva párrafos separados por líneas en blanco. Revisar tablas, poemas y listas con la fuente. La eliminación opcional de caracteres invisibles afecta únicamente a U+200B y BOM. La normalización NFKC y NFKD también cambia los caracteres de compatibilidad.

La conversión es diferente de la inspección de privacidad

Markdown-to-HTML convierte el marcado de documentos; HTML-to-TXT descarta etiquetas y diseño. El inspector Office informa información del autor, comentarios, hojas ocultas y seguimientos de enlaces externos. Un informe por sí solo no significa que esos elementos hayan sido eliminados del expediente.

Elija la herramienta adecuada

Las entradas de ejemplo ilustran el flujo de trabajo; no prometen un tamaño de archivo, precisión de reconocimiento o compatibilidad en particular.

Convertir DOCX a Texto

Extraiga texto para buscar u organizar. La copia TXT no reproduce el diseño del documento ni las imágenes.

Ejemplo

documento.docx → texto.txt extraído
  1. Elige archivos en formato DOCX. Máximo: 1.
  2. Revisa los ajustes (Separador de documentos) e inicia el proceso.
  3. Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar

Se extrae texto, no el diseño original. No se conservan imágenes, estilos ni objetos incrustados. No se aplica OCR.

El texto se lee del contenido del documento de Word. Revisa las tablas y los cuadros de texto: no se conserva su disposición visual. No se admiten los antiguos archivos binarios .doc.

Abre la herramienta →

Convertir PPTX a Texto

Recopile el texto de la diapositiva en una transcripción funcional. Elija un separador y revise el orden de extracción.

Ejemplo

diapositivas.pptx → texto.txt separado por diapositivas
  1. Elige archivos en formato PPTX. Máximo: 1.
  2. Revisa los ajustes (Separador de documentos) e inicia el proceso.
  3. Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar

El orden puede diferir de la posición visual de los cuadros de texto. No se transcriben imágenes ni voz.

Abre la herramienta →

Convertir ODT a Texto

Extraiga texto sin formato de un archivo OpenDocument. Las tablas, fuentes y paginación no se conservan en TXT.

Ejemplo

documento.odt → texto.txt extraído
  1. Elige archivos en formato ODT. Máximo: 1.
  2. Revisa los ajustes (Separador de documentos) e inicia el proceso.
  3. Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar

Se extrae texto, no el diseño original. No se conservan imágenes, estilos ni objetos incrustados. No se aplica OCR.

OpenDocument separa el texto de los estilos. TXT no conserva plantillas, columnas ni saltos de página como diseño fijo. Revisa las listas y las tablas después de exportar.

Abre la herramienta →

Convertir EPUB a Texto

Recopile texto de un EPUB compatible para flujos de trabajo personales. Consulte la compatibilidad con libros protegidos y diseños de lectura complejos.

Ejemplo

libro.epub → texto de lectura simple.txt
  1. Elige archivos en formato EPUB. Máximo: 1.
  2. Revisa los ajustes (Separador de documentos) e inicia el proceso.
  3. Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar

No se admiten libros protegidos por DRM. TXT pierde navegación, tipografía e ilustraciones.

Abre la herramienta →

Convertir HWPX a Texto

Extraiga texto de HWPX. El HWP heredado y la reproducción precisa del diseño de edición original requieren otros flujos de trabajo.

Ejemplo

documento.hwpx → sección texto.txt
  1. Elige archivos en formato HWPX. Máximo: 1.
  2. Revisa los ajustes (Separador de documentos) e inicia el proceso.
  3. Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar

HWPX y el antiguo HWP binario son distintos. No se abren archivos .hwp.

Abre la herramienta →

Convertir RTF a Texto

Elimine el formato de control RTF compatible para una copia de texto. Compare caracteres especiales y tablas con la fuente.

Ejemplo

documento.rtf → texto plano.txt
  1. Elige archivos en formato RTF. Máximo: 1.
  2. Revisa el formato y el orden de los archivos e inicia el proceso.
  3. Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar

Se extrae texto, no el diseño original. No se conservan imágenes, estilos ni objetos incrustados. No se aplica OCR.

Rich Text contiene comandos de formato y codificación que se eliminan o interpretan al extraer el texto. Revisa los caracteres especiales y las codificaciones antiguas. No se extraen imágenes incrustadas.

Abre la herramienta →

Convertir MARKDOWN a HTML

Exporte la escritura de Markdown como HTML. Compruebe cómo se representan los títulos, listas y párrafos admitidos.

Ejemplo

# Encabezado + párrafos → document.html
  1. Elige archivos en formato MD, MARKDOWN. Máximo: 1.
  2. Revisa los ajustes (Estilo del documento HTML, Abrir enlaces en otra pestaña) e inicia el proceso.
  3. Descarga el resultado HTML y revisa su contenido y calidad.
Que comprobar

Se admite una sintaxis Markdown limitada. Tablas complejas, celdas multilínea, extensiones y scripts no se conservan por completo.

Abre la herramienta →

Convertir HTML a Texto

Extraiga texto de un archivo HTML. Esto no visita una URL para extraer un sitio web activo.

Ejemplo

página guardada.html → texto legible.txt
  1. Elige archivos en formato HTML, HTM. Máximo: 1.
  2. Revisa el formato y el orden de los archivos e inicia el proceso.
  3. Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar

No se descarga ni ejecuta contenido cargado con JavaScript. No se conserva el diseño CSS.

Abre la herramienta →

Leer HWPX

Lea párrafos, tablas e imágenes HWPX compatibles y extraiga texto. No se admiten HWP heredados ni edición de diseño precisa.

Ejemplo

document.hwpx → vista previa de contenido compatible + TXTAbre la herramienta →

Lista de texto limpio

Limpie los espacios en blanco, duplicados y espacios en blanco en listas de un elemento por línea. Ordene sólo cuando se pretenda cambiar el orden.

Ejemplo

líneas de pedido repetidas → lista de líneas limpiasAbre la herramienta →

normalizar Unicode

Normalice Unicode con composiciones diferentes, incluido el texto coreano descompuesto. La normalización de compatibilidad puede alterar los caracteres.

Ejemplo

texto descompuesto + NFC → texto compuestoAbre la herramienta →

Personajes invisibles

Inspeccione el texto copiado en busca de caracteres invisibles y revise las posiciones y puntos de código antes de eliminarlo.

Ejemplo

texto con caracteres invisibles → informe de ubicación/punto de códigoAbre la herramienta →

Eliminar saltos de línea

Únase a saltos de línea no deseados en prosa copiada. Las tablas, poemas y listas pueden depender de saltos de línea intencionales.

Ejemplo

prosa empaquetada + párrafos en blanco → párrafos unidosAbre la herramienta →

Inspeccionar información oculta en archivos de Office

Inspeccione los metadatos del autor, los comentarios y los rastros de contenido oculto antes de compartir archivos de Office y luego edítelos en la aplicación de origen.

Ejemplo

Archivo de Office → informe de inspección de información ocultaAbre la herramienta →

Esta guía describe las herramientas web públicas y sus límites de soporte. Conserve su original y verifique el resultado descargado. Coverton · Correcciones y contacto

Esta traducción fue preparada con asistencia de software. También puedes leer la versión en inglés. Leer en ingles