Extraer y limpiar texto de documentos DOCX y HWPX
Guardar un documento como TXT hace que sus palabras sean reutilizables, pero no conserva el diseño ni el formato de página original. Seleccione la herramienta para DOCX, PPTX, ODT, EPUB, HWPX o RTF, luego compare el texto importante con la fuente.
Utilice la herramienta gratuita →Primero verifique el formato del documento coreano.
El lector HWPX maneja párrafos, tablas e imágenes compatibles. Legacy HWP no es compatible y el lector no reproduce fuentes, formas, ecuaciones o paginaciones originales. Conserve el envío original y utilice el resultado TXT para reutilizar el texto.
Limpie cuidadosamente los saltos de línea y los caracteres invisibles.
La limpieza Copied-PDF une saltos de línea internos y conserva párrafos separados por líneas en blanco. Revisar tablas, poemas y listas con la fuente. La eliminación opcional de caracteres invisibles afecta únicamente a U+200B y BOM. La normalización NFKC y NFKD también cambia los caracteres de compatibilidad.
La conversión es diferente de la inspección de privacidad
Markdown-to-HTML convierte el marcado de documentos; HTML-to-TXT descarta etiquetas y diseño. El inspector Office informa información del autor, comentarios, hojas ocultas y seguimientos de enlaces externos. Un informe por sí solo no significa que esos elementos hayan sido eliminados del expediente.
Elija la herramienta adecuada
Las entradas de ejemplo ilustran el flujo de trabajo; no prometen un tamaño de archivo, precisión de reconocimiento o compatibilidad en particular.
Convertir DOCX a Texto
Extraiga texto para buscar u organizar. La copia TXT no reproduce el diseño del documento ni las imágenes.
Ejemplo
documento.docx → texto.txt extraído- Elige archivos en formato DOCX. Máximo: 1.
- Revisa los ajustes (Separador de documentos) e inicia el proceso.
- Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar
Se extrae texto, no el diseño original. No se conservan imágenes, estilos ni objetos incrustados. No se aplica OCR.
El texto se lee del contenido del documento de Word. Revisa las tablas y los cuadros de texto: no se conserva su disposición visual. No se admiten los antiguos archivos binarios .doc.
Convertir PPTX a Texto
Recopile el texto de la diapositiva en una transcripción funcional. Elija un separador y revise el orden de extracción.
Ejemplo
diapositivas.pptx → texto.txt separado por diapositivas- Elige archivos en formato PPTX. Máximo: 1.
- Revisa los ajustes (Separador de documentos) e inicia el proceso.
- Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar
El orden puede diferir de la posición visual de los cuadros de texto. No se transcriben imágenes ni voz.
Convertir ODT a Texto
Extraiga texto sin formato de un archivo OpenDocument. Las tablas, fuentes y paginación no se conservan en TXT.
Ejemplo
documento.odt → texto.txt extraído- Elige archivos en formato ODT. Máximo: 1.
- Revisa los ajustes (Separador de documentos) e inicia el proceso.
- Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar
Se extrae texto, no el diseño original. No se conservan imágenes, estilos ni objetos incrustados. No se aplica OCR.
OpenDocument separa el texto de los estilos. TXT no conserva plantillas, columnas ni saltos de página como diseño fijo. Revisa las listas y las tablas después de exportar.
Convertir EPUB a Texto
Recopile texto de un EPUB compatible para flujos de trabajo personales. Consulte la compatibilidad con libros protegidos y diseños de lectura complejos.
Ejemplo
libro.epub → texto de lectura simple.txt- Elige archivos en formato EPUB. Máximo: 1.
- Revisa los ajustes (Separador de documentos) e inicia el proceso.
- Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar
No se admiten libros protegidos por DRM. TXT pierde navegación, tipografía e ilustraciones.
Convertir HWPX a Texto
Extraiga texto de HWPX. El HWP heredado y la reproducción precisa del diseño de edición original requieren otros flujos de trabajo.
Ejemplo
documento.hwpx → sección texto.txt- Elige archivos en formato HWPX. Máximo: 1.
- Revisa los ajustes (Separador de documentos) e inicia el proceso.
- Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar
HWPX y el antiguo HWP binario son distintos. No se abren archivos .hwp.
Convertir RTF a Texto
Elimine el formato de control RTF compatible para una copia de texto. Compare caracteres especiales y tablas con la fuente.
Ejemplo
documento.rtf → texto plano.txt- Elige archivos en formato RTF. Máximo: 1.
- Revisa el formato y el orden de los archivos e inicia el proceso.
- Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar
Se extrae texto, no el diseño original. No se conservan imágenes, estilos ni objetos incrustados. No se aplica OCR.
Rich Text contiene comandos de formato y codificación que se eliminan o interpretan al extraer el texto. Revisa los caracteres especiales y las codificaciones antiguas. No se extraen imágenes incrustadas.
Convertir MARKDOWN a HTML
Exporte la escritura de Markdown como HTML. Compruebe cómo se representan los títulos, listas y párrafos admitidos.
Ejemplo
# Encabezado + párrafos → document.html- Elige archivos en formato MD, MARKDOWN. Máximo: 1.
- Revisa los ajustes (Estilo del documento HTML, Abrir enlaces en otra pestaña) e inicia el proceso.
- Descarga el resultado HTML y revisa su contenido y calidad.
Que comprobar
Se admite una sintaxis Markdown limitada. Tablas complejas, celdas multilínea, extensiones y scripts no se conservan por completo.
Convertir HTML a Texto
Extraiga texto de un archivo HTML. Esto no visita una URL para extraer un sitio web activo.
Ejemplo
página guardada.html → texto legible.txt- Elige archivos en formato HTML, HTM. Máximo: 1.
- Revisa el formato y el orden de los archivos e inicia el proceso.
- Descarga el resultado TXT y revisa su contenido y calidad.
Que comprobar
No se descarga ni ejecuta contenido cargado con JavaScript. No se conserva el diseño CSS.
Leer HWPX
Lea párrafos, tablas e imágenes HWPX compatibles y extraiga texto. No se admiten HWP heredados ni edición de diseño precisa.
Ejemplo
document.hwpx → vista previa de contenido compatible + TXTAbre la herramienta →Lista de texto limpio
Limpie los espacios en blanco, duplicados y espacios en blanco en listas de un elemento por línea. Ordene sólo cuando se pretenda cambiar el orden.
Ejemplo
líneas de pedido repetidas → lista de líneas limpiasAbre la herramienta →normalizar Unicode
Normalice Unicode con composiciones diferentes, incluido el texto coreano descompuesto. La normalización de compatibilidad puede alterar los caracteres.
Ejemplo
texto descompuesto + NFC → texto compuestoAbre la herramienta →Personajes invisibles
Inspeccione el texto copiado en busca de caracteres invisibles y revise las posiciones y puntos de código antes de eliminarlo.
Ejemplo
texto con caracteres invisibles → informe de ubicación/punto de códigoAbre la herramienta →Eliminar saltos de línea
Únase a saltos de línea no deseados en prosa copiada. Las tablas, poemas y listas pueden depender de saltos de línea intencionales.
Ejemplo
prosa empaquetada + párrafos en blanco → párrafos unidosAbre la herramienta →Inspeccionar información oculta en archivos de Office
Inspeccione los metadatos del autor, los comentarios y los rastros de contenido oculto antes de compartir archivos de Office y luego edítelos en la aplicación de origen.
Ejemplo
Archivo de Office → informe de inspección de información ocultaAbre la herramienta →Esta guía describe las herramientas web públicas y sus límites de soporte. Conserve su original y verifique el resultado descargado. Coverton · Correcciones y contacto
Esta traducción fue preparada con asistencia de software. También puedes leer la versión en inglés. Leer en ingles