跳至内容
Coverton 博客
在这篇文章中
文件和文本

提取 DOCX、HWPX 文字并整理文本

将文档另存为 TXT 使其文字可重复使用,但不会保留原始页面布局或格式。选择 DOCX、PPTX、ODT、EPUB、HWPX 或 RTF 的工具,然后将重要文本与源进行比较。

使用免费工具 →

先检查韩文文档格式

HWPX 阅读器可处理支持的段落、表格和图片。旧版 HWP 不受支持,并且阅读器无法重现原始字体、形状、方程式或分页。保留提交原件并使用 TXT 结果进行文本重用。

仔细清理换行符和隐形字符

Copied-PDF 清理会加入内部换行符,同时保留空行分隔的段落。根据来源审查表格、诗歌和列表。可选的不可见字符删除仅影响 U+200B 和 BOM。 NFKC 和 NFKD 规范化也会更改兼容性字符。

转换与隐私检查不同

Markdown-to-HTML 转换文档标记; HTML-to-TXT 丢弃标签和布局。 Office 检查器报告作者信息、评论、隐藏表和外部链接跟踪。报告本身并不意味着这些项目已从文件中删除。

选择正确的工具

输入示例说明了工作流程;他们不承诺特定的文件大小、识别准确性或兼容性。

DOCX 转 文本

提取文本以进行搜索或组织。 TXT 副本不会复制文档布局或图片。

示例

文档.docx → 提取文本.txt
  1. 选择 DOCX 文件,最多可选 1 个。
  2. 检查设置(文档分隔方式),然后开始处理。
  3. 下载 TXT 结果并检查内容与质量。
要检查什么

提取的是文字,不是原始排版。不保留图片、样式或嵌入对象,也不进行 OCR。

从 Word 文档包中读取文字。请检查表格和文本框内容,结果不保留其视觉布局。不支持旧版二进制 .doc 文件。

打开工具 →

PPTX 转 文本

将幻灯片文本收集到工作记录中。选择分隔符并检查提取顺序。

示例

Slides.pptx → 幻灯片分隔文本.txt
  1. 选择 PPTX 文件,最多可选 1 个。
  2. 检查设置(文档分隔方式),然后开始处理。
  3. 下载 TXT 结果并检查内容与质量。
要检查什么

读取顺序可能与文本框的视觉位置不同,不会转录图片或语音内容。

打开工具 →

ODT 转 文本

从 OpenDocument 文件中提取纯文本。 TXT 中不保留表格、字体和分页。

示例

document.odt → 提取的文本.txt
  1. 选择 ODT 文件,最多可选 1 个。
  2. 检查设置(文档分隔方式),然后开始处理。
  3. 下载 TXT 结果并检查内容与质量。
要检查什么

提取的是文字,不是原始排版。不保留图片、样式或嵌入对象,也不进行 OCR。

OpenDocument 将文字与样式分开存储。TXT 不保留模板、分栏或固定分页布局。导出后请检查列表和表格。

打开工具 →

EPUB 转 文本

从受支持的 EPUB 收集文本以用于个人工作流程。检查对受保护书籍和复杂阅读布局的支持。

示例

book.epub → 普通阅读文本.txt
  1. 选择 EPUB 文件,最多可选 1 个。
  2. 检查设置(文档分隔方式),然后开始处理。
  3. 下载 TXT 结果并检查内容与质量。
要检查什么

不支持受 DRM 保护的电子书。TXT 不保留导航、字体排版或插图。

打开工具 →

HWPX 转 文本

从 HWPX 中提取文本。旧版 HWP 和原始编辑布局的精确再现需要其他工作流程。

示例

document.hwpx → 节 text.txt
  1. 选择 HWPX 文件,最多可选 1 个。
  2. 检查设置(文档分隔方式),然后开始处理。
  3. 下载 TXT 结果并检查内容与质量。
要检查什么

HWPX 与旧版二进制 HWP 不同,本工具无法打开 .hwp 文件。

打开工具 →

RTF 转 文本

删除文本副本支持的 RTF 控件格式。将特殊字符和表格与源进行比较。

示例

文档.rtf → 纯文本.txt
  1. 选择 RTF 文件,最多可选 1 个。
  2. 检查输入格式和文件顺序,然后开始处理。
  3. 下载 TXT 结果并检查内容与质量。
要检查什么

提取的是文字,不是原始排版。不保留图片、样式或嵌入对象,也不进行 OCR。

Rich Text 包含格式与字符编码控制字,提取文字时会移除或解析这些控制字。请核对特殊字符和旧编码内容,不提取嵌入图片。

打开工具 →

MARKDOWN 转 HTML

将 Markdown 写作导出为 HTML。检查支持的标题、列表和段落的呈现方式。

示例

# 标题 + 段落 → document.html
  1. 选择 MD, MARKDOWN 文件,最多可选 1 个。
  2. 检查设置(HTML 文档样式, 在新标签页打开链接),然后开始处理。
  3. 下载 HTML 结果并检查内容与质量。
要检查什么

仅支持有限的 Markdown 语法,复杂表格、多行单元格、扩展和脚本可能无法完整保留。

打开工具 →

HTML 转 文本

从 HTML 文件中提取文本。这不会访问 URL 来抓取实时网站。

示例

已保存页面.html → 可读文本.txt
  1. 选择 HTML, HTM 文件,最多可选 1 个。
  2. 检查输入格式和文件顺序,然后开始处理。
  3. 下载 TXT 结果并检查内容与质量。
要检查什么

不会获取或执行仅通过 JavaScript 加载的内容,也不保留 CSS 布局。

打开工具 →

阅读 HWPX

阅读支持的 HWPX 段落、表格和图片并提取文本。不支持旧版 HWP 和精确布局编辑。

示例

document.hwpx → 支持的内容预览 + TXT打开工具 →

干净的文本列表

清除每行一项列表中的空白、重复项和空格。仅当打算更改顺序时才排序。

示例

重复的行项目 → 已清理的行列表打开工具 →

Unicode 标准化

规范化不同组成的 Unicode,包括分解的韩文文本。兼容性规范化可以改变字符。

示例

分解文本 + NFC → 组合文本打开工具 →

隐形字符

检查复制的文本是否有不可见字符,并在删除之前检查位置和代码点。

示例

带有不可见字符的文本 → 位置/代码点报告打开工具 →

删除换行符

在复制的散文中加入不需要的换行符。表格、诗歌和列表可能依赖于有意的换行。

示例

包裹散文+空白段落→连接段落打开工具 →

检查 Office 文件中的隐藏信息

在共享 Office 文件之前检查作者元数据、评论和隐藏内容跟踪,然后在源应用程序中对其进行编辑。

示例

办公文件→隐藏信息检查报告打开工具 →

本指南介绍了公共网络工具及其支持限制。保留原件并检查下载的结果。 Coverton · 更正及联系方式

此翻译是在软件协助下完成的。您也可以阅读英文版本。 阅读英文