跳至內容
Coverton 部落格
在這篇文章中
文件與文字

擷取 DOCX、HWPX 文字並整理文本

将文档另存为 TXT 使其文字可重复使用,但不会保留原始页面布局或格式。選擇 DOCX、PPTX、ODT、EPUB、HWPX 或 RTF 的工具,然後將重要文字與來源進行比較。

使用免費工具 →

先檢查韓文文檔格式

HWPX 閱讀器可處理支援的段落、表格和圖片。舊版 HWP 不受支持,且閱讀器無法重現原始字體、形狀、方程式或分頁。保留提交原件並使用 TXT 結果進行文字重複使用。

仔細清理換行符和隱形字符

Copied-PDF 清理會加入內部換行符,同時保留空白行分隔的段落。根據來源審查表格、詩歌和清單。可選的不可見字元刪除僅影響 U+200B 和 BOM。 NFKC 和 NFKD 規範化也會變更相容性字元。

轉換與隱私檢查不同

Markdown-to-HTML 轉換文件標記;HTML-to-TXT 丟棄標籤和佈局。 Office 檢查器報告作者資訊、評論、隱藏表和外部連結追蹤。報告本身並不意味著這些項目已從文件中刪除。

選擇正確的工具

輸入範例說明了工作流程;他們不承諾特定的文件大小、識別準確性或相容性。

將 DOCX 轉換為 文字

提取文字以進行搜尋或組織。 TXT 副本不會複製文件佈局或圖片。

範例

文檔.docx → 提取文字.txt
  1. 選擇 DOCX 格式的檔案。每批最大檔案數:1。
  2. 查看表格列分隔符,然後開始處理。
  3. 下載 TXT 結果並檢查其內容和品質。
要檢查什麼

文字是提取的,而不是原始頁面佈局。不保留影像、格式和嵌入物件。不執行 OCR。

對於 Word 文件,文字部分是從文檔包中讀取的。檢查結果中的表格和文字欄位;他們的視覺安排沒有被採用。不支援舊的二進位 .doc 檔案。

開啟工具 →

將 PPTX 轉換為 文字

將投影片文字收集到工作記錄中。選擇分隔符號並檢查提取順序。

範例

Slides.pptx → 幻燈片分隔文字.txt
  1. 選擇 PPTX 格式的檔案。每批最大檔案數:1。
  2. 查看表格列分隔符,然後開始處理。
  3. 下載 TXT 結果並檢查其內容和品質。
要檢查什麼

閱讀順序可能與文字欄位的可見位置不同。影像和語音內容不會被轉錄。

開啟工具 →

將 ODT 轉換為 文字

從 OpenDocument 文件中提取純文字。 TXT 中不保留表格、字型和分頁。

範例

document.odt → 擷取的文字.txt
  1. 選擇 ODT 格式的檔案。每批最大檔案數:1。
  2. 查看表格列分隔符,然後開始處理。
  3. 下載 TXT 結果並檢查其內容和品質。
要檢查什麼

文字是提取的,而不是原始頁面佈局。不保留影像、格式和嵌入物件。不執行 OCR。

OpenDocument 分別儲存文字和樣式。 TXT輸出不採用範本、分欄或分頁符號作為固定佈局。匯出後檢查清單和表格。

開啟工具 →

將 EPUB 轉換為 文字

從受支援的 EPUB 收集文字以用於個人工作流程。檢視受保護書籍和複雜閱讀佈局的支援。

範例

book.epub → 普通閱讀文字.txt
  1. 選擇 EPUB 格式的檔案。每批最大檔案數:1。
  2. 查看表格列分隔符,然後開始處理。
  3. 下載 TXT 結果並檢查其內容和品質。
要檢查什麼

不支援受 DRM 保護的圖書。 TXT 中的導航、排版和插圖都遺失了。

開啟工具 →

將 HWPX 轉換為 文字

從 HWPX 中提取文字。舊版 HWP 和原始編輯版面的精確再現需要其他工作流程。

範例

document.hwpx → 節 text.txt
  1. 選擇 HWPX 格式的檔案。每批最大檔案數:1。
  2. 查看表格列分隔符,然後開始處理。
  3. 下載 TXT 結果並檢查其內容和品質。
要檢查什麼

HWPX 和舊的二進位 HWP 是不同的格式。帶有 .hwp 的檔案將無法開啟。

開啟工具 →

將 RTF 轉換為 文字

刪除文字副本支援的 RTF 控制項格式。將特殊字元和表格與來源進行比較。

範例

文檔.rtf → 純文字.txt
  1. 選擇 RTF 格式的檔案。每批最大檔案數:1。
  2. 檢查輸入格式和檔案順序,然後開始處理。
  3. 下載 TXT 結果並檢查其內容和品質。
要檢查什麼

文字是提取的,而不是原始頁面佈局。不保留影像、格式和嵌入物件。不執行 OCR。

富文本包含用於格式化和字元編碼的控製字。這些在文字匯出期間被刪除或評估。檢查結果中的特殊字元和較舊的代碼頁;不會提取嵌入的圖像。

開啟工具 →

將 MARKDOWN 轉換為 HTML

將 Markdown 寫作匯出為 HTML。檢查支援的標題、清單和段落的呈現方式。

範例

# 標題 + 段落 → document.html
  1. 選擇 MD, MARKDOWN 格式的檔案。每批最大檔案數:1。
  2. 查看HTML 文件樣式, 在新分頁中開啟鏈接,然後開始處理。
  3. 下載 HTML 結果並檢查其內容和品質。
要檢查什麼

支援有限的 Markdown 語法。複雜的表格、多行單元格、擴充功能和腳本尚未完全採用。

開啟工具 →

將 HTML 轉換為 文字

從 HTML 文件中提取文字。這不會訪問 URL 來抓取實時網站。

範例

已儲存頁面.html → 可讀文字.txt
  1. 選擇 HTML, HTM 格式的檔案。每批最大檔案數:1。
  2. 檢查輸入格式和檔案順序,然後開始處理。
  3. 下載 TXT 結果並檢查其內容和品質。
要檢查什麼

透過 JavaScript 重新載入的內容不會被檢索或執行。不保留 CSS 佈局。

開啟工具 →

閱讀 HWPX

閱讀支援的 HWPX 段落、表格和圖片並提取文字。不支援舊版 HWP 和精確版面編輯。

範例

document.hwpx → 支援的內容預覽 + TXT開啟工具 →

干净的文本列表

清除每行一項清單中的空白、重複項和空格。僅當打算更改順序時才排序。

範例

重複的行項目 → 已清理的行列表開啟工具 →

Unicode 标准化

規範化不同組成的 Unicode,包括分解的韓文文本。相容性規範化可以改變字元。

範例

分解文本 + NFC → 組合文本開啟工具 →

隱形字符

檢查複製的文字是否有不可見字符,並在刪除之前檢查位置和代碼點。

範例

帶有不可見字元的文字 → 位置/代碼點報告開啟工具 →

刪除換行符

在複製的散文中加入不需要的換行符。表格、詩歌和清單可能依賴有意的換行。

範例

包裹散文+空白段落→連結段落開啟工具 →

檢查 Office 文件中的隱藏訊息

在共享 Office 文件之前檢查作者元數據、評論和隱藏內容跟踪,然後在來源應用程式中對其進行編輯。

範例

辦公室文件→隱藏資訊檢查報告開啟工具 →

本指南介紹了公共網路工具及其支援限制。保留原件並檢查下載的結果。 Coverton · 更正及聯絡方式

此翻譯是在軟體協助下完成的。您也可以閱讀英文版本。 閱讀英文