擷取 DOCX、HWPX 文字並整理文本
将文档另存为 TXT 使其文字可重复使用,但不会保留原始页面布局或格式。選擇 DOCX、PPTX、ODT、EPUB、HWPX 或 RTF 的工具,然後將重要文字與來源進行比較。
使用免費工具 →先檢查韓文文檔格式
HWPX 閱讀器可處理支援的段落、表格和圖片。舊版 HWP 不受支持,且閱讀器無法重現原始字體、形狀、方程式或分頁。保留提交原件並使用 TXT 結果進行文字重複使用。
仔細清理換行符和隱形字符
Copied-PDF 清理會加入內部換行符,同時保留空白行分隔的段落。根據來源審查表格、詩歌和清單。可選的不可見字元刪除僅影響 U+200B 和 BOM。 NFKC 和 NFKD 規範化也會變更相容性字元。
轉換與隱私檢查不同
Markdown-to-HTML 轉換文件標記;HTML-to-TXT 丟棄標籤和佈局。 Office 檢查器報告作者資訊、評論、隱藏表和外部連結追蹤。報告本身並不意味著這些項目已從文件中刪除。
選擇正確的工具
輸入範例說明了工作流程;他們不承諾特定的文件大小、識別準確性或相容性。
將 DOCX 轉換為 文字
提取文字以進行搜尋或組織。 TXT 副本不會複製文件佈局或圖片。
範例
文檔.docx → 提取文字.txt- 選擇 DOCX 格式的檔案。每批最大檔案數:1。
- 查看表格列分隔符,然後開始處理。
- 下載 TXT 結果並檢查其內容和品質。
要檢查什麼
文字是提取的,而不是原始頁面佈局。不保留影像、格式和嵌入物件。不執行 OCR。
對於 Word 文件,文字部分是從文檔包中讀取的。檢查結果中的表格和文字欄位;他們的視覺安排沒有被採用。不支援舊的二進位 .doc 檔案。
將 PPTX 轉換為 文字
將投影片文字收集到工作記錄中。選擇分隔符號並檢查提取順序。
範例
Slides.pptx → 幻燈片分隔文字.txt- 選擇 PPTX 格式的檔案。每批最大檔案數:1。
- 查看表格列分隔符,然後開始處理。
- 下載 TXT 結果並檢查其內容和品質。
要檢查什麼
閱讀順序可能與文字欄位的可見位置不同。影像和語音內容不會被轉錄。
將 ODT 轉換為 文字
從 OpenDocument 文件中提取純文字。 TXT 中不保留表格、字型和分頁。
範例
document.odt → 擷取的文字.txt- 選擇 ODT 格式的檔案。每批最大檔案數:1。
- 查看表格列分隔符,然後開始處理。
- 下載 TXT 結果並檢查其內容和品質。
要檢查什麼
文字是提取的,而不是原始頁面佈局。不保留影像、格式和嵌入物件。不執行 OCR。
OpenDocument 分別儲存文字和樣式。 TXT輸出不採用範本、分欄或分頁符號作為固定佈局。匯出後檢查清單和表格。
將 EPUB 轉換為 文字
從受支援的 EPUB 收集文字以用於個人工作流程。檢視受保護書籍和複雜閱讀佈局的支援。
範例
book.epub → 普通閱讀文字.txt- 選擇 EPUB 格式的檔案。每批最大檔案數:1。
- 查看表格列分隔符,然後開始處理。
- 下載 TXT 結果並檢查其內容和品質。
要檢查什麼
不支援受 DRM 保護的圖書。 TXT 中的導航、排版和插圖都遺失了。
將 HWPX 轉換為 文字
從 HWPX 中提取文字。舊版 HWP 和原始編輯版面的精確再現需要其他工作流程。
範例
document.hwpx → 節 text.txt- 選擇 HWPX 格式的檔案。每批最大檔案數:1。
- 查看表格列分隔符,然後開始處理。
- 下載 TXT 結果並檢查其內容和品質。
要檢查什麼
HWPX 和舊的二進位 HWP 是不同的格式。帶有 .hwp 的檔案將無法開啟。
將 RTF 轉換為 文字
刪除文字副本支援的 RTF 控制項格式。將特殊字元和表格與來源進行比較。
範例
文檔.rtf → 純文字.txt- 選擇 RTF 格式的檔案。每批最大檔案數:1。
- 檢查輸入格式和檔案順序,然後開始處理。
- 下載 TXT 結果並檢查其內容和品質。
要檢查什麼
文字是提取的,而不是原始頁面佈局。不保留影像、格式和嵌入物件。不執行 OCR。
富文本包含用於格式化和字元編碼的控製字。這些在文字匯出期間被刪除或評估。檢查結果中的特殊字元和較舊的代碼頁;不會提取嵌入的圖像。
將 MARKDOWN 轉換為 HTML
將 Markdown 寫作匯出為 HTML。檢查支援的標題、清單和段落的呈現方式。
範例
# 標題 + 段落 → document.html- 選擇 MD, MARKDOWN 格式的檔案。每批最大檔案數:1。
- 查看HTML 文件樣式, 在新分頁中開啟鏈接,然後開始處理。
- 下載 HTML 結果並檢查其內容和品質。
要檢查什麼
支援有限的 Markdown 語法。複雜的表格、多行單元格、擴充功能和腳本尚未完全採用。
將 HTML 轉換為 文字
從 HTML 文件中提取文字。這不會訪問 URL 來抓取實時網站。
範例
已儲存頁面.html → 可讀文字.txt- 選擇 HTML, HTM 格式的檔案。每批最大檔案數:1。
- 檢查輸入格式和檔案順序,然後開始處理。
- 下載 TXT 結果並檢查其內容和品質。
要檢查什麼
透過 JavaScript 重新載入的內容不會被檢索或執行。不保留 CSS 佈局。
本指南介紹了公共網路工具及其支援限制。保留原件並檢查下載的結果。 Coverton · 更正及聯絡方式
此翻譯是在軟體協助下完成的。您也可以閱讀英文版本。 閱讀英文