DOCX・HWPXから文字を取り出し、テキストを整える
文書を TXT として保存すると、その単語が再利用可能になりますが、元のページ レイアウトや書式は保持されません。 DOCX、PPTX、ODT、EPUB、HWPX、または RTF のツールを選択し、重要なテキストをソースと比較します。
無料ツールを使う →まず韓国語の文書形式を確認してください
HWPX リーダーは、サポートされている段落、表、画像を処理します。レガシー HWP はサポートされておらず、リーダーは元のフォント、形状、数式、ページネーションを再現しません。送信のオリジナルを保存し、テキストの再利用に TXT の結果を使用します。
改行や非表示文字を慎重に削除する
Copied-PDF クリーンアップは、空白行で区切られた段落を保持しながら内部改行を結合します。出典と照らし合わせて表、詩、リストを確認します。オプションの非表示文字の削除は、U+200B および BOM にのみ影響します。 NFKC および NFKD の正規化でも互換性文字が変更されます。
変換はプライバシー検査とは異なります
Markdown-to-HTML はドキュメント マークアップを変換します。 HTML-to-TXT はタグとレイアウトを破棄します。 Office インスペクタは、作成者情報、コメント、非表示シート、外部リンク トレースをレポートします。レポートだけでは、それらの項目がファイルから削除されたことを意味しません。
目的に合うツールを選ぶ
入力例はワークフローを示しています。特定のファイル サイズ、認識精度、互換性を保証するものではありません。
DOCXからテキストを抽出
検索または整理のためにテキストを抽出します。 TXT コピーでは、ドキュメントのレイアウトや画像は再現されません。
例
document.docx → 抽出された text.txt- DOCXファイルを選択します。最大1ファイルを選べます。
- 文書の区切り方を確認し、処理を開始します。
- TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか
レイアウト、画像、変更履歴の構造は再現しません。画像内の文字のOCRも行いません。
PPTXからテキストを抽出
スライドのテキストを作業記録に収集します。区切り記号を選択し、抽出順序を確認します。
例
slides.pptx → スライド区切りテキスト.txt- PPTXファイルを選択します。最大1ファイルを選べます。
- 文書の区切り方を確認し、処理を開始します。
- TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか
テキストボックスの見た目の順序とは異なる場合があります。画像や音声の文字起こしは行いません。
ODTからテキストを抽出
OpenDocument ファイルからプレーン テキストを抽出します。表、フォント、ページネーションは TXT には保存されません。
例
document.odt → 抽出された text.txt- ODTファイルを選択します。最大1ファイルを選べます。
- 文書の区切り方を確認し、処理を開始します。
- TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか
ページ書式、埋め込みオブジェクト、表の完全な配置はプレーンテキストに保持されません。
EPUBからテキストを抽出
個人のワークフロー用にサポートされている EPUB からテキストを収集します。保護された書籍と複雑な読書レイアウトのサポートを確認してください。
例
book.epub → 平文テキスト.txt- EPUBファイルを選択します。最大1ファイルを選べます。
- 文書の区切り方を確認し、処理を開始します。
- TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか
DRM付きの本には対応しません。目次の操作、組版、挿絵はTXTに保持されません。
HWPXからテキストを抽出
HWPX からテキストを抽出します。従来の HWP と元の編集レイアウトを正確に再現するには、他のワークフローが必要です。
例
document.hwpx → セクション text.txt- HWPXファイルを選択します。最大1ファイルを選べます。
- 文書の区切り方を確認し、処理を開始します。
- TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか
HWPXと旧形式のバイナリHWPは別形式です。.hwpの読み込みやページ配置の保持はできません。
RTFをプレーンテキストに変換
テキスト コピーに対してサポートされている RTF コントロールの書式設定を削除します。特殊文字と表をソースと比較します。
例
document.rtf → プレーンテキスト.txt- RTFファイルを選択します。最大1ファイルを選べます。
- 入力形式とファイル順を確認して、処理を開始します。
- TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか
複雑なフィールド、埋め込みオブジェクト、特殊な文字コードは正確に再現できない場合があります。
MarkdownをHTMLに変換
Markdown の記述を HTML としてエクスポートします。サポートされている見出し、リスト、段落がどのようにレンダリングされるかを確認してください。
例
# 見出し + 段落 → document.html- MD, MARKDOWNファイルを選択します。最大1ファイルを選べます。
- HTML文書スタイル, リンクを新しいタブで開くを確認し、処理を開始します。
- HTMLの結果をダウンロードし、内容と品質を確認します。
何を確認するか
対応範囲を限定した変換です。すべての拡張記法、プラグイン、スクリプトには対応しません。
HTMLからテキストを抽出
HTML ファイルからテキストを抽出します。これは、ライブ Web サイトをスクレイピングするために URL にアクセスすることはありません。
例
保存されたページ.html → 読めるテキスト.txt- HTML, HTMファイルを選択します。最大1ファイルを選べます。
- 入力形式とファイル順を確認して、処理を開始します。
- TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか
JavaScriptだけで読み込む内容の取得・実行は行いません。CSSのレイアウトは保持しません。
HWPXを読む
サポートされている HWPX の段落、表、画像を読み取り、テキストを抽出します。従来の HWP と正確なレイアウト編集はサポートされていません。
例
document.hwpx → サポートされているコンテンツのプレビュー + TXTツールを開く →Unicode 正規化
分解された韓国語テキストを含む、さまざまに構成された Unicode を正規化します。互換性の正規化により文字が変更される可能性があります。
例
分解テキスト + NFC → 合成テキストツールを開く →Office ファイル内の非表示情報を検査する
Office ファイルを共有する前に、作成者のメタデータ、コメント、および非表示コンテンツのトレースを検査し、ソース アプリケーションで編集します。
例
オフィスファイル→隠蔽情報検査報告書ツールを開く →このガイドでは、パブリック Web ツールとそのサポート制限について説明します。オリジナルを保存して、ダウンロードした結果を確認してください。 Coverton · 訂正と連絡
この翻訳はソフトウェアの支援を利用して作成されました。英語版も読むことができます。 英語で読む