コンテンツにスキップ
Coverton ブログ
この記事では
文書とテキスト

DOCX・HWPXから文字を取り出し、テキストを整える

文書を TXT として保存すると、その単語が再利用可能になりますが、元のページ レイアウトや書式は保持されません。 DOCX、PPTX、ODT、EPUB、HWPX、または RTF のツールを選択し、重要なテキストをソースと比較します。

無料ツールを使う →

まず韓国語の文書形式を確認してください

HWPX リーダーは、サポートされている段落、表、画像を処理します。レガシー HWP はサポートされておらず、リーダーは元のフォント、形状、数式、ページネーションを再現しません。送信のオリジナルを保存し、テキストの再利用に TXT の結果を使用します。

改行や非表示文字を慎重に削除する

Copied-PDF クリーンアップは、空白行で区切られた段落を保持しながら内部改行を結合します。出典と照らし合わせて表、詩、リストを確認します。オプションの非表示文字の削除は、U+200B および BOM にのみ影響します。 NFKC および NFKD の正規化でも互換性文字が変更されます。

変換はプライバシー検査とは異なります

Markdown-to-HTML はドキュメント マークアップを変換します。 HTML-to-TXT はタグとレイアウトを破棄します。 Office インスペクタは、作成者情報、コメント、非表示シート、外部リンク トレースをレポートします。レポートだけでは、それらの項目がファイルから削除されたことを意味しません。

目的に合うツールを選ぶ

入力例はワークフローを示しています。特定のファイル サイズ、認識精度、互換性を保証するものではありません。

DOCXからテキストを抽出

検索または整理のためにテキストを抽出します。 TXT コピーでは、ドキュメントのレイアウトや画像は再現されません。

例

document.docx → 抽出された text.txt
  1. DOCXファイルを選択します。最大1ファイルを選べます。
  2. 文書の区切り方を確認し、処理を開始します。
  3. TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか

レイアウト、画像、変更履歴の構造は再現しません。画像内の文字のOCRも行いません。

ツールを開く →

PPTXからテキストを抽出

スライドのテキストを作業記録に収集します。区切り記号を選択し、抽出順序を確認します。

例

slides.pptx → スライド区切りテキスト.txt
  1. PPTXファイルを選択します。最大1ファイルを選べます。
  2. 文書の区切り方を確認し、処理を開始します。
  3. TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか

テキストボックスの見た目の順序とは異なる場合があります。画像や音声の文字起こしは行いません。

ツールを開く →

ODTからテキストを抽出

OpenDocument ファイルからプレーン テキストを抽出します。表、フォント、ページネーションは TXT には保存されません。

例

document.odt → 抽出された text.txt
  1. ODTファイルを選択します。最大1ファイルを選べます。
  2. 文書の区切り方を確認し、処理を開始します。
  3. TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか

ページ書式、埋め込みオブジェクト、表の完全な配置はプレーンテキストに保持されません。

ツールを開く →

EPUBからテキストを抽出

個人のワークフロー用にサポートされている EPUB からテキストを収集します。保護された書籍と複雑な読書レイアウトのサポートを確認してください。

例

book.epub → 平文テキスト.txt
  1. EPUBファイルを選択します。最大1ファイルを選べます。
  2. 文書の区切り方を確認し、処理を開始します。
  3. TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか

DRM付きの本には対応しません。目次の操作、組版、挿絵はTXTに保持されません。

ツールを開く →

HWPXからテキストを抽出

HWPX からテキストを抽出します。従来の HWP と元の編集レイアウトを正確に再現するには、他のワークフローが必要です。

例

document.hwpx → セクション text.txt
  1. HWPXファイルを選択します。最大1ファイルを選べます。
  2. 文書の区切り方を確認し、処理を開始します。
  3. TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか

HWPXと旧形式のバイナリHWPは別形式です。.hwpの読み込みやページ配置の保持はできません。

ツールを開く →

RTFをプレーンテキストに変換

テキスト コピーに対してサポートされている RTF コントロールの書式設定を削除します。特殊文字と表をソースと比較します。

例

document.rtf → プレーンテキスト.txt
  1. RTFファイルを選択します。最大1ファイルを選べます。
  2. 入力形式とファイル順を確認して、処理を開始します。
  3. TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか

複雑なフィールド、埋め込みオブジェクト、特殊な文字コードは正確に再現できない場合があります。

ツールを開く →

MarkdownをHTMLに変換

Markdown の記述を HTML としてエクスポートします。サポートされている見出し、リスト、段落がどのようにレンダリングされるかを確認してください。

例

# 見出し + 段落 → document.html
  1. MD, MARKDOWNファイルを選択します。最大1ファイルを選べます。
  2. HTML文書スタイル, リンクを新しいタブで開くを確認し、処理を開始します。
  3. HTMLの結果をダウンロードし、内容と品質を確認します。
何を確認するか

対応範囲を限定した変換です。すべての拡張記法、プラグイン、スクリプトには対応しません。

ツールを開く →

HTMLからテキストを抽出

HTML ファイルからテキストを抽出します。これは、ライブ Web サイトをスクレイピングするために URL にアクセスすることはありません。

例

保存されたページ.html → 読めるテキスト.txt
  1. HTML, HTMファイルを選択します。最大1ファイルを選べます。
  2. 入力形式とファイル順を確認して、処理を開始します。
  3. TXTの結果をダウンロードし、内容と品質を確認します。
何を確認するか

JavaScriptだけで読み込む内容の取得・実行は行いません。CSSのレイアウトは保持しません。

ツールを開く →

HWPXを読む

サポートされている HWPX の段落、表、画像を読み取り、テキストを抽出します。従来の HWP と正確なレイアウト編集はサポートされていません。

例

document.hwpx → サポートされているコンテンツのプレビュー + TXTツールを開く →

クリーンなテキストリスト

1 行に 1 項目のリスト内の空白、重複、空白を削除します。順序を変更する場合にのみ並べ替えます。

例

繰り返される広告申込情報 → クリーンな広告申込情報リストツールを開く →

Unicode 正規化

分解された韓国語テキストを含む、さまざまに構成された Unicode を正規化します。互換性の正規化により文字が変更される可能性があります。

例

分解テキスト + NFC → 合成テキストツールを開く →

見えない文字

コピーしたテキストに非表示の文字がないか検査し、削除する前に位置とコード ポイントを確認します。

例

非表示文字を含むテキスト → 位置/コードポイントレポートツールを開く →

改行を削除する

コピーした散文内の不要な改行を結合します。表、詩、リストは意図的な改行に依存する場合があります。

例

折り返された散文 + 空白の段落 → 結合された段落ツールを開く →

Office ファイル内の非表示情報を検査する

Office ファイルを共有する前に、作成者のメタデータ、コメント、および非表示コンテンツのトレースを検査し、ソース アプリケーションで編集します。

例

オフィスファイル→隠蔽情報検査報告書ツールを開く →

このガイドでは、パブリック Web ツールとそのサポート制限について説明します。オリジナルを保存して、ダウンロードした結果を確認してください。 Coverton · 訂正と連絡

この翻訳はソフトウェアの支援を利用して作成されました。英語版も読むことができます。 英語で読む