Zum Inhalt springen
Coverton Blog
In diesem Artikel
Dokumente und Texte

Extrahieren und bereinigen Sie Text aus DOCX, HWPX und kopierten Dokumenten

Durch das Speichern eines Dokuments als TXT werden seine Wörter wiederverwendbar, das ursprüngliche Seitenlayout oder die ursprüngliche Formatierung bleiben jedoch nicht erhalten. Wählen Sie das Tool für DOCX, PPTX, ODT, EPUB, HWPX oder RTF aus und vergleichen Sie dann wichtigen Text mit der Quelle.

Nutzen Sie das kostenlose Tool →

Überprüfen Sie zunächst das koreanische Dokumentformat

Der HWPX-Reader verarbeitet unterstützte Absätze, Tabellen und Bilder. Die Vorgängerversion HWP wird nicht unterstützt und der Reader reproduziert keine Originalschriftarten, Formen, Gleichungen oder Seitenumbrüche. Bewahren Sie das Original der Einreichung auf und verwenden Sie das TXT-Ergebnis für die Wiederverwendung von Text.

Reinigen Sie Zeilenumbrüche und unsichtbare Zeichen sorgfältig

Durch die Bereinigung von Copied-PDF werden interne Zeilenumbrüche zusammengefügt, während durch Leerzeilen getrennte Absätze erhalten bleiben. Überprüfen Sie Tabellen, Gedichte und Listen anhand der Quelle. Die optionale Entfernung unsichtbarer Zeichen betrifft nur U+200B und BOM. Die Normalisierung von NFKC und NFKD ändert auch die Kompatibilitätszeichen.

Die Konvertierung unterscheidet sich von der Datenschutzprüfung

Markdown-to-HTML konvertiert Dokument-Markup; HTML-to-TXT verwirft Tags und Layout. Der Office-Inspektor meldet Autoreninformationen, Kommentare, ausgeblendete Blätter und Spuren externer Links. Ein Bericht allein bedeutet nicht, dass diese Elemente aus der Datei entfernt wurden.

Wählen Sie das richtige Werkzeug

Beispieleingaben veranschaulichen den Arbeitsablauf; Sie versprechen keine bestimmte Dateigröße, Erkennungsgenauigkeit oder Kompatibilität.

DOCX in Text konvertieren

Extrahieren Sie Text zum Suchen oder Organisieren. Die TXT-Kopie gibt weder das Dokumentlayout noch die Bilder wieder.

Beispiel

document.docx → extrahierter Text.txt
  1. Wählen Sie Dateien im Format DOCX. Maximale Anzahl: 1.
  2. Prüfen Sie die Einstellungen (Dokument-Trennzeichen) und starten Sie die Verarbeitung.
  3. Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist

Extrahiert wird Text, nicht das ursprüngliche Seitenlayout. Bilder, Formatierung und eingebettete Objekte bleiben nicht erhalten. OCR wird nicht ausgeführt.

Bei Word-Dokumenten werden Textabschnitte aus dem Dokumentpaket gelesen. Prüfen Sie Tabellen und Textfelder im Ergebnis; deren visuelle Anordnung wird nicht übernommen. Alte binäre .doc-Dateien werden nicht unterstützt.

Öffnen Sie das Tool →

PPTX in Text konvertieren

Sammeln Sie Folientext in einem Arbeitstranskript. Wählen Sie ein Trennzeichen und überprüfen Sie die Extraktionsreihenfolge.

Beispiel

slides.pptx → durch Folien getrennter Text.txt
  1. Wählen Sie Dateien im Format PPTX. Maximale Anzahl: 1.
  2. Prüfen Sie die Einstellungen (Dokument-Trennzeichen) und starten Sie die Verarbeitung.
  3. Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist

Die Lesereihenfolge kann von der sichtbaren Position der Textfelder abweichen. Bilder und gesprochene Inhalte werden nicht transkribiert.

Öffnen Sie das Tool →

ODT in Text konvertieren

Extrahieren Sie einfachen Text aus einer OpenDocument-Datei. Tabellen, Schriftarten und Paginierung bleiben in TXT nicht erhalten.

Beispiel

document.odt → extrahierte text.txt
  1. Wählen Sie Dateien im Format ODT. Maximale Anzahl: 1.
  2. Prüfen Sie die Einstellungen (Dokument-Trennzeichen) und starten Sie die Verarbeitung.
  3. Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist

Extrahiert wird Text, nicht das ursprüngliche Seitenlayout. Bilder, Formatierung und eingebettete Objekte bleiben nicht erhalten. OCR wird nicht ausgeführt.

OpenDocument speichert Text und Formatvorlagen getrennt. Die TXT-Ausgabe übernimmt keine Vorlagen, Spalten oder Seitenumbrüche als festes Layout. Prüfen Sie Listen und Tabellen nach dem Export.

Öffnen Sie das Tool →

EPUB in Text konvertieren

Sammeln Sie Text aus einem unterstützten EPUB für persönliche Arbeitsabläufe. Überprüfen Sie die Unterstützung für geschützte Bücher und komplexe Leselayouts.

Beispiel

book.epub → Klartext.txt
  1. Wählen Sie Dateien im Format EPUB. Maximale Anzahl: 1.
  2. Prüfen Sie die Einstellungen (Dokument-Trennzeichen) und starten Sie die Verarbeitung.
  3. Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist

DRM-geschützte Bücher werden nicht unterstützt. Navigation, Typografie und Illustrationen gehen in TXT verloren.

Öffnen Sie das Tool →

HWPX in Text konvertieren

Extrahieren Sie Text aus HWPX. Älteres HWP und eine präzise Reproduktion des ursprünglichen Bearbeitungslayouts erfordern andere Arbeitsabläufe.

Beispiel

document.hwpx → Abschnitt text.txt
  1. Wählen Sie Dateien im Format HWPX. Maximale Anzahl: 1.
  2. Prüfen Sie die Einstellungen (Dokument-Trennzeichen) und starten Sie die Verarbeitung.
  3. Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist

HWPX und das ältere binäre HWP sind unterschiedliche Formate. Dateien mit .hwp werden nicht geöffnet.

Öffnen Sie das Tool →

RTF in Text konvertieren

Entfernen Sie die unterstützte RTF-Steuerelementformatierung für eine Textkopie. Vergleichen Sie Sonderzeichen und Tabellen mit der Quelle.

Beispiel

document.rtf → Klartext.txt
  1. Wählen Sie Dateien im Format RTF. Maximale Anzahl: 1.
  2. Prüfen Sie Eingabeformat und Dateireihenfolge und starten Sie die Verarbeitung.
  3. Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist

Extrahiert wird Text, nicht das ursprüngliche Seitenlayout. Bilder, Formatierung und eingebettete Objekte bleiben nicht erhalten. OCR wird nicht ausgeführt.

Rich Text enthält Steuerwörter für Formatierung und Zeichencodierung. Diese werden beim Textexport entfernt oder ausgewertet. Prüfen Sie Sonderzeichen und ältere Codepages im Ergebnis; eingebettete Bilder werden nicht extrahiert.

Öffnen Sie das Tool →

MARKDOWN in HTML konvertieren

Markdown-Schreiben als HTML exportieren. Überprüfen Sie, wie unterstützte Überschriften, Listen und Absätze dargestellt werden.

Beispiel

# Überschrift + Absätze → document.html
  1. Wählen Sie Dateien im Format MD, MARKDOWN. Maximale Anzahl: 1.
  2. Prüfen Sie die Einstellungen (HTML-Dokumentstil, Links in neuem Tab öffnen) und starten Sie die Verarbeitung.
  3. Laden Sie das HTML-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist

Unterstützt wird eine begrenzte Markdown-Syntax. Komplexe Tabellen, mehrzeilige Zellen, Erweiterungen und Skripte werden nicht vollständig übernommen.

Öffnen Sie das Tool →

HTML in Text konvertieren

Extrahieren Sie Text aus einer HTML-Datei. Dabei wird keine URL besucht, um eine Live-Website zu crawlen.

Beispiel

gespeicherte Seite.html → lesbarer Text.txt
  1. Wählen Sie Dateien im Format HTML, HTM. Maximale Anzahl: 1.
  2. Prüfen Sie Eingabeformat und Dateireihenfolge und starten Sie die Verarbeitung.
  3. Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist

Per JavaScript nachgeladene Inhalte werden nicht abgerufen oder ausgeführt. CSS-Layout wird nicht erhalten.

Öffnen Sie das Tool →

Lesen Sie HWPX

Lesen Sie unterstützte HWPX-Absätze, Tabellen und Bilder und extrahieren Sie Text. Legacy-HWP und präzise Layoutbearbeitung werden nicht unterstützt.

Beispiel

document.hwpx → unterstützte Inhaltsvorschau + TXTÖffnen Sie das Tool →

Saubere Textliste

Bereinigen Sie Leerzeichen, Duplikate und Leerzeichen in Listen mit einem Element pro Zeile. Sortieren Sie nur, wenn eine Änderung der Reihenfolge beabsichtigt ist.

Beispiel

wiederholte Zeilenelemente → bereinigte ZeilenlisteÖffnen Sie das Tool →

Unicode normalisieren

Normalisieren Sie unterschiedlich zusammengesetzten Unicode, einschließlich zerlegten koreanischen Textes. Durch die Kompatibilitätsnormalisierung können Zeichen verändert werden.

Beispiel

zerlegter Text + NFC → zusammengesetzter TextÖffnen Sie das Tool →

Unsichtbare Charaktere

Überprüfen Sie kopierten Text auf unsichtbare Zeichen und überprüfen Sie Positionen und Codepunkte, bevor Sie ihn entfernen.

Beispiel

Text mit unsichtbaren Zeichen → Standort-/CodepunktberichtÖffnen Sie das Tool →

Zeilenumbrüche entfernen

Fügen Sie unerwünschte Zeilenumbrüche in kopierter Prosa hinzu. Tabellen, Gedichte und Listen können auf absichtliche Zeilenumbrüche angewiesen sein.

Beispiel

umschlossene Prosa + leere Absätze → verbundene AbsätzeÖffnen Sie das Tool →

Untersuchen Sie versteckte Informationen in Office-Dateien

Überprüfen Sie Autorenmetadaten, Kommentare und Spuren versteckter Inhalte, bevor Sie Office-Dateien freigeben, und bearbeiten Sie sie dann in der Quellanwendung.

Beispiel

Office-Akte → Inspektionsbericht mit versteckten InformationenÖffnen Sie das Tool →

In diesem Leitfaden werden die öffentlichen Webtools und ihre Supportgrenzen beschrieben. Bewahren Sie Ihr Original auf und überprüfen Sie das heruntergeladene Ergebnis. Coverton · Korrekturen und Kontakt

Diese Übersetzung wurde mit Softwareunterstützung erstellt. Sie können auch die englische Version lesen. Lesen Sie auf Englisch