Extrahieren und bereinigen Sie Text aus DOCX, HWPX und kopierten Dokumenten
Durch das Speichern eines Dokuments als TXT werden seine Wörter wiederverwendbar, das ursprüngliche Seitenlayout oder die ursprüngliche Formatierung bleiben jedoch nicht erhalten. Wählen Sie das Tool für DOCX, PPTX, ODT, EPUB, HWPX oder RTF aus und vergleichen Sie dann wichtigen Text mit der Quelle.
Nutzen Sie das kostenlose Tool →Überprüfen Sie zunächst das koreanische Dokumentformat
Der HWPX-Reader verarbeitet unterstützte Absätze, Tabellen und Bilder. Die Vorgängerversion HWP wird nicht unterstützt und der Reader reproduziert keine Originalschriftarten, Formen, Gleichungen oder Seitenumbrüche. Bewahren Sie das Original der Einreichung auf und verwenden Sie das TXT-Ergebnis für die Wiederverwendung von Text.
Reinigen Sie Zeilenumbrüche und unsichtbare Zeichen sorgfältig
Durch die Bereinigung von Copied-PDF werden interne Zeilenumbrüche zusammengefügt, während durch Leerzeilen getrennte Absätze erhalten bleiben. Überprüfen Sie Tabellen, Gedichte und Listen anhand der Quelle. Die optionale Entfernung unsichtbarer Zeichen betrifft nur U+200B und BOM. Die Normalisierung von NFKC und NFKD ändert auch die Kompatibilitätszeichen.
Die Konvertierung unterscheidet sich von der Datenschutzprüfung
Markdown-to-HTML konvertiert Dokument-Markup; HTML-to-TXT verwirft Tags und Layout. Der Office-Inspektor meldet Autoreninformationen, Kommentare, ausgeblendete Blätter und Spuren externer Links. Ein Bericht allein bedeutet nicht, dass diese Elemente aus der Datei entfernt wurden.
Wählen Sie das richtige Werkzeug
Beispieleingaben veranschaulichen den Arbeitsablauf; Sie versprechen keine bestimmte Dateigröße, Erkennungsgenauigkeit oder Kompatibilität.
DOCX in Text konvertieren
Extrahieren Sie Text zum Suchen oder Organisieren. Die TXT-Kopie gibt weder das Dokumentlayout noch die Bilder wieder.
Beispiel
document.docx → extrahierter Text.txt- Wählen Sie Dateien im Format DOCX. Maximale Anzahl: 1.
- Prüfen Sie die Einstellungen (Dokument-Trennzeichen) und starten Sie die Verarbeitung.
- Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist
Extrahiert wird Text, nicht das ursprüngliche Seitenlayout. Bilder, Formatierung und eingebettete Objekte bleiben nicht erhalten. OCR wird nicht ausgeführt.
Bei Word-Dokumenten werden Textabschnitte aus dem Dokumentpaket gelesen. Prüfen Sie Tabellen und Textfelder im Ergebnis; deren visuelle Anordnung wird nicht übernommen. Alte binäre .doc-Dateien werden nicht unterstützt.
PPTX in Text konvertieren
Sammeln Sie Folientext in einem Arbeitstranskript. Wählen Sie ein Trennzeichen und überprüfen Sie die Extraktionsreihenfolge.
Beispiel
slides.pptx → durch Folien getrennter Text.txt- Wählen Sie Dateien im Format PPTX. Maximale Anzahl: 1.
- Prüfen Sie die Einstellungen (Dokument-Trennzeichen) und starten Sie die Verarbeitung.
- Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist
Die Lesereihenfolge kann von der sichtbaren Position der Textfelder abweichen. Bilder und gesprochene Inhalte werden nicht transkribiert.
ODT in Text konvertieren
Extrahieren Sie einfachen Text aus einer OpenDocument-Datei. Tabellen, Schriftarten und Paginierung bleiben in TXT nicht erhalten.
Beispiel
document.odt → extrahierte text.txt- Wählen Sie Dateien im Format ODT. Maximale Anzahl: 1.
- Prüfen Sie die Einstellungen (Dokument-Trennzeichen) und starten Sie die Verarbeitung.
- Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist
Extrahiert wird Text, nicht das ursprüngliche Seitenlayout. Bilder, Formatierung und eingebettete Objekte bleiben nicht erhalten. OCR wird nicht ausgeführt.
OpenDocument speichert Text und Formatvorlagen getrennt. Die TXT-Ausgabe übernimmt keine Vorlagen, Spalten oder Seitenumbrüche als festes Layout. Prüfen Sie Listen und Tabellen nach dem Export.
EPUB in Text konvertieren
Sammeln Sie Text aus einem unterstützten EPUB für persönliche Arbeitsabläufe. Überprüfen Sie die Unterstützung für geschützte Bücher und komplexe Leselayouts.
Beispiel
book.epub → Klartext.txt- Wählen Sie Dateien im Format EPUB. Maximale Anzahl: 1.
- Prüfen Sie die Einstellungen (Dokument-Trennzeichen) und starten Sie die Verarbeitung.
- Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist
DRM-geschützte Bücher werden nicht unterstützt. Navigation, Typografie und Illustrationen gehen in TXT verloren.
HWPX in Text konvertieren
Extrahieren Sie Text aus HWPX. Älteres HWP und eine präzise Reproduktion des ursprünglichen Bearbeitungslayouts erfordern andere Arbeitsabläufe.
Beispiel
document.hwpx → Abschnitt text.txt- Wählen Sie Dateien im Format HWPX. Maximale Anzahl: 1.
- Prüfen Sie die Einstellungen (Dokument-Trennzeichen) und starten Sie die Verarbeitung.
- Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist
HWPX und das ältere binäre HWP sind unterschiedliche Formate. Dateien mit .hwp werden nicht geöffnet.
RTF in Text konvertieren
Entfernen Sie die unterstützte RTF-Steuerelementformatierung für eine Textkopie. Vergleichen Sie Sonderzeichen und Tabellen mit der Quelle.
Beispiel
document.rtf → Klartext.txt- Wählen Sie Dateien im Format RTF. Maximale Anzahl: 1.
- Prüfen Sie Eingabeformat und Dateireihenfolge und starten Sie die Verarbeitung.
- Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist
Extrahiert wird Text, nicht das ursprüngliche Seitenlayout. Bilder, Formatierung und eingebettete Objekte bleiben nicht erhalten. OCR wird nicht ausgeführt.
Rich Text enthält Steuerwörter für Formatierung und Zeichencodierung. Diese werden beim Textexport entfernt oder ausgewertet. Prüfen Sie Sonderzeichen und ältere Codepages im Ergebnis; eingebettete Bilder werden nicht extrahiert.
MARKDOWN in HTML konvertieren
Markdown-Schreiben als HTML exportieren. Überprüfen Sie, wie unterstützte Überschriften, Listen und Absätze dargestellt werden.
Beispiel
# Überschrift + Absätze → document.html- Wählen Sie Dateien im Format MD, MARKDOWN. Maximale Anzahl: 1.
- Prüfen Sie die Einstellungen (HTML-Dokumentstil, Links in neuem Tab öffnen) und starten Sie die Verarbeitung.
- Laden Sie das HTML-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist
Unterstützt wird eine begrenzte Markdown-Syntax. Komplexe Tabellen, mehrzeilige Zellen, Erweiterungen und Skripte werden nicht vollständig übernommen.
HTML in Text konvertieren
Extrahieren Sie Text aus einer HTML-Datei. Dabei wird keine URL besucht, um eine Live-Website zu crawlen.
Beispiel
gespeicherte Seite.html → lesbarer Text.txt- Wählen Sie Dateien im Format HTML, HTM. Maximale Anzahl: 1.
- Prüfen Sie Eingabeformat und Dateireihenfolge und starten Sie die Verarbeitung.
- Laden Sie das TXT-Ergebnis herunter und prüfen Sie Inhalt und Qualität.
Was zu überprüfen ist
Per JavaScript nachgeladene Inhalte werden nicht abgerufen oder ausgeführt. CSS-Layout wird nicht erhalten.
Lesen Sie HWPX
Lesen Sie unterstützte HWPX-Absätze, Tabellen und Bilder und extrahieren Sie Text. Legacy-HWP und präzise Layoutbearbeitung werden nicht unterstützt.
Beispiel
document.hwpx → unterstützte Inhaltsvorschau + TXTÖffnen Sie das Tool →Saubere Textliste
Bereinigen Sie Leerzeichen, Duplikate und Leerzeichen in Listen mit einem Element pro Zeile. Sortieren Sie nur, wenn eine Änderung der Reihenfolge beabsichtigt ist.
Beispiel
wiederholte Zeilenelemente → bereinigte ZeilenlisteÖffnen Sie das Tool →Unicode normalisieren
Normalisieren Sie unterschiedlich zusammengesetzten Unicode, einschließlich zerlegten koreanischen Textes. Durch die Kompatibilitätsnormalisierung können Zeichen verändert werden.
Beispiel
zerlegter Text + NFC → zusammengesetzter TextÖffnen Sie das Tool →Unsichtbare Charaktere
Überprüfen Sie kopierten Text auf unsichtbare Zeichen und überprüfen Sie Positionen und Codepunkte, bevor Sie ihn entfernen.
Beispiel
Text mit unsichtbaren Zeichen → Standort-/CodepunktberichtÖffnen Sie das Tool →Zeilenumbrüche entfernen
Fügen Sie unerwünschte Zeilenumbrüche in kopierter Prosa hinzu. Tabellen, Gedichte und Listen können auf absichtliche Zeilenumbrüche angewiesen sein.
Beispiel
umschlossene Prosa + leere Absätze → verbundene AbsätzeÖffnen Sie das Tool →Untersuchen Sie versteckte Informationen in Office-Dateien
Überprüfen Sie Autorenmetadaten, Kommentare und Spuren versteckter Inhalte, bevor Sie Office-Dateien freigeben, und bearbeiten Sie sie dann in der Quellanwendung.
Beispiel
Office-Akte → Inspektionsbericht mit versteckten InformationenÖffnen Sie das Tool →In diesem Leitfaden werden die öffentlichen Webtools und ihre Supportgrenzen beschrieben. Bewahren Sie Ihr Original auf und überprüfen Sie das heruntergeladene Ergebnis. Coverton · Korrekturen und Kontakt
Diese Übersetzung wurde mit Softwareunterstützung erstellt. Sie können auch die englische Version lesen. Lesen Sie auf Englisch