Przejdź do treści
Coverton Bloga
W tym artykule
Dokumenty i tekst

Wyodrębnij i wyczyść tekst z DOCX, HWPX i skopiowanych dokumentów

Zapisanie dokumentu jako TXT umożliwia ponowne wykorzystanie zawartych w nim słów, ale nie powoduje zachowania oryginalnego układu ani formatowania strony. Wybierz narzędzie dla DOCX, PPTX, ODT, EPUB, HWPX lub RTF, a następnie porównaj ważny tekst ze źródłem.

Skorzystaj z darmowego narzędzia →

Najpierw sprawdź koreański format dokumentu

Czytnik HWPX obsługuje obsługiwane akapity, tabele i obrazy. Starsza wersja HWP nie jest obsługiwana, a czytnik nie odtwarza oryginalnych czcionek, kształtów, równań ani paginacji. Zachowaj oryginał zgłoszenia i użyj wyniku TXT do ponownego wykorzystania tekstu.

Starannie wyczyść podziały linii i niewidoczne znaki

Skopiowane-PDF czyszczenie łączy wewnętrzne podziały wierszy, zachowując akapity oddzielone pustymi wierszami. Przejrzyj tabele, wiersze i listy w odniesieniu do źródła. Opcjonalne usuwanie niewidzialnych znaków dotyczy tylko modeli U+200B i BOM. Normalizacja NFKC i NFKD zmienia również znaki zgodności.

Konwersja różni się od kontroli prywatności

Markdown-to-HTML konwertuje znaczniki dokumentu; HTML-to-TXT odrzuca znaczniki i układ. Inspektor Office raportuje informacje o autorze, komentarze, ukryte arkusze i ślady linków zewnętrznych. Sam raport nie oznacza, że ​​te elementy zostały usunięte z pliku.

Wybierz odpowiednie narzędzie

Przykładowe dane wejściowe ilustrują przepływ pracy; nie obiecują określonego rozmiaru pliku, dokładności rozpoznawania ani kompatybilności.

Konwertuj DOCX na Tekst

Wyodrębnij tekst do wyszukiwania lub porządkowania. Kopia TXT nie odtwarza układu dokumentu ani obrazów.

Przykład

dokument.docx → wyodrębniony plik tekstowy.txt
  1. Wybierz pliki w formacie DOCX. Maksymalna liczba plików na partię: 1.
  2. Przejrzyj Separator kolumn tabeli, a następnie rozpocznij przetwarzanie.
  3. Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić

Wyodrębniany jest tekst, a nie oryginalny układ strony. Obrazy, formatowanie i osadzone obiekty nie są zachowywane. OCR nie jest wykonywany.

W przypadku dokumentów programu Word fragmenty tekstu są odczytywane z pakietu dokumentów. Sprawdź tabele i pola tekstowe w wyniku; nie przyjęto ich układu wizualnego. Stare pliki binarne .doc nie są obsługiwane.

Otwórz narzędzie →

Konwertuj PPTX na Tekst

Zbierz tekst slajdu w działający transkrypcję. Wybierz separator i sprawdź kolejność ekstrakcji.

Przykład

slajdy.pptx → tekst oddzielony slajdami.txt
  1. Wybierz pliki w formacie PPTX. Maksymalna liczba plików na partię: 1.
  2. Przejrzyj Separator kolumn tabeli, a następnie rozpocznij przetwarzanie.
  3. Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić

Kolejność czytania może różnić się od widocznej pozycji pól tekstowych. Obrazy i treści mówione nie są transkrybowane.

Otwórz narzędzie →

Konwertuj ODT na Tekst

Wyodrębnij zwykły tekst z pliku OpenDocument. Tabele, czcionki i paginacja nie są zachowywane w formacie TXT.

Przykład

dokument.odt → wyodrębniony plik tekstowy.txt
  1. Wybierz pliki w formacie ODT. Maksymalna liczba plików na partię: 1.
  2. Przejrzyj Separator kolumn tabeli, a następnie rozpocznij przetwarzanie.
  3. Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić

Wyodrębniany jest tekst, a nie oryginalny układ strony. Obrazy, formatowanie i osadzone obiekty nie są zachowywane. OCR nie jest wykonywany.

OpenDocument przechowuje tekst i style oddzielnie. Dane wyjściowe TXT nie przyjmują szablonów, kolumn ani podziałów stron jako stałego układu. Sprawdź listy i tabele po eksporcie.

Otwórz narzędzie →

Konwertuj EPUB na Tekst

Zbieraj tekst z obsługiwanego pliku EPUB na potrzeby osobistych obiegów pracy. Sprawdź obsługę chronionych książek i złożonych układów czytania.

Przykład

book.epub → zwykły tekst do czytania.txt
  1. Wybierz pliki w formacie EPUB. Maksymalna liczba plików na partię: 1.
  2. Przejrzyj Separator kolumn tabeli, a następnie rozpocznij przetwarzanie.
  3. Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić

Książki chronione systemem DRM nie są obsługiwane. Nawigacja, typografia i ilustracje zostały utracone w formacie TXT.

Otwórz narzędzie →

Konwertuj HWPX na Tekst

Wyodrębnij tekst z HWPX. Starsze rozwiązania HWP i precyzyjna reprodukcja oryginalnego układu edycyjnego wymagają innych procesów roboczych.

Przykład

dokument.hwpx → sekcja tekst.txt
  1. Wybierz pliki w formacie HWPX. Maksymalna liczba plików na partię: 1.
  2. Przejrzyj Separator kolumn tabeli, a następnie rozpocznij przetwarzanie.
  3. Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić

HWPX i starszy binarny HWP to różne formaty. Pliki z rozszerzeniem .hwp nie zostaną otwarte.

Otwórz narzędzie →

Konwertuj RTF na Tekst

Usuń obsługiwane formatowanie kontrolne RTF dla kopii tekstowej. Porównaj znaki specjalne i tabele ze źródłem.

Przykład

dokument.rtf → zwykły tekst.txt
  1. Wybierz pliki w formacie RTF. Maksymalna liczba plików na partię: 1.
  2. Sprawdź format wejściowy i kolejność plików, a następnie rozpocznij przetwarzanie.
  3. Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić

Wyodrębniany jest tekst, a nie oryginalny układ strony. Obrazy, formatowanie i osadzone obiekty nie są zachowywane. OCR nie jest wykonywany.

Tekst sformatowany zawiera słowa kontrolne służące do formatowania i kodowania znaków. Są one usuwane lub oceniane podczas eksportowania tekstu. Sprawdź w wyniku znaki specjalne i starsze strony kodowe; osadzone obrazy nie są wyodrębniane.

Otwórz narzędzie →

Konwertuj MARKDOWN na HTML

Eksportuj zapis Markdown jako HTML. Sprawdź, jak renderowane są obsługiwane nagłówki, listy i akapity.

Przykład

# Nagłówek + akapity → dokument.html
  1. Wybierz pliki w formacie MD, MARKDOWN. Maksymalna liczba plików na partię: 1.
  2. Przejrzyj Styl dokumentu HTML, Otwórz linki w nowej karcie, a następnie rozpocznij przetwarzanie.
  3. Pobierz wynik HTML i sprawdź jego zawartość i jakość.
Co sprawdzić

Obsługiwana jest ograniczona składnia Markdown. Złożone tabele, komórki wielowierszowe, rozszerzenia i skrypty nie są w pełni przyjęte.

Otwórz narzędzie →

Konwertuj HTML na Tekst

Wyodrębnij tekst z pliku HTML. Nie powoduje to odwiedzenia adresu URL w celu zeskrobania działającej witryny internetowej.

Przykład

zapisana-strona.html → czytelny tekst.txt
  1. Wybierz pliki w formacie HTML, HTM. Maksymalna liczba plików na partię: 1.
  2. Sprawdź format wejściowy i kolejność plików, a następnie rozpocznij przetwarzanie.
  3. Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić

Treść ponownie załadowana za pomocą JavaScript nie jest pobierana ani wykonywana. Układ CSS nie jest zachowany.

Otwórz narzędzie →

Przeczytaj HWPX

Przeczytaj obsługiwane akapity, tabele i obrazy HWPX oraz wyodrębnij tekst. Starsze wersje HWP i precyzyjna edycja układu nie są obsługiwane.

Przykład

document.hwpx → obsługiwany podgląd treści + TXTOtwórz narzędzie →

Czysta lista tekstowa

Wyczyść puste miejsca, duplikaty i białe znaki na listach z jednym elementem w wierszu. Sortuj tylko wtedy, gdy zamierzona jest zmiana kolejności.

Przykład

powtarzane pozycje → wyczyszczona lista liniiOtwórz narzędzie →

Normalizacja Unicode

Normalizuj różnie złożony Unicode, w tym rozłożony tekst koreański. Normalizacja zgodności może zmieniać znaki.

Przykład

tekst rozłożony + NFC → tekst złożonyOtwórz narzędzie →

Niewidzialne postacie

Sprawdź skopiowany tekst pod kątem niewidocznych znaków oraz przejrzyj pozycje i punkty kodowe przed usunięciem.

Przykład

tekst zawierający niewidoczne znaki → raport lokalizacji/punktu kodowegoOtwórz narzędzie →

Usuń podziały wierszy

Dołącz do niechcianych podziałów wierszy w skopiowanej prozie. Tabele, wiersze i listy mogą zależeć od celowego łamania wierszy.

Przykład

zawinięta proza + puste akapity → połączone akapityOtwórz narzędzie →

Sprawdź ukryte informacje w plikach pakietu Office

Przed udostępnieniem plików pakietu Office sprawdź metadane autora, komentarze i ślady ukrytej zawartości, a następnie edytuj je w aplikacji źródłowej.

Przykład

Plik pakietu Office → raport z inspekcji ukrytych informacjiOtwórz narzędzie →

W tym przewodniku opisano publiczne narzędzia internetowe i ograniczenia ich wsparcia. Zachowaj oryginał i sprawdź pobrany wynik. Coverton · Korekty i kontakt

To tłumaczenie zostało przygotowane przy pomocy oprogramowania. Możesz przeczytać także wersję angielską. Przeczytaj po angielsku