Wyodrębnij i wyczyść tekst z DOCX, HWPX i skopiowanych dokumentów
Zapisanie dokumentu jako TXT umożliwia ponowne wykorzystanie zawartych w nim słów, ale nie powoduje zachowania oryginalnego układu ani formatowania strony. Wybierz narzędzie dla DOCX, PPTX, ODT, EPUB, HWPX lub RTF, a następnie porównaj ważny tekst ze źródłem.
Skorzystaj z darmowego narzędzia →Najpierw sprawdź koreański format dokumentu
Czytnik HWPX obsługuje obsługiwane akapity, tabele i obrazy. Starsza wersja HWP nie jest obsługiwana, a czytnik nie odtwarza oryginalnych czcionek, kształtów, równań ani paginacji. Zachowaj oryginał zgłoszenia i użyj wyniku TXT do ponownego wykorzystania tekstu.
Starannie wyczyść podziały linii i niewidoczne znaki
Skopiowane-PDF czyszczenie łączy wewnętrzne podziały wierszy, zachowując akapity oddzielone pustymi wierszami. Przejrzyj tabele, wiersze i listy w odniesieniu do źródła. Opcjonalne usuwanie niewidzialnych znaków dotyczy tylko modeli U+200B i BOM. Normalizacja NFKC i NFKD zmienia również znaki zgodności.
Konwersja różni się od kontroli prywatności
Markdown-to-HTML konwertuje znaczniki dokumentu; HTML-to-TXT odrzuca znaczniki i układ. Inspektor Office raportuje informacje o autorze, komentarze, ukryte arkusze i ślady linków zewnętrznych. Sam raport nie oznacza, że te elementy zostały usunięte z pliku.
Wybierz odpowiednie narzędzie
Przykładowe dane wejściowe ilustrują przepływ pracy; nie obiecują określonego rozmiaru pliku, dokładności rozpoznawania ani kompatybilności.
Konwertuj DOCX na Tekst
Wyodrębnij tekst do wyszukiwania lub porządkowania. Kopia TXT nie odtwarza układu dokumentu ani obrazów.
Przykład
dokument.docx → wyodrębniony plik tekstowy.txt- Wybierz pliki w formacie DOCX. Maksymalna liczba plików na partię: 1.
- Przejrzyj Separator kolumn tabeli, a następnie rozpocznij przetwarzanie.
- Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić
Wyodrębniany jest tekst, a nie oryginalny układ strony. Obrazy, formatowanie i osadzone obiekty nie są zachowywane. OCR nie jest wykonywany.
W przypadku dokumentów programu Word fragmenty tekstu są odczytywane z pakietu dokumentów. Sprawdź tabele i pola tekstowe w wyniku; nie przyjęto ich układu wizualnego. Stare pliki binarne .doc nie są obsługiwane.
Konwertuj PPTX na Tekst
Zbierz tekst slajdu w działający transkrypcję. Wybierz separator i sprawdź kolejność ekstrakcji.
Przykład
slajdy.pptx → tekst oddzielony slajdami.txt- Wybierz pliki w formacie PPTX. Maksymalna liczba plików na partię: 1.
- Przejrzyj Separator kolumn tabeli, a następnie rozpocznij przetwarzanie.
- Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić
Kolejność czytania może różnić się od widocznej pozycji pól tekstowych. Obrazy i treści mówione nie są transkrybowane.
Konwertuj ODT na Tekst
Wyodrębnij zwykły tekst z pliku OpenDocument. Tabele, czcionki i paginacja nie są zachowywane w formacie TXT.
Przykład
dokument.odt → wyodrębniony plik tekstowy.txt- Wybierz pliki w formacie ODT. Maksymalna liczba plików na partię: 1.
- Przejrzyj Separator kolumn tabeli, a następnie rozpocznij przetwarzanie.
- Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić
Wyodrębniany jest tekst, a nie oryginalny układ strony. Obrazy, formatowanie i osadzone obiekty nie są zachowywane. OCR nie jest wykonywany.
OpenDocument przechowuje tekst i style oddzielnie. Dane wyjściowe TXT nie przyjmują szablonów, kolumn ani podziałów stron jako stałego układu. Sprawdź listy i tabele po eksporcie.
Konwertuj EPUB na Tekst
Zbieraj tekst z obsługiwanego pliku EPUB na potrzeby osobistych obiegów pracy. Sprawdź obsługę chronionych książek i złożonych układów czytania.
Przykład
book.epub → zwykły tekst do czytania.txt- Wybierz pliki w formacie EPUB. Maksymalna liczba plików na partię: 1.
- Przejrzyj Separator kolumn tabeli, a następnie rozpocznij przetwarzanie.
- Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić
Książki chronione systemem DRM nie są obsługiwane. Nawigacja, typografia i ilustracje zostały utracone w formacie TXT.
Konwertuj HWPX na Tekst
Wyodrębnij tekst z HWPX. Starsze rozwiązania HWP i precyzyjna reprodukcja oryginalnego układu edycyjnego wymagają innych procesów roboczych.
Przykład
dokument.hwpx → sekcja tekst.txt- Wybierz pliki w formacie HWPX. Maksymalna liczba plików na partię: 1.
- Przejrzyj Separator kolumn tabeli, a następnie rozpocznij przetwarzanie.
- Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić
HWPX i starszy binarny HWP to różne formaty. Pliki z rozszerzeniem .hwp nie zostaną otwarte.
Konwertuj RTF na Tekst
Usuń obsługiwane formatowanie kontrolne RTF dla kopii tekstowej. Porównaj znaki specjalne i tabele ze źródłem.
Przykład
dokument.rtf → zwykły tekst.txt- Wybierz pliki w formacie RTF. Maksymalna liczba plików na partię: 1.
- Sprawdź format wejściowy i kolejność plików, a następnie rozpocznij przetwarzanie.
- Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić
Wyodrębniany jest tekst, a nie oryginalny układ strony. Obrazy, formatowanie i osadzone obiekty nie są zachowywane. OCR nie jest wykonywany.
Tekst sformatowany zawiera słowa kontrolne służące do formatowania i kodowania znaków. Są one usuwane lub oceniane podczas eksportowania tekstu. Sprawdź w wyniku znaki specjalne i starsze strony kodowe; osadzone obrazy nie są wyodrębniane.
Konwertuj MARKDOWN na HTML
Eksportuj zapis Markdown jako HTML. Sprawdź, jak renderowane są obsługiwane nagłówki, listy i akapity.
Przykład
# Nagłówek + akapity → dokument.html- Wybierz pliki w formacie MD, MARKDOWN. Maksymalna liczba plików na partię: 1.
- Przejrzyj Styl dokumentu HTML, Otwórz linki w nowej karcie, a następnie rozpocznij przetwarzanie.
- Pobierz wynik HTML i sprawdź jego zawartość i jakość.
Co sprawdzić
Obsługiwana jest ograniczona składnia Markdown. Złożone tabele, komórki wielowierszowe, rozszerzenia i skrypty nie są w pełni przyjęte.
Konwertuj HTML na Tekst
Wyodrębnij tekst z pliku HTML. Nie powoduje to odwiedzenia adresu URL w celu zeskrobania działającej witryny internetowej.
Przykład
zapisana-strona.html → czytelny tekst.txt- Wybierz pliki w formacie HTML, HTM. Maksymalna liczba plików na partię: 1.
- Sprawdź format wejściowy i kolejność plików, a następnie rozpocznij przetwarzanie.
- Pobierz wynik TXT i sprawdź jego zawartość i jakość.
Co sprawdzić
Treść ponownie załadowana za pomocą JavaScript nie jest pobierana ani wykonywana. Układ CSS nie jest zachowany.
Przeczytaj HWPX
Przeczytaj obsługiwane akapity, tabele i obrazy HWPX oraz wyodrębnij tekst. Starsze wersje HWP i precyzyjna edycja układu nie są obsługiwane.
Przykład
document.hwpx → obsługiwany podgląd treści + TXTOtwórz narzędzie →Czysta lista tekstowa
Wyczyść puste miejsca, duplikaty i białe znaki na listach z jednym elementem w wierszu. Sortuj tylko wtedy, gdy zamierzona jest zmiana kolejności.
Przykład
powtarzane pozycje → wyczyszczona lista liniiOtwórz narzędzie →Normalizacja Unicode
Normalizuj różnie złożony Unicode, w tym rozłożony tekst koreański. Normalizacja zgodności może zmieniać znaki.
Przykład
tekst rozłożony + NFC → tekst złożonyOtwórz narzędzie →Niewidzialne postacie
Sprawdź skopiowany tekst pod kątem niewidocznych znaków oraz przejrzyj pozycje i punkty kodowe przed usunięciem.
Przykład
tekst zawierający niewidoczne znaki → raport lokalizacji/punktu kodowegoOtwórz narzędzie →Usuń podziały wierszy
Dołącz do niechcianych podziałów wierszy w skopiowanej prozie. Tabele, wiersze i listy mogą zależeć od celowego łamania wierszy.
Przykład
zawinięta proza + puste akapity → połączone akapityOtwórz narzędzie →Sprawdź ukryte informacje w plikach pakietu Office
Przed udostępnieniem plików pakietu Office sprawdź metadane autora, komentarze i ślady ukrytej zawartości, a następnie edytuj je w aplikacji źródłowej.
Przykład
Plik pakietu Office → raport z inspekcji ukrytych informacjiOtwórz narzędzie →W tym przewodniku opisano publiczne narzędzia internetowe i ograniczenia ich wsparcia. Zachowaj oryginał i sprawdź pobrany wynik. Coverton · Korekty i kontakt
To tłumaczenie zostało przygotowane przy pomocy oprogramowania. Możesz przeczytać także wersję angielską. Przeczytaj po angielsku