Extrahujte a vyčistěte text z DOCX, HWPX a zkopírovaných dokumentů
Uložením dokumentu jako TXT budou jeho slova znovu použitelná, ale nezachová se původní rozvržení stránky ani formátování. Vyberte nástroj pro DOCX, PPTX, ODT, EPUB, HWPX nebo RTF a poté porovnejte důležitý text se zdrojem.
Použijte bezplatný nástroj →Nejprve zkontrolujte formát korejského dokumentu
Čtečka HWPX si poradí s podporovanými odstavci, tabulkami a obrázky. Starší HWP není podporován a čtečka nereprodukuje původní písma, tvary, rovnice nebo stránkování. Zachovejte originál odeslání a použijte výsledek TXT pro opětovné použití textu.
Pečlivě čisté konce řádků a neviditelné znaky
Vyčištění Copied-PDF spojuje vnitřní zalomení řádků a zachovává odstavce oddělené prázdnými řádky. Zkontrolujte tabulky, básně a seznamy podle zdroje. Volitelné odstranění neviditelných znaků se týká pouze U+200B a BOM. Normalizace NFKC a NFKD také mění znaky kompatibility.
Konverze se liší od kontroly soukromí
Markdown-to-HTML převádí označení dokumentů; HTML-to-TXT zahodí štítky a rozvržení. Inspektor Office hlásí informace o autorovi, komentáře, skryté listy a stopy externích odkazů. Samotná sestava neznamená, že tyto položky byly ze souboru odstraněny.
Vyberte si správný nástroj
Příklady vstupů ilustrují pracovní postup; neslibují konkrétní velikost souboru, přesnost rozpoznávání nebo kompatibilitu.
Převést DOCX na Text
Extrahujte text pro vyhledávání nebo organizování. Kopie TXT nereprodukuje rozložení dokumentu ani obrázky.
Příklad
document.docx → extrahovaný text.txt- Vyberte soubory ve formátu DOCX. Maximální počet souborů v dávce: 1.
- Zkontrolujte Oddělovač sloupců tabulky a poté spusťte zpracování.
- Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat
Extrahuje se text, nikoli původní rozvržení stránky. Obrázky, formátování a vložené objekty nebudou zachovány. OCR se neprovede.
U dokumentů aplikace Word se části textu čtou z balíku dokumentů. Zkontrolujte tabulky a textová pole ve výsledku; jejich vizuální uspořádání není převzato. Staré binární soubory .doc nejsou podporovány.
Převést PPTX na Text
Shromážděte text snímku do funkčního přepisu. Vyberte oddělovač a zkontrolujte pořadí extrakce.
Příklad
snímky.pptx → text oddělený snímky.txt- Vyberte soubory ve formátu PPTX. Maximální počet souborů v dávce: 1.
- Zkontrolujte Oddělovač sloupců tabulky a poté spusťte zpracování.
- Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat
Pořadí čtení se může lišit od viditelné pozice textových polí. Obrázky a mluvený obsah se nepřepisují.
Převést ODT na Text
Extrahujte prostý text ze souboru OpenDocument. Tabulky, fonty a stránkování nejsou v TXT zachovány.
Příklad
document.odt → extrahovaný text.txt- Vyberte soubory ve formátu ODT. Maximální počet souborů v dávce: 1.
- Zkontrolujte Oddělovač sloupců tabulky a poté spusťte zpracování.
- Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat
Extrahuje se text, nikoli původní rozvržení stránky. Obrázky, formátování a vložené objekty nebudou zachovány. OCR se neprovede.
OpenDocument ukládá text a styly odděleně. Výstup TXT nepřijímá šablony, sloupce nebo konce stránek jako pevné rozvržení. Po exportu zkontrolujte seznamy a tabulky.
Převést EPUB na Text
Sbírejte text z podporovaného souboru EPUB pro osobní pracovní postupy. Zkontrolujte podporu chráněných knih a složitých rozvržení čtení.
Příklad
book.epub → prosté čtení text.txt- Vyberte soubory ve formátu EPUB. Maximální počet souborů v dávce: 1.
- Zkontrolujte Oddělovač sloupců tabulky a poté spusťte zpracování.
- Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat
Knihy chráněné DRM nejsou podporovány. Navigace, typografie a ilustrace jsou v TXT ztraceny.
Převést HWPX na Text
Extrahujte text z HWPX. Starší HWP a přesná reprodukce původního rozvržení úprav vyžadují jiné pracovní postupy.
Příklad
document.hwpx → sekce text.txt- Vyberte soubory ve formátu HWPX. Maximální počet souborů v dávce: 1.
- Zkontrolujte Oddělovač sloupců tabulky a poté spusťte zpracování.
- Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat
HWPX a starší binární HWP jsou různé formáty. Soubory s příponou .hwp se neotevře.
Převést RTF na Text
Odeberte podporované formátování ovládacího prvku RTF pro textovou kopii. Porovnejte speciální znaky a tabulky se zdrojem.
Příklad
document.rtf → prostý text.txt- Vyberte soubory ve formátu RTF. Maximální počet souborů v dávce: 1.
- Zkontrolujte vstupní formát a pořadí souborů a poté spusťte zpracování.
- Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat
Extrahuje se text, nikoli původní rozvržení stránky. Obrázky, formátování a vložené objekty nebudou zachovány. OCR se neprovede.
Formát RTF obsahuje řídicí slova pro formátování a kódování znaků. Ty se při exportu textu odstraní nebo vyhodnotí. Ve výsledku zkontrolujte speciální znaky a starší kódové stránky; vložené obrázky nejsou extrahovány.
Převést MARKDOWN na HTML
Exportujte zápis Markdown jako HTML. Zkontrolujte, jak se vykreslují podporované nadpisy, seznamy a odstavce.
Příklad
# Nadpis + odstavce → document.html- Vyberte soubory ve formátu MD, MARKDOWN. Maximální počet souborů v dávce: 1.
- Zkontrolujte Styl dokumentu HTML, Otevřít odkazy na nové kartě a poté spusťte zpracování.
- Stáhněte si výsledek HTML a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat
Je podporována omezená syntaxe Markdown. Složité tabulky, víceřádkové buňky, rozšíření a skripty nejsou plně přijaty.
Převést HTML na Text
Extrahujte text ze souboru HTML. Toto nenavštíví adresu URL za účelem seškrábnutí aktivní webové stránky.
Příklad
uložená-stránka.html → čitelný text.txt- Vyberte soubory ve formátu HTML, HTM. Maximální počet souborů v dávce: 1.
- Zkontrolujte vstupní formát a pořadí souborů a poté spusťte zpracování.
- Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat
Obsah znovu načtený pomocí JavaScriptu se nenačte ani nespustí. CSS layout není zachován.
Přečtěte si HWPX
Čtěte podporované odstavce, tabulky a obrázky HWPX a extrahujte text. Starší HWP a přesné úpravy rozvržení nejsou podporovány.
Příklad
document.hwpx → podporovaný náhled obsahu + TXTOtevřete nástroj →Seznam čistého textu
Vyčistěte prázdná místa, duplikáty a mezery v seznamech s jednou položkou na řádek. Řaďte pouze v případě, že je záměrem změnit pořadí.
Příklad
opakované řádkové položky → vyčištěný seznam řádkůOtevřete nástroj →Unicode normalizovat
Normalizace odlišně složeného Unicode, včetně rozloženého korejského textu. Normalizace kompatibility může změnit znaky.
Příklad
rozložený text + NFC → složený textOtevřete nástroj →Neviditelné postavy
Před odstraněním zkontrolujte zkopírovaný text, zda neobsahuje neviditelné znaky, a zkontrolujte pozice a body kódu.
Příklad
text s neviditelnými znaky → zpráva o umístění/kóduOtevřete nástroj →Odstraňte zalomení řádků
Připojte nechtěné konce řádků do zkopírované prózy. Tabulky, básně a seznamy mohou záviset na záměrném zalomení řádků.
Příklad
zabalená próza + prázdné odstavce → spojené odstavceOtevřete nástroj →Zkontrolujte skryté informace v souborech Office
Před sdílením souborů Office zkontrolujte metadata autora, komentáře a stopy skrytého obsahu a poté je upravte ve zdrojové aplikaci.
Příklad
Soubor Office → zpráva o kontrole skrytých informacíOtevřete nástroj →Tato příručka popisuje veřejné webové nástroje a jejich limity podpory. Uschovejte si originál a zkontrolujte stažený výsledek. Coverton · Opravy a kontakt
Tento překlad byl připraven za softwarové pomoci. Můžete si také přečíst anglickou verzi. Číst v angličtině