Přejít na obsah
Coverton Blog
V tomto článku
Dokumenty a text

Extrahujte a vyčistěte text z DOCX, HWPX a zkopírovaných dokumentů

Uložením dokumentu jako TXT budou jeho slova znovu použitelná, ale nezachová se původní rozvržení stránky ani formátování. Vyberte nástroj pro DOCX, PPTX, ODT, EPUB, HWPX nebo RTF a poté porovnejte důležitý text se zdrojem.

Použijte bezplatný nástroj →

Nejprve zkontrolujte formát korejského dokumentu

Čtečka HWPX si poradí s podporovanými odstavci, tabulkami a obrázky. Starší HWP není podporován a čtečka nereprodukuje původní písma, tvary, rovnice nebo stránkování. Zachovejte originál odeslání a použijte výsledek TXT pro opětovné použití textu.

Pečlivě čisté konce řádků a neviditelné znaky

Vyčištění Copied-PDF spojuje vnitřní zalomení řádků a zachovává odstavce oddělené prázdnými řádky. Zkontrolujte tabulky, básně a seznamy podle zdroje. Volitelné odstranění neviditelných znaků se týká pouze U+200B a BOM. Normalizace NFKC a NFKD také mění znaky kompatibility.

Konverze se liší od kontroly soukromí

Markdown-to-HTML převádí označení dokumentů; HTML-to-TXT zahodí štítky a rozvržení. Inspektor Office hlásí informace o autorovi, komentáře, skryté listy a stopy externích odkazů. Samotná sestava neznamená, že tyto položky byly ze souboru odstraněny.

Vyberte si správný nástroj

Příklady vstupů ilustrují pracovní postup; neslibují konkrétní velikost souboru, přesnost rozpoznávání nebo kompatibilitu.

Převést DOCX na Text

Extrahujte text pro vyhledávání nebo organizování. Kopie TXT nereprodukuje rozložení dokumentu ani obrázky.

Příklad

document.docx → extrahovaný text.txt
  1. Vyberte soubory ve formátu DOCX. Maximální počet souborů v dávce: 1.
  2. Zkontrolujte Oddělovač sloupců tabulky a poté spusťte zpracování.
  3. Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat

Extrahuje se text, nikoli původní rozvržení stránky. Obrázky, formátování a vložené objekty nebudou zachovány. OCR se neprovede.

U dokumentů aplikace Word se části textu čtou z balíku dokumentů. Zkontrolujte tabulky a textová pole ve výsledku; jejich vizuální uspořádání není převzato. Staré binární soubory .doc nejsou podporovány.

Otevřete nástroj →

Převést PPTX na Text

Shromážděte text snímku do funkčního přepisu. Vyberte oddělovač a zkontrolujte pořadí extrakce.

Příklad

snímky.pptx → text oddělený snímky.txt
  1. Vyberte soubory ve formátu PPTX. Maximální počet souborů v dávce: 1.
  2. Zkontrolujte Oddělovač sloupců tabulky a poté spusťte zpracování.
  3. Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat

Pořadí čtení se může lišit od viditelné pozice textových polí. Obrázky a mluvený obsah se nepřepisují.

Otevřete nástroj →

Převést ODT na Text

Extrahujte prostý text ze souboru OpenDocument. Tabulky, fonty a stránkování nejsou v TXT zachovány.

Příklad

document.odt → extrahovaný text.txt
  1. Vyberte soubory ve formátu ODT. Maximální počet souborů v dávce: 1.
  2. Zkontrolujte Oddělovač sloupců tabulky a poté spusťte zpracování.
  3. Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat

Extrahuje se text, nikoli původní rozvržení stránky. Obrázky, formátování a vložené objekty nebudou zachovány. OCR se neprovede.

OpenDocument ukládá text a styly odděleně. Výstup TXT nepřijímá šablony, sloupce nebo konce stránek jako pevné rozvržení. Po exportu zkontrolujte seznamy a tabulky.

Otevřete nástroj →

Převést EPUB na Text

Sbírejte text z podporovaného souboru EPUB pro osobní pracovní postupy. Zkontrolujte podporu chráněných knih a složitých rozvržení čtení.

Příklad

book.epub → prosté čtení text.txt
  1. Vyberte soubory ve formátu EPUB. Maximální počet souborů v dávce: 1.
  2. Zkontrolujte Oddělovač sloupců tabulky a poté spusťte zpracování.
  3. Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat

Knihy chráněné DRM nejsou podporovány. Navigace, typografie a ilustrace jsou v TXT ztraceny.

Otevřete nástroj →

Převést HWPX na Text

Extrahujte text z HWPX. Starší HWP a přesná reprodukce původního rozvržení úprav vyžadují jiné pracovní postupy.

Příklad

document.hwpx → sekce text.txt
  1. Vyberte soubory ve formátu HWPX. Maximální počet souborů v dávce: 1.
  2. Zkontrolujte Oddělovač sloupců tabulky a poté spusťte zpracování.
  3. Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat

HWPX a starší binární HWP jsou různé formáty. Soubory s příponou .hwp se neotevře.

Otevřete nástroj →

Převést RTF na Text

Odeberte podporované formátování ovládacího prvku RTF pro textovou kopii. Porovnejte speciální znaky a tabulky se zdrojem.

Příklad

document.rtf → prostý text.txt
  1. Vyberte soubory ve formátu RTF. Maximální počet souborů v dávce: 1.
  2. Zkontrolujte vstupní formát a pořadí souborů a poté spusťte zpracování.
  3. Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat

Extrahuje se text, nikoli původní rozvržení stránky. Obrázky, formátování a vložené objekty nebudou zachovány. OCR se neprovede.

Formát RTF obsahuje řídicí slova pro formátování a kódování znaků. Ty se při exportu textu odstraní nebo vyhodnotí. Ve výsledku zkontrolujte speciální znaky a starší kódové stránky; vložené obrázky nejsou extrahovány.

Otevřete nástroj →

Převést MARKDOWN na HTML

Exportujte zápis Markdown jako HTML. Zkontrolujte, jak se vykreslují podporované nadpisy, seznamy a odstavce.

Příklad

# Nadpis + odstavce → document.html
  1. Vyberte soubory ve formátu MD, MARKDOWN. Maximální počet souborů v dávce: 1.
  2. Zkontrolujte Styl dokumentu HTML, Otevřít odkazy na nové kartě a poté spusťte zpracování.
  3. Stáhněte si výsledek HTML a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat

Je podporována omezená syntaxe Markdown. Složité tabulky, víceřádkové buňky, rozšíření a skripty nejsou plně přijaty.

Otevřete nástroj →

Převést HTML na Text

Extrahujte text ze souboru HTML. Toto nenavštíví adresu URL za účelem seškrábnutí aktivní webové stránky.

Příklad

uložená-stránka.html → čitelný text.txt
  1. Vyberte soubory ve formátu HTML, HTM. Maximální počet souborů v dávce: 1.
  2. Zkontrolujte vstupní formát a pořadí souborů a poté spusťte zpracování.
  3. Stáhněte si výsledek TXT a zkontrolujte jeho obsah a kvalitu.
Co zkontrolovat

Obsah znovu načtený pomocí JavaScriptu se nenačte ani nespustí. CSS layout není zachován.

Otevřete nástroj →

Přečtěte si HWPX

Čtěte podporované odstavce, tabulky a obrázky HWPX a extrahujte text. Starší HWP a přesné úpravy rozvržení nejsou podporovány.

Příklad

document.hwpx → podporovaný náhled obsahu + TXTOtevřete nástroj →

Seznam čistého textu

Vyčistěte prázdná místa, duplikáty a mezery v seznamech s jednou položkou na řádek. Řaďte ​​pouze v případě, že je záměrem změnit pořadí.

Příklad

opakované řádkové položky → vyčištěný seznam řádkůOtevřete nástroj →

Unicode normalizovat

Normalizace odlišně složeného Unicode, včetně rozloženého korejského textu. Normalizace kompatibility může změnit znaky.

Příklad

rozložený text + NFC → složený textOtevřete nástroj →

Neviditelné postavy

Před odstraněním zkontrolujte zkopírovaný text, zda neobsahuje neviditelné znaky, a zkontrolujte pozice a body kódu.

Příklad

text s neviditelnými znaky → zpráva o umístění/kóduOtevřete nástroj →

Odstraňte zalomení řádků

Připojte nechtěné konce řádků do zkopírované prózy. Tabulky, básně a seznamy mohou záviset na záměrném zalomení řádků.

Příklad

zabalená próza + prázdné odstavce → spojené odstavceOtevřete nástroj →

Zkontrolujte skryté informace v souborech Office

Před sdílením souborů Office zkontrolujte metadata autora, komentáře a stopy skrytého obsahu a poté je upravte ve zdrojové aplikaci.

Příklad

Soubor Office → zpráva o kontrole skrytých informacíOtevřete nástroj →

Tato příručka popisuje veřejné webové nástroje a jejich limity podpory. Uschovejte si originál a zkontrolujte stažený výsledek. Coverton · Opravy a kontakt

Tento překlad byl připraven za softwarové pomoci. Můžete si také přečíst anglickou verzi. Číst v angličtině