Preskočiť na obsah
Coverton Blog
V tomto článku
Dokumenty a text

Extrahujte a vyčistite text zo DOCX, HWPX a skopírovaných dokumentov

Uložením dokumentu ako TXT budú jeho slová opätovne použiteľné, ale nezachová sa pôvodné rozloženie strany ani formátovanie. Vyberte nástroj pre DOCX, PPTX, ODT, EPUB, HWPX alebo RTF a potom porovnajte dôležitý text so zdrojom.

Použite bezplatný nástroj →

Najprv skontrolujte kórejský formát dokumentu

Čítačka HWPX si poradí s podporovanými odsekmi, tabuľkami a obrázkami. Legacy HWP nie je podporované a čítačka nereprodukuje pôvodné písma, tvary, rovnice ani stránkovanie. Uchovajte originál odoslania a použite výsledok TXT na opätovné použitie textu.

Čisté zalomenia riadkov a neviditeľné znaky opatrne

Čistenie Copied-PDF spája vnútorné zalomenia riadkov a zároveň zachováva odseky oddelené prázdnymi riadkami. Skontrolujte tabuľky, básne a zoznamy oproti zdroju. Voliteľné odstránenie neviditeľných znakov ovplyvňuje iba U+200B a BOM. Normalizácia NFKC a NFKD tiež mení znaky kompatibility.

Konverzia sa líši od kontroly súkromia

Markdown-to-HTML prevádza označovanie dokumentov; HTML-to-TXT zahodí štítky a rozloženie. Inšpektor Office hlási informácie o autorovi, komentáre, skryté hárky a stopy externých odkazov. Samotná správa neznamená, že tieto položky boli zo súboru odstránené.

Vyberte si správny nástroj

Príklady vstupov ilustrujú pracovný postup; nesľubujú konkrétnu veľkosť súboru, presnosť rozpoznávania alebo kompatibilitu.

Previesť DOCX na Text

Extrahujte text na vyhľadávanie alebo organizáciu. Kópia TXT nereprodukuje rozloženie dokumentu ani obrázky.

Príklad

document.docx → extrahovaný text.txt
  1. Vyberte súbory vo formáte DOCX. Maximálny počet súborov v dávke: 1.
  2. Skontrolujte Oddeľovač stĺpcov tabuľky a potom začnite spracovávať.
  3. Stiahnite si výsledok TXT a skontrolujte jeho obsah a kvalitu.
Čo skontrolovať

Extrahuje sa text, nie pôvodné rozloženie stránky. Obrázky, formátovanie a vložené objekty sa nezachovajú. OCR sa nevykoná.

V dokumentoch programu Word sa časti textu čítajú z balíka dokumentov. Skontrolujte tabuľky a textové polia vo výsledku; ich vizuálne usporiadanie nie je prijaté. Staré binárne súbory .doc nie sú podporované.

Otvorte nástroj →

Previesť PPTX na Text

Zhromaždite text snímky do pracovného prepisu. Vyberte oddeľovač a skontrolujte poradie extrakcie.

Príklad

snímky.pptx → text oddelený snímkami.txt
  1. Vyberte súbory vo formáte PPTX. Maximálny počet súborov v dávke: 1.
  2. Skontrolujte Oddeľovač stĺpcov tabuľky a potom začnite spracovávať.
  3. Stiahnite si výsledok TXT a skontrolujte jeho obsah a kvalitu.
Čo skontrolovať

Poradie čítania sa môže líšiť od viditeľnej polohy textových polí. Obrázky a hovorený obsah sa neprepisujú.

Otvorte nástroj →

Previesť ODT na Text

Extrahujte obyčajný text zo súboru OpenDocument. Tabuľky, fonty a stránkovanie nie sú v TXT zachované.

Príklad

document.odt → extrahovaný text.txt
  1. Vyberte súbory vo formáte ODT. Maximálny počet súborov v dávke: 1.
  2. Skontrolujte Oddeľovač stĺpcov tabuľky a potom začnite spracovávať.
  3. Stiahnite si výsledok TXT a skontrolujte jeho obsah a kvalitu.
Čo skontrolovať

Extrahuje sa text, nie pôvodné rozloženie stránky. Obrázky, formátovanie a vložené objekty sa nezachovajú. OCR sa nevykoná.

OpenDocument ukladá text a štýly oddelene. Výstup TXT neprijíma šablóny, stĺpce ani zlomy strán ako pevné rozloženie. Po exporte skontrolujte zoznamy a tabuľky.

Otvorte nástroj →

Previesť EPUB na Text

Zbierajte text z podporovaného súboru EPUB pre osobné pracovné postupy. Skontrolujte podporu pre chránené knihy a zložité rozloženia na čítanie.

Príklad

kniha.epub → text na čítanie.txt
  1. Vyberte súbory vo formáte EPUB. Maximálny počet súborov v dávke: 1.
  2. Skontrolujte Oddeľovač stĺpcov tabuľky a potom začnite spracovávať.
  3. Stiahnite si výsledok TXT a skontrolujte jeho obsah a kvalitu.
Čo skontrolovať

Knihy chránené DRM nie sú podporované. Navigácia, typografia a ilustrácie sa v TXT strácajú.

Otvorte nástroj →

Previesť HWPX na Text

Extrahujte text z HWPX. Starší HWP a presná reprodukcia pôvodného rozloženia úprav vyžadujú iné pracovné postupy.

Príklad

document.hwpx → sekcia text.txt
  1. Vyberte súbory vo formáte HWPX. Maximálny počet súborov v dávke: 1.
  2. Skontrolujte Oddeľovač stĺpcov tabuľky a potom začnite spracovávať.
  3. Stiahnite si výsledok TXT a skontrolujte jeho obsah a kvalitu.
Čo skontrolovať

HWPX a starší binárny HWP sú rôzne formáty. Súbory s príponou .hwp sa neotvoria.

Otvorte nástroj →

Previesť RTF na Text

Odstráňte podporované formátovanie ovládacieho prvku RTF pre textovú kópiu. Porovnajte špeciálne znaky a tabuľky so zdrojom.

Príklad

document.rtf → obyčajný text.txt
  1. Vyberte súbory vo formáte RTF. Maximálny počet súborov v dávke: 1.
  2. Skontrolujte vstupný formát a poradie súborov a potom začnite spracovávať.
  3. Stiahnite si výsledok TXT a skontrolujte jeho obsah a kvalitu.
Čo skontrolovať

Extrahuje sa text, nie pôvodné rozloženie stránky. Obrázky, formátovanie a vložené objekty sa nezachovajú. OCR sa nevykoná.

Formátovaný text obsahuje riadiace slová na formátovanie a kódovanie znakov. Tieto sa pri exporte textu odstránia alebo vyhodnotia. Vo výsledku skontrolujte špeciálne znaky a staršie kódové stránky; vložené obrázky sa neextrahujú.

Otvorte nástroj →

Previesť MARKDOWN na HTML

Exportujte zápis Markdown ako HTML. Skontrolujte, ako sa vykresľujú podporované nadpisy, zoznamy a odseky.

Príklad

# Nadpis + odseky → document.html
  1. Vyberte súbory vo formáte MD, MARKDOWN. Maximálny počet súborov v dávke: 1.
  2. Skontrolujte Štýl dokumentu HTML, Otvoriť odkazy na novej karte a potom začnite spracovávať.
  3. Stiahnite si výsledok HTML a skontrolujte jeho obsah a kvalitu.
Čo skontrolovať

Obmedzená syntax Markdown je podporovaná. Komplexné tabuľky, viacriadkové bunky, rozšírenia a skripty nie sú plne prijaté.

Otvorte nástroj →

Previesť HTML na Text

Extrahujte text zo súboru HTML. Toto nenavštívi webovú adresu na zoškrabanie aktívnej webovej stránky.

Príklad

uložená-stranka.html → čitateľný text.txt
  1. Vyberte súbory vo formáte HTML, HTM. Maximálny počet súborov v dávke: 1.
  2. Skontrolujte vstupný formát a poradie súborov a potom začnite spracovávať.
  3. Stiahnite si výsledok TXT a skontrolujte jeho obsah a kvalitu.
Čo skontrolovať

Obsah znovu načítaný cez JavaScript sa nenačíta ani nespustí. Rozloženie CSS nie je zachované.

Otvorte nástroj →

Prečítajte si HWPX

Čítajte podporované odseky, tabuľky a obrázky HWPX a extrahujte text. Starší HWP a presné úpravy rozloženia nie sú podporované.

Príklad

document.hwpx → podporovaný náhľad obsahu + TXTOtvorte nástroj →

Čistý textový zoznam

Vyčistite prázdne miesta, duplikáty a medzery v zoznamoch po jednej položke na riadok. Triediť len vtedy, keď je zámerom zmeniť poradie.

Príklad

opakované riadkové položky → vyčistený zoznam riadkovOtvorte nástroj →

Unicode normalizovať

Normalizácia odlišne zloženého Unicode vrátane rozloženého kórejského textu. Normalizácia kompatibility môže zmeniť znaky.

Príklad

rozložený text + NFC → zložený textOtvorte nástroj →

Neviditeľné postavy

Pred odstránením skontrolujte skopírovaný text, či neobsahuje neviditeľné znaky, a skontrolujte pozície a body kódu.

Príklad

text s neviditeľnými znakmi → správa o polohe/kódeOtvorte nástroj →

Odstráňte zlomy riadkov

Pridajte nechcené zalomenia riadkov do skopírovanej prózy. Tabuľky, básne a zoznamy môžu závisieť od úmyselného zalomenia riadkov.

Príklad

zabalená próza + prázdne odseky → spojené odsekyOtvorte nástroj →

Skontrolujte skryté informácie v súboroch balíka Office

Pred zdieľaním súborov balíka Office skontrolujte metadáta autorov, komentáre a stopy skrytého obsahu a potom ich upravte v zdrojovej aplikácii.

Príklad

Kancelársky súbor → správa o kontrole skrytých informáciíOtvorte nástroj →

Táto príručka popisuje verejné webové nástroje a limity ich podpory. Ponechajte si svoj originál a skontrolujte stiahnutý výsledok. Coverton · Opravy a kontakt

Tento preklad bol pripravený so softvérovou pomocou. Môžete si prečítať aj anglickú verziu. Čítajte v angličtine