Ugrás a tartalomhoz
Coverton Blog
Ebben a cikkben
Dokumentumok és szövegek

Szöveg kinyerése és tisztítása a DOCX, HWPX és másolt dokumentumokból

A dokumentum TXT néven történő mentése újrafelhasználhatóvá teszi a szavait, de nem őrzi meg az eredeti oldalelrendezést vagy formázást. Válassza ki a DOCX, PPTX, ODT, EPUB, HWPX vagy RTF eszközt, majd hasonlítsa össze a fontos szöveget a forrással.

Használja az ingyenes eszközt →

Először ellenőrizze a koreai dokumentumformátumot

A HWPX olvasó a támogatott bekezdéseket, táblázatokat és képeket kezeli. A régi HWP nem támogatott, és az olvasó nem reprodukálja az eredeti betűtípusokat, alakzatokat, egyenleteket vagy oldalszámozást. Őrizze meg a beadvány eredetijét, és használja a TXT eredményt a szöveg újrafelhasználásához.

Gondosan tisztítsa meg a sortöréseket és a láthatatlan karaktereket

A Copied-PDF tisztítás egyesíti a belső sortöréseket, miközben megtartja az üres sorokkal elválasztott bekezdéseket. Tekintse át a táblázatokat, verseket és listákat a forrás alapján. Az opcionális láthatatlan karakterek eltávolítása csak a U+200B és BOM típusokat érinti. A NFKC és NFKD normalizálás a kompatibilitási karaktereket is megváltoztatja.

Az átalakítás eltér az adatvédelmi ellenőrzéstől

A Markdown-HTML konvertálja a dokumentumjelölést; A HTML-TXT elveti a címkéket és az elrendezést. A Office felügyelő jelent szerzői információkat, megjegyzéseket, rejtett lapokat és külső hivatkozások nyomait. A jelentés önmagában nem jelenti azt, hogy ezeket az elemeket eltávolították a fájlból.

Válassza ki a megfelelő eszközt

Példabemenetek illusztrálják a munkafolyamatot; nem ígérnek meghatározott fájlméretet, felismerési pontosságot vagy kompatibilitást.

Alakítsa át a DOCX-t Szöveg-re

Szöveg kibontása kereséshez vagy rendszerezéshez. A TXT másolat nem reprodukálja a dokumentum elrendezését vagy a képeket.

Példa

document.docx → kicsomagolt szöveg.txt
  1. Válasszon fájlokat DOCX formátumban. Fájlok maximális száma kötegenként: 1.
  2. Tekintse át a Táblázat oszlopelválasztó-t, majd kezdje el a feldolgozást.
  3. Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni

A rendszer a szöveget bontja ki, nem az eredeti oldalelrendezést. A képek, a formázások és a beágyazott objektumok nem maradnak meg. Az OCR nem hajtódik végre.

Word dokumentumok esetén a szövegrészek a dokumentumcsomagból kerülnek kiolvasásra. Ellenőrizze a táblázatokat és a szövegmezőket az eredményben; vizuális elrendezésüket nem veszik át. A régi bináris .doc fájlok nem támogatottak.

Nyissa ki az eszközt →

Alakítsa át a PPTX-t Szöveg-re

Gyűjtsd össze a dia szövegét működő átiratba. Válasszon elválasztót, és tekintse át a kivonatolási sorrendet.

Példa

slides.pptx → diadal elválasztott szöveg.txt
  1. Válasszon fájlokat PPTX formátumban. Fájlok maximális száma kötegenként: 1.
  2. Tekintse át a Táblázat oszlopelválasztó-t, majd kezdje el a feldolgozást.
  3. Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni

Az olvasási sorrend eltérhet a szövegmezők látható helyétől. A képek és az elhangzott tartalmak nem kerülnek átírásra.

Nyissa ki az eszközt →

Alakítsa át a ODT-t Szöveg-re

Egyszerű szöveg kibontása egy OpenDocument fájlból. A TXT nem őrzi meg a táblázatokat, a betűtípusokat és az oldalszámozást.

Példa

document.odt → kivont text.txt
  1. Válasszon fájlokat ODT formátumban. Fájlok maximális száma kötegenként: 1.
  2. Tekintse át a Táblázat oszlopelválasztó-t, majd kezdje el a feldolgozást.
  3. Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni

A rendszer a szöveget bontja ki, nem az eredeti oldalelrendezést. A képek, a formázások és a beágyazott objektumok nem maradnak meg. Az OCR nem hajtódik végre.

Az OpenDocument külön tárolja a szöveget és a stílusokat. A TXT kimenet nem alkalmaz sablonokat, oszlopokat vagy oldaltöréseket rögzített elrendezésként. Az exportálás után ellenőrizze a listákat és a táblázatokat.

Nyissa ki az eszközt →

Alakítsa át a EPUB-t Szöveg-re

Szöveg gyűjtése támogatott EPUB-ból személyes munkafolyamatokhoz. Ellenőrizze a védett könyvek és az összetett olvasási elrendezések támogatását.

Példa

könyv.epub → egyszerű olvasási szöveg.txt
  1. Válasszon fájlokat EPUB formátumban. Fájlok maximális száma kötegenként: 1.
  2. Tekintse át a Táblázat oszlopelválasztó-t, majd kezdje el a feldolgozást.
  3. Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni

A DRM-védett könyvek nem támogatottak. A navigáció, a tipográfia és az illusztrációk elvesznek a TXT-ben.

Nyissa ki az eszközt →

Alakítsa át a HWPX-t Szöveg-re

Szöveg kibontása a HWPX-ből. Az örökölt HWP és az eredeti szerkesztési elrendezés pontos reprodukálása más munkafolyamatokat igényel.

Példa

document.hwpx → szakasz text.txt
  1. Válasszon fájlokat HWPX formátumban. Fájlok maximális száma kötegenként: 1.
  2. Tekintse át a Táblázat oszlopelválasztó-t, majd kezdje el a feldolgozást.
  3. Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni

A HWPX és a régebbi bináris HWP különböző formátumok. A .hwp fájlok nem nyílnak meg.

Nyissa ki az eszközt →

Alakítsa át a RTF-t Szöveg-re

Távolítsa el a támogatott RTF-vezérlő formázást a szövegmásolatnál. Hasonlítsa össze a speciális karaktereket és táblázatokat a forrással.

Példa

document.rtf → plain text.txt
  1. Válasszon fájlokat RTF formátumban. Fájlok maximális száma kötegenként: 1.
  2. Ellenőrizze a beviteli formátumot és a fájl sorrendjét, majd kezdje el a feldolgozást.
  3. Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni

A rendszer a szöveget bontja ki, nem az eredeti oldalelrendezést. A képek, a formázások és a beágyazott objektumok nem maradnak meg. Az OCR nem hajtódik végre.

A gazdag szöveg vezérlőszavakat tartalmaz a formázáshoz és a karakterkódoláshoz. Ezeket a szöveg exportálása során eltávolítják vagy kiértékelik. Ellenőrizze a speciális karaktereket és a régebbi kódlapokat az eredményben; a beágyazott képek nem kerülnek kibontásra.

Nyissa ki az eszközt →

Alakítsa át a MARKDOWN-t HTML-re

Exportálja a Markdown-írást HTML-ként. Ellenőrizze, hogyan jelennek meg a támogatott címsorok, listák és bekezdések.

Példa

# Címsor + bekezdések → document.html
  1. Válasszon fájlokat MD, MARKDOWN formátumban. Fájlok maximális száma kötegenként: 1.
  2. Tekintse át a HTML dokumentumstílus, Nyissa meg a hivatkozásokat egy új lapon-t, majd kezdje el a feldolgozást.
  3. Töltse le a HTML eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni

Korlátozott Markdown szintaxis támogatott. Az összetett táblázatok, a többsoros cellák, a kiterjesztések és a szkriptek nincsenek teljesen átvéve.

Nyissa ki az eszközt →

Alakítsa át a HTML-t Szöveg-re

Szöveg kibontása HTML-fájlból. Ez nem látogat meg egy URL-t egy élő webhely lekaparásához.

Példa

mentett-oldal.html → olvasható szöveg.txt
  1. Válasszon fájlokat HTML, HTM formátumban. Fájlok maximális száma kötegenként: 1.
  2. Ellenőrizze a beviteli formátumot és a fájl sorrendjét, majd kezdje el a feldolgozást.
  3. Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni

A JavaScript segítségével újratöltött tartalom nem kerül lekérésre vagy végrehajtásra. A CSS-elrendezés nem őrződik meg.

Nyissa ki az eszközt →

Olvassa el a HWPX-et

Olvasson támogatott HWPX bekezdéseket, táblázatokat és képeket, és bontsa ki a szöveget. A régi HWP és a pontos elrendezés szerkesztése nem támogatott.

Példa

document.hwpx → támogatott tartalom előnézete + TXTNyissa ki az eszközt →

Tiszta szöveglista

Tisztítsa meg az üres helyeket, a duplikációkat és a szóközöket a soronként egy-egy listán. Csak akkor válasszon, ha módosítani kívánja a rendelést.

Példa

ismételt sorok → törölt sorlistaNyissa ki az eszközt →

Unicode normalizálás

Normalizálja a különböző összetételű Unicode-ot, beleértve a bontott koreai szöveget is. A kompatibilitás normalizálása megváltoztathatja a karaktereket.

Példa

bontott szöveg + NFC → komponált szövegNyissa ki az eszközt →

Láthatatlan karakterek

Az eltávolítás előtt ellenőrizze a másolt szöveget, hogy vannak-e láthatatlan karakterek, és tekintse át a pozíciókat és a kódpontokat.

Példa

szöveg láthatatlan karakterekkel → hely/kódpont jelentésNyissa ki az eszközt →

Távolítsa el a sortöréseket

Csatlakozzon a nem kívánt sortörésekhez a másolt prózában. A táblázatok, versek és listák a szándékos sortöréstől függhetnek.

Példa

becsomagolt próza + üres bekezdések → összekapcsolt bekezdésekNyissa ki az eszközt →

Vizsgálja meg az Office-fájlok rejtett adatait

Az Office-fájlok megosztása előtt ellenőrizze a szerző metaadatait, megjegyzéseit és rejtett tartalom nyomait, majd szerkessze azokat a forrásalkalmazásban.

Példa

Irodai fájl → rejtett információs vizsgálati jelentésNyissa ki az eszközt →

Ez az útmutató a nyilvános webes eszközöket és azok támogatási korlátait ismerteti. Őrizze meg az eredetit, és ellenőrizze a letöltött eredményt. Coverton · Helyesbítés és kapcsolatfelvétel

Ez a fordítás szoftveres segítséggel készült. Elolvashatja az angol verziót is. Olvass angolul