Szöveg kinyerése és tisztítása a DOCX, HWPX és másolt dokumentumokból
A dokumentum TXT néven történő mentése újrafelhasználhatóvá teszi a szavait, de nem őrzi meg az eredeti oldalelrendezést vagy formázást. Válassza ki a DOCX, PPTX, ODT, EPUB, HWPX vagy RTF eszközt, majd hasonlítsa össze a fontos szöveget a forrással.
Használja az ingyenes eszközt →Először ellenőrizze a koreai dokumentumformátumot
A HWPX olvasó a támogatott bekezdéseket, táblázatokat és képeket kezeli. A régi HWP nem támogatott, és az olvasó nem reprodukálja az eredeti betűtípusokat, alakzatokat, egyenleteket vagy oldalszámozást. Őrizze meg a beadvány eredetijét, és használja a TXT eredményt a szöveg újrafelhasználásához.
Gondosan tisztítsa meg a sortöréseket és a láthatatlan karaktereket
A Copied-PDF tisztítás egyesíti a belső sortöréseket, miközben megtartja az üres sorokkal elválasztott bekezdéseket. Tekintse át a táblázatokat, verseket és listákat a forrás alapján. Az opcionális láthatatlan karakterek eltávolítása csak a U+200B és BOM típusokat érinti. A NFKC és NFKD normalizálás a kompatibilitási karaktereket is megváltoztatja.
Az átalakítás eltér az adatvédelmi ellenőrzéstől
A Markdown-HTML konvertálja a dokumentumjelölést; A HTML-TXT elveti a címkéket és az elrendezést. A Office felügyelő jelent szerzői információkat, megjegyzéseket, rejtett lapokat és külső hivatkozások nyomait. A jelentés önmagában nem jelenti azt, hogy ezeket az elemeket eltávolították a fájlból.
Válassza ki a megfelelő eszközt
Példabemenetek illusztrálják a munkafolyamatot; nem ígérnek meghatározott fájlméretet, felismerési pontosságot vagy kompatibilitást.
Alakítsa át a DOCX-t Szöveg-re
Szöveg kibontása kereséshez vagy rendszerezéshez. A TXT másolat nem reprodukálja a dokumentum elrendezését vagy a képeket.
Példa
document.docx → kicsomagolt szöveg.txt- Válasszon fájlokat DOCX formátumban. Fájlok maximális száma kötegenként: 1.
- Tekintse át a Táblázat oszlopelválasztó-t, majd kezdje el a feldolgozást.
- Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni
A rendszer a szöveget bontja ki, nem az eredeti oldalelrendezést. A képek, a formázások és a beágyazott objektumok nem maradnak meg. Az OCR nem hajtódik végre.
Word dokumentumok esetén a szövegrészek a dokumentumcsomagból kerülnek kiolvasásra. Ellenőrizze a táblázatokat és a szövegmezőket az eredményben; vizuális elrendezésüket nem veszik át. A régi bináris .doc fájlok nem támogatottak.
Alakítsa át a PPTX-t Szöveg-re
Gyűjtsd össze a dia szövegét működő átiratba. Válasszon elválasztót, és tekintse át a kivonatolási sorrendet.
Példa
slides.pptx → diadal elválasztott szöveg.txt- Válasszon fájlokat PPTX formátumban. Fájlok maximális száma kötegenként: 1.
- Tekintse át a Táblázat oszlopelválasztó-t, majd kezdje el a feldolgozást.
- Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni
Az olvasási sorrend eltérhet a szövegmezők látható helyétől. A képek és az elhangzott tartalmak nem kerülnek átírásra.
Alakítsa át a ODT-t Szöveg-re
Egyszerű szöveg kibontása egy OpenDocument fájlból. A TXT nem őrzi meg a táblázatokat, a betűtípusokat és az oldalszámozást.
Példa
document.odt → kivont text.txt- Válasszon fájlokat ODT formátumban. Fájlok maximális száma kötegenként: 1.
- Tekintse át a Táblázat oszlopelválasztó-t, majd kezdje el a feldolgozást.
- Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni
A rendszer a szöveget bontja ki, nem az eredeti oldalelrendezést. A képek, a formázások és a beágyazott objektumok nem maradnak meg. Az OCR nem hajtódik végre.
Az OpenDocument külön tárolja a szöveget és a stílusokat. A TXT kimenet nem alkalmaz sablonokat, oszlopokat vagy oldaltöréseket rögzített elrendezésként. Az exportálás után ellenőrizze a listákat és a táblázatokat.
Alakítsa át a EPUB-t Szöveg-re
Szöveg gyűjtése támogatott EPUB-ból személyes munkafolyamatokhoz. Ellenőrizze a védett könyvek és az összetett olvasási elrendezések támogatását.
Példa
könyv.epub → egyszerű olvasási szöveg.txt- Válasszon fájlokat EPUB formátumban. Fájlok maximális száma kötegenként: 1.
- Tekintse át a Táblázat oszlopelválasztó-t, majd kezdje el a feldolgozást.
- Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni
A DRM-védett könyvek nem támogatottak. A navigáció, a tipográfia és az illusztrációk elvesznek a TXT-ben.
Alakítsa át a HWPX-t Szöveg-re
Szöveg kibontása a HWPX-ből. Az örökölt HWP és az eredeti szerkesztési elrendezés pontos reprodukálása más munkafolyamatokat igényel.
Példa
document.hwpx → szakasz text.txt- Válasszon fájlokat HWPX formátumban. Fájlok maximális száma kötegenként: 1.
- Tekintse át a Táblázat oszlopelválasztó-t, majd kezdje el a feldolgozást.
- Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni
A HWPX és a régebbi bináris HWP különböző formátumok. A .hwp fájlok nem nyílnak meg.
Alakítsa át a RTF-t Szöveg-re
Távolítsa el a támogatott RTF-vezérlő formázást a szövegmásolatnál. Hasonlítsa össze a speciális karaktereket és táblázatokat a forrással.
Példa
document.rtf → plain text.txt- Válasszon fájlokat RTF formátumban. Fájlok maximális száma kötegenként: 1.
- Ellenőrizze a beviteli formátumot és a fájl sorrendjét, majd kezdje el a feldolgozást.
- Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni
A rendszer a szöveget bontja ki, nem az eredeti oldalelrendezést. A képek, a formázások és a beágyazott objektumok nem maradnak meg. Az OCR nem hajtódik végre.
A gazdag szöveg vezérlőszavakat tartalmaz a formázáshoz és a karakterkódoláshoz. Ezeket a szöveg exportálása során eltávolítják vagy kiértékelik. Ellenőrizze a speciális karaktereket és a régebbi kódlapokat az eredményben; a beágyazott képek nem kerülnek kibontásra.
Alakítsa át a MARKDOWN-t HTML-re
Exportálja a Markdown-írást HTML-ként. Ellenőrizze, hogyan jelennek meg a támogatott címsorok, listák és bekezdések.
Példa
# Címsor + bekezdések → document.html- Válasszon fájlokat MD, MARKDOWN formátumban. Fájlok maximális száma kötegenként: 1.
- Tekintse át a HTML dokumentumstílus, Nyissa meg a hivatkozásokat egy új lapon-t, majd kezdje el a feldolgozást.
- Töltse le a HTML eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni
Korlátozott Markdown szintaxis támogatott. Az összetett táblázatok, a többsoros cellák, a kiterjesztések és a szkriptek nincsenek teljesen átvéve.
Alakítsa át a HTML-t Szöveg-re
Szöveg kibontása HTML-fájlból. Ez nem látogat meg egy URL-t egy élő webhely lekaparásához.
Példa
mentett-oldal.html → olvasható szöveg.txt- Válasszon fájlokat HTML, HTM formátumban. Fájlok maximális száma kötegenként: 1.
- Ellenőrizze a beviteli formátumot és a fájl sorrendjét, majd kezdje el a feldolgozást.
- Töltse le a TXT eredményt, és ellenőrizze annak tartalmát és minőségét.
Mit kell ellenőrizni
A JavaScript segítségével újratöltött tartalom nem kerül lekérésre vagy végrehajtásra. A CSS-elrendezés nem őrződik meg.
Olvassa el a HWPX-et
Olvasson támogatott HWPX bekezdéseket, táblázatokat és képeket, és bontsa ki a szöveget. A régi HWP és a pontos elrendezés szerkesztése nem támogatott.
Példa
document.hwpx → támogatott tartalom előnézete + TXTNyissa ki az eszközt →Tiszta szöveglista
Tisztítsa meg az üres helyeket, a duplikációkat és a szóközöket a soronként egy-egy listán. Csak akkor válasszon, ha módosítani kívánja a rendelést.
Példa
ismételt sorok → törölt sorlistaNyissa ki az eszközt →Unicode normalizálás
Normalizálja a különböző összetételű Unicode-ot, beleértve a bontott koreai szöveget is. A kompatibilitás normalizálása megváltoztathatja a karaktereket.
Példa
bontott szöveg + NFC → komponált szövegNyissa ki az eszközt →Láthatatlan karakterek
Az eltávolítás előtt ellenőrizze a másolt szöveget, hogy vannak-e láthatatlan karakterek, és tekintse át a pozíciókat és a kódpontokat.
Példa
szöveg láthatatlan karakterekkel → hely/kódpont jelentésNyissa ki az eszközt →Távolítsa el a sortöréseket
Csatlakozzon a nem kívánt sortörésekhez a másolt prózában. A táblázatok, versek és listák a szándékos sortöréstől függhetnek.
Példa
becsomagolt próza + üres bekezdések → összekapcsolt bekezdésekNyissa ki az eszközt →Vizsgálja meg az Office-fájlok rejtett adatait
Az Office-fájlok megosztása előtt ellenőrizze a szerző metaadatait, megjegyzéseit és rejtett tartalom nyomait, majd szerkessze azokat a forrásalkalmazásban.
Példa
Irodai fájl → rejtett információs vizsgálati jelentésNyissa ki az eszközt →Ez az útmutató a nyilvános webes eszközöket és azok támogatási korlátait ismerteti. Őrizze meg az eredetit, és ellenőrizze a letöltött eredményt. Coverton · Helyesbítés és kapcsolatfelvétel
Ez a fordítás szoftveres segítséggel készült. Elolvashatja az angol verziót is. Olvass angolul