Siirry sisältöön
Coverton Blogi
Tässä artikkelissa
Asiakirjoja ja tekstiä

Poimi ja puhdista teksti DOCX, HWPX ja kopioiduista asiakirjoista

Asiakirjan tallentaminen nimellä TXT tekee sen sanoista uudelleenkäytettäviä, mutta ei säilytä alkuperäistä sivun asettelua tai muotoilua. Valitse työkalu malleille DOCX, PPTX, ODT, EPUB, HWPX tai RTF ja vertaa sitten tärkeää tekstiä lähteeseen.

Käytä ilmaista työkalua →

Tarkista ensin korealainen asiakirjamuoto

HWPX-lukija käsittelee tuetut kappaleet, taulukot ja kuvat. Vanhaa HWP:tä ei tueta, eikä lukija toista alkuperäisiä fontteja, muotoja, yhtälöitä tai sivutusta. Säilytä lähetyksen alkuperäinen ja käytä TXT-tulosta tekstin uudelleenkäyttöön.

Puhdista rivinvaihdot ja näkymätön merkit huolellisesti

Kopioitu-PDF-siivous yhdistää sisäiset rivinvaihdot ja säilyttää tyhjät rivillä erotetut kappaleet. Tarkista taulukot, runot ja luettelot lähdettä vastaan. Valinnainen näkymättömien merkkien poisto vaikuttaa vain U+200B- ja BOM-malleihin. NFKC ja NFKD normalisointi muuttaa myös yhteensopivuusmerkkejä.

Muuntaminen on eri asia kuin yksityisyyden tarkastus

Markdown-HTML muuntaa asiakirjan merkinnät; HTML-to-TXT hylkää tunnisteet ja asettelun. Office-tarkastaja raportoi tekijätiedot, kommentit, piilotetut taulukot ja ulkoisten linkkien jäljet. Pelkkä raportti ei tarkoita, että kyseiset kohteet olisi poistettu tiedostosta.

Valitse oikea työkalu

Esimerkkisyötteet havainnollistavat työnkulkua; ne eivät lupaa tiettyä tiedostokokoa, tunnistustarkkuutta tai yhteensopivuutta.

Muunna DOCX muotoon Teksti

Poimi tekstiä hakua tai järjestämistä varten. TXT-kopio ei toista asiakirjan asettelua tai kuvia.

Esimerkki

document.docx → purettu teksti.txt
  1. Valitse tiedostot muodossa DOCX. Tiedostojen enimmäismäärä erää kohti: 1.
  2. Tarkista Taulukon sarakkeiden erotin ja aloita sitten käsittely.
  3. Lataa TXT tulos ja tarkista sen sisältö ja laatu.
Mitä tarkistaa

Teksti poimitaan, ei alkuperäinen sivuasettelu. Kuvia, muotoilua ja upotettuja objekteja ei säilytetä. Tekstintunnistusta ei suoriteta.

Word-asiakirjoissa tekstin osia luetaan asiakirjapaketista. Tarkista tuloksen taulukot ja tekstikentät; niiden visuaalista järjestelyä ei ole hyväksytty. Vanhoja binaarisia .doc-tiedostoja ei tueta.

Avaa työkalu →

Muunna PPTX muotoon Teksti

Kerää dian tekstiä toimivaksi transkriptioksi. Valitse erotin ja tarkista poimintajärjestys.

Esimerkki

slides.pptx → dioilla erotettu teksti.txt
  1. Valitse tiedostot muodossa PPTX. Tiedostojen enimmäismäärä erää kohti: 1.
  2. Tarkista Taulukon sarakkeiden erotin ja aloita sitten käsittely.
  3. Lataa TXT tulos ja tarkista sen sisältö ja laatu.
Mitä tarkistaa

Lukujärjestys voi poiketa tekstikenttien näkyvästä sijainnista. Kuvia ja puhuttua sisältöä ei litteroida.

Avaa työkalu →

Muunna ODT muotoon Teksti

Pura pelkkää tekstiä OpenDocument-tiedostosta. Taulukot, fontit ja sivutus eivät säily TXT:ssä.

Esimerkki

document.odt → purettu text.txt
  1. Valitse tiedostot muodossa ODT. Tiedostojen enimmäismäärä erää kohti: 1.
  2. Tarkista Taulukon sarakkeiden erotin ja aloita sitten käsittely.
  3. Lataa TXT tulos ja tarkista sen sisältö ja laatu.
Mitä tarkistaa

Teksti poimitaan, ei alkuperäinen sivuasettelu. Kuvia, muotoilua ja upotettuja objekteja ei säilytetä. Tekstintunnistusta ei suoriteta.

OpenDocument tallentaa tekstin ja tyylit erikseen. TXT-tuloste ei käytä malleja, sarakkeita tai sivunvaihtoja kiinteänä asetteluna. Tarkista luettelot ja taulukot viennin jälkeen.

Avaa työkalu →

Muunna EPUB muotoon Teksti

Kerää tekstiä tuetuista EPUB-levyistä henkilökohtaisia työnkulkuja varten. Tarkista suojattujen kirjojen ja monimutkaisten lukuasettelujen tuki.

Esimerkki

book.epub → pelkkä teksti.txt
  1. Valitse tiedostot muodossa EPUB. Tiedostojen enimmäismäärä erää kohti: 1.
  2. Tarkista Taulukon sarakkeiden erotin ja aloita sitten käsittely.
  3. Lataa TXT tulos ja tarkista sen sisältö ja laatu.
Mitä tarkistaa

DRM-suojattuja kirjoja ei tueta. Navigointi, typografia ja kuvat ovat kadonneet TXT:ssä.

Avaa työkalu →

Muunna HWPX muotoon Teksti

Pura tekstiä HWPX:stä. Vanha HWP ja alkuperäisen muokkausasettelun tarkka toisto edellyttävät muita työnkulkuja.

Esimerkki

document.hwpx → osio text.txt
  1. Valitse tiedostot muodossa HWPX. Tiedostojen enimmäismäärä erää kohti: 1.
  2. Tarkista Taulukon sarakkeiden erotin ja aloita sitten käsittely.
  3. Lataa TXT tulos ja tarkista sen sisältö ja laatu.
Mitä tarkistaa

HWPX ja vanhempi binääri HWP ovat eri muotoja. Tiedostot, joissa on .hwp, eivät avaudu.

Avaa työkalu →

Muunna RTF muotoon Teksti

Poista tuettu RTF-ohjausmuotoilu tekstikopiosta. Vertaa erikoismerkkejä ja taulukoita lähteeseen.

Esimerkki

document.rtf → pelkkä teksti.txt
  1. Valitse tiedostot muodossa RTF. Tiedostojen enimmäismäärä erää kohti: 1.
  2. Tarkista syöttömuoto ja tiedostojärjestys ja aloita sitten käsittely.
  3. Lataa TXT tulos ja tarkista sen sisältö ja laatu.
Mitä tarkistaa

Teksti poimitaan, ei alkuperäinen sivuasettelu. Kuvia, muotoilua ja upotettuja objekteja ei säilytetä. Tekstintunnistusta ei suoriteta.

Rich text sisältää ohjaussanoja muotoilua ja merkkikoodausta varten. Nämä poistetaan tai arvioidaan tekstin viennin aikana. Tarkista tuloksesta erikoismerkit ja vanhemmat koodisivut; upotettuja kuvia ei pureta.

Avaa työkalu →

Muunna MARKDOWN muotoon HTML

Vie Markdown-kirjoitus HTML-muodossa. Tarkista, kuinka tuetut otsikot, luettelot ja kappaleet näkyvät.

Esimerkki

# Otsikko + kappaleet → document.html
  1. Valitse tiedostot muodossa MD, MARKDOWN. Tiedostojen enimmäismäärä erää kohti: 1.
  2. Tarkista HTML-dokumenttityyli, Avaa linkit uudessa välilehdessä ja aloita sitten käsittely.
  3. Lataa HTML tulos ja tarkista sen sisältö ja laatu.
Mitä tarkistaa

Rajoitettu Markdown-syntaksi on tuettu. Monimutkaisia ​​taulukoita, monirivisiä soluja, laajennuksia ja komentosarjoja ei oteta täysin käyttöön.

Avaa työkalu →

Muunna HTML muotoon Teksti

Pura tekstiä HTML-tiedostosta. Tämä ei käy URL-osoitteessa kaapatakseen toimivan verkkosivuston.

Esimerkki

saved-page.html → luettava teksti.txt
  1. Valitse tiedostot muodossa HTML, HTM. Tiedostojen enimmäismäärä erää kohti: 1.
  2. Tarkista syöttömuoto ja tiedostojärjestys ja aloita sitten käsittely.
  3. Lataa TXT tulos ja tarkista sen sisältö ja laatu.
Mitä tarkistaa

JavaScriptin kautta uudelleenladattua sisältöä ei haeta tai suoriteta. CSS-asettelua ei säilytetä.

Avaa työkalu →

Lue HWPX

Lue tuetut HWPX-kappaleet, taulukot ja kuvat ja pura tekstiä. Vanhaa HWP:tä ja tarkkaa asettelun muokkausta ei tueta.

Esimerkki

document.hwpx → tuettu sisällön esikatselu + TXTAvaa työkalu →

Puhdas tekstilista

Puhdista tyhjät kohdat, kaksoiskappaleet ja välilyönnit yksi kohde riviä kohden. Lajittele vain, kun tilausta on tarkoitus muuttaa.

Esimerkki

toistuvat rivikohdat → puhdistettu riviluetteloAvaa työkalu →

Unicode-normalisointi

Normalisoi eri tavoin koostettu Unicode, mukaan lukien hajautettu korealainen teksti. Yhteensopivuuden normalisointi voi muuttaa merkkejä.

Esimerkki

hajautettu teksti + NFC → koottu tekstiAvaa työkalu →

Näkymättömät hahmot

Tarkista kopioitu teksti näkymättömien merkkien varalta ja tarkista paikat ja koodipisteet ennen poistamista.

Esimerkki

teksti näkymättömillä merkeillä → sijainti/koodipisteraporttiAvaa työkalu →

Poista rivinvaihdot

Liity ei-toivottuihin rivinvaihtoihin kopioidussa proosassa. Taulukot, runot ja luettelot voivat riippua tahallisista rivinvaihdoista.

Esimerkki

kääritty proosa + tyhjät kappaleet → yhdistetyt kappaleetAvaa työkalu →

Tarkista Office-tiedostojen piilotetut tiedot

Tarkista tekijän metatiedot, kommentit ja piilotetun sisällön jäljet ennen Office-tiedostojen jakamista ja muokkaa niitä sitten lähdesovelluksessa.

Esimerkki

Office-tiedosto → piilotettujen tietojen tarkastusraporttiAvaa työkalu →

Tässä oppaassa kuvataan julkiset verkkotyökalut ja niiden tukirajoitukset. Säilytä alkuperäinen ja tarkista ladattu tulos. Coverton · Korjaukset ja yhteydenotot

Tämä käännös on laadittu ohjelmiston avulla. Voit lukea myös englanninkielisen version. Lue englanniksi