Gå til indhold
Coverton Blog
I denne artikel
Dokumenter og tekst

Udtræk og rengør tekst fra DOCX, HWPX og kopierede dokumenter

Hvis du gemmer et dokument som TXT, kan dets ord genbruges, men det bevarer ikke det originale sidelayout eller formatering. Vælg værktøjet til DOCX, PPTX, ODT, EPUB, HWPX eller RTF, og sammenlign derefter vigtig tekst med kilden.

Brug det gratis værktøj →

Tjek først det koreanske dokumentformat

HWPX-læseren håndterer understøttede afsnit, tabeller og billeder. Legacy HWP understøttes ikke, og læseren gengiver ikke originale skrifttyper, former, ligninger eller paginering. Bevar indsendelsens original og brug TXT-resultatet til genbrug af tekst.

Rene linjeskift og usynlige tegn omhyggeligt

Copied-PDF-oprydning forbinder interne linjeskift, mens der bibeholdes tomme linjer adskilte afsnit. Gennemgå tabeller, digte og lister mod kilden. Valgfri fjernelse af usynlige tegn påvirker kun U+200B og BOM. NFKC og NFKD normalisering ændrer også kompatibilitetstegn.

Konvertering er forskellig fra privatlivsinspektion

Markdown-til-HTML konverterer dokumentmarkering; HTML-til-TXT kasserer tags og layout. Office-inspektøren rapporterer forfatteroplysninger, kommentarer, skjulte ark og spor af eksterne links. En rapport alene betyder ikke, at disse elementer er blevet fjernet fra filen.

Vælg det rigtige værktøj

Eksempler på input illustrerer arbejdsgangen; de lover ikke en bestemt filstørrelse, genkendelsesnøjagtighed eller kompatibilitet.

Konverter DOCX til Tekst

Uddrag tekst til søgning eller organisering. TXT-kopien gengiver ikke dokumentlayout eller billeder.

Eksempel

document.docx → udtrukket text.txt
  1. Vælg filer i formatet DOCX. Maksimalt antal filer pr. batch: 1.
  2. Gennemgå Tabelsøjleseparator, og start derefter behandlingen.
  3. Download the TXT result and check its content and quality.
Hvad skal man tjekke

Tekst er udtrukket, ikke det originale sidelayout. Billeder, formatering og indlejrede objekter bevares ikke. OCR udføres ikke.

Med Word-dokumenter læses tekstsektioner fra dokumentpakken. Tjek tabeller og tekstfelter i resultatet; deres visuelle arrangement er ikke vedtaget. Gamle binære .doc-filer understøttes ikke.

Åbn værktøjet →

Konverter PPTX til Tekst

Saml diastekst til et arbejdsudskrift. Vælg en separator og gennemse ekstraktionsrækkefølgen.

Eksempel

slides.pptx → dias-separeret tekst.txt
  1. Vælg filer i formatet PPTX. Maksimalt antal filer pr. batch: 1.
  2. Gennemgå Tabelsøjleseparator, og start derefter behandlingen.
  3. Download the TXT result and check its content and quality.
Hvad skal man tjekke

Læserækkefølgen kan afvige fra den synlige placering af tekstfelterne. Billeder og talt indhold transskriberes ikke.

Åbn værktøjet →

Konverter ODT til Tekst

Uddrag almindelig tekst fra en OpenDocument-fil. Tabeller, skrifttyper og paginering er ikke bevaret i TXT.

Eksempel

document.odt → udvundet text.txt
  1. Vælg filer i formatet ODT. Maksimalt antal filer pr. batch: 1.
  2. Gennemgå Tabelsøjleseparator, og start derefter behandlingen.
  3. Download the TXT result and check its content and quality.
Hvad skal man tjekke

Tekst er udtrukket, ikke det originale sidelayout. Billeder, formatering og indlejrede objekter bevares ikke. OCR udføres ikke.

OpenDocument gemmer tekst og typografier separat. TXT-outputtet anvender ikke skabeloner, kolonner eller sideskift som et fast layout. Tjeklister og tabeller efter eksport.

Åbn værktøjet →

Konverter EPUB til Tekst

Saml tekst fra en understøttet EPUB til personlige arbejdsgange. Tjek understøttelse af beskyttede bøger og komplekse læselayouts.

Eksempel

book.epub → almindelig læsetekst.txt
  1. Vælg filer i formatet EPUB. Maksimalt antal filer pr. batch: 1.
  2. Gennemgå Tabelsøjleseparator, og start derefter behandlingen.
  3. Download the TXT result and check its content and quality.
Hvad skal man tjekke

DRM-beskyttede bøger understøttes ikke. Navigation, typografi og illustrationer går tabt i TXT.

Åbn værktøjet →

Konverter HWPX til Tekst

Uddrag tekst fra HWPX. Ældre HWP og præcis gengivelse af det originale redigeringslayout kræver andre arbejdsgange.

Eksempel

document.hwpx → afsnit text.txt
  1. Vælg filer i formatet HWPX. Maksimalt antal filer pr. batch: 1.
  2. Gennemgå Tabelsøjleseparator, og start derefter behandlingen.
  3. Download the TXT result and check its content and quality.
Hvad skal man tjekke

HWPX og det ældre binære HWP er forskellige formater. Filer med .hwp åbnes ikke.

Åbn værktøjet →

Konverter RTF til Tekst

Fjern understøttet RTF-kontrolformatering for en tekstkopi. Sammenlign specialtegn og tabeller med kilden.

Eksempel

document.rtf → almindelig tekst.txt
  1. Vælg filer i formatet RTF. Maksimalt antal filer pr. batch: 1.
  2. Check the input format and file order, then start processing.
  3. Download the TXT result and check its content and quality.
Hvad skal man tjekke

Tekst er udtrukket, ikke det originale sidelayout. Billeder, formatering og indlejrede objekter bevares ikke. OCR udføres ikke.

Rich text indeholder kontrolord til formatering og tegnkodning. Disse fjernes eller evalueres under teksteksport. Tjek specialtegn og ældre kodesider i resultatet; indlejrede billeder udtrækkes ikke.

Åbn værktøjet →

Konverter MARKDOWN til HTML

Eksporter Markdown-skrivning som HTML. Tjek, hvordan understøttede overskrifter, lister og afsnit gengives.

Eksempel

# Overskrift + afsnit → document.html
  1. Vælg filer i formatet MD, MARKDOWN. Maksimalt antal filer pr. batch: 1.
  2. Gennemgå HTML dokument stil, Åbn links i en ny fane, og start derefter behandlingen.
  3. Download the HTML result and check its content and quality.
Hvad skal man tjekke

Begrænset Markdown-syntaks understøttes. Komplekse tabeller, celler med flere rækker, udvidelser og scripts er ikke fuldt ud overtaget.

Åbn værktøjet →

Konverter HTML til Tekst

Uddrag tekst fra en HTML-fil. Dette besøger ikke en URL for at skrabe et live websted.

Eksempel

saved-page.html → læsbar text.txt
  1. Vælg filer i formatet HTML, HTM. Maksimalt antal filer pr. batch: 1.
  2. Check the input format and file order, then start processing.
  3. Download the TXT result and check its content and quality.
Hvad skal man tjekke

Indhold, der genindlæses via JavaScript, hentes eller udføres ikke. CSS-layout er ikke bevaret.

Åbn værktøjet →

Læs HWPX

Læs understøttede HWPX-afsnit, tabeller og billeder og udtræk tekst. Ældre HWP og præcis layoutredigering understøttes ikke.

Eksempel

document.hwpx → understøttet forhåndsvisning af indhold + TXTÅbn værktøjet →

Ren tekstliste

Rens tomme felter, dubletter og mellemrum i lister med ét element pr. linje. Sorter kun, når det er hensigten at ændre rækkefølge.

Eksempel

gentagne linjeposter → renset linjelisteÅbn værktøjet →

Unicode normalisere

Normaliser forskelligt sammensat Unicode, inklusive dekomponeret koreansk tekst. Kompatibilitetsnormalisering kan ændre tegn.

Eksempel

nedbrudt tekst + NFC → sammensat tekstÅbn værktøjet →

Usynlige karakterer

Undersøg kopieret tekst for usynlige tegn og gennemse positioner og kodepunkter før fjernelse.

Eksempel

text with invisible characters → location/code-point reportÅbn værktøjet →

Fjern linjeskift

Deltag i uønskede linjeskift i kopieret prosa. Tabeller, digte og lister kan afhænge af bevidste linjeskift.

Eksempel

indpakket prosa + tomme afsnit → sammenføjede afsnitÅbn værktøjet →

Undersøg skjulte oplysninger i Office-filer

Undersøg forfattermetadata, kommentarer og spor af skjult indhold, før du deler Office-filer, og rediger dem derefter i kildeprogrammet.

Eksempel

Kontorfil → inspektionsrapport med skjulte oplysningerÅbn værktøjet →

Denne vejledning beskriver de offentlige webværktøjer og deres supportgrænser. Behold din original og tjek det downloadede resultat. Coverton · Rettelser og kontakt

Denne oversættelse er udarbejdet med softwareassistance. Du kan også læse den engelske version. Læs på engelsk