Gå til innhold
Coverton Blogg
I denne artikkelen
Dokumenter og tekst

Trekk ut og rengjør tekst fra DOCX, HWPX og kopierte dokumenter

Lagring av et dokument som TXT gjør ordene gjenbrukbare, men beholder ikke det originale sideoppsettet eller formateringen. Velg verktøyet for DOCX, PPTX, ODT, EPUB, HWPX eller RTF, og sammenlign deretter viktig tekst med kilden.

Bruk gratisverktøyet →

Sjekk det koreanske dokumentformatet først

HWPX-leseren håndterer støttede avsnitt, tabeller og bilder. Legacy HWP støttes ikke, og leseren reproduserer ikke originale fonter, former, ligninger eller paginering. Ta vare på originalen og bruk TXT-resultatet for gjenbruk av tekst.

Rene linjeskift og usynlige karakterer nøye

Copied-PDF-opprydding føyer sammen interne linjeskift mens de beholder tomme linjer-separerte avsnitt. Gjennomgå tabeller, dikt og lister opp mot kilden. Valgfri fjerning av usynlige tegn påvirker kun U+200B og BOM. NFKC og NFKD-normalisering endrer også kompatibilitetstegn.

Konvertering er forskjellig fra personverninspeksjon

Markdown-til-HTML konverterer dokumentmarkering; HTML-til-TXT forkaster tagger og layout. Office-inspektøren rapporterer forfatterinformasjon, kommentarer, skjulte ark og eksterne lenker. En rapport alene betyr ikke at disse elementene er fjernet fra filen.

Velg riktig verktøy

Eksempelinndata illustrerer arbeidsflyten; de lover ikke en bestemt filstørrelse, gjenkjenningsnøyaktighet eller kompatibilitet.

Konverter DOCX til Tekst

Trekk ut tekst for å søke eller organisere. TXT-kopien gjengir ikke dokumentlayout eller bilder.

Eksempel

document.docx → ekstrahert tekst.txt
  1. Velg filer i DOCX-format. Maksimalt antall filer per batch: 1.
  2. Se gjennom Tabell kolonneseparator, og begynn deretter behandlingen.
  3. Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes

Teksten er trukket ut, ikke det originale sideoppsettet. Bilder, formatering og innebygde objekter beholdes ikke. OCR blir ikke utført.

Med Word-dokumenter leses tekstdeler fra dokumentpakken. Sjekk tabeller og tekstfelt i resultatet; deres visuelle arrangement er ikke vedtatt. Gamle binære .doc-filer støttes ikke.

Åpne verktøyet →

Konverter PPTX til Tekst

Samle lysbildetekst til en fungerende transkripsjon. Velg en separator og se gjennom utvinningsrekkefølgen.

Eksempel

slides.pptx → lysbildeseparert tekst.txt
  1. Velg filer i PPTX-format. Maksimalt antall filer per batch: 1.
  2. Se gjennom Tabell kolonneseparator, og begynn deretter behandlingen.
  3. Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes

Leserekkefølgen kan avvike fra den synlige plasseringen til tekstfeltene. Bilder og taleinnhold blir ikke transkribert.

Åpne verktøyet →

Konverter ODT til Tekst

Trekk ut ren tekst fra en OpenDocument-fil. Tabeller, fonter og paginering er ikke bevart i TXT.

Eksempel

document.odt → ekstrahert tekst.txt
  1. Velg filer i ODT-format. Maksimalt antall filer per batch: 1.
  2. Se gjennom Tabell kolonneseparator, og begynn deretter behandlingen.
  3. Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes

Teksten er trukket ut, ikke det originale sideoppsettet. Bilder, formatering og innebygde objekter beholdes ikke. OCR blir ikke utført.

OpenDocument lagrer tekst og stiler separat. TXT-utgangen tar ikke i bruk maler, kolonner eller sideskift som en fast layout. Sjekklister og tabeller etter eksport.

Åpne verktøyet →

Konverter EPUB til Tekst

Samle tekst fra en støttet EPUB for personlige arbeidsflyter. Sjekk støtte for beskyttede bøker og komplekse leseoppsett.

Eksempel

book.epub → ren lesing text.txt
  1. Velg filer i EPUB-format. Maksimalt antall filer per batch: 1.
  2. Se gjennom Tabell kolonneseparator, og begynn deretter behandlingen.
  3. Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes

DRM-beskyttede bøker støttes ikke. Navigasjon, typografi og illustrasjoner går tapt i TXT.

Åpne verktøyet →

Konverter HWPX til Tekst

Trekk ut tekst fra HWPX. Eldre HWP og presis reproduksjon av det originale redigeringsoppsettet krever andre arbeidsflyter.

Eksempel

document.hwpx → avsnitt text.txt
  1. Velg filer i HWPX-format. Maksimalt antall filer per batch: 1.
  2. Se gjennom Tabell kolonneseparator, og begynn deretter behandlingen.
  3. Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes

HWPX og den eldre binære HWP er forskjellige formater. Filer med .hwp åpnes ikke.

Åpne verktøyet →

Konverter RTF til Tekst

Fjern støttet RTF-kontrollformatering for en tekstkopi. Sammenlign spesialtegn og tabeller med kilden.

Eksempel

document.rtf → ren tekst.txt
  1. Velg filer i RTF-format. Maksimalt antall filer per batch: 1.
  2. Sjekk inndataformatet og filrekkefølgen, og begynn deretter behandlingen.
  3. Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes

Teksten er trukket ut, ikke det originale sideoppsettet. Bilder, formatering og innebygde objekter beholdes ikke. OCR blir ikke utført.

Rik tekst inneholder kontrollord for formatering og tegnkoding. Disse fjernes eller evalueres under teksteksport. Sjekk spesialtegn og eldre kodesider i resultatet; innebygde bilder trekkes ikke ut.

Åpne verktøyet →

Konverter MARKDOWN til HTML

Eksporter Markdown-skriving som HTML. Sjekk hvordan støttede overskrifter, lister og avsnitt gjengis.

Eksempel

# Overskrift + avsnitt → document.html
  1. Velg filer i MD, MARKDOWN-format. Maksimalt antall filer per batch: 1.
  2. Se gjennom HTML-dokumentstil, Åpne koblinger i en ny fane, og begynn deretter behandlingen.
  3. Last ned HTML-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes

Begrenset Markdown-syntaks støttes. Komplekse tabeller, celler med flere rader, utvidelser og skript blir ikke tatt i bruk fullt ut.

Åpne verktøyet →

Konverter HTML til Tekst

Trekk ut tekst fra en HTML-fil. Dette besøker ikke en URL for å skrape et live nettsted.

Eksempel

saved-page.html → lesbar text.txt
  1. Velg filer i HTML, HTM-format. Maksimalt antall filer per batch: 1.
  2. Sjekk inndataformatet og filrekkefølgen, og begynn deretter behandlingen.
  3. Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes

Innhold som lastes inn på nytt via JavaScript, hentes eller kjøres ikke. CSS-layout er ikke bevart.

Åpne verktøyet →

Les HWPX

Les støttede HWPX-avsnitt, tabeller og bilder og trekk ut tekst. Eldre HWP og presis layoutredigering støttes ikke.

Eksempel

document.hwpx → støttet forhåndsvisning av innhold + TXTÅpne verktøyet →

Ren tekstliste

Rengjør blanke, duplikater og mellomrom i ett-element-per-linje-lister. Sorter kun når det er ment å endre rekkefølge.

Eksempel

gjentatte linjer → renset linjelisteÅpne verktøyet →

Unicode normalisere

Normaliser forskjellig sammensatt Unicode, inkludert dekomponert koreansk tekst. Kompatibilitetsnormalisering kan endre tegn.

Eksempel

dekomponert tekst + NFC → sammensatt tekstÅpne verktøyet →

Usynlige karakterer

Inspiser kopiert tekst for usynlige tegn og se gjennom posisjoner og kodepunkter før fjerning.

Eksempel

tekst med usynlige tegn → plassering/kodepunktrapportÅpne verktøyet →

Fjern linjeskift

Bli med uønskede linjeskift i kopiert prosa. Tabeller, dikt og lister kan avhenge av tilsiktede linjeskift.

Eksempel

innpakket prosa + tomme avsnitt → sammenføyde avsnittÅpne verktøyet →

Inspiser skjult informasjon i Office-filer

Inspiser forfattermetadata, kommentarer og spor av skjult innhold før du deler Office-filer, og rediger dem deretter i kildeprogrammet.

Eksempel

Kontorfil → inspeksjonsrapport for skjult informasjonÅpne verktøyet →

Denne veiledningen beskriver de offentlige nettverktøyene og deres støttegrenser. Behold originalen og sjekk det nedlastede resultatet. Coverton · Rettelser og kontakt

Denne oversettelsen ble utarbeidet med programvarehjelp. Du kan også lese den engelske versjonen. Les på engelsk