Udtræk og rengør tekst fra DOCX, HWPX og kopierede dokumenter
Hvis du gemmer et dokument som TXT, kan dets ord genbruges, men det bevarer ikke det originale sidelayout eller formatering. Vælg værktøjet til DOCX, PPTX, ODT, EPUB, HWPX eller RTF, og sammenlign derefter vigtig tekst med kilden.
Brug det gratis værktøj →Tjek først det koreanske dokumentformat
HWPX-læseren håndterer understøttede afsnit, tabeller og billeder. Legacy HWP understøttes ikke, og læseren gengiver ikke originale skrifttyper, former, ligninger eller paginering. Bevar indsendelsens original og brug TXT-resultatet til genbrug af tekst.
Rene linjeskift og usynlige tegn omhyggeligt
Copied-PDF-oprydning forbinder interne linjeskift, mens der bibeholdes tomme linjer adskilte afsnit. Gennemgå tabeller, digte og lister mod kilden. Valgfri fjernelse af usynlige tegn påvirker kun U+200B og BOM. NFKC og NFKD normalisering ændrer også kompatibilitetstegn.
Konvertering er forskellig fra privatlivsinspektion
Markdown-til-HTML konverterer dokumentmarkering; HTML-til-TXT kasserer tags og layout. Office-inspektøren rapporterer forfatteroplysninger, kommentarer, skjulte ark og spor af eksterne links. En rapport alene betyder ikke, at disse elementer er blevet fjernet fra filen.
Vælg det rigtige værktøj
Eksempler på input illustrerer arbejdsgangen; de lover ikke en bestemt filstørrelse, genkendelsesnøjagtighed eller kompatibilitet.
Konverter DOCX til Tekst
Uddrag tekst til søgning eller organisering. TXT-kopien gengiver ikke dokumentlayout eller billeder.
Eksempel
document.docx → udtrukket text.txt- Vælg filer i formatet DOCX. Maksimalt antal filer pr. batch: 1.
- Gennemgå Tabelsøjleseparator, og start derefter behandlingen.
- Download the TXT result and check its content and quality.
Hvad skal man tjekke
Tekst er udtrukket, ikke det originale sidelayout. Billeder, formatering og indlejrede objekter bevares ikke. OCR udføres ikke.
Med Word-dokumenter læses tekstsektioner fra dokumentpakken. Tjek tabeller og tekstfelter i resultatet; deres visuelle arrangement er ikke vedtaget. Gamle binære .doc-filer understøttes ikke.
Konverter PPTX til Tekst
Saml diastekst til et arbejdsudskrift. Vælg en separator og gennemse ekstraktionsrækkefølgen.
Eksempel
slides.pptx → dias-separeret tekst.txt- Vælg filer i formatet PPTX. Maksimalt antal filer pr. batch: 1.
- Gennemgå Tabelsøjleseparator, og start derefter behandlingen.
- Download the TXT result and check its content and quality.
Hvad skal man tjekke
Læserækkefølgen kan afvige fra den synlige placering af tekstfelterne. Billeder og talt indhold transskriberes ikke.
Konverter ODT til Tekst
Uddrag almindelig tekst fra en OpenDocument-fil. Tabeller, skrifttyper og paginering er ikke bevaret i TXT.
Eksempel
document.odt → udvundet text.txt- Vælg filer i formatet ODT. Maksimalt antal filer pr. batch: 1.
- Gennemgå Tabelsøjleseparator, og start derefter behandlingen.
- Download the TXT result and check its content and quality.
Hvad skal man tjekke
Tekst er udtrukket, ikke det originale sidelayout. Billeder, formatering og indlejrede objekter bevares ikke. OCR udføres ikke.
OpenDocument gemmer tekst og typografier separat. TXT-outputtet anvender ikke skabeloner, kolonner eller sideskift som et fast layout. Tjeklister og tabeller efter eksport.
Konverter EPUB til Tekst
Saml tekst fra en understøttet EPUB til personlige arbejdsgange. Tjek understøttelse af beskyttede bøger og komplekse læselayouts.
Eksempel
book.epub → almindelig læsetekst.txt- Vælg filer i formatet EPUB. Maksimalt antal filer pr. batch: 1.
- Gennemgå Tabelsøjleseparator, og start derefter behandlingen.
- Download the TXT result and check its content and quality.
Hvad skal man tjekke
DRM-beskyttede bøger understøttes ikke. Navigation, typografi og illustrationer går tabt i TXT.
Konverter HWPX til Tekst
Uddrag tekst fra HWPX. Ældre HWP og præcis gengivelse af det originale redigeringslayout kræver andre arbejdsgange.
Eksempel
document.hwpx → afsnit text.txt- Vælg filer i formatet HWPX. Maksimalt antal filer pr. batch: 1.
- Gennemgå Tabelsøjleseparator, og start derefter behandlingen.
- Download the TXT result and check its content and quality.
Hvad skal man tjekke
HWPX og det ældre binære HWP er forskellige formater. Filer med .hwp åbnes ikke.
Konverter RTF til Tekst
Fjern understøttet RTF-kontrolformatering for en tekstkopi. Sammenlign specialtegn og tabeller med kilden.
Eksempel
document.rtf → almindelig tekst.txt- Vælg filer i formatet RTF. Maksimalt antal filer pr. batch: 1.
- Check the input format and file order, then start processing.
- Download the TXT result and check its content and quality.
Hvad skal man tjekke
Tekst er udtrukket, ikke det originale sidelayout. Billeder, formatering og indlejrede objekter bevares ikke. OCR udføres ikke.
Rich text indeholder kontrolord til formatering og tegnkodning. Disse fjernes eller evalueres under teksteksport. Tjek specialtegn og ældre kodesider i resultatet; indlejrede billeder udtrækkes ikke.
Konverter MARKDOWN til HTML
Eksporter Markdown-skrivning som HTML. Tjek, hvordan understøttede overskrifter, lister og afsnit gengives.
Eksempel
# Overskrift + afsnit → document.html- Vælg filer i formatet MD, MARKDOWN. Maksimalt antal filer pr. batch: 1.
- Gennemgå HTML dokument stil, Åbn links i en ny fane, og start derefter behandlingen.
- Download the HTML result and check its content and quality.
Hvad skal man tjekke
Begrænset Markdown-syntaks understøttes. Komplekse tabeller, celler med flere rækker, udvidelser og scripts er ikke fuldt ud overtaget.
Konverter HTML til Tekst
Uddrag tekst fra en HTML-fil. Dette besøger ikke en URL for at skrabe et live websted.
Eksempel
saved-page.html → læsbar text.txt- Vælg filer i formatet HTML, HTM. Maksimalt antal filer pr. batch: 1.
- Check the input format and file order, then start processing.
- Download the TXT result and check its content and quality.
Hvad skal man tjekke
Indhold, der genindlæses via JavaScript, hentes eller udføres ikke. CSS-layout er ikke bevaret.
Læs HWPX
Læs understøttede HWPX-afsnit, tabeller og billeder og udtræk tekst. Ældre HWP og præcis layoutredigering understøttes ikke.
Eksempel
document.hwpx → understøttet forhåndsvisning af indhold + TXTÅbn værktøjet →Ren tekstliste
Rens tomme felter, dubletter og mellemrum i lister med ét element pr. linje. Sorter kun, når det er hensigten at ændre rækkefølge.
Eksempel
gentagne linjeposter → renset linjelisteÅbn værktøjet →Unicode normalisere
Normaliser forskelligt sammensat Unicode, inklusive dekomponeret koreansk tekst. Kompatibilitetsnormalisering kan ændre tegn.
Eksempel
nedbrudt tekst + NFC → sammensat tekstÅbn værktøjet →Usynlige karakterer
Undersøg kopieret tekst for usynlige tegn og gennemse positioner og kodepunkter før fjernelse.
Eksempel
text with invisible characters → location/code-point reportÅbn værktøjet →Fjern linjeskift
Deltag i uønskede linjeskift i kopieret prosa. Tabeller, digte og lister kan afhænge af bevidste linjeskift.
Eksempel
indpakket prosa + tomme afsnit → sammenføjede afsnitÅbn værktøjet →Undersøg skjulte oplysninger i Office-filer
Undersøg forfattermetadata, kommentarer og spor af skjult indhold, før du deler Office-filer, og rediger dem derefter i kildeprogrammet.
Eksempel
Kontorfil → inspektionsrapport med skjulte oplysningerÅbn værktøjet →Denne vejledning beskriver de offentlige webværktøjer og deres supportgrænser. Behold din original og tjek det downloadede resultat. Coverton · Rettelser og kontakt
Denne oversættelse er udarbejdet med softwareassistance. Du kan også læse den engelske version. Læs på engelsk