Trekk ut og rengjør tekst fra DOCX, HWPX og kopierte dokumenter
Lagring av et dokument som TXT gjør ordene gjenbrukbare, men beholder ikke det originale sideoppsettet eller formateringen. Velg verktøyet for DOCX, PPTX, ODT, EPUB, HWPX eller RTF, og sammenlign deretter viktig tekst med kilden.
Bruk gratisverktøyet →Sjekk det koreanske dokumentformatet først
HWPX-leseren håndterer støttede avsnitt, tabeller og bilder. Legacy HWP støttes ikke, og leseren reproduserer ikke originale fonter, former, ligninger eller paginering. Ta vare på originalen og bruk TXT-resultatet for gjenbruk av tekst.
Rene linjeskift og usynlige karakterer nøye
Copied-PDF-opprydding føyer sammen interne linjeskift mens de beholder tomme linjer-separerte avsnitt. Gjennomgå tabeller, dikt og lister opp mot kilden. Valgfri fjerning av usynlige tegn påvirker kun U+200B og BOM. NFKC og NFKD-normalisering endrer også kompatibilitetstegn.
Konvertering er forskjellig fra personverninspeksjon
Markdown-til-HTML konverterer dokumentmarkering; HTML-til-TXT forkaster tagger og layout. Office-inspektøren rapporterer forfatterinformasjon, kommentarer, skjulte ark og eksterne lenker. En rapport alene betyr ikke at disse elementene er fjernet fra filen.
Velg riktig verktøy
Eksempelinndata illustrerer arbeidsflyten; de lover ikke en bestemt filstørrelse, gjenkjenningsnøyaktighet eller kompatibilitet.
Konverter DOCX til Tekst
Trekk ut tekst for å søke eller organisere. TXT-kopien gjengir ikke dokumentlayout eller bilder.
Eksempel
document.docx → ekstrahert tekst.txt- Velg filer i DOCX-format. Maksimalt antall filer per batch: 1.
- Se gjennom Tabell kolonneseparator, og begynn deretter behandlingen.
- Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes
Teksten er trukket ut, ikke det originale sideoppsettet. Bilder, formatering og innebygde objekter beholdes ikke. OCR blir ikke utført.
Med Word-dokumenter leses tekstdeler fra dokumentpakken. Sjekk tabeller og tekstfelt i resultatet; deres visuelle arrangement er ikke vedtatt. Gamle binære .doc-filer støttes ikke.
Konverter PPTX til Tekst
Samle lysbildetekst til en fungerende transkripsjon. Velg en separator og se gjennom utvinningsrekkefølgen.
Eksempel
slides.pptx → lysbildeseparert tekst.txt- Velg filer i PPTX-format. Maksimalt antall filer per batch: 1.
- Se gjennom Tabell kolonneseparator, og begynn deretter behandlingen.
- Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes
Leserekkefølgen kan avvike fra den synlige plasseringen til tekstfeltene. Bilder og taleinnhold blir ikke transkribert.
Konverter ODT til Tekst
Trekk ut ren tekst fra en OpenDocument-fil. Tabeller, fonter og paginering er ikke bevart i TXT.
Eksempel
document.odt → ekstrahert tekst.txt- Velg filer i ODT-format. Maksimalt antall filer per batch: 1.
- Se gjennom Tabell kolonneseparator, og begynn deretter behandlingen.
- Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes
Teksten er trukket ut, ikke det originale sideoppsettet. Bilder, formatering og innebygde objekter beholdes ikke. OCR blir ikke utført.
OpenDocument lagrer tekst og stiler separat. TXT-utgangen tar ikke i bruk maler, kolonner eller sideskift som en fast layout. Sjekklister og tabeller etter eksport.
Konverter EPUB til Tekst
Samle tekst fra en støttet EPUB for personlige arbeidsflyter. Sjekk støtte for beskyttede bøker og komplekse leseoppsett.
Eksempel
book.epub → ren lesing text.txt- Velg filer i EPUB-format. Maksimalt antall filer per batch: 1.
- Se gjennom Tabell kolonneseparator, og begynn deretter behandlingen.
- Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes
DRM-beskyttede bøker støttes ikke. Navigasjon, typografi og illustrasjoner går tapt i TXT.
Konverter HWPX til Tekst
Trekk ut tekst fra HWPX. Eldre HWP og presis reproduksjon av det originale redigeringsoppsettet krever andre arbeidsflyter.
Eksempel
document.hwpx → avsnitt text.txt- Velg filer i HWPX-format. Maksimalt antall filer per batch: 1.
- Se gjennom Tabell kolonneseparator, og begynn deretter behandlingen.
- Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes
HWPX og den eldre binære HWP er forskjellige formater. Filer med .hwp åpnes ikke.
Konverter RTF til Tekst
Fjern støttet RTF-kontrollformatering for en tekstkopi. Sammenlign spesialtegn og tabeller med kilden.
Eksempel
document.rtf → ren tekst.txt- Velg filer i RTF-format. Maksimalt antall filer per batch: 1.
- Sjekk inndataformatet og filrekkefølgen, og begynn deretter behandlingen.
- Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes
Teksten er trukket ut, ikke det originale sideoppsettet. Bilder, formatering og innebygde objekter beholdes ikke. OCR blir ikke utført.
Rik tekst inneholder kontrollord for formatering og tegnkoding. Disse fjernes eller evalueres under teksteksport. Sjekk spesialtegn og eldre kodesider i resultatet; innebygde bilder trekkes ikke ut.
Konverter MARKDOWN til HTML
Eksporter Markdown-skriving som HTML. Sjekk hvordan støttede overskrifter, lister og avsnitt gjengis.
Eksempel
# Overskrift + avsnitt → document.html- Velg filer i MD, MARKDOWN-format. Maksimalt antall filer per batch: 1.
- Se gjennom HTML-dokumentstil, Åpne koblinger i en ny fane, og begynn deretter behandlingen.
- Last ned HTML-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes
Begrenset Markdown-syntaks støttes. Komplekse tabeller, celler med flere rader, utvidelser og skript blir ikke tatt i bruk fullt ut.
Konverter HTML til Tekst
Trekk ut tekst fra en HTML-fil. Dette besøker ikke en URL for å skrape et live nettsted.
Eksempel
saved-page.html → lesbar text.txt- Velg filer i HTML, HTM-format. Maksimalt antall filer per batch: 1.
- Sjekk inndataformatet og filrekkefølgen, og begynn deretter behandlingen.
- Last ned TXT-resultatet og sjekk innholdet og kvaliteten.
Hva skal sjekkes
Innhold som lastes inn på nytt via JavaScript, hentes eller kjøres ikke. CSS-layout er ikke bevart.
Les HWPX
Les støttede HWPX-avsnitt, tabeller og bilder og trekk ut tekst. Eldre HWP og presis layoutredigering støttes ikke.
Eksempel
document.hwpx → støttet forhåndsvisning av innhold + TXTÅpne verktøyet →Ren tekstliste
Rengjør blanke, duplikater og mellomrom i ett-element-per-linje-lister. Sorter kun når det er ment å endre rekkefølge.
Eksempel
gjentatte linjer → renset linjelisteÅpne verktøyet →Unicode normalisere
Normaliser forskjellig sammensatt Unicode, inkludert dekomponert koreansk tekst. Kompatibilitetsnormalisering kan endre tegn.
Eksempel
dekomponert tekst + NFC → sammensatt tekstÅpne verktøyet →Usynlige karakterer
Inspiser kopiert tekst for usynlige tegn og se gjennom posisjoner og kodepunkter før fjerning.
Eksempel
tekst med usynlige tegn → plassering/kodepunktrapportÅpne verktøyet →Fjern linjeskift
Bli med uønskede linjeskift i kopiert prosa. Tabeller, dikt og lister kan avhenge av tilsiktede linjeskift.
Eksempel
innpakket prosa + tomme avsnitt → sammenføyde avsnittÅpne verktøyet →Inspiser skjult informasjon i Office-filer
Inspiser forfattermetadata, kommentarer og spor av skjult innhold før du deler Office-filer, og rediger dem deretter i kildeprogrammet.
Eksempel
Kontorfil → inspeksjonsrapport for skjult informasjonÅpne verktøyet →Denne veiledningen beskriver de offentlige nettverktøyene og deres støttegrenser. Behold originalen og sjekk det nedlastede resultatet. Coverton · Rettelser og kontakt
Denne oversettelsen ble utarbeidet med programvarehjelp. Du kan også lese den engelske versjonen. Les på engelsk