Extrahera och rensa text från DOCX, HWPX och kopierade dokument
Att spara ett dokument som TXT gör dess ord återanvändbara, men behåller inte den ursprungliga sidlayouten eller formateringen. Välj verktyget för DOCX, PPTX, ODT, EPUB, HWPX eller RTF och jämför sedan viktig text med källan.
Använd det kostnadsfria verktyget →Kontrollera först det koreanska dokumentformatet
HWPX-läsaren hanterar stycken, tabeller och bilder som stöds. Legacy HWP stöds inte, och läsaren återger inte originaltypsnitt, former, ekvationer eller sidnumrering. Bevara inlämningsoriginalet och använd TXT-resultatet för återanvändning av text.
Rengör radbrytningar och osynliga karaktärer noggrant
Copied-PDF rensning sammanfogar interna radbrytningar samtidigt som tomma radseparerade stycken behålls. Granska tabeller, dikter och listor mot källan. Valfri borttagning av osynliga tecken påverkar endast U+200B och BOM. NFKC och NFKD normalisering ändrar också kompatibilitetstecken.
Konvertering skiljer sig från integritetsinspektion
Markdown-till-HTML konverterar dokumentuppmärkning; HTML-till-TXT kasserar taggar och layout. Office-inspektören rapporterar författarinformation, kommentarer, dolda ark och spår av externa länkar. Enbart en rapport betyder inte att dessa objekt har tagits bort från filen.
Välj rätt verktyg
Exempelingångar illustrerar arbetsflödet; de lovar inte en viss filstorlek, igenkänningsnoggrannhet eller kompatibilitet.
Konvertera DOCX till Text
Extrahera text för att söka eller organisera. TXT-kopian återger inte dokumentlayout eller bilder.
Exempel
document.docx → extraherad text.txt- Välj filer i formatet DOCX. Maximalt antal filer per batch: 1.
- Granska Tabell kolumnavskiljare och börja sedan bearbeta.
- Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera
Texten extraheras, inte den ursprungliga sidlayouten. Bilder, formatering och inbäddade objekt behålls inte. OCR utförs inte.
Med Word-dokument läses delar av text från dokumentpaketet. Kontrollera tabeller och textfält i resultatet; deras visuella arrangemang antas inte. Gamla binära .doc-filer stöds inte.
Konvertera PPTX till Text
Samla bildtext till en fungerande utskrift. Välj en separator och granska utvinningsordningen.
Exempel
slides.pptx → bildseparerad text.txt- Välj filer i formatet PPTX. Maximalt antal filer per batch: 1.
- Granska Tabell kolumnavskiljare och börja sedan bearbeta.
- Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera
Läsordningen kan skilja sig från den synliga positionen för textfälten. Bilder och talat innehåll transkriberas inte.
Konvertera ODT till Text
Extrahera vanlig text från en OpenDocument-fil. Tabeller, typsnitt och paginering bevaras inte i TXT.
Exempel
document.odt → extraherad text.txt- Välj filer i formatet ODT. Maximalt antal filer per batch: 1.
- Granska Tabell kolumnavskiljare och börja sedan bearbeta.
- Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera
Texten extraheras, inte den ursprungliga sidlayouten. Bilder, formatering och inbäddade objekt behålls inte. OCR utförs inte.
OpenDocument lagrar text och stilar separat. TXT-utgången använder inte mallar, kolumner eller sidbrytningar som en fast layout. Checklistor och tabeller efter export.
Konvertera EPUB till Text
Samla in text från en EPUB som stöds för personliga arbetsflöden. Kontrollera stöd för skyddade böcker och komplexa läslayouter.
Exempel
book.epub → vanlig text.txt- Välj filer i formatet EPUB. Maximalt antal filer per batch: 1.
- Granska Tabell kolumnavskiljare och börja sedan bearbeta.
- Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera
DRM-skyddade böcker stöds inte. Navigation, typografi och illustrationer går förlorade i TXT.
Konvertera HWPX till Text
Extrahera text från HWPX. Äldre HWP och exakt återgivning av den ursprungliga redigeringslayouten kräver andra arbetsflöden.
Exempel
document.hwpx → avsnitt text.txt- Välj filer i formatet HWPX. Maximalt antal filer per batch: 1.
- Granska Tabell kolumnavskiljare och börja sedan bearbeta.
- Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera
HWPX och den äldre binära HWP är olika format. Filer med .hwp öppnas inte.
Konvertera RTF till Text
Ta bort RTF-kontrollformatering som stöds för en textkopia. Jämför specialtecken och tabeller med källan.
Exempel
document.rtf → vanlig text.txt- Välj filer i formatet RTF. Maximalt antal filer per batch: 1.
- Kontrollera inmatningsformatet och filordningen och börja sedan bearbeta.
- Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera
Texten extraheras, inte den ursprungliga sidlayouten. Bilder, formatering och inbäddade objekt behålls inte. OCR utförs inte.
Rich text innehåller kontrollord för formatering och teckenkodning. Dessa tas bort eller utvärderas under textexport. Kontrollera specialtecken och äldre teckentabeller i resultatet; inbäddade bilder extraheras inte.
Konvertera MARKDOWN till HTML
Exportera Markdown-skrivning som HTML. Kontrollera hur rubriker, listor och stycken som stöds återges.
Exempel
# Rubrik + stycken → document.html- Välj filer i formatet MD, MARKDOWN. Maximalt antal filer per batch: 1.
- Granska HTML-dokumentstil, Öppna länkar på en ny flik och börja sedan bearbeta.
- Ladda ner HTML-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera
Begränsad Markdown-syntax stöds. Komplexa tabeller, celler med flera rader, tillägg och skript används inte helt.
Konvertera HTML till Text
Extrahera text från en HTML-fil. Detta besöker inte en URL för att skrapa en livewebbplats.
Exempel
saved-page.html → läsbar text.txt- Välj filer i formatet HTML, HTM. Maximalt antal filer per batch: 1.
- Kontrollera inmatningsformatet och filordningen och börja sedan bearbeta.
- Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera
Innehåll som laddas om via JavaScript hämtas eller körs inte. CSS-layouten är inte bevarad.
Läs HWPX
Läs HWPX-stycken, tabeller och bilder som stöds och extrahera text. Äldre HWP och exakt layoutredigering stöds inte.
Exempel
document.hwpx → förhandsgranskning av innehåll som stöds + TXTÖppna verktyget →Ren textlista
Rensa tomrum, dubbletter och blanksteg i listor med ett objekt per rad. Sortera endast när ändring av ordning är avsedd.
Exempel
upprepade rader → rensad radlistaÖppna verktyget →Unicode normalisera
Normalisera olika sammansatt Unicode, inklusive nedbruten koreansk text. Kompatibilitetsnormalisering kan ändra tecken.
Exempel
nedbruten text + NFC → sammansatt textÖppna verktyget →Osynliga karaktärer
Inspektera kopierad text för osynliga tecken och granska positioner och kodpunkter innan borttagning.
Exempel
text med osynliga tecken → plats/kodpunktsrapportÖppna verktyget →Ta bort radbrytningar
Gå med i oönskade radbrytningar i kopierad prosa. Tabeller, dikter och listor kan bero på avsiktliga radbrytningar.
Exempel
inslagen prosa + tomma stycken → sammanfogade styckenÖppna verktyget →Inspektera dold information i Office-filer
Inspektera författarens metadata, kommentarer och spår av dolt innehåll innan du delar Office-filer och redigera dem sedan i källprogrammet.
Exempel
Office-fil → inspektionsrapport för dold informationÖppna verktyget →Den här guiden beskriver de offentliga webbverktygen och deras supportgränser. Behåll ditt original och kontrollera det nedladdade resultatet. Coverton · Rättelser och kontakt
Denna översättning förbereddes med hjälp av programvara. Du kan också läsa den engelska versionen. Läs på engelska