Hoppa till innehållet
Coverton Blogg
I den här artikeln
Dokument och text

Extrahera och rensa text från DOCX, HWPX och kopierade dokument

Att spara ett dokument som TXT gör dess ord återanvändbara, men behåller inte den ursprungliga sidlayouten eller formateringen. Välj verktyget för DOCX, PPTX, ODT, EPUB, HWPX eller RTF och jämför sedan viktig text med källan.

Använd det kostnadsfria verktyget →

Kontrollera först det koreanska dokumentformatet

HWPX-läsaren hanterar stycken, tabeller och bilder som stöds. Legacy HWP stöds inte, och läsaren återger inte originaltypsnitt, former, ekvationer eller sidnumrering. Bevara inlämningsoriginalet och använd TXT-resultatet för återanvändning av text.

Rengör radbrytningar och osynliga karaktärer noggrant

Copied-PDF rensning sammanfogar interna radbrytningar samtidigt som tomma radseparerade stycken behålls. Granska tabeller, dikter och listor mot källan. Valfri borttagning av osynliga tecken påverkar endast U+200B och BOM. NFKC och NFKD normalisering ändrar också kompatibilitetstecken.

Konvertering skiljer sig från integritetsinspektion

Markdown-till-HTML konverterar dokumentuppmärkning; HTML-till-TXT kasserar taggar och layout. Office-inspektören rapporterar författarinformation, kommentarer, dolda ark och spår av externa länkar. Enbart en rapport betyder inte att dessa objekt har tagits bort från filen.

Välj rätt verktyg

Exempelingångar illustrerar arbetsflödet; de lovar inte en viss filstorlek, igenkänningsnoggrannhet eller kompatibilitet.

Konvertera DOCX till Text

Extrahera text för att söka eller organisera. TXT-kopian återger inte dokumentlayout eller bilder.

Exempel

document.docx → extraherad text.txt
  1. Välj filer i formatet DOCX. Maximalt antal filer per batch: 1.
  2. Granska Tabell kolumnavskiljare och börja sedan bearbeta.
  3. Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera

Texten extraheras, inte den ursprungliga sidlayouten. Bilder, formatering och inbäddade objekt behålls inte. OCR utförs inte.

Med Word-dokument läses delar av text från dokumentpaketet. Kontrollera tabeller och textfält i resultatet; deras visuella arrangemang antas inte. Gamla binära .doc-filer stöds inte.

Öppna verktyget →

Konvertera PPTX till Text

Samla bildtext till en fungerande utskrift. Välj en separator och granska utvinningsordningen.

Exempel

slides.pptx → bildseparerad text.txt
  1. Välj filer i formatet PPTX. Maximalt antal filer per batch: 1.
  2. Granska Tabell kolumnavskiljare och börja sedan bearbeta.
  3. Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera

Läsordningen kan skilja sig från den synliga positionen för textfälten. Bilder och talat innehåll transkriberas inte.

Öppna verktyget →

Konvertera ODT till Text

Extrahera vanlig text från en OpenDocument-fil. Tabeller, typsnitt och paginering bevaras inte i TXT.

Exempel

document.odt → extraherad text.txt
  1. Välj filer i formatet ODT. Maximalt antal filer per batch: 1.
  2. Granska Tabell kolumnavskiljare och börja sedan bearbeta.
  3. Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera

Texten extraheras, inte den ursprungliga sidlayouten. Bilder, formatering och inbäddade objekt behålls inte. OCR utförs inte.

OpenDocument lagrar text och stilar separat. TXT-utgången använder inte mallar, kolumner eller sidbrytningar som en fast layout. Checklistor och tabeller efter export.

Öppna verktyget →

Konvertera EPUB till Text

Samla in text från en EPUB som stöds för personliga arbetsflöden. Kontrollera stöd för skyddade böcker och komplexa läslayouter.

Exempel

book.epub → vanlig text.txt
  1. Välj filer i formatet EPUB. Maximalt antal filer per batch: 1.
  2. Granska Tabell kolumnavskiljare och börja sedan bearbeta.
  3. Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera

DRM-skyddade böcker stöds inte. Navigation, typografi och illustrationer går förlorade i TXT.

Öppna verktyget →

Konvertera HWPX till Text

Extrahera text från HWPX. Äldre HWP och exakt återgivning av den ursprungliga redigeringslayouten kräver andra arbetsflöden.

Exempel

document.hwpx → avsnitt text.txt
  1. Välj filer i formatet HWPX. Maximalt antal filer per batch: 1.
  2. Granska Tabell kolumnavskiljare och börja sedan bearbeta.
  3. Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera

HWPX och den äldre binära HWP är olika format. Filer med .hwp öppnas inte.

Öppna verktyget →

Konvertera RTF till Text

Ta bort RTF-kontrollformatering som stöds för en textkopia. Jämför specialtecken och tabeller med källan.

Exempel

document.rtf → vanlig text.txt
  1. Välj filer i formatet RTF. Maximalt antal filer per batch: 1.
  2. Kontrollera inmatningsformatet och filordningen och börja sedan bearbeta.
  3. Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera

Texten extraheras, inte den ursprungliga sidlayouten. Bilder, formatering och inbäddade objekt behålls inte. OCR utförs inte.

Rich text innehåller kontrollord för formatering och teckenkodning. Dessa tas bort eller utvärderas under textexport. Kontrollera specialtecken och äldre teckentabeller i resultatet; inbäddade bilder extraheras inte.

Öppna verktyget →

Konvertera MARKDOWN till HTML

Exportera Markdown-skrivning som HTML. Kontrollera hur rubriker, listor och stycken som stöds återges.

Exempel

# Rubrik + stycken → document.html
  1. Välj filer i formatet MD, MARKDOWN. Maximalt antal filer per batch: 1.
  2. Granska HTML-dokumentstil, Öppna länkar på en ny flik och börja sedan bearbeta.
  3. Ladda ner HTML-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera

Begränsad Markdown-syntax stöds. Komplexa tabeller, celler med flera rader, tillägg och skript används inte helt.

Öppna verktyget →

Konvertera HTML till Text

Extrahera text från en HTML-fil. Detta besöker inte en URL för att skrapa en livewebbplats.

Exempel

saved-page.html → läsbar text.txt
  1. Välj filer i formatet HTML, HTM. Maximalt antal filer per batch: 1.
  2. Kontrollera inmatningsformatet och filordningen och börja sedan bearbeta.
  3. Ladda ner TXT-resultatet och kontrollera dess innehåll och kvalitet.
Vad ska man kontrollera

Innehåll som laddas om via JavaScript hämtas eller körs inte. CSS-layouten är inte bevarad.

Öppna verktyget →

Läs HWPX

Läs HWPX-stycken, tabeller och bilder som stöds och extrahera text. Äldre HWP och exakt layoutredigering stöds inte.

Exempel

document.hwpx → förhandsgranskning av innehåll som stöds + TXTÖppna verktyget →

Ren textlista

Rensa tomrum, dubbletter och blanksteg i listor med ett objekt per rad. Sortera endast när ändring av ordning är avsedd.

Exempel

upprepade rader → rensad radlistaÖppna verktyget →

Unicode normalisera

Normalisera olika sammansatt Unicode, inklusive nedbruten koreansk text. Kompatibilitetsnormalisering kan ändra tecken.

Exempel

nedbruten text + NFC → sammansatt textÖppna verktyget →

Osynliga karaktärer

Inspektera kopierad text för osynliga tecken och granska positioner och kodpunkter innan borttagning.

Exempel

text med osynliga tecken → plats/kodpunktsrapportÖppna verktyget →

Ta bort radbrytningar

Gå med i oönskade radbrytningar i kopierad prosa. Tabeller, dikter och listor kan bero på avsiktliga radbrytningar.

Exempel

inslagen prosa + tomma stycken → sammanfogade styckenÖppna verktyget →

Inspektera dold information i Office-filer

Inspektera författarens metadata, kommentarer och spår av dolt innehåll innan du delar Office-filer och redigera dem sedan i källprogrammet.

Exempel

Office-fil → inspektionsrapport för dold informationÖppna verktyget →

Den här guiden beskriver de offentliga webbverktygen och deras supportgränser. Behåll ditt original och kontrollera det nedladdade resultatet. Coverton · Rättelser och kontakt

Denna översättning förbereddes med hjälp av programvara. Du kan också läsa den engelska versionen. Läs på engelska