Ga naar de inhoud
Coverton Bloggen
In dit artikel
Documenten en tekst

Tekst uit DOCX, HWPX en gekopieerde documenten extraheren en opschonen

Door een document op te slaan als TXT zijn de woorden herbruikbaar, maar blijft de oorspronkelijke pagina-indeling of opmaak behouden. Selecteer de tool voor DOCX, PPTX, ODT, EPUB, HWPX of RTF en vergelijk vervolgens belangrijke tekst met de bron.

Gebruik de gratis tool →

Controleer eerst het Koreaanse documentformaat

De HWPX-lezer verwerkt ondersteunde alinea's, tabellen en afbeeldingen. Legacy HWP wordt niet ondersteund en de lezer reproduceert geen originele lettertypen, vormen, vergelijkingen of paginering. Behoud het origineel van de inzending en gebruik het TXT-resultaat voor hergebruik van tekst.

Maak regeleinden en onzichtbare tekens zorgvuldig schoon

Bij het opschonen van gekopieerde PDF worden interne regeleinden samengevoegd, terwijl de door witregels gescheiden paragrafen behouden blijven. Beoordeel tabellen, gedichten en lijsten met de bron. Het optioneel verwijderen van onzichtbare tekens heeft alleen betrekking op U+200B en BOM. De normalisatie van NFKC en NFKD verandert ook de compatibiliteitstekens.

Conversie is iets anders dan privacyinspectie

Markdown-naar-HTML converteert documentmarkeringen; HTML-to-TXT verwijdert tags en lay-out. De Office-inspecteur rapporteert auteursinformatie, opmerkingen, verborgen bladen en sporen van externe links. Een melding alleen betekent niet dat deze stukken uit het dossier zijn verwijderd.

Kies het juiste gereedschap

Voorbeeldinvoer illustreert de workflow; ze beloven geen bepaalde bestandsgrootte, herkenningsnauwkeurigheid of compatibiliteit.

Converteer DOCX naar Tekst

Extraheer tekst om te zoeken of te ordenen. De TXT-kopie reproduceert geen documentindeling of afbeeldingen.

Voorbeeld

document.docx → geëxtraheerde tekst.txt
  1. Kies bestanden in het DOCX-formaat. Maximaal aantal bestanden per batch: 1.
  2. Controleer Tabelkolomscheidingsteken en start vervolgens de verwerking.
  3. Download het TXT-resultaat en controleer de inhoud en kwaliteit ervan.
Wat te controleren

Tekst wordt geëxtraheerd, niet de oorspronkelijke pagina-indeling. Afbeeldingen, opmaak en ingesloten objecten blijven niet behouden. OCR wordt niet uitgevoerd.

Bij Word-documenten worden tekstgedeelten uit het documentenpakket gelezen. Controleer tabellen en tekstvelden in het resultaat; hun visuele opstelling wordt niet overgenomen. Oude binaire .doc-bestanden worden niet ondersteund.

Open het gereedschap →

Converteer PPTX naar Tekst

Verzamel diatekst in een werkend transcript. Kies een scheidingsteken en bekijk de extractievolgorde.

Voorbeeld

slides.pptx → door dia's gescheiden tekst.txt
  1. Kies bestanden in het PPTX-formaat. Maximaal aantal bestanden per batch: 1.
  2. Controleer Tabelkolomscheidingsteken en start vervolgens de verwerking.
  3. Download het TXT-resultaat en controleer de inhoud en kwaliteit ervan.
Wat te controleren

De leesvolgorde kan afwijken van de zichtbare positie van de tekstvelden. Afbeeldingen en gesproken inhoud worden niet getranscribeerd.

Open het gereedschap →

Converteer ODT naar Tekst

Extraheer platte tekst uit een OpenDocument-bestand. Tabellen, lettertypen en paginering blijven niet behouden in TXT.

Voorbeeld

document.odt → geëxtraheerde tekst.txt
  1. Kies bestanden in het ODT-formaat. Maximaal aantal bestanden per batch: 1.
  2. Controleer Tabelkolomscheidingsteken en start vervolgens de verwerking.
  3. Download het TXT-resultaat en controleer de inhoud en kwaliteit ervan.
Wat te controleren

Tekst wordt geëxtraheerd, niet de oorspronkelijke pagina-indeling. Afbeeldingen, opmaak en ingesloten objecten blijven niet behouden. OCR wordt niet uitgevoerd.

OpenDocument slaat tekst en stijlen afzonderlijk op. De TXT-uitvoer gebruikt geen sjablonen, kolommen of pagina-einden als vaste lay-out. Checklijsten en tabellen na export.

Open het gereedschap →

Converteer EPUB naar Tekst

Verzamel tekst uit een ondersteunde EPUB voor persoonlijke workflows. Controleer de ondersteuning voor beveiligde boeken en complexe leeslay-outs.

Voorbeeld

book.epub → leesbare tekst.txt
  1. Kies bestanden in het EPUB-formaat. Maximaal aantal bestanden per batch: 1.
  2. Controleer Tabelkolomscheidingsteken en start vervolgens de verwerking.
  3. Download het TXT-resultaat en controleer de inhoud en kwaliteit ervan.
Wat te controleren

Met DRM beveiligde boeken worden niet ondersteund. Navigatie, typografie en illustraties gaan verloren in TXT.

Open het gereedschap →

Converteer HWPX naar Tekst

Extraheer tekst uit HWPX. Oudere HWP en nauwkeurige reproductie van de originele bewerkingslay-out vereisen andere workflows.

Voorbeeld

document.hwpx → sectie tekst.txt
  1. Kies bestanden in het HWPX-formaat. Maximaal aantal bestanden per batch: 1.
  2. Controleer Tabelkolomscheidingsteken en start vervolgens de verwerking.
  3. Download het TXT-resultaat en controleer de inhoud en kwaliteit ervan.
Wat te controleren

HWPX en de oudere binaire HWP zijn verschillende formaten. Bestanden met .hwp worden niet geopend.

Open het gereedschap →

Converteer RTF naar Tekst

Verwijder de ondersteunde RTF-besturingsopmaak voor een tekstkopie. Vergelijk speciale tekens en tabellen met de bron.

Voorbeeld

document.rtf → platte tekst.txt
  1. Kies bestanden in het RTF-formaat. Maximaal aantal bestanden per batch: 1.
  2. Controleer het invoerformaat en de bestandsvolgorde en start vervolgens de verwerking.
  3. Download het TXT-resultaat en controleer de inhoud en kwaliteit ervan.
Wat te controleren

Tekst wordt geëxtraheerd, niet de oorspronkelijke pagina-indeling. Afbeeldingen, opmaak en ingesloten objecten blijven niet behouden. OCR wordt niet uitgevoerd.

Rich text bevat controlewoorden voor opmaak en tekencodering. Deze worden tijdens de tekstexport verwijderd of geëvalueerd. Controleer speciale tekens en oudere codepagina's in het resultaat; ingebedde afbeeldingen worden niet geëxtraheerd.

Open het gereedschap →

Converteer MARKDOWN naar HTML

Markdown-schrijven exporteren als HTML. Controleer hoe ondersteunde koppen, lijsten en alinea's worden weergegeven.

Voorbeeld

# Kop + alinea's → document.html
  1. Kies bestanden in het MD, MARKDOWN-formaat. Maximaal aantal bestanden per batch: 1.
  2. Controleer HTML-documentstijl, Open links in een nieuw tabblad en start vervolgens de verwerking.
  3. Download het HTML-resultaat en controleer de inhoud en kwaliteit ervan.
Wat te controleren

Er wordt beperkte Markdown-syntaxis ondersteund. Complexe tabellen, cellen met meerdere rijen, extensies en scripts worden niet volledig overgenomen.

Open het gereedschap →

Converteer HTML naar Tekst

Extraheer tekst uit een HTML-bestand. Hiermee wordt geen URL bezocht om een ​​live website te schrapen.

Voorbeeld

opgeslagen-pagina.html → leesbare tekst.txt
  1. Kies bestanden in het HTML, HTM-formaat. Maximaal aantal bestanden per batch: 1.
  2. Controleer het invoerformaat en de bestandsvolgorde en start vervolgens de verwerking.
  3. Download het TXT-resultaat en controleer de inhoud en kwaliteit ervan.
Wat te controleren

Inhoud die via JavaScript opnieuw wordt geladen, wordt niet opgehaald of uitgevoerd. De CSS-indeling blijft niet behouden.

Open het gereedschap →

Lees HWPX

Lees ondersteunde HWPX-paragrafen, tabellen en afbeeldingen en extraheer tekst. Verouderde HWP en nauwkeurige lay-outbewerking worden niet ondersteund.

Voorbeeld

document.hwpx → ondersteund inhoudsvoorbeeld + TXTOpen het gereedschap →

Schone tekstlijst

Verwijder spaties, duplicaten en witruimte in lijsten met één item per regel. Sorteer alleen als het de bedoeling is om de volgorde te wijzigen.

Voorbeeld

herhaalde regelitems → opgeschoonde regellijstOpen het gereedschap →

Unicode normaliseert

Normaliseer anders samengestelde Unicode, inclusief ontlede Koreaanse tekst. Compatibiliteitsnormalisatie kan karakters veranderen.

Voorbeeld

ontlede tekst + NFC → samengestelde tekstOpen het gereedschap →

Onzichtbare karakters

Inspecteer gekopieerde tekst op onzichtbare tekens en controleer posities en codepunten voordat u deze verwijdert.

Voorbeeld

tekst met onzichtbare tekens → locatie-/codepuntrapportOpen het gereedschap →

Verwijder regeleinden

Sluit ongewenste regeleinden aan in gekopieerd proza. Tabellen, gedichten en lijsten kunnen afhankelijk zijn van opzettelijke regeleinden.

Voorbeeld

verpakt proza + blanco alinea's → samengevoegde alinea'sOpen het gereedschap →

Inspecteer verborgen informatie in Office-bestanden

Inspecteer metagegevens, opmerkingen en sporen van verborgen inhoud van de auteur voordat u Office-bestanden deelt, en bewerk ze vervolgens in de brontoepassing.

Voorbeeld

Office-bestand → inspectierapport met verborgen informatieOpen het gereedschap →

In deze handleiding worden de openbare webtools en hun ondersteuningslimieten beschreven. Bewaar uw origineel en controleer het gedownloade resultaat. Coverton · Correcties en contact

Deze vertaling is met softwarematige hulp tot stand gekomen. Je kunt ook de Engelse versie lezen. Lees in het Engels