Vai al contenuto
Coverton Blog
In questo articolo
Documenti e testo

Estrai e pulisci il testo da DOCX, HWPX e documenti copiati

Il salvataggio di un documento come TXT rende le sue parole riutilizzabili, ma non mantiene il layout o la formattazione della pagina originale. Seleziona lo strumento per DOCX, PPTX, ODT, EPUB, HWPX o RTF, quindi confronta il testo importante con la fonte.

Utilizza lo strumento gratuito →

Controlla prima il formato del documento coreano

Il lettore HWPX gestisce paragrafi, tabelle e immagini supportati. La versione precedente HWP non è supportata e il lettore non riproduce caratteri, forme, equazioni o impaginazione originali. Conserva l'originale inviato e utilizza il risultato TXT per il riutilizzo del testo.

Pulisci attentamente le interruzioni di riga e i caratteri invisibili

La pulizia Copied-PDF unisce le interruzioni di riga interne mantenendo i paragrafi separati da righe vuote. Rivedi tabelle, poesie ed elenchi confrontandoli con la fonte. La rimozione opzionale dei caratteri invisibili interessa solo U+200B e BOM. Anche la normalizzazione NFKC e NFKD modifica i caratteri di compatibilità.

La conversione è diversa dall'ispezione della privacy

Markdown-to-HTML converte il markup del documento; HTML-to-TXT elimina tag e layout. L'ispettore Office riporta informazioni sull'autore, commenti, fogli nascosti e tracce di collegamenti esterni. Una segnalazione da sola non significa che tali elementi siano stati rimossi dal file.

Scegli lo strumento giusto

Gli input di esempio illustrano il flusso di lavoro; non promettono una particolare dimensione del file, accuratezza del riconoscimento o compatibilità.

Converti DOCX in Testo

Estrai testo per la ricerca o l'organizzazione. La copia TXT non riproduce il layout o le immagini del documento.

Esempio

document.docx → testo estratto.txt
  1. Scegli i file nel formato DOCX. Numero massimo di file per batch: 1.
  2. Rivedi Separatore di colonne della tabella, quindi avvia l'elaborazione.
  3. Scarica il risultato TXT e controllane il contenuto e la qualità.
Cosa controllare

Viene estratto il testo, non il layout di pagina originale. Le immagini, la formattazione e gli oggetti incorporati non vengono conservati. L'OCR non viene eseguito.

Con i documenti Word, le sezioni di testo vengono lette dal pacchetto documenti. Controlla tabelle e campi di testo nel risultato; la loro disposizione visiva non viene adottata. I vecchi file binari .doc non sono supportati.

Apri lo strumento →

Converti PPTX in Testo

Raccogli il testo della diapositiva in una trascrizione di lavoro. Scegli un separatore e rivedi l'ordine di estrazione.

Esempio

slides.pptx → testo separato da diapositive.txt
  1. Scegli i file nel formato PPTX. Numero massimo di file per batch: 1.
  2. Rivedi Separatore di colonne della tabella, quindi avvia l'elaborazione.
  3. Scarica il risultato TXT e controllane il contenuto e la qualità.
Cosa controllare

L'ordine di lettura può differire dalla posizione visibile dei campi di testo. Le immagini e il contenuto parlato non vengono trascritti.

Apri lo strumento →

Converti ODT in Testo

Estrai testo semplice da un file OpenDocument. Tabelle, caratteri e impaginazione non vengono conservati in TXT.

Esempio

document.odt → testo.txt estratto
  1. Scegli i file nel formato ODT. Numero massimo di file per batch: 1.
  2. Rivedi Separatore di colonne della tabella, quindi avvia l'elaborazione.
  3. Scarica il risultato TXT e controllane il contenuto e la qualità.
Cosa controllare

Viene estratto il testo, non il layout di pagina originale. Le immagini, la formattazione e gli oggetti incorporati non vengono conservati. L'OCR non viene eseguito.

OpenDocument memorizza testo e stili separatamente. L'output TXT non adotta modelli, colonne o interruzioni di pagina come layout fisso. Elenchi e tabelle di controllo dopo l'esportazione.

Apri lo strumento →

Converti EPUB in Testo

Raccogli testo da un EPUB supportato per flussi di lavoro personali. Verifica il supporto per libri protetti e layout di lettura complessi.

Esempio

book.epub → lettura semplice text.txt
  1. Scegli i file nel formato EPUB. Numero massimo di file per batch: 1.
  2. Rivedi Separatore di colonne della tabella, quindi avvia l'elaborazione.
  3. Scarica il risultato TXT e controllane il contenuto e la qualità.
Cosa controllare

I libri protetti da DRM non sono supportati. Navigazione, tipografia e illustrazioni si perdono in TXT.

Apri lo strumento →

Converti HWPX in Testo

Estrai testo da HWPX. L'HWP legacy e la riproduzione precisa del layout di editing originale richiedono altri flussi di lavoro.

Esempio

document.hwpx → sezione text.txt
  1. Scegli i file nel formato HWPX. Numero massimo di file per batch: 1.
  2. Rivedi Separatore di colonne della tabella, quindi avvia l'elaborazione.
  3. Scarica il risultato TXT e controllane il contenuto e la qualità.
Cosa controllare

HWPX e il vecchio HWP binario sono formati diversi. I file con estensione hwp non si apriranno.

Apri lo strumento →

Converti RTF in Testo

Rimuovere la formattazione del controllo RTF supportata per una copia di testo. Confronta i caratteri speciali e le tabelle con la fonte.

Esempio

documento.rtf → testo semplice.txt
  1. Scegli i file nel formato RTF. Numero massimo di file per batch: 1.
  2. Controlla il formato di input e l'ordine dei file, quindi avvia l'elaborazione.
  3. Scarica il risultato TXT e controllane il contenuto e la qualità.
Cosa controllare

Viene estratto il testo, non il layout di pagina originale. Le immagini, la formattazione e gli oggetti incorporati non vengono conservati. L'OCR non viene eseguito.

Il testo RTF contiene parole di controllo per la formattazione e la codifica dei caratteri. Questi vengono rimossi o valutati durante l'esportazione del testo. Controlla i caratteri speciali e le codepage più vecchie nel risultato; le immagini incorporate non vengono estratte.

Apri lo strumento →

Converti MARKDOWN in HTML

Esporta la scrittura Markdown come HTML. Controlla il rendering di intestazioni, elenchi e paragrafi supportati.

Esempio

# Intestazione + paragrafi → document.html
  1. Scegli i file nel formato MD, MARKDOWN. Numero massimo di file per batch: 1.
  2. Rivedi Stile del documento HTML, Apri i collegamenti in una nuova scheda, quindi avvia l'elaborazione.
  3. Scarica il risultato HTML e controllane il contenuto e la qualità.
Cosa controllare

È supportata la sintassi Markdown limitata. Tabelle complesse, celle a più righe, estensioni e script non vengono completamente adottate.

Apri lo strumento →

Converti HTML in Testo

Estrai testo da un file HTML. Questo non visita un URL per raschiare un sito Web live.

Esempio

pagina-salvata.html → testo leggibile.txt
  1. Scegli i file nel formato HTML, HTM. Numero massimo di file per batch: 1.
  2. Controlla il formato di input e l'ordine dei file, quindi avvia l'elaborazione.
  3. Scarica il risultato TXT e controllane il contenuto e la qualità.
Cosa controllare

Il contenuto ricaricato tramite JavaScript non viene recuperato o eseguito. Il layout CSS non viene conservato.

Apri lo strumento →

Leggi HWPX

Leggi paragrafi, tabelle e immagini HWPX supportati ed estrai testo. L'HWP legacy e la modifica precisa del layout non sono supportati.

Esempio

document.hwpx → anteprima del contenuto supportato + TXTApri lo strumento →

Elenco testi pulito

Pulisci spazi vuoti, duplicati e spazi bianchi negli elenchi di un elemento per riga. Ordina solo quando si intende modificare l'ordine.

Esempio

elementi riga ripetuti → elenco righe puliteApri lo strumento →

Normalizzazione Unicode

Normalizza Unicode composto in modo diverso, incluso il testo coreano scomposto. La normalizzazione della compatibilità può alterare i personaggi.

Esempio

testo scomposto + NFC → testo compostoApri lo strumento →

Personaggi invisibili

Ispeziona il testo copiato per individuare caratteri invisibili e rivedi posizioni e punti di codice prima della rimozione.

Esempio

testo con caratteri invisibili → rapporto posizione/punto codiceApri lo strumento →

Rimuovi le interruzioni di riga

Unisciti alle interruzioni di riga indesiderate nella prosa copiata. Tabelle, poesie ed elenchi possono dipendere da interruzioni di riga intenzionali.

Esempio

prosa avvolta + paragrafi vuoti → paragrafi unitiApri lo strumento →

Esamina le informazioni nascoste nei file di Office

Esamina i metadati dell'autore, i commenti e le tracce dei contenuti nascosti prima di condividere i file di Office, quindi modificali nell'applicazione di origine.

Esempio

File Office → rapporto di ispezione con informazioni nascosteApri lo strumento →

Questa guida descrive gli strumenti Web pubblici e i relativi limiti di supporto. Conserva l'originale e controlla il risultato scaricato. Coverton · Correzioni e contatti

Questa traduzione è stata preparata con l'assistenza del software. Puoi leggere anche la versione inglese. Leggi in inglese