Passer au contenu
Coverton Blog
Dans cet article
Documents et textes

Extraire et nettoyer le texte de documents DOCX et HWPX

L'enregistrement d'un document sous le nom TXT rend ses mots réutilisables, mais ne conserve pas la mise en page ou le formatage d'origine. Sélectionnez l'outil pour DOCX, PPTX, ODT, EPUB, HWPX ou RTF, puis comparez le texte important avec la source.

Utiliser l’outil gratuit →

Vérifiez d'abord le format du document coréen

Le lecteur HWPX gère les paragraphes, tableaux et images pris en charge. L'ancien HWP n'est pas pris en charge et le lecteur ne reproduit pas les polices, formes, équations ou paginations d'origine. Conservez l'original de la soumission et utilisez le résultat TXT pour la réutilisation du texte.

Nettoyez soigneusement les sauts de ligne et les caractères invisibles

Le nettoyage Copied-PDF joint les sauts de ligne internes tout en conservant les paragraphes séparés par des lignes vides. Examinez les tableaux, les poèmes et les listes par rapport à la source. La suppression facultative des caractères invisibles affecte uniquement U+200B et BOM. La normalisation NFKC et NFKD modifie également les caractères de compatibilité.

La conversion est différente de l'inspection de la confidentialité

Markdown-to-HTML convertit le balisage du document ; HTML-to-TXT supprime les balises et la mise en page. L'inspecteur Office rapporte les informations sur l'auteur, les commentaires, les feuilles cachées et les traces de liens externes. Un rapport à lui seul ne signifie pas que ces éléments ont été supprimés du dossier.

Quel outil choisir ?

Des exemples d'entrées illustrent le flux de travail ; ils ne promettent pas de taille de fichier particulière, de précision de reconnaissance ou de compatibilité.

Convertir DOCX en Texte

Extrayez du texte pour la recherche ou l’organisation. La copie TXT ne reproduit pas la mise en page du document ni les images.

Exemple

document.docx → texte.txt extrait
  1. Choisissez des fichiers au format DOCX. Maximum : 1.
  2. Vérifiez les réglages (Séparateur de documents), puis lancez le traitement.
  3. Téléchargez le résultat TXT et vérifiez son contenu et sa qualité.
Que vérifier

L’extraction porte sur le texte, pas sur la mise en page. Images, styles et objets intégrés ne sont pas conservés. Aucun OCR n’est effectué.

Le texte est lu dans le contenu du document Word. Vérifiez les tableaux et zones de texte : leur disposition visuelle n’est pas reproduite. Les anciens fichiers binaires .doc ne sont pas pris en charge.

Ouvrir l’outil →

Convertir PPTX en Texte

Rassemblez le texte de la diapositive dans une transcription de travail. Choisissez un séparateur et vérifiez l’ordre d’extraction.

Exemple

slides.pptx → text.txt séparé par diapositives
  1. Choisissez des fichiers au format PPTX. Maximum : 1.
  2. Vérifiez les réglages (Séparateur de documents), puis lancez le traitement.
  3. Téléchargez le résultat TXT et vérifiez son contenu et sa qualité.
Que vérifier

L’ordre de lecture peut différer de la disposition des zones de texte. Images et paroles ne sont pas transcrites.

Ouvrir l’outil →

Convertir ODT en Texte

Extrayez le texte brut d'un fichier OpenDocument. Les tableaux, polices et pagination ne sont pas conservés dans TXT.

Exemple

document.odt → texte.txt extrait
  1. Choisissez des fichiers au format ODT. Maximum : 1.
  2. Vérifiez les réglages (Séparateur de documents), puis lancez le traitement.
  3. Téléchargez le résultat TXT et vérifiez son contenu et sa qualité.
Que vérifier

L’extraction porte sur le texte, pas sur la mise en page. Images, styles et objets intégrés ne sont pas conservés. Aucun OCR n’est effectué.

OpenDocument sépare le texte des styles. Le fichier TXT ne conserve pas les modèles, les colonnes ni les sauts de page sous forme de mise en page fixe. Vérifiez listes et tableaux après l’export.

Ouvrir l’outil →

Convertir EPUB en Texte

Collectez le texte d'un EPUB pris en charge pour les flux de travail personnels. Vérifiez la prise en charge des livres protégés et des mises en page de lecture complexes.

Exemple

book.epub → texte en lecture simple.txt
  1. Choisissez des fichiers au format EPUB. Maximum : 1.
  2. Vérifiez les réglages (Séparateur de documents), puis lancez le traitement.
  3. Téléchargez le résultat TXT et vérifiez son contenu et sa qualité.
Que vérifier

Les livres protégés par DRM ne sont pas pris en charge. Navigation, typographie et illustrations sont perdues en TXT.

Ouvrir l’outil →

Convertir HWPX en Texte

Extrayez le texte de HWPX. Le HWP hérité et la reproduction précise de la mise en page d'édition originale nécessitent d'autres flux de travail.

Exemple

document.hwpx → section texte.txt
  1. Choisissez des fichiers au format HWPX. Maximum : 1.
  2. Vérifiez les réglages (Séparateur de documents), puis lancez le traitement.
  3. Téléchargez le résultat TXT et vérifiez son contenu et sa qualité.
Que vérifier

HWPX et l’ancien HWP binaire sont différents. Les fichiers .hwp ne sont pas ouverts.

Ouvrir l’outil →

Convertir RTF en Texte

Supprimez le formatage de contrôle RTF pris en charge pour une copie de texte. Comparez les caractères spéciaux et les tableaux avec la source.

Exemple

document.rtf → texte brut.txt
  1. Choisissez des fichiers au format RTF. Maximum : 1.
  2. Vérifiez le format et l’ordre des fichiers, puis lancez le traitement.
  3. Téléchargez le résultat TXT et vérifiez son contenu et sa qualité.
Que vérifier

L’extraction porte sur le texte, pas sur la mise en page. Images, styles et objets intégrés ne sont pas conservés. Aucun OCR n’est effectué.

Rich Text contient des commandes de mise en forme et d’encodage. Elles sont supprimées ou interprétées lors de l’extraction. Vérifiez les caractères spéciaux et les anciens jeux de caractères ; les images intégrées ne sont pas extraites.

Ouvrir l’outil →

Convertir MARKDOWN en HTML

Exportez l’écriture Markdown au format HTML. Vérifiez le rendu des titres, listes et paragraphes pris en charge.

Exemple

# Titre + paragraphes → document.html
  1. Choisissez des fichiers au format MD, MARKDOWN. Maximum : 1.
  2. Vérifiez les réglages (Style du document HTML, Ouvrir les liens dans un nouvel onglet), puis lancez le traitement.
  3. Téléchargez le résultat HTML et vérifiez son contenu et sa qualité.
Que vérifier

Seule une syntaxe Markdown limitée est prise en charge. Les tableaux complexes, cellules multilignes, extensions et scripts ne sont pas entièrement repris.

Ouvrir l’outil →

Convertir HTML en Texte

Extraire le texte d'un fichier HTML. Cela ne visite pas une URL pour récupérer un site Web en direct.

Exemple

page enregistrée.html → texte.txt lisible
  1. Choisissez des fichiers au format HTML, HTM. Maximum : 1.
  2. Vérifiez le format et l’ordre des fichiers, puis lancez le traitement.
  3. Téléchargez le résultat TXT et vérifiez son contenu et sa qualité.
Que vérifier

Le contenu chargé par JavaScript n’est ni récupéré ni exécuté. La mise en page CSS n’est pas conservée.

Ouvrir l’outil →

Lire HWPX

Lisez les paragraphes, tableaux et images HWPX pris en charge et extrayez le texte. Les anciens HWP et l'édition précise de la mise en page ne sont pas pris en charge.

Exemple

document.hwpx → aperçu du contenu pris en charge + TXTOuvrir l’outil →

Nettoyer la liste de textes

Nettoyez les blancs, les doublons et les espaces dans les listes à un élément par ligne. Triez uniquement lorsque vous souhaitez modifier l'ordre.

Exemple

éléments de campagne répétés → liste de lignes nettoyéeOuvrir l’outil →

Normaliser Unicode

Normalisez l'Unicode composé différemment, y compris le texte coréen décomposé. La normalisation de la compatibilité peut modifier les caractères.

Exemple

texte décomposé + NFC → texte composéOuvrir l’outil →

Personnages invisibles

Inspectez le texte copié pour détecter les caractères invisibles et examinez les positions et les points de code avant de les supprimer.

Exemple

texte avec caractères invisibles → rapport de localisation/point de codeOuvrir l’outil →

Supprimer les sauts de ligne

Joignez les sauts de ligne indésirables dans la prose copiée. Les tableaux, poèmes et listes peuvent dépendre de sauts de ligne intentionnels.

Exemple

prose enveloppée + paragraphes vierges → paragraphes jointsOuvrir l’outil →

Inspecter les informations cachées dans les fichiers Office

Inspectez les métadonnées de l'auteur, les commentaires et les traces de contenu masqué avant de partager des fichiers Office, puis modifiez-les dans l'application source.

Exemple

Fichier Office → rapport d'inspection des informations cachéesOuvrir l’outil →

Ce guide décrit les outils Web publics et leurs limites de prise en charge. Conservez votre original et vérifiez le résultat téléchargé. Coverton · Corrections et contact

Cette traduction a été préparée avec l'aide d'un logiciel. Vous pouvez également lire la version anglaise. Lire en anglais