Извлечение и очистка текста из DOCX, HWPX и скопированных документов.
Сохранение документа как TXT делает его слова пригодными для повторного использования, но не сохраняет исходный макет или форматирование страницы. Выберите инструмент для DOCX, PPTX, ODT, EPUB, HWPX или RTF, затем сравните важный текст с источником.
Используйте бесплатный инструмент →Сначала проверьте корейский формат документа
Читатель HWPX обрабатывает поддерживаемые абзацы, таблицы и изображения. Устаревшая версия HWP не поддерживается, и программа чтения не воспроизводит оригинальные шрифты, фигуры, уравнения и нумерацию страниц. Сохраните отправленный оригинал и используйте результат TXT для повторного использования текста.
Тщательно очищайте разрывы строк и невидимые символы.
Очистка Copied-PDF объединяет внутренние разрывы строк, сохраняя при этом абзацы, разделенные пустыми строками. Сравните таблицы, стихи и списки с первоисточником. Дополнительное удаление невидимых символов влияет только на U+200B и BOM. Нормализация NFKC и NFKD также меняет символы совместимости.
Конверсия отличается от проверки конфиденциальности
Markdown-to-HTML преобразует разметку документа; HTML-to-TXT отбрасывает теги и макет. Инспектор Office сообщает информацию об авторе, комментарии, скрытые листы и следы внешних ссылок. Сам по себе отчет не означает, что эти элементы были удалены из файла.
Выберите правильный инструмент
Примеры входных данных иллюстрируют рабочий процесс; они не обещают определенного размера файла, точности распознавания или совместимости.
Преобразовать DOCX в Текст
Извлеките текст для поиска или систематизации. Копия TXT не воспроизводит макет документа или изображения.
Пример
document.docx → извлеченный text.txt- Выбирайте файлы в формате DOCX. Максимальное количество файлов в пакете: 1.
- Просмотрите Разделитель столбцов таблицы, затем начните обработку.
- Загрузите результат TXT и проверьте его содержимое и качество.
Что проверить
Извлекается текст, а не исходный макет страницы. Изображения, форматирование и внедренные объекты не сохраняются. OCR не выполняется.
В документах Word разделы текста считываются из пакета документов. Проверьте таблицы и текстовые поля в результате; их визуальное расположение не принято. Старые двоичные файлы .doc не поддерживаются.
Преобразовать PPTX в Текст
Соберите текст слайда в рабочую расшифровку. Выберите разделитель и проверьте порядок извлечения.
Пример
слайды.pptx → текст, разделенный слайдами.txt- Выбирайте файлы в формате PPTX. Максимальное количество файлов в пакете: 1.
- Просмотрите Разделитель столбцов таблицы, затем начните обработку.
- Загрузите результат TXT и проверьте его содержимое и качество.
Что проверить
Порядок чтения может отличаться от видимого положения текстовых полей. Изображения и устный контент не расшифровываются.
Преобразовать ODT в Текст
Извлеките простой текст из файла OpenDocument. Таблицы, шрифты и нумерация страниц в TXT не сохраняются.
Пример
document.odt → извлеченный text.txt- Выбирайте файлы в формате ODT. Максимальное количество файлов в пакете: 1.
- Просмотрите Разделитель столбцов таблицы, затем начните обработку.
- Загрузите результат TXT и проверьте его содержимое и качество.
Что проверить
Извлекается текст, а не исходный макет страницы. Изображения, форматирование и внедренные объекты не сохраняются. OCR не выполняется.
OpenDocument хранит текст и стили отдельно. Вывод TXT не использует шаблоны, столбцы или разрывы страниц в качестве фиксированного макета. Проверьте списки и таблицы после экспорта.
Преобразовать EPUB в Текст
Собирайте текст из поддерживаемого формата EPUB для личных рабочих процессов. Проверьте поддержку защищенных книг и сложных макетов чтения.
Пример
book.epub → обычный текст для чтения.txt- Выбирайте файлы в формате EPUB. Максимальное количество файлов в пакете: 1.
- Просмотрите Разделитель столбцов таблицы, затем начните обработку.
- Загрузите результат TXT и проверьте его содержимое и качество.
Что проверить
Книги с защитой DRM не поддерживаются. Навигация, типографика и иллюстрации теряются в TXT.
Преобразовать HWPX в Текст
Извлеките текст из HWPX. Устаревший HWP и точное воспроизведение исходного макета редактирования требуют других рабочих процессов.
Пример
document.hwpx → раздел text.txt- Выбирайте файлы в формате HWPX. Максимальное количество файлов в пакете: 1.
- Просмотрите Разделитель столбцов таблицы, затем начните обработку.
- Загрузите результат TXT и проверьте его содержимое и качество.
Что проверить
HWPX и более старый двоичный файл HWP — это разные форматы. Файлы с расширением .hwp не открываются.
Преобразовать RTF в Текст
Удалите поддерживаемое форматирование элемента управления RTF для текстовой копии. Сравните специальные символы и таблицы с источником.
Пример
document.rtf → обычный текст.txt- Выбирайте файлы в формате RTF. Максимальное количество файлов в пакете: 1.
- Проверьте входной формат и порядок файлов, затем начните обработку.
- Загрузите результат TXT и проверьте его содержимое и качество.
Что проверить
Извлекается текст, а не исходный макет страницы. Изображения, форматирование и внедренные объекты не сохраняются. OCR не выполняется.
Форматированный текст содержит управляющие слова для форматирования и кодировки символов. Они удаляются или оцениваются во время экспорта текста. Проверьте в результате специальные символы и старые кодовые страницы; встроенные изображения не извлекаются.
Преобразовать MARKDOWN в HTML
Экспортируйте запись Markdown в формате HTML. Проверьте, как отображаются поддерживаемые заголовки, списки и абзацы.
Пример
# Заголовок + абзацы → document.html- Выбирайте файлы в формате MD, MARKDOWN. Максимальное количество файлов в пакете: 1.
- Просмотрите стиль HTML-документа, Открыть ссылки в новой вкладке, затем начните обработку.
- Загрузите результат HTML и проверьте его содержимое и качество.
Что проверить
Поддерживается ограниченный синтаксис Markdown. Сложные таблицы, многострочные ячейки, расширения и скрипты реализованы не полностью.
Преобразовать HTML в Текст
Извлечение текста из HTML-файла. Это не посещение URL-адреса для очистки работающего веб-сайта.
Пример
save-page.html → читаемый text.txt- Выбирайте файлы в формате HTML, HTM. Максимальное количество файлов в пакете: 1.
- Проверьте входной формат и порядок файлов, затем начните обработку.
- Загрузите результат TXT и проверьте его содержимое и качество.
Что проверить
Содержимое, перезагружаемое через JavaScript, не извлекается и не выполняется. CSS-макет не сохраняется.
Читать HWPX
Чтение поддерживаемых параграфов, таблиц и изображений HWPX и извлечение текста. Устаревшие HWP и точное редактирование макетов не поддерживаются.
Пример
document.hwpx → предварительный просмотр поддерживаемого контента + TXTОткройте инструмент →Очистить список текстов
Очистите пробелы, дубликаты и пробелы в списках по одному элементу в строке. Сортируйте только тогда, когда предполагается изменение порядка.
Пример
повторяющиеся позиции → очищенный список строкОткройте инструмент →Нормализация Юникода
Нормализуйте Юникод, составленный по-разному, включая разложенный корейский текст. Нормализация совместимости может изменить символы.
Пример
разложенный текст + NFC → составной текстОткройте инструмент →Невидимые персонажи
Проверьте скопированный текст на наличие невидимых символов и просмотрите позиции и кодовые точки перед удалением.
Пример
текст с невидимыми символами → отчет о местоположении/кодовой точкеОткройте инструмент →Удалить разрывы строк
Соединяйте нежелательные разрывы строк в скопированной прозе. Таблицы, стихи и списки могут зависеть от намеренных переносов строк.
Пример
завернутая проза + пустые абзацы → объединенные абзацыОткройте инструмент →Проверка скрытой информации в файлах Office
Прежде чем делиться файлами Office, проверяйте метаданные автора, комментарии и следы скрытого содержимого, а затем редактируйте их в исходном приложении.
Пример
Офисный файл → Отчет о проверке скрытой информацииОткройте инструмент →В этом руководстве описаны общедоступные веб-инструменты и ограничения их поддержки. Сохраните оригинал и проверьте загруженный результат. Coverton · Исправления и контакты
Этот перевод был подготовлен с помощью программного обеспечения. Вы также можете прочитать английскую версию. Читать на английском