Витягніть і очистіть текст із DOCX, HWPX і скопійованих документів
Збереження документа як TXT робить його слова придатними для повторного використання, але не зберігає початковий макет сторінки чи форматування. Виберіть інструмент для DOCX, PPTX, ODT, EPUB, HWPX або RTF, а потім порівняйте важливий текст із джерелом.
Використовуйте безкоштовний інструмент →Спочатку перевірте корейський формат документа
Зчитувач HWPX обробляє підтримувані абзаци, таблиці та малюнки. Застарілий HWP не підтримується, і пристрій для читання не відтворює оригінальні шрифти, форми, формули чи розбивку на сторінки. Збережіть оригінал подання та використовуйте результат TXT для повторного використання тексту.
Ретельно очищуйте розриви рядків і невидимі символи
Очищення Copied-PDF об’єднує внутрішні розриви рядків, зберігаючи абзаци, розділені порожніми рядками. Перегляньте таблиці, вірші та списки за джерелом. Додаткове видалення невидимих символів стосується лише U+200B і BOM. Нормалізація NFKC і NFKD також змінює символи сумісності.
Перетворення відрізняється від перевірки конфіденційності
Markdown-to-HTML перетворює розмітку документа; HTML-to-TXT відкидає теги та макет. Інспектор Office повідомляє інформацію про автора, коментарі, приховані аркуші та трасування зовнішніх посилань. Сам по собі звіт не означає, що ці елементи було видалено з файлу.
Виберіть правильний інструмент
Приклади вхідних даних ілюструють робочий процес; вони не обіцяють певного розміру файлу, точності розпізнавання чи сумісності.
Перетворіть DOCX на текст
Витягніть текст для пошуку чи впорядкування. Копія TXT не відтворює макет документа чи зображення.
приклад
document.docx → видобутий text.txt- Виберіть файли у форматі DOCX. Максимальна кількість файлів на пакет: 1.
- Перегляньте Роздільник стовпців таблиці, а потім почніть обробку.
- Завантажте результат TXT і перевірте його вміст і якість.
Що перевірити
Витягується текст, а не оригінальний макет сторінки. Зображення, форматування та вбудовані об’єкти не зберігаються. OCR не виконується.
У документах Word фрагменти тексту зчитуються з пакета документів. Перевірте таблиці та текстові поля в результаті; їх візуальне розташування не прийнято. Старі двійкові файли .doc не підтримуються.
Перетворіть PPTX на текст
Зберіть текст слайда в робочу стенограму. Виберіть роздільник і перегляньте порядок вилучення.
приклад
slides.pptx → текст, розділений слайдами.txt- Виберіть файли у форматі PPTX. Максимальна кількість файлів на пакет: 1.
- Перегляньте Роздільник стовпців таблиці, а потім почніть обробку.
- Завантажте результат TXT і перевірте його вміст і якість.
Що перевірити
Порядок читання може відрізнятися від видимого положення текстових полів. Зображення та голосовий вміст не транскрибуються.
Перетворіть ODT на текст
Витягніть звичайний текст із файлу OpenDocument. Таблиці, шрифти та сторінки не зберігаються в TXT.
приклад
document.odt → видобутий text.txt- Виберіть файли у форматі ODT. Максимальна кількість файлів на пакет: 1.
- Перегляньте Роздільник стовпців таблиці, а потім почніть обробку.
- Завантажте результат TXT і перевірте його вміст і якість.
Що перевірити
Витягується текст, а не оригінальний макет сторінки. Зображення, форматування та вбудовані об’єкти не зберігаються. OCR не виконується.
OpenDocument зберігає текст і стилі окремо. Вихід TXT не використовує шаблони, стовпці чи розриви сторінок як фіксований макет. Перевірте списки та таблиці після експорту.
Перетворіть EPUB на текст
Збирайте текст із підтримуваного EPUB для особистих робочих процесів. Перевірте підтримку захищених книг і складних макетів для читання.
приклад
book.epub → простий текст для читання.txt- Виберіть файли у форматі EPUB. Максимальна кількість файлів на пакет: 1.
- Перегляньте Роздільник стовпців таблиці, а потім почніть обробку.
- Завантажте результат TXT і перевірте його вміст і якість.
Що перевірити
Книги, захищені DRM, не підтримуються. У TXT втрачено навігацію, типографіку та ілюстрації.
Перетворіть HWPX на текст
Видобути текст із HWPX. Застарілий HWP і точне відтворення оригінального макета редагування потребують інших робочих процесів.
приклад
document.hwpx → розділ text.txt- Виберіть файли у форматі HWPX. Максимальна кількість файлів на пакет: 1.
- Перегляньте Роздільник стовпців таблиці, а потім почніть обробку.
- Завантажте результат TXT і перевірте його вміст і якість.
Що перевірити
HWPX і старіший бінарний HWP — це різні формати. Файли з .hwp не відкриваються.
Перетворіть RTF на текст
Видаліть підтримуване форматування керування RTF для копії тексту. Порівняйте спеціальні символи та таблиці з джерелом.
приклад
document.rtf → звичайний текст.txt- Виберіть файли у форматі RTF. Максимальна кількість файлів на пакет: 1.
- Перевірте формат введення та порядок файлів, а потім почніть обробку.
- Завантажте результат TXT і перевірте його вміст і якість.
Що перевірити
Витягується текст, а не оригінальний макет сторінки. Зображення, форматування та вбудовані об’єкти не зберігаються. OCR не виконується.
Форматований текст містить керуючі слова для форматування та кодування символів. Вони видаляються або оцінюються під час експорту тексту. Перевірте спеціальні символи та старі кодові сторінки в результаті; вбудовані зображення не витягуються.
Перетворіть MARKDOWN на HTML
Експортувати запис Markdown як HTML. Перевірте, як відображаються підтримувані заголовки, списки та абзаци.
приклад
# Заголовок + абзаци → document.html- Виберіть файли у форматі MD, MARKDOWN. Максимальна кількість файлів на пакет: 1.
- Перегляньте Стиль документа HTML, Відкривати посилання в новій вкладці, а потім почніть обробку.
- Завантажте результат HTML і перевірте його вміст і якість.
Що перевірити
Підтримується обмежений синтаксис Markdown. Складні таблиці, багаторядкові клітинки, розширення та сценарії не повністю прийняті.
Перетворіть HTML на текст
Витягніть текст із файлу HTML. Це не відвідує URL-адресу для сканування активного веб-сайту.
приклад
saved-page.html → читабельний text.txt- Виберіть файли у форматі HTML, HTM. Максимальна кількість файлів на пакет: 1.
- Перевірте формат введення та порядок файлів, а потім почніть обробку.
- Завантажте результат TXT і перевірте його вміст і якість.
Що перевірити
Вміст, перезавантажений через JavaScript, не отримується та не виконується. Макет CSS не зберігся.
Читайте HWPX
Читайте підтримувані абзаци, таблиці та малюнки HWPX і витягуйте текст. Застарілий HWP і точне редагування макета не підтримуються.
приклад
document.hwpx → попередній перегляд підтримуваного вмісту + TXTВідкрийте інструмент →Чистий текстовий список
Очистіть пропуски, дублікати та пробіли в списках по одному елементу на рядок. Сортувати лише тоді, коли планується змінити порядок.
приклад
повторювані рядки → очищений список рядківВідкрийте інструмент →Нормалізація Unicode
Нормалізація по-різному складеного Unicode, включаючи розкладений корейський текст. Нормалізація сумісності може змінити персонажів.
приклад
розкладений текст + NFC → складений текстВідкрийте інструмент →Невидимі персонажі
Перевірте скопійований текст на наявність невидимих символів і перегляньте позиції та кодові точки перед видаленням.
приклад
текст із невидимими символами → звіт про розташування/кодові точкиВідкрийте інструмент →Видаліть розриви рядків
Об’єднайте небажані розриви рядків у скопійованій прозі. Таблиці, вірші та списки можуть залежати від навмисних розривів рядків.
приклад
загорнута проза + порожні абзаци → з’єднані абзациВідкрийте інструмент →Перевірте приховану інформацію у файлах Office
Перевірте авторські метадані, коментарі та сліди прихованого вмісту, перш ніж надати спільний доступ до файлів Office, а потім відредагуйте їх у вихідній програмі.
приклад
Службовий файл → протокол перевірки прихованої інформаціїВідкрийте інструмент →У цьому посібнику описано загальнодоступні веб-інструменти та обмеження їх підтримки. Збережіть свій оригінал і перевірте завантажений результат. Coverton · Виправлення та контакт
Цей переклад було підготовлено за допомогою програмного забезпечення. Ви також можете прочитати англійську версію. Читайте англійською