Lewati ke konten
Coverton blog
Dalam artikel ini
Dokumen dan teks

Ekstrak dan bersihkan teks dari DOCX, HWPX dan dokumen yang disalin

Menyimpan dokumen sebagai TXT membuat kata-katanya dapat digunakan kembali, namun tidak mempertahankan tata letak atau format halaman asli. Pilih alat untuk DOCX, PPTX, ODT, EPUB, HWPX atau RTF, lalu bandingkan teks penting dengan sumbernya.

Gunakan alat gratis →

Periksa format dokumen Korea terlebih dahulu

Pembaca HWPX menangani paragraf, tabel, dan gambar yang didukung. HWP lama tidak didukung, dan pembaca tidak mereproduksi font, bentuk, persamaan, atau penomoran halaman asli. Pertahankan kiriman asli dan gunakan hasil TXT untuk penggunaan kembali teks.

Bersihkan jeda baris dan karakter yang tidak terlihat dengan hati-hati

Pembersihan yang disalin-PDF menggabungkan jeda baris internal sambil mempertahankan paragraf yang dipisahkan baris kosong. Tinjau tabel, puisi, dan daftar berdasarkan sumbernya. Penghapusan karakter tak terlihat opsional hanya memengaruhi U+200B dan BOM. Normalisasi NFKC dan NFKD juga mengubah karakter kompatibilitas.

Konversi berbeda dengan pemeriksaan privasi

Markdown-ke-HTML mengonversi markup dokumen; HTML-to-TXT membuang tag dan tata letak. Inspektur Office melaporkan informasi penulis, komentar, lembar tersembunyi, dan jejak tautan eksternal. Laporan saja tidak berarti item tersebut telah dihapus dari file.

Pilih alat yang tepat

Contoh masukan menggambarkan alur kerja; mereka tidak menjanjikan ukuran file tertentu, keakuratan pengenalan, atau kompatibilitas.

Ubah DOCX menjadi Teks

Ekstrak teks untuk dicari atau diatur. Salinan TXT tidak mereproduksi tata letak dokumen atau gambar.

Contoh

dokumen.docx → ekstrak teks.txt
  1. Pilih file dalam format DOCX. File maksimum per batch: 1.
  2. Tinjau Pemisah kolom tabel, lalu mulai memproses.
  3. Unduh hasil TXT dan periksa konten dan kualitasnya.
Apa yang harus diperiksa

Teks diekstraksi, bukan tata letak halaman asli. Gambar, pemformatan, dan objek yang disematkan tidak dipertahankan. OCR tidak dijalankan.

Dengan dokumen Word, bagian teks dibaca dari paket dokumen. Periksa tabel dan kolom teks pada hasilnya; pengaturan visualnya tidak diadopsi. File .doc biner lama tidak didukung.

Buka alatnya →

Ubah PPTX menjadi Teks

Kumpulkan teks slide menjadi transkrip kerja. Pilih pemisah dan tinjau urutan ekstraksi.

Contoh

slides.pptx → text.txt yang dipisahkan slide
  1. Pilih file dalam format PPTX. File maksimum per batch: 1.
  2. Tinjau Pemisah kolom tabel, lalu mulai memproses.
  3. Unduh hasil TXT dan periksa konten dan kualitasnya.
Apa yang harus diperiksa

Urutan pembacaan mungkin berbeda dari posisi kolom teks yang terlihat. Gambar dan konten lisan tidak ditranskripsi.

Buka alatnya →

Ubah ODT menjadi Teks

Ekstrak teks biasa dari file OpenDocument. Tabel, font, dan penomoran halaman tidak disimpan di TXT.

Contoh

document.odt → mengekstrak teks.txt
  1. Pilih file dalam format ODT. File maksimum per batch: 1.
  2. Tinjau Pemisah kolom tabel, lalu mulai memproses.
  3. Unduh hasil TXT dan periksa konten dan kualitasnya.
Apa yang harus diperiksa

Teks diekstraksi, bukan tata letak halaman asli. Gambar, pemformatan, dan objek yang disematkan tidak dipertahankan. OCR tidak dijalankan.

OpenDocument menyimpan teks dan gaya secara terpisah. Keluaran TXT tidak mengadopsi templat, kolom, atau hentian halaman sebagai tata letak tetap. Periksa daftar dan tabel setelah ekspor.

Buka alatnya →

Ubah EPUB menjadi Teks

Kumpulkan teks dari EPUB yang didukung untuk alur kerja pribadi. Periksa dukungan untuk buku yang dilindungi dan tata letak bacaan yang rumit.

Contoh

book.epub → bacaan biasa text.txt
  1. Pilih file dalam format EPUB. File maksimum per batch: 1.
  2. Tinjau Pemisah kolom tabel, lalu mulai memproses.
  3. Unduh hasil TXT dan periksa konten dan kualitasnya.
Apa yang harus diperiksa

Buku yang dilindungi DRM tidak didukung. Navigasi, tipografi, dan ilustrasi hilang di TXT.

Buka alatnya →

Ubah HWPX menjadi Teks

Ekstrak teks dari HWPX. HWP lama dan reproduksi tata letak pengeditan asli yang presisi memerlukan alur kerja lain.

Contoh

dokumen.hwpx → bagian text.txt
  1. Pilih file dalam format HWPX. File maksimum per batch: 1.
  2. Tinjau Pemisah kolom tabel, lalu mulai memproses.
  3. Unduh hasil TXT dan periksa konten dan kualitasnya.
Apa yang harus diperiksa

HWPX dan HWP biner lama memiliki format yang berbeda. File dengan .hwp tidak akan terbuka.

Buka alatnya →

Ubah RTF menjadi Teks

Hapus pemformatan kontrol RTF yang didukung untuk salinan teks. Bandingkan karakter dan tabel khusus dengan sumbernya.

Contoh

document.rtf → teks biasa.txt
  1. Pilih file dalam format RTF. File maksimum per batch: 1.
  2. Periksa format input dan urutan file, lalu mulai memproses.
  3. Unduh hasil TXT dan periksa konten dan kualitasnya.
Apa yang harus diperiksa

Teks diekstraksi, bukan tata letak halaman asli. Gambar, pemformatan, dan objek yang disematkan tidak dipertahankan. OCR tidak dijalankan.

Teks kaya berisi kata-kata kontrol untuk pemformatan dan pengkodean karakter. Ini dihapus atau dievaluasi selama ekspor teks. Periksa karakter khusus dan halaman kode lama di hasilnya; gambar yang disematkan tidak diekstraksi.

Buka alatnya →

Ubah MARKDOWN menjadi HTML

Ekspor tulisan Markdown sebagai HTML. Periksa bagaimana judul, daftar, dan paragraf yang didukung dirender.

Contoh

# Judul + paragraf → document.html
  1. Pilih file dalam format MD, MARKDOWN. File maksimum per batch: 1.
  2. Tinjau Gaya dokumen HTML, Buka tautan di tab baru, lalu mulai memproses.
  3. Unduh hasil HTML dan periksa konten dan kualitasnya.
Apa yang harus diperiksa

Sintaks Penurunan Harga Terbatas didukung. Tabel kompleks, sel multi-baris, ekstensi, dan skrip tidak sepenuhnya diadopsi.

Buka alatnya →

Ubah HTML menjadi Teks

Ekstrak teks dari file HTML. Ini tidak mengunjungi URL untuk mengikis situs web yang aktif.

Contoh

halaman tersimpan.html → teks.txt yang dapat dibaca
  1. Pilih file dalam format HTML, HTM. File maksimum per batch: 1.
  2. Periksa format input dan urutan file, lalu mulai memproses.
  3. Unduh hasil TXT dan periksa konten dan kualitasnya.
Apa yang harus diperiksa

Konten yang dimuat ulang melalui JavaScript tidak diambil atau dijalankan. Tata letak CSS tidak dipertahankan.

Buka alatnya →

Baca HWPX

Baca paragraf, tabel, dan gambar HWPX yang didukung, lalu ekstrak teks. HWP lawas dan pengeditan tata letak presisi tidak didukung.

Contoh

document.hwpx → pratinjau konten yang didukung + TXTBuka alatnya →

Bersihkan daftar teks

Bersihkan bagian yang kosong, duplikat, dan spasi dalam daftar satu item per baris. Urutkan hanya jika ingin mengubah urutan.

Contoh

item baris berulang → daftar baris dibersihkanBuka alatnya →

Unicode dinormalisasi

Normalisasikan Unicode yang disusun secara berbeda, termasuk teks Korea yang terurai. Normalisasi kompatibilitas dapat mengubah karakter.

Contoh

teks terurai + NFC → teks tersusunBuka alatnya →

Karakter yang tidak terlihat

Periksa teks yang disalin untuk karakter yang tidak terlihat dan tinjau posisi dan titik kode sebelum dihapus.

Contoh

teks dengan karakter tak terlihat → laporan lokasi/titik kodeBuka alatnya →

Hapus jeda baris

Bergabunglah dengan jeda baris yang tidak diinginkan dalam prosa yang disalin. Tabel, puisi, dan daftar dapat bergantung pada jeda baris yang disengaja.

Contoh

prosa terbungkus + paragraf kosong → paragraf gabunganBuka alatnya →

Periksa informasi tersembunyi di file Office

Periksa metadata penulis, komentar, dan jejak konten tersembunyi sebelum berbagi file Office, lalu edit di aplikasi sumber.

Contoh

File Office → laporan inspeksi informasi tersembunyiBuka alatnya →

Panduan ini menjelaskan alat web publik dan batas dukungannya. Simpan yang asli dan periksa hasil unduhan. Coverton · Koreksi dan kontak

Terjemahan ini disiapkan dengan bantuan perangkat lunak. Anda juga dapat membaca versi bahasa Inggris. Baca dalam bahasa Inggris