ข้ามไปที่เนื้อหา
Coverton บล็อก
ในบทความนี้
เอกสารและข้อความ

แยกและล้างข้อความจาก DOCX, HWPX และเอกสารที่คัดลอก

การบันทึกเอกสารเนื่องจาก TXT ทำให้คำต่างๆ สามารถนำมาใช้ซ้ำได้ แต่จะไม่คงเค้าโครงหน้าหรือการจัดรูปแบบเดิมไว้ เลือกเครื่องมือสำหรับ DOCX, PPTX, ODT, EPUB, HWPX หรือ RTF จากนั้นเปรียบเทียบข้อความสำคัญกับแหล่งที่มา

ใช้เครื่องมือฟรี →

ตรวจสอบรูปแบบเอกสารภาษาเกาหลีก่อน

เครื่องอ่าน HWPX รองรับย่อหน้า ตาราง และรูปภาพ ไม่รองรับ HWP รุ่นเก่า และเครื่องอ่านจะไม่สร้างแบบอักษร รูปร่าง สมการ หรือการแบ่งหน้าต้นฉบับขึ้นมาใหม่ เก็บต้นฉบับที่ส่งไว้และใช้ผลลัพธ์ TXT เพื่อนำข้อความไปใช้ซ้ำ

ทำความสะอาดตัวแบ่งบรรทัดและอักขระที่มองไม่เห็นอย่างระมัดระวัง

การล้างข้อมูลที่คัดลอก-PDF รวมตัวแบ่งบรรทัดภายในในขณะที่ยังคงรักษาย่อหน้าที่คั่นด้วยบรรทัดว่าง ทบทวนตาราง บทกวี และรายการเทียบกับแหล่งที่มา ตัวเลือกการลบอักขระที่มองไม่เห็นมีผลกับ U+200B และ BOM เท่านั้น การทำให้เป็นมาตรฐานของ NFKC และ NFKD ยังเปลี่ยนอักขระที่เข้ากันได้ด้วย

การแปลงแตกต่างจากการตรวจสอบความเป็นส่วนตัว

Markdown-to-HTML แปลงมาร์กอัปเอกสาร HTML-to-TXT ละทิ้งแท็กและโครงร่าง ตัวตรวจสอบ Office จะรายงานข้อมูลผู้เขียน ความคิดเห็น แผ่นงานที่ซ่อน และการติดตามลิงก์ภายนอก รายงานเพียงอย่างเดียวไม่ได้หมายความว่ารายการเหล่านั้นถูกลบออกจากไฟล์แล้ว

เลือกเครื่องมือที่เหมาะสม

อินพุตตัวอย่างแสดงขั้นตอนการทำงาน พวกเขาไม่ได้รับประกันขนาดไฟล์ ความแม่นยำในการจดจำ หรือความเข้ากันได้โดยเฉพาะ

แปลง DOCX เป็น ข้อความ

แยกข้อความเพื่อค้นหาหรือจัดระเบียบ สำเนา TXT จะไม่สร้างเค้าโครงเอกสารหรือรูปภาพขึ้นมาใหม่

ตัวอย่าง

document.docx → แตก text.txt
  1. เลือกไฟล์ในรูปแบบ DOCX จำนวนไฟล์สูงสุดต่อแบตช์: 1
  2. ตรวจสอบ ตัวคั่นคอลัมน์ตาราง จากนั้นเริ่มการประมวลผล
  3. ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ

ข้อความถูกแยกออก ไม่ใช่เค้าโครงหน้าเดิม รูปภาพ การจัดรูปแบบ และออบเจ็กต์ที่ฝังจะไม่ถูกเก็บไว้ OCR ไม่ได้ถูกดำเนินการ

สำหรับเอกสาร Word ส่วนของข้อความจะถูกอ่านจากแพ็คเกจเอกสาร ตรวจสอบตารางและช่องข้อความในผลลัพธ์ ไม่มีการจัดเรียงภาพของพวกเขา ไม่รองรับไฟล์ไบนารี .doc เก่า

เปิดเครื่องมือ →

แปลง PPTX เป็น ข้อความ

รวบรวมข้อความสไลด์ลงในสำเนาที่ใช้งานได้ เลือกตัวคั่นและตรวจสอบลำดับการแยก

ตัวอย่าง

slides.pptx → text.txt ที่คั่นด้วยสไลด์
  1. เลือกไฟล์ในรูปแบบ PPTX จำนวนไฟล์สูงสุดต่อแบตช์: 1
  2. ตรวจสอบ ตัวคั่นคอลัมน์ตาราง จากนั้นเริ่มการประมวลผล
  3. ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ

ลำดับการอ่านอาจแตกต่างไปจากตำแหน่งที่มองเห็นได้ของช่องข้อความ รูปภาพและเนื้อหาคำพูดไม่ได้รับการถอดเสียง

เปิดเครื่องมือ →

แปลง ODT เป็น ข้อความ

แยกข้อความธรรมดาออกจากไฟล์ OpenDocument ตาราง แบบอักษร และการแบ่งหน้าจะไม่ถูกเก็บรักษาไว้ใน TXT

ตัวอย่าง

document.odt → แยก text.txt
  1. เลือกไฟล์ในรูปแบบ ODT จำนวนไฟล์สูงสุดต่อแบตช์: 1
  2. ตรวจสอบ ตัวคั่นคอลัมน์ตาราง จากนั้นเริ่มการประมวลผล
  3. ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ

ข้อความถูกแยกออก ไม่ใช่เค้าโครงหน้าเดิม รูปภาพ การจัดรูปแบบ และออบเจ็กต์ที่ฝังจะไม่ถูกเก็บไว้ OCR ไม่ได้ถูกดำเนินการ

OpenDocument จะจัดเก็บข้อความและสไตล์แยกกัน เอาต์พุต TXT ไม่ใช้เทมเพลต คอลัมน์ หรือตัวแบ่งหน้าเป็นเค้าโครงคงที่ ตรวจสอบรายการและตารางหลังการส่งออก

เปิดเครื่องมือ →

แปลง EPUB เป็น ข้อความ

รวบรวมข้อความจาก EPUB ที่รองรับสำหรับเวิร์กโฟลว์ส่วนตัว ตรวจสอบการรองรับหนังสือที่ได้รับการคุ้มครองและรูปแบบการอ่านที่ซับซ้อน

ตัวอย่าง

book.epub → ข้อความอ่านธรรมดา.txt
  1. เลือกไฟล์ในรูปแบบ EPUB จำนวนไฟล์สูงสุดต่อแบตช์: 1
  2. ตรวจสอบ ตัวคั่นคอลัมน์ตาราง จากนั้นเริ่มการประมวลผล
  3. ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ

ไม่รองรับหนังสือที่มีการป้องกัน DRM การนำทาง การพิมพ์ และภาพประกอบหายไปใน TXT

เปิดเครื่องมือ →

แปลง HWPX เป็น ข้อความ

แยกข้อความจาก HWPX HWP รุ่นเก่าและการสร้างเค้าโครงการแก้ไขต้นฉบับที่แม่นยำต้องใช้ขั้นตอนการทำงานอื่น

ตัวอย่าง

document.hwpx → ส่วน text.txt
  1. เลือกไฟล์ในรูปแบบ HWPX จำนวนไฟล์สูงสุดต่อแบตช์: 1
  2. ตรวจสอบ ตัวคั่นคอลัมน์ตาราง จากนั้นเริ่มการประมวลผล
  3. ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ

HWPX และ HWP ไบนารีรุ่นเก่ามีรูปแบบที่แตกต่างกัน ไฟล์ที่มี .hwp จะไม่เปิดขึ้น

เปิดเครื่องมือ →

แปลง RTF เป็น ข้อความ

ลบการจัดรูปแบบการควบคุม RTF ที่รองรับสำหรับสำเนาข้อความ เปรียบเทียบอักขระพิเศษและตารางกับแหล่งที่มา

ตัวอย่าง

document.rtf → ข้อความธรรมดา.txt
  1. เลือกไฟล์ในรูปแบบ RTF จำนวนไฟล์สูงสุดต่อแบตช์: 1
  2. ตรวจสอบรูปแบบอินพุตและลำดับไฟล์ จากนั้นเริ่มการประมวลผล
  3. ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ

ข้อความถูกแยกออก ไม่ใช่เค้าโครงหน้าเดิม รูปภาพ การจัดรูปแบบ และออบเจ็กต์ที่ฝังจะไม่ถูกเก็บไว้ OCR ไม่ได้ถูกดำเนินการ

Rich Text มีคำควบคุมสำหรับการจัดรูปแบบและการเข้ารหัสอักขระ สิ่งเหล่านี้จะถูกลบออกหรือประเมินระหว่างการส่งออกข้อความ ตรวจสอบอักขระพิเศษและโค้ดเพจเก่าในผลลัพธ์ ภาพที่ฝังไว้จะไม่ถูกดึงออกมา

เปิดเครื่องมือ →

แปลง MARKDOWN เป็น HTML

ส่งออกการเขียน Markdown เป็น HTML ตรวจสอบว่าส่วนหัว รายการ และย่อหน้าได้รับการสนับสนุนอย่างไร

ตัวอย่าง

# หัวเรื่อง + ย่อหน้า → document.html
  1. เลือกไฟล์ในรูปแบบ MD, MARKDOWN จำนวนไฟล์สูงสุดต่อแบตช์: 1
  2. ตรวจสอบ รูปแบบเอกสาร HTML, เปิดลิงก์ในแท็บใหม่ จากนั้นเริ่มการประมวลผล
  3. ดาวน์โหลดผลลัพธ์ HTML และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ

รองรับไวยากรณ์ Markdown แบบจำกัด ตารางที่ซับซ้อน เซลล์หลายแถว ส่วนขยาย และสคริปต์ยังไม่ถูกนำมาใช้อย่างสมบูรณ์

เปิดเครื่องมือ →

แปลง HTML เป็น ข้อความ

แยกข้อความออกจากไฟล์ HTML สิ่งนี้ไม่ได้ไปที่ URL เพื่อขูดเว็บไซต์สด

ตัวอย่าง

Saved-page.html → text.txt ที่อ่านได้
  1. เลือกไฟล์ในรูปแบบ HTML, HTM จำนวนไฟล์สูงสุดต่อแบตช์: 1
  2. ตรวจสอบรูปแบบอินพุตและลำดับไฟล์ จากนั้นเริ่มการประมวลผล
  3. ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ

เนื้อหาที่โหลดซ้ำผ่าน JavaScript จะไม่ถูกดึงหรือดำเนินการ เค้าโครง CSS จะไม่ถูกรักษาไว้

เปิดเครื่องมือ →

อ่าน HWPX

อ่านย่อหน้า ตาราง และรูปภาพ HWPX ที่รองรับ และแยกข้อความ ไม่รองรับ HWP รุ่นเก่าและการแก้ไขเค้าโครงที่แม่นยำ

ตัวอย่าง

document.hwpx → ดูตัวอย่างเนื้อหาที่รองรับ + TXTเปิดเครื่องมือ →

รายการข้อความที่สะอาด

ทำความสะอาดช่องว่าง ข้อมูลซ้ำ และช่องว่างในรายการแบบหนึ่งรายการต่อบรรทัด จัดเรียงเฉพาะเมื่อมีการเปลี่ยนลำดับเท่านั้น

ตัวอย่าง

รายการโฆษณาที่ซ้ำ → รายการบรรทัดที่ล้างแล้วเปิดเครื่องมือ →

ยูนิโค้ดทำให้เป็นมาตรฐาน

ปรับ Unicode ที่มีองค์ประกอบต่างกันให้เป็นมาตรฐาน รวมถึงข้อความภาษาเกาหลีที่แยกส่วน การทำให้เป็นมาตรฐานความเข้ากันได้สามารถเปลี่ยนแปลงอักขระได้

ตัวอย่าง

ข้อความที่สลายตัว + NFC → ข้อความที่แต่งเปิดเครื่องมือ →

ตัวอักษรที่มองไม่เห็น

ตรวจสอบข้อความที่คัดลอกเพื่อหาอักขระที่มองไม่เห็น และตรวจสอบตำแหน่งและจุดโค้ดก่อนนำออก

ตัวอย่าง

ข้อความที่มีอักขระที่มองไม่เห็น → รายงานตำแหน่ง/จุดโค้ดเปิดเครื่องมือ →

ลบตัวแบ่งบรรทัด

เข้าร่วมการแบ่งบรรทัดที่ไม่ต้องการในร้อยแก้วที่คัดลอกมา ตาราง บทกวี และรายการอาจขึ้นอยู่กับการตั้งใจแบ่งบรรทัด

ตัวอย่าง

ร้อยแก้วห่อ + ย่อหน้าว่าง → ย่อหน้ารวมเปิดเครื่องมือ →

ตรวจสอบข้อมูลที่ซ่อนอยู่ในไฟล์ Office

ตรวจสอบข้อมูลเมตาของผู้เขียน ความคิดเห็น และการติดตามเนื้อหาที่ซ่อนอยู่ก่อนแชร์ไฟล์ Office จากนั้นแก้ไขในแอปพลิเคชันต้นทาง

ตัวอย่าง

ไฟล์ Office → รายงานการตรวจสอบข้อมูลที่ซ่อนไว้เปิดเครื่องมือ →

คู่มือนี้จะอธิบายเครื่องมือเว็บสาธารณะและขีดจำกัดการสนับสนุน เก็บต้นฉบับของคุณไว้และตรวจสอบผลลัพธ์ที่ดาวน์โหลด Coverton · การแก้ไขและการติดต่อ

การแปลนี้จัดทำขึ้นด้วยความช่วยเหลือของซอฟต์แวร์ คุณยังสามารถอ่านเวอร์ชันภาษาอังกฤษได้ อ่านเป็นภาษาอังกฤษ