แยกและล้างข้อความจาก DOCX, HWPX และเอกสารที่คัดลอก
การบันทึกเอกสารเนื่องจาก TXT ทำให้คำต่างๆ สามารถนำมาใช้ซ้ำได้ แต่จะไม่คงเค้าโครงหน้าหรือการจัดรูปแบบเดิมไว้ เลือกเครื่องมือสำหรับ DOCX, PPTX, ODT, EPUB, HWPX หรือ RTF จากนั้นเปรียบเทียบข้อความสำคัญกับแหล่งที่มา
ใช้เครื่องมือฟรี →ตรวจสอบรูปแบบเอกสารภาษาเกาหลีก่อน
เครื่องอ่าน HWPX รองรับย่อหน้า ตาราง และรูปภาพ ไม่รองรับ HWP รุ่นเก่า และเครื่องอ่านจะไม่สร้างแบบอักษร รูปร่าง สมการ หรือการแบ่งหน้าต้นฉบับขึ้นมาใหม่ เก็บต้นฉบับที่ส่งไว้และใช้ผลลัพธ์ TXT เพื่อนำข้อความไปใช้ซ้ำ
ทำความสะอาดตัวแบ่งบรรทัดและอักขระที่มองไม่เห็นอย่างระมัดระวัง
การล้างข้อมูลที่คัดลอก-PDF รวมตัวแบ่งบรรทัดภายในในขณะที่ยังคงรักษาย่อหน้าที่คั่นด้วยบรรทัดว่าง ทบทวนตาราง บทกวี และรายการเทียบกับแหล่งที่มา ตัวเลือกการลบอักขระที่มองไม่เห็นมีผลกับ U+200B และ BOM เท่านั้น การทำให้เป็นมาตรฐานของ NFKC และ NFKD ยังเปลี่ยนอักขระที่เข้ากันได้ด้วย
การแปลงแตกต่างจากการตรวจสอบความเป็นส่วนตัว
Markdown-to-HTML แปลงมาร์กอัปเอกสาร HTML-to-TXT ละทิ้งแท็กและโครงร่าง ตัวตรวจสอบ Office จะรายงานข้อมูลผู้เขียน ความคิดเห็น แผ่นงานที่ซ่อน และการติดตามลิงก์ภายนอก รายงานเพียงอย่างเดียวไม่ได้หมายความว่ารายการเหล่านั้นถูกลบออกจากไฟล์แล้ว
เลือกเครื่องมือที่เหมาะสม
อินพุตตัวอย่างแสดงขั้นตอนการทำงาน พวกเขาไม่ได้รับประกันขนาดไฟล์ ความแม่นยำในการจดจำ หรือความเข้ากันได้โดยเฉพาะ
แปลง DOCX เป็น ข้อความ
แยกข้อความเพื่อค้นหาหรือจัดระเบียบ สำเนา TXT จะไม่สร้างเค้าโครงเอกสารหรือรูปภาพขึ้นมาใหม่
ตัวอย่าง
document.docx → แตก text.txt- เลือกไฟล์ในรูปแบบ DOCX จำนวนไฟล์สูงสุดต่อแบตช์: 1
- ตรวจสอบ ตัวคั่นคอลัมน์ตาราง จากนั้นเริ่มการประมวลผล
- ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ
ข้อความถูกแยกออก ไม่ใช่เค้าโครงหน้าเดิม รูปภาพ การจัดรูปแบบ และออบเจ็กต์ที่ฝังจะไม่ถูกเก็บไว้ OCR ไม่ได้ถูกดำเนินการ
สำหรับเอกสาร Word ส่วนของข้อความจะถูกอ่านจากแพ็คเกจเอกสาร ตรวจสอบตารางและช่องข้อความในผลลัพธ์ ไม่มีการจัดเรียงภาพของพวกเขา ไม่รองรับไฟล์ไบนารี .doc เก่า
แปลง PPTX เป็น ข้อความ
รวบรวมข้อความสไลด์ลงในสำเนาที่ใช้งานได้ เลือกตัวคั่นและตรวจสอบลำดับการแยก
ตัวอย่าง
slides.pptx → text.txt ที่คั่นด้วยสไลด์- เลือกไฟล์ในรูปแบบ PPTX จำนวนไฟล์สูงสุดต่อแบตช์: 1
- ตรวจสอบ ตัวคั่นคอลัมน์ตาราง จากนั้นเริ่มการประมวลผล
- ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ
ลำดับการอ่านอาจแตกต่างไปจากตำแหน่งที่มองเห็นได้ของช่องข้อความ รูปภาพและเนื้อหาคำพูดไม่ได้รับการถอดเสียง
แปลง ODT เป็น ข้อความ
แยกข้อความธรรมดาออกจากไฟล์ OpenDocument ตาราง แบบอักษร และการแบ่งหน้าจะไม่ถูกเก็บรักษาไว้ใน TXT
ตัวอย่าง
document.odt → แยก text.txt- เลือกไฟล์ในรูปแบบ ODT จำนวนไฟล์สูงสุดต่อแบตช์: 1
- ตรวจสอบ ตัวคั่นคอลัมน์ตาราง จากนั้นเริ่มการประมวลผล
- ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ
ข้อความถูกแยกออก ไม่ใช่เค้าโครงหน้าเดิม รูปภาพ การจัดรูปแบบ และออบเจ็กต์ที่ฝังจะไม่ถูกเก็บไว้ OCR ไม่ได้ถูกดำเนินการ
OpenDocument จะจัดเก็บข้อความและสไตล์แยกกัน เอาต์พุต TXT ไม่ใช้เทมเพลต คอลัมน์ หรือตัวแบ่งหน้าเป็นเค้าโครงคงที่ ตรวจสอบรายการและตารางหลังการส่งออก
แปลง EPUB เป็น ข้อความ
รวบรวมข้อความจาก EPUB ที่รองรับสำหรับเวิร์กโฟลว์ส่วนตัว ตรวจสอบการรองรับหนังสือที่ได้รับการคุ้มครองและรูปแบบการอ่านที่ซับซ้อน
ตัวอย่าง
book.epub → ข้อความอ่านธรรมดา.txt- เลือกไฟล์ในรูปแบบ EPUB จำนวนไฟล์สูงสุดต่อแบตช์: 1
- ตรวจสอบ ตัวคั่นคอลัมน์ตาราง จากนั้นเริ่มการประมวลผล
- ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ
ไม่รองรับหนังสือที่มีการป้องกัน DRM การนำทาง การพิมพ์ และภาพประกอบหายไปใน TXT
แปลง HWPX เป็น ข้อความ
แยกข้อความจาก HWPX HWP รุ่นเก่าและการสร้างเค้าโครงการแก้ไขต้นฉบับที่แม่นยำต้องใช้ขั้นตอนการทำงานอื่น
ตัวอย่าง
document.hwpx → ส่วน text.txt- เลือกไฟล์ในรูปแบบ HWPX จำนวนไฟล์สูงสุดต่อแบตช์: 1
- ตรวจสอบ ตัวคั่นคอลัมน์ตาราง จากนั้นเริ่มการประมวลผล
- ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ
HWPX และ HWP ไบนารีรุ่นเก่ามีรูปแบบที่แตกต่างกัน ไฟล์ที่มี .hwp จะไม่เปิดขึ้น
แปลง RTF เป็น ข้อความ
ลบการจัดรูปแบบการควบคุม RTF ที่รองรับสำหรับสำเนาข้อความ เปรียบเทียบอักขระพิเศษและตารางกับแหล่งที่มา
ตัวอย่าง
document.rtf → ข้อความธรรมดา.txt- เลือกไฟล์ในรูปแบบ RTF จำนวนไฟล์สูงสุดต่อแบตช์: 1
- ตรวจสอบรูปแบบอินพุตและลำดับไฟล์ จากนั้นเริ่มการประมวลผล
- ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ
ข้อความถูกแยกออก ไม่ใช่เค้าโครงหน้าเดิม รูปภาพ การจัดรูปแบบ และออบเจ็กต์ที่ฝังจะไม่ถูกเก็บไว้ OCR ไม่ได้ถูกดำเนินการ
Rich Text มีคำควบคุมสำหรับการจัดรูปแบบและการเข้ารหัสอักขระ สิ่งเหล่านี้จะถูกลบออกหรือประเมินระหว่างการส่งออกข้อความ ตรวจสอบอักขระพิเศษและโค้ดเพจเก่าในผลลัพธ์ ภาพที่ฝังไว้จะไม่ถูกดึงออกมา
แปลง MARKDOWN เป็น HTML
ส่งออกการเขียน Markdown เป็น HTML ตรวจสอบว่าส่วนหัว รายการ และย่อหน้าได้รับการสนับสนุนอย่างไร
ตัวอย่าง
# หัวเรื่อง + ย่อหน้า → document.html- เลือกไฟล์ในรูปแบบ MD, MARKDOWN จำนวนไฟล์สูงสุดต่อแบตช์: 1
- ตรวจสอบ รูปแบบเอกสาร HTML, เปิดลิงก์ในแท็บใหม่ จากนั้นเริ่มการประมวลผล
- ดาวน์โหลดผลลัพธ์ HTML และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ
รองรับไวยากรณ์ Markdown แบบจำกัด ตารางที่ซับซ้อน เซลล์หลายแถว ส่วนขยาย และสคริปต์ยังไม่ถูกนำมาใช้อย่างสมบูรณ์
แปลง HTML เป็น ข้อความ
แยกข้อความออกจากไฟล์ HTML สิ่งนี้ไม่ได้ไปที่ URL เพื่อขูดเว็บไซต์สด
ตัวอย่าง
Saved-page.html → text.txt ที่อ่านได้- เลือกไฟล์ในรูปแบบ HTML, HTM จำนวนไฟล์สูงสุดต่อแบตช์: 1
- ตรวจสอบรูปแบบอินพุตและลำดับไฟล์ จากนั้นเริ่มการประมวลผล
- ดาวน์โหลดผลลัพธ์ TXT และตรวจสอบเนื้อหาและคุณภาพ
สิ่งที่ต้องตรวจสอบ
เนื้อหาที่โหลดซ้ำผ่าน JavaScript จะไม่ถูกดึงหรือดำเนินการ เค้าโครง CSS จะไม่ถูกรักษาไว้
อ่าน HWPX
อ่านย่อหน้า ตาราง และรูปภาพ HWPX ที่รองรับ และแยกข้อความ ไม่รองรับ HWP รุ่นเก่าและการแก้ไขเค้าโครงที่แม่นยำ
ตัวอย่าง
document.hwpx → ดูตัวอย่างเนื้อหาที่รองรับ + TXTเปิดเครื่องมือ →รายการข้อความที่สะอาด
ทำความสะอาดช่องว่าง ข้อมูลซ้ำ และช่องว่างในรายการแบบหนึ่งรายการต่อบรรทัด จัดเรียงเฉพาะเมื่อมีการเปลี่ยนลำดับเท่านั้น
ตัวอย่าง
รายการโฆษณาที่ซ้ำ → รายการบรรทัดที่ล้างแล้วเปิดเครื่องมือ →ยูนิโค้ดทำให้เป็นมาตรฐาน
ปรับ Unicode ที่มีองค์ประกอบต่างกันให้เป็นมาตรฐาน รวมถึงข้อความภาษาเกาหลีที่แยกส่วน การทำให้เป็นมาตรฐานความเข้ากันได้สามารถเปลี่ยนแปลงอักขระได้
ตัวอย่าง
ข้อความที่สลายตัว + NFC → ข้อความที่แต่งเปิดเครื่องมือ →ตัวอักษรที่มองไม่เห็น
ตรวจสอบข้อความที่คัดลอกเพื่อหาอักขระที่มองไม่เห็น และตรวจสอบตำแหน่งและจุดโค้ดก่อนนำออก
ตัวอย่าง
ข้อความที่มีอักขระที่มองไม่เห็น → รายงานตำแหน่ง/จุดโค้ดเปิดเครื่องมือ →ลบตัวแบ่งบรรทัด
เข้าร่วมการแบ่งบรรทัดที่ไม่ต้องการในร้อยแก้วที่คัดลอกมา ตาราง บทกวี และรายการอาจขึ้นอยู่กับการตั้งใจแบ่งบรรทัด
ตัวอย่าง
ร้อยแก้วห่อ + ย่อหน้าว่าง → ย่อหน้ารวมเปิดเครื่องมือ →ตรวจสอบข้อมูลที่ซ่อนอยู่ในไฟล์ Office
ตรวจสอบข้อมูลเมตาของผู้เขียน ความคิดเห็น และการติดตามเนื้อหาที่ซ่อนอยู่ก่อนแชร์ไฟล์ Office จากนั้นแก้ไขในแอปพลิเคชันต้นทาง
ตัวอย่าง
ไฟล์ Office → รายงานการตรวจสอบข้อมูลที่ซ่อนไว้เปิดเครื่องมือ →คู่มือนี้จะอธิบายเครื่องมือเว็บสาธารณะและขีดจำกัดการสนับสนุน เก็บต้นฉบับของคุณไว้และตรวจสอบผลลัพธ์ที่ดาวน์โหลด Coverton · การแก้ไขและการติดต่อ
การแปลนี้จัดทำขึ้นด้วยความช่วยเหลือของซอฟต์แวร์ คุณยังสามารถอ่านเวอร์ชันภาษาอังกฤษได้ อ่านเป็นภาษาอังกฤษ