DOCX, HWPX और कॉपी किए गए दस्तावेज़ों से टेक्स्ट निकालें और साफ़ करें
किसी दस्तावेज़ को TXT के रूप में सहेजने से उसके शब्द पुन: प्रयोज्य हो जाते हैं, लेकिन मूल पृष्ठ लेआउट या फ़ॉर्मेटिंग बरकरार नहीं रहती है। DOCX, PPTX, ODT, EPUB, HWPX या RTF के लिए टूल का चयन करें, फिर स्रोत के साथ महत्वपूर्ण पाठ की तुलना करें।
निःशुल्क टूल का उपयोग करें →पहले कोरियाई दस्तावेज़ प्रारूप की जाँच करें
HWPX रीडर समर्थित पैराग्राफ, तालिकाओं और चित्रों को संभालता है। लीगेसी HWP असमर्थित है, और पाठक मूल फ़ॉन्ट, आकार, समीकरण या पेजिनेशन को पुन: उत्पन्न नहीं करता है। सबमिशन मूल को सुरक्षित रखें और पाठ के पुन: उपयोग के लिए TXT परिणाम का उपयोग करें।
लाइन ब्रेक और अदृश्य वर्णों को सावधानीपूर्वक साफ करें
कॉपी किया गया-PDF क्लीनअप रिक्त-पंक्ति-पृथक पैराग्राफ को बनाए रखते हुए आंतरिक लाइन ब्रेक को जोड़ता है। स्रोत के सामने तालिकाओं, कविताओं और सूचियों की समीक्षा करें। वैकल्पिक अदृश्य-वर्ण निष्कासन केवल U+200B और BOM को प्रभावित करता है। NFKC और NFKD सामान्यीकरण भी संगतता वर्ण बदलते हैं।
रूपांतरण गोपनीयता निरीक्षण से भिन्न है
Markdown-to-HTML दस्तावेज़ मार्कअप को परिवर्तित करता है; HTML-to-TXT टैग और लेआउट को हटा देता है। Office इंस्पेक्टर लेखक की जानकारी, टिप्पणियाँ, छिपी हुई शीट और बाहरी-लिंक निशान की रिपोर्ट करता है। केवल एक रिपोर्ट का मतलब यह नहीं है कि उन वस्तुओं को फ़ाइल से हटा दिया गया है।
सही उपकरण चुनें
उदाहरण इनपुट वर्कफ़्लो को दर्शाते हैं; वे किसी विशेष फ़ाइल आकार, पहचान सटीकता या अनुकूलता का वादा नहीं करते हैं।
DOCX को टेक्स्ट में बदलें
खोजने या व्यवस्थित करने के लिए पाठ निकालें. TXT कॉपी दस्तावेज़ लेआउट या चित्रों को पुन: प्रस्तुत नहीं करती है।
उदाहरण
document.docx → निकाला गया text.txt- DOCX फ़ाइलें चुनें। अधिकतम संख्या: 1।
- सेटिंग (दस्तावेज़ विभाजक) जाँचें और प्रोसेसिंग शुरू करें।
- TXT नतीजा डाउनलोड करें और उसकी सामग्री व गुणवत्ता जाँचें।
क्या जांच करनी है
सिर्फ़ टेक्स्ट निकलता है, मूल पेज लेआउट नहीं। चित्र, फ़ॉर्मैटिंग और एम्बेडेड ऑब्जेक्ट नहीं रहते। OCR नहीं होता।
Word दस्तावेज़ के पैकेज से टेक्स्ट पढ़ा जाता है। परिणाम में टेबल और टेक्स्ट बॉक्स जाँचें; उनका दृश्य लेआउट नहीं रखा जाता। पुराने बाइनरी .doc समर्थित नहीं हैं।
PPTX को टेक्स्ट में बदलें
स्लाइड टेक्स्ट को एक कार्यशील प्रतिलेख में एकत्रित करें। एक विभाजक चुनें और निष्कर्षण क्रम की समीक्षा करें।
उदाहरण
स्लाइड्स.पीपीटीएक्स → स्लाइड से अलग किया गया टेक्स्ट.txt- PPTX फ़ाइलें चुनें। अधिकतम संख्या: 1।
- सेटिंग (दस्तावेज़ विभाजक) जाँचें और प्रोसेसिंग शुरू करें।
- TXT नतीजा डाउनलोड करें और उसकी सामग्री व गुणवत्ता जाँचें।
क्या जांच करनी है
पढ़ने का क्रम टेक्स्ट बॉक्स की दिखती जगह से अलग हो सकता है। चित्र या बोले गए शब्द ट्रांसक्राइब नहीं होते।
ODT को टेक्स्ट में बदलें
OpenDocument फ़ाइल से सादा पाठ निकालें। TXT में तालिकाएँ, फ़ॉन्ट और पेजिनेशन संरक्षित नहीं हैं।
उदाहरण
document.odt → निकाला गया text.txt- ODT फ़ाइलें चुनें। अधिकतम संख्या: 1।
- सेटिंग (दस्तावेज़ विभाजक) जाँचें और प्रोसेसिंग शुरू करें।
- TXT नतीजा डाउनलोड करें और उसकी सामग्री व गुणवत्ता जाँचें।
क्या जांच करनी है
सिर्फ़ टेक्स्ट निकलता है, मूल पेज लेआउट नहीं। चित्र, फ़ॉर्मैटिंग और एम्बेडेड ऑब्जेक्ट नहीं रहते। OCR नहीं होता।
OpenDocument में टेक्स्ट और स्टाइल अलग रखे जाते हैं। TXT टेम्पलेट, कॉलम या पेज ब्रेक को स्थिर लेआउट के रूप में नहीं रखता। एक्सपोर्ट के बाद सूची और टेबल जाँचें।
EPUB को टेक्स्ट में बदलें
व्यक्तिगत वर्कफ़्लो के लिए समर्थित EPUB से टेक्स्ट एकत्र करें। संरक्षित पुस्तकों और जटिल पठन लेआउट के लिए समर्थन की जाँच करें।
उदाहरण
Book.epub → सादा पठन text.txt- EPUB फ़ाइलें चुनें। अधिकतम संख्या: 1।
- सेटिंग (दस्तावेज़ विभाजक) जाँचें और प्रोसेसिंग शुरू करें।
- TXT नतीजा डाउनलोड करें और उसकी सामग्री व गुणवत्ता जाँचें।
क्या जांच करनी है
DRM-सुरक्षित किताबें समर्थित नहीं हैं। TXT में नेविगेशन, टाइपोग्राफ़ी और चित्र नहीं बचते।
HWPX को टेक्स्ट में बदलें
HWPX से टेक्स्ट निकालें. लीगेसी HWP और मूल संपादन लेआउट के सटीक पुनरुत्पादन के लिए अन्य वर्कफ़्लो की आवश्यकता होती है।
उदाहरण
document.hwpx → अनुभाग text.txt- HWPX फ़ाइलें चुनें। अधिकतम संख्या: 1।
- सेटिंग (दस्तावेज़ विभाजक) जाँचें और प्रोसेसिंग शुरू करें।
- TXT नतीजा डाउनलोड करें और उसकी सामग्री व गुणवत्ता जाँचें।
क्या जांच करनी है
HWPX और पुराने बाइनरी HWP अलग फ़ॉर्मैट हैं। .hwp फ़ाइलें नहीं खुलतीं।
RTF को टेक्स्ट में बदलें
टेक्स्ट कॉपी के लिए समर्थित आरटीएफ नियंत्रण फ़ॉर्मेटिंग हटाएं। स्रोत के साथ विशेष वर्णों और तालिकाओं की तुलना करें।
उदाहरण
document.rtf → सादा text.txt- RTF फ़ाइलें चुनें। अधिकतम संख्या: 1।
- इनपुट फ़ॉर्मैट और फ़ाइलों का क्रम जाँचकर प्रोसेसिंग शुरू करें।
- TXT नतीजा डाउनलोड करें और उसकी सामग्री व गुणवत्ता जाँचें।
क्या जांच करनी है
सिर्फ़ टेक्स्ट निकलता है, मूल पेज लेआउट नहीं। चित्र, फ़ॉर्मैटिंग और एम्बेडेड ऑब्जेक्ट नहीं रहते। OCR नहीं होता।
Rich Text में फ़ॉर्मैटिंग और एन्कोडिंग के कंट्रोल शब्द होते हैं, जिन्हें टेक्स्ट निकालते समय हटाया या समझा जाता है। विशेष अक्षर और पुराने कोडपेज जाँचें; एम्बेड किए चित्र नहीं निकाले जाते।
MARKDOWN को HTML में बदलें
मार्कडाउन लेखन को HTML के रूप में निर्यात करें। जाँचें कि समर्थित शीर्षक, सूचियाँ और पैराग्राफ कैसे प्रस्तुत होते हैं।
उदाहरण
# शीर्षक + पैराग्राफ → document.html- MD, MARKDOWN फ़ाइलें चुनें। अधिकतम संख्या: 1।
- सेटिंग (HTML दस्तावेज़ स्टाइल, लिंक नए टैब में खोलें) जाँचें और प्रोसेसिंग शुरू करें।
- HTML नतीजा डाउनलोड करें और उसकी सामग्री व गुणवत्ता जाँचें।
क्या जांच करनी है
सीमित Markdown सिंटैक्स समर्थित है। जटिल टेबल, कई पंक्तियों वाले सेल, एक्सटेंशन और स्क्रिप्ट पूरी तरह नहीं बचते।
HTML को टेक्स्ट में बदलें
HTML फ़ाइल से टेक्स्ट निकालें. यह किसी लाइव वेबसाइट को स्क्रैप करने के लिए URL पर नहीं जाता है।
उदाहरण
save-page.html → पठनीय text.txt- HTML, HTM फ़ाइलें चुनें। अधिकतम संख्या: 1।
- इनपुट फ़ॉर्मैट और फ़ाइलों का क्रम जाँचकर प्रोसेसिंग शुरू करें।
- TXT नतीजा डाउनलोड करें और उसकी सामग्री व गुणवत्ता जाँचें।
क्या जांच करनी है
JavaScript से लोड सामग्री न मँगाई जाती है न चलाई जाती है। CSS लेआउट नहीं रहता।
HWPX पढ़ें
समर्थित HWPX पैराग्राफ, तालिकाएँ और चित्र पढ़ें और पाठ निकालें। लीगेसी HWP और सटीक लेआउट संपादन समर्थित नहीं हैं।
उदाहरण
document.hwpx → समर्थित सामग्री पूर्वावलोकन + TXTटूल खोलें →साफ़ पाठ सूची
एक-आइटम-प्रति-पंक्ति सूचियों में रिक्त स्थान, डुप्लिकेट और रिक्त स्थान साफ़ करें। केवल तभी क्रमबद्ध करें जब क्रम बदलने का इरादा हो।
उदाहरण
बार-बार पंक्ति वस्तुएँ → साफ़ की गई पंक्ति सूचीटूल खोलें →यूनिकोड सामान्यीकरण
विघटित कोरियाई पाठ सहित, भिन्न रूप से रचित यूनिकोड को सामान्यीकृत करें। संगतता सामान्यीकरण वर्णों को बदल सकता है।
उदाहरण
विघटित पाठ + एनएफसी → रचित पाठटूल खोलें →अदृश्य पात्र
अदृश्य वर्णों के लिए कॉपी किए गए पाठ का निरीक्षण करें और हटाने से पहले स्थिति और कोड बिंदुओं की समीक्षा करें।
उदाहरण
अदृश्य वर्णों वाला पाठ → स्थान/कोड-बिंदु रिपोर्टटूल खोलें →लाइन ब्रेक हटाएं
नकल किए गए गद्य में अवांछित पंक्ति विराम जोड़ें। तालिकाएँ, कविताएँ और सूचियाँ जानबूझकर लाइन ब्रेक पर निर्भर हो सकती हैं।
उदाहरण
लपेटा हुआ गद्य + रिक्त अनुच्छेद → सम्मिलित अनुच्छेदटूल खोलें →Office फ़ाइलों में छिपी जानकारी का निरीक्षण करें
Office फ़ाइलों को साझा करने से पहले लेखक मेटाडेटा, टिप्पणियों और छिपी हुई सामग्री के निशानों का निरीक्षण करें, फिर उन्हें स्रोत एप्लिकेशन में संपादित करें।
उदाहरण
कार्यालय फ़ाइल → छिपी हुई जानकारी निरीक्षण रिपोर्टटूल खोलें →यह मार्गदर्शिका सार्वजनिक वेब टूल और उनकी समर्थन सीमाओं का वर्णन करती है। अपना मूल रखें और डाउनलोड किए गए परिणाम की जांच करें। Coverton · सुधार एवं संपर्क
यह अनुवाद सॉफ्टवेयर सहायता से तैयार किया गया था। आप अंग्रेजी संस्करण भी पढ़ सकते हैं। अंग्रेजी में पढ़ें