DOCX، HWPX اور کاپی شدہ دستاویزات سے متن نکالیں اور صاف کریں
کسی دستاویز کو TXT کے بطور محفوظ کرنا اس کے الفاظ کو دوبارہ قابل استعمال بناتا ہے، لیکن صفحہ کی اصل ترتیب یا فارمیٹنگ کو برقرار نہیں رکھتا ہے۔ DOCX, PPTX, ODT, EPUB, HWPX یا RTF کے لیے ٹول منتخب کریں، پھر ماخذ کے ساتھ اہم متن کا موازنہ کریں۔
مفت ٹول استعمال کریں۔ →پہلے کورین دستاویز کی شکل چیک کریں۔
HWPX ریڈر معاون پیراگراف، ٹیبلز اور تصاویر کو ہینڈل کرتا ہے۔ لیگیسی HWP غیر تعاون یافتہ ہے، اور قاری اصل فونٹس، اشکال، مساوات یا صفحہ بندی کو دوبارہ پیش نہیں کرتا ہے۔ جمع کرانے کی اصل کو محفوظ کریں اور متن کے دوبارہ استعمال کے لیے TXT نتیجہ استعمال کریں۔
لائن بریک اور پوشیدہ حروف کو احتیاط سے صاف کریں۔
کاپی شدہ-PDF کلین اپ خالی لائن سے علیحدہ پیراگراف کو برقرار رکھتے ہوئے اندرونی لائن بریکس میں شامل ہوتا ہے۔ ماخذ کے خلاف جدولوں، نظموں اور فہرستوں کا جائزہ لیں۔ اختیاری غیر مرئی کردار کو ہٹانا صرف U+200B اور BOM کو متاثر کرتا ہے۔ NFKC اور NFKD نارملائزیشن بھی مطابقت کے حروف کو تبدیل کرتی ہے۔
تبدیلی رازداری کے معائنے سے مختلف ہے۔
Markdown-to-HTML دستاویز کے مارک اپ کو تبدیل کرتا ہے۔ HTML-to-TXT ٹیگز اور لے آؤٹ کو مسترد کرتا ہے۔ Office انسپکٹر مصنف کی معلومات، تبصرے، پوشیدہ شیٹس اور بیرونی لنک کے نشانات کی رپورٹ کرتا ہے۔ اکیلے رپورٹ کا مطلب یہ نہیں ہے کہ وہ آئٹمز فائل سے ہٹا دیے گئے ہیں۔
صحیح ٹول کا انتخاب کریں۔
مثال کے ان پٹ ورک فلو کو واضح کرتے ہیں۔ وہ کسی خاص فائل کے سائز، شناخت کی درستگی یا مطابقت کا وعدہ نہیں کرتے ہیں۔
DOCX کو متن میں تبدیل کریں۔
تلاش کرنے یا ترتیب دینے کے لیے متن نکالیں۔ TXT کاپی دستاویز کی ترتیب یا تصاویر کو دوبارہ پیش نہیں کرتی ہے۔
مثال
document.docx → extracted text.txt- DOCX فارمیٹ میں فائلوں کا انتخاب کریں۔ فی بیچ زیادہ سے زیادہ فائلیں: 1۔
- ٹیبل کالم الگ کرنے والا کا جائزہ لیں، پھر کارروائی شروع کریں۔
- TXT نتیجہ ڈاؤن لوڈ کریں اور اس کا مواد اور معیار چیک کریں۔
کیا چیک کرنا ہے۔
متن نکالا گیا ہے، اصل صفحہ کی ترتیب نہیں۔ امیجز، فارمیٹنگ، اور ایمبیڈڈ اشیاء کو برقرار نہیں رکھا جاتا ہے۔ OCR پر عمل نہیں ہوتا ہے۔
ورڈ دستاویزات کے ساتھ، متن کے حصے دستاویز کے پیکج سے پڑھے جاتے ہیں۔ نتیجہ میں ٹیبلز اور ٹیکسٹ فیلڈز چیک کریں۔ ان کا بصری انتظام نہیں اپنایا جاتا ہے۔ پرانی بائنری .doc فائلیں تعاون یافتہ نہیں ہیں۔
PPTX کو متن میں تبدیل کریں۔
سلائیڈ ٹیکسٹ کو ورکنگ ٹرانسکرپٹ میں جمع کریں۔ ایک الگ کرنے والا منتخب کریں اور نکالنے کے آرڈر کا جائزہ لیں۔
مثال
slides.pptx → slide-separated text.txt- PPTX فارمیٹ میں فائلوں کا انتخاب کریں۔ فی بیچ زیادہ سے زیادہ فائلیں: 1۔
- ٹیبل کالم الگ کرنے والا کا جائزہ لیں، پھر کارروائی شروع کریں۔
- TXT نتیجہ ڈاؤن لوڈ کریں اور اس کا مواد اور معیار چیک کریں۔
کیا چیک کرنا ہے۔
پڑھنے کی ترتیب ٹیکسٹ فیلڈز کی مرئی پوزیشن سے مختلف ہو سکتی ہے۔ تصاویر اور بولے گئے مواد کو نقل نہیں کیا گیا ہے۔
ODT کو متن میں تبدیل کریں۔
OpenDocument فائل سے سادہ متن نکالیں۔ ٹیبلز، فونٹس اور صفحہ بندی TXT میں محفوظ نہیں ہیں۔
مثال
document.odt → extracted text.txt- ODT فارمیٹ میں فائلوں کا انتخاب کریں۔ فی بیچ زیادہ سے زیادہ فائلیں: 1۔
- ٹیبل کالم الگ کرنے والا کا جائزہ لیں، پھر کارروائی شروع کریں۔
- TXT نتیجہ ڈاؤن لوڈ کریں اور اس کا مواد اور معیار چیک کریں۔
کیا چیک کرنا ہے۔
متن نکالا گیا ہے، اصل صفحہ کی ترتیب نہیں۔ امیجز، فارمیٹنگ، اور ایمبیڈڈ اشیاء کو برقرار نہیں رکھا جاتا ہے۔ OCR پر عمل نہیں ہوتا ہے۔
OpenDocument متن اور اسٹائل کو الگ الگ اسٹور کرتا ہے۔ TXT آؤٹ پٹ ٹیمپلیٹس، کالم یا صفحہ کے وقفے کو ایک مقررہ ترتیب کے طور پر نہیں اپناتا ہے۔ برآمد کے بعد فہرستیں اور میزیں چیک کریں۔
EPUB کو متن میں تبدیل کریں۔
ذاتی ورک فلو کے لیے تعاون یافتہ EPUB سے متن جمع کریں۔ محفوظ کتابوں اور پیچیدہ پڑھنے کے لے آؤٹ کے لیے سپورٹ چیک کریں۔
مثال
book.epub → سادہ پڑھنا text.txt- EPUB فارمیٹ میں فائلوں کا انتخاب کریں۔ فی بیچ زیادہ سے زیادہ فائلیں: 1۔
- ٹیبل کالم الگ کرنے والا کا جائزہ لیں، پھر کارروائی شروع کریں۔
- TXT نتیجہ ڈاؤن لوڈ کریں اور اس کا مواد اور معیار چیک کریں۔
کیا چیک کرنا ہے۔
DRM سے محفوظ کتابیں تعاون یافتہ نہیں ہیں۔ نیویگیشن، ٹائپوگرافی اور عکاسی TXT میں گم ہو گئی ہے۔
HWPX کو متن میں تبدیل کریں۔
HWPX سے متن نکالیں۔ میراثی HWP اور اصل ترمیمی ترتیب کی درست تولید کے لیے دوسرے ورک فلو کی ضرورت ہوتی ہے۔
مثال
document.hwpx → سیکشن text.txt- HWPX فارمیٹ میں فائلوں کا انتخاب کریں۔ فی بیچ زیادہ سے زیادہ فائلیں: 1۔
- ٹیبل کالم الگ کرنے والا کا جائزہ لیں، پھر کارروائی شروع کریں۔
- TXT نتیجہ ڈاؤن لوڈ کریں اور اس کا مواد اور معیار چیک کریں۔
کیا چیک کرنا ہے۔
HWPX اور پرانے بائنری HWP مختلف فارمیٹس ہیں۔ .hwp والی فائلیں نہیں کھلیں گی۔
RTF کو متن میں تبدیل کریں۔
ٹیکسٹ کاپی کے لیے تعاون یافتہ RTF کنٹرول فارمیٹنگ کو ہٹا دیں۔ ماخذ کے ساتھ خصوصی حروف اور جدولوں کا موازنہ کریں۔
مثال
document.rtf → سادہ text.txt- RTF فارمیٹ میں فائلوں کا انتخاب کریں۔ فی بیچ زیادہ سے زیادہ فائلیں: 1۔
- ان پٹ فارمیٹ اور فائل آرڈر کو چیک کریں، پھر پروسیسنگ شروع کریں۔
- TXT نتیجہ ڈاؤن لوڈ کریں اور اس کا مواد اور معیار چیک کریں۔
کیا چیک کرنا ہے۔
متن نکالا گیا ہے، اصل صفحہ کی ترتیب نہیں۔ امیجز، فارمیٹنگ، اور ایمبیڈڈ اشیاء کو برقرار نہیں رکھا جاتا ہے۔ OCR پر عمل نہیں ہوتا ہے۔
رچ ٹیکسٹ فارمیٹنگ اور کریکٹر انکوڈنگ کے لیے کنٹرول الفاظ پر مشتمل ہے۔ ٹیکسٹ ایکسپورٹ کے دوران ان کو ہٹایا یا جانچا جاتا ہے۔ نتیجہ میں خصوصی حروف اور پرانے کوڈ کے صفحات کو چیک کریں۔ سرایت شدہ تصاویر نہیں نکالی جاتی ہیں۔
MARKDOWN کو HTML میں تبدیل کریں۔
مارک ڈاؤن تحریر کو HTML کے بطور برآمد کریں۔ چیک کریں کہ کس طرح معاون عنوانات، فہرستیں اور پیراگراف پیش کرتے ہیں۔
مثال
# سرخی + پیراگراف → document.html- MD, MARKDOWN فارمیٹ میں فائلوں کا انتخاب کریں۔ فی بیچ زیادہ سے زیادہ فائلیں: 1۔
- HTML دستاویز کا انداز, لنکس کو ایک نئے ٹیب میں کھولیں۔ کا جائزہ لیں، پھر کارروائی شروع کریں۔
- HTML نتیجہ ڈاؤن لوڈ کریں اور اس کا مواد اور معیار چیک کریں۔
کیا چیک کرنا ہے۔
محدود مارک ڈاون نحو تعاون یافتہ ہے۔ پیچیدہ میزیں، کثیر قطار سیل، ایکسٹینشنز اور اسکرپٹس کو مکمل طور پر اپنایا نہیں گیا ہے۔
HTML کو متن میں تبدیل کریں۔
HTML فائل سے متن نکالیں۔ یہ کسی لائیو ویب سائٹ کو سکریپ کرنے کے لیے یو آر ایل پر نہیں جاتا ہے۔
مثال
saved-page.html → پڑھنے کے قابل text.txt- HTML, HTM فارمیٹ میں فائلوں کا انتخاب کریں۔ فی بیچ زیادہ سے زیادہ فائلیں: 1۔
- ان پٹ فارمیٹ اور فائل آرڈر کو چیک کریں، پھر پروسیسنگ شروع کریں۔
- TXT نتیجہ ڈاؤن لوڈ کریں اور اس کا مواد اور معیار چیک کریں۔
کیا چیک کرنا ہے۔
جاوا اسکرپٹ کے ذریعے دوبارہ لوڈ کیا گیا مواد بازیافت یا عمل میں نہیں لایا جاتا ہے۔ سی ایس ایس لے آؤٹ محفوظ نہیں ہے۔
HWPX پڑھیں
تعاون یافتہ HWPX پیراگراف، ٹیبلز اور تصاویر پڑھیں اور متن نکالیں۔ لیگیسی HWP اور درست ترتیب میں ترمیم غیر تعاون یافتہ ہے۔
مثال
document.hwpx → معاون مواد کا پیش نظارہ + TXTٹول کھولیں۔ →متن کی فہرست کو صاف کریں۔
ایک آئٹم فی لائن فہرستوں میں خالی جگہیں، ڈپلیکیٹس اور وائٹ اسپیس صاف کریں۔ ترتیب صرف اس صورت میں کریں جب ترتیب کو تبدیل کرنا مقصود ہو۔
مثال
بار بار لائن آئٹمز → صاف لائن کی فہرستٹول کھولیں۔ →یونیکوڈ کو معمول بنائیں
مختلف طریقے سے بنائے گئے یونی کوڈ کو معمول بنائیں، بشمول سڑے ہوئے کوریائی متن۔ مطابقت کو معمول بنانا حروف کو تبدیل کر سکتا ہے۔
مثال
سڑا ہوا متن + NFC → تحریر شدہ متنٹول کھولیں۔ →غیر مرئی کردار
غیر مرئی حروف کے لیے کاپی شدہ متن کا معائنہ کریں اور ہٹانے سے پہلے پوزیشنز اور کوڈ پوائنٹس کا جائزہ لیں۔
مثال
غیر مرئی حروف کے ساتھ متن → مقام/کوڈ پوائنٹ رپورٹٹول کھولیں۔ →لائن بریکس کو ہٹا دیں۔
نقل شدہ نثر میں ناپسندیدہ لائن بریکس میں شامل ہوں۔ میزیں، نظمیں اور فہرستیں جان بوجھ کر لائن کے وقفے پر منحصر ہو سکتی ہیں۔
مثال
لپیٹے ہوئے نثر + خالی پیراگراف → شامل پیراگرافٹول کھولیں۔ →آفس فائلوں میں چھپی ہوئی معلومات کا معائنہ کریں۔
آفس فائلوں کو شیئر کرنے سے پہلے مصنف کے میٹا ڈیٹا، تبصروں اور چھپے ہوئے مواد کے نشانات کا معائنہ کریں، پھر سورس ایپلی کیشن میں ان میں ترمیم کریں۔
مثال
آفس فائل → پوشیدہ معلومات کے معائنے کی رپورٹٹول کھولیں۔ →یہ گائیڈ عوامی ویب ٹولز اور ان کی سپورٹ کی حدود کو بیان کرتا ہے۔ اپنا اصل رکھیں اور ڈاؤن لوڈ کردہ نتیجہ چیک کریں۔ Coverton · تصحیح اور رابطہ
یہ ترجمہ سافٹ ویئر کی مدد سے تیار کیا گیا تھا۔ آپ انگریزی ورژن بھی پڑھ سکتے ہیں۔ انگریزی میں پڑھیں