پرش به محتوا
Coverton وبلاگ
در این مقاله
اسناد و متن

استخراج و پاک کردن متن از DOCX، HWPX و اسناد کپی شده

ذخیره یک سند به عنوان TXT کلمات آن را قابل استفاده مجدد می کند، اما طرح بندی یا قالب بندی صفحه اصلی را حفظ نمی کند. ابزار DOCX، PPTX، ODT، EPUB، HWPX یا RTF را انتخاب کنید، سپس متن مهم را با منبع مقایسه کنید.

از ابزار رایگان استفاده کنید →

ابتدا فرمت سند کره ای را بررسی کنید

خواننده HWPX پاراگراف ها، جداول و تصاویر پشتیبانی شده را کنترل می کند. Legacy HWP پشتیبانی نمی‌شود و خواننده فونت‌ها، اشکال، معادلات یا صفحه‌بندی اصلی را بازتولید نمی‌کند. اصل ارسال را حفظ کنید و از نتیجه TXT برای استفاده مجدد از متن استفاده کنید.

خطوط تمیز و شخصیت های نامرئی را با دقت تمیز کنید

پاک‌سازی Copied-PDF با حفظ پاراگراف‌های جدا شده از خط خالی، به خطوط داخلی می‌پیوندد. جداول، اشعار و فهرست ها را بر اساس منبع مرور کنید. حذف اختیاری نویسه نامرئی فقط U+200B و BOM را تحت تأثیر قرار می دهد. عادی سازی NFKC و NFKD نیز کاراکترهای سازگاری را تغییر می دهند.

تبدیل با بازرسی حریم خصوصی متفاوت است

Markdown-به-HTML نشانه گذاری سند را تبدیل می کند. HTML به TXT برچسب‌ها و طرح‌بندی را کنار می‌گذارد. بازرس Office اطلاعات نویسنده، نظرات، برگه‌های پنهان و ردیابی پیوندهای خارجی را گزارش می‌کند. گزارش به تنهایی به این معنی نیست که آن موارد از فایل حذف شده اند.

ابزار مناسب را انتخاب کنید

ورودی های نمونه گردش کار را نشان می دهد. آنها اندازه فایل خاص، دقت تشخیص یا سازگاری را وعده نمی دهند.

DOCX را به متن تبدیل کنید

متن را برای جستجو یا سازماندهی استخراج کنید. کپی TXT طرح یا تصاویر سند را بازتولید نمی کند.

مثال

document.docx → text.txt استخراج شده
  1. فایل ها را با فرمت DOCX انتخاب کنید. حداکثر فایل در هر دسته: 1.
  2. جداکننده ستون جدول را مرور کنید، سپس پردازش را شروع کنید.
  3. نتیجه TXT را دانلود کنید و محتوا و کیفیت آن را بررسی کنید.
چه چیزی را بررسی کنیم

متن استخراج شده است، نه طرح بندی صفحه اصلی. تصاویر، قالب‌بندی و اشیاء تعبیه‌شده حفظ نمی‌شوند. OCR اجرا نمی شود.

با اسناد Word، بخش هایی از متن از بسته سند خوانده می شود. جداول و فیلدهای متن را در نتیجه بررسی کنید. ترتیب بصری آنها پذیرفته نشده است. فایل های باینری .doc قدیمی پشتیبانی نمی شوند.

ابزار را باز کنید →

PPTX را به متن تبدیل کنید

متن اسلاید را در یک رونوشت کاری جمع آوری کنید. جداکننده را انتخاب کنید و ترتیب استخراج را بررسی کنید.

مثال

slides.pptx → text.txt جدا شده با اسلاید
  1. فایل ها را با فرمت PPTX انتخاب کنید. حداکثر فایل در هر دسته: 1.
  2. جداکننده ستون جدول را مرور کنید، سپس پردازش را شروع کنید.
  3. نتیجه TXT را دانلود کنید و محتوا و کیفیت آن را بررسی کنید.
چه چیزی را بررسی کنیم

ترتیب خواندن ممکن است با موقعیت قابل مشاهده فیلدهای متنی متفاوت باشد. تصاویر و محتوای گفتاری رونویسی نمی شوند.

ابزار را باز کنید →

ODT را به متن تبدیل کنید

متن ساده را از فایل OpenDocument استخراج کنید. جداول، فونت ها و صفحه بندی در TXT حفظ نمی شوند.

مثال

document.odt → text.txt استخراج شده
  1. فایل ها را با فرمت ODT انتخاب کنید. حداکثر فایل در هر دسته: 1.
  2. جداکننده ستون جدول را مرور کنید، سپس پردازش را شروع کنید.
  3. نتیجه TXT را دانلود کنید و محتوا و کیفیت آن را بررسی کنید.
چه چیزی را بررسی کنیم

متن استخراج شده است، نه طرح بندی صفحه اصلی. تصاویر، قالب‌بندی و اشیاء تعبیه‌شده حفظ نمی‌شوند. OCR اجرا نمی شود.

OpenDocument متن و سبک ها را جداگانه ذخیره می کند. خروجی TXT از الگوها، ستون‌ها یا شکستگی‌های صفحه به عنوان یک طرح‌بندی ثابت استفاده نمی‌کند. لیست ها و جداول را پس از صادرات بررسی کنید.

ابزار را باز کنید →

EPUB را به متن تبدیل کنید

برای گردش کار شخصی، متن را از یک EPUB پشتیبانی شده جمع آوری کنید. پشتیبانی از کتاب‌های محافظت‌شده و طرح‌بندی‌های خواندنی پیچیده را بررسی کنید.

مثال

book.epub → متن خواندنی ساده.txt
  1. فایل ها را با فرمت EPUB انتخاب کنید. حداکثر فایل در هر دسته: 1.
  2. جداکننده ستون جدول را مرور کنید، سپس پردازش را شروع کنید.
  3. نتیجه TXT را دانلود کنید و محتوا و کیفیت آن را بررسی کنید.
چه چیزی را بررسی کنیم

کتاب های محافظت شده DRM پشتیبانی نمی شوند. ناوبری، تایپوگرافی و تصاویر در TXT گم می شوند.

ابزار را باز کنید →

HWPX را به متن تبدیل کنید

متن را از HWPX استخراج کنید. HWP قدیمی و بازتولید دقیق طرح‌بندی ویرایش اصلی نیاز به جریان‌های کاری دیگری دارد.

مثال

document.hwpx → بخش text.txt
  1. فایل ها را با فرمت HWPX انتخاب کنید. حداکثر فایل در هر دسته: 1.
  2. جداکننده ستون جدول را مرور کنید، سپس پردازش را شروع کنید.
  3. نتیجه TXT را دانلود کنید و محتوا و کیفیت آن را بررسی کنید.
چه چیزی را بررسی کنیم

HWPX و HWP باینری قدیمی‌تر فرمت‌های متفاوتی هستند. فایل های با hwp باز نمی شوند.

ابزار را باز کنید →

RTF را به متن تبدیل کنید

قالب بندی کنترل RTF پشتیبانی شده را برای کپی متنی حذف کنید. کاراکترها و جداول خاص را با منبع مقایسه کنید.

مثال

document.rtf → plain text.txt
  1. فایل ها را با فرمت RTF انتخاب کنید. حداکثر فایل در هر دسته: 1.
  2. فرمت ورودی و ترتیب فایل را بررسی کنید، سپس پردازش را شروع کنید.
  3. نتیجه TXT را دانلود کنید و محتوا و کیفیت آن را بررسی کنید.
چه چیزی را بررسی کنیم

متن استخراج شده است، نه طرح بندی صفحه اصلی. تصاویر، قالب‌بندی و اشیاء تعبیه‌شده حفظ نمی‌شوند. OCR اجرا نمی شود.

متن غنی حاوی کلمات کنترلی برای قالب بندی و رمزگذاری کاراکتر است. این موارد در حین صادرات متن حذف یا ارزیابی می شوند. کاراکترهای خاص و صفحات کد قدیمی را در نتیجه بررسی کنید. تصاویر تعبیه شده استخراج نمی شوند.

ابزار را باز کنید →

MARKDOWN را به HTML تبدیل کنید

نوشتن Markdown را به عنوان HTML صادر کنید. بررسی کنید که عنوان‌ها، فهرست‌ها و پاراگراف‌های پشتیبانی شده چگونه ارائه می‌شوند.

مثال

# عنوان + پاراگراف → document.html
  1. فایل ها را با فرمت MD, MARKDOWN انتخاب کنید. حداکثر فایل در هر دسته: 1.
  2. سبک سند HTML, پیوندها را در یک برگه جدید باز کنید را مرور کنید، سپس پردازش را شروع کنید.
  3. نتیجه HTML را دانلود کنید و محتوا و کیفیت آن را بررسی کنید.
چه چیزی را بررسی کنیم

نحو Markdown محدود پشتیبانی می شود. جداول پیچیده، سلول های چند ردیفه، برنامه های افزودنی و اسکریپت ها به طور کامل پذیرفته نشده اند.

ابزار را باز کنید →

HTML را به متن تبدیل کنید

متن را از یک فایل HTML استخراج کنید. این یک URL برای خراش دادن یک وب سایت زنده بازدید نمی کند.

مثال

save-page.html → قابل خواندن text.txt
  1. فایل ها را با فرمت HTML, HTM انتخاب کنید. حداکثر فایل در هر دسته: 1.
  2. فرمت ورودی و ترتیب فایل را بررسی کنید، سپس پردازش را شروع کنید.
  3. نتیجه TXT را دانلود کنید و محتوا و کیفیت آن را بررسی کنید.
چه چیزی را بررسی کنیم

محتوای بارگیری مجدد از طریق جاوا اسکریپت بازیابی یا اجرا نمی شود. طرح CSS حفظ نشده است.

ابزار را باز کنید →

HWPX را بخوانید

پاراگراف ها، جداول و تصاویر HWPX پشتیبانی شده را بخوانید و متن را استخراج کنید. HWP قدیمی و ویرایش دقیق طرح‌بندی پشتیبانی نمی‌شوند.

مثال

document.hwpx → پیش نمایش محتوای پشتیبانی شده + TXTابزار را باز کنید →

فهرست متن را پاک کنید

جاهای خالی، تکراری و فضای خالی را در لیست های یک مورد در خط پاک کنید. مرتب سازی فقط زمانی که تغییر ترتیب در نظر گرفته شده است.

مثال

موارد خط مکرر → لیست خطوط پاک شدهابزار را باز کنید →

نرمال شدن یونیکد

عادی سازی یونیکد با ترکیب متفاوت، از جمله متن کره ای تجزیه شده. عادی سازی سازگاری می تواند کاراکترها را تغییر دهد.

مثال

متن تجزیه شده + NFC → متن ترکیب شدهابزار را باز کنید →

شخصیت های نامرئی

متن کپی شده را برای کاراکترهای نامرئی بررسی کنید و موقعیت ها و نقاط کد را قبل از حذف بررسی کنید.

مثال

متن با کاراکترهای نامرئی → گزارش مکان/نقطه کدابزار را باز کنید →

خطوط شکسته را حذف کنید

به خط شکنی های ناخواسته در نثر کپی شده بپیوندید. جداول، اشعار و فهرست ها می توانند به شکست های عمدی خطوط بستگی داشته باشند.

مثال

نثر پیچیده + پاراگراف های خالی → پاراگراف های پیوست شدهابزار را باز کنید →

اطلاعات پنهان در فایل های آفیس را بررسی کنید

قبل از به اشتراک گذاری فایل های Office، ابرداده ها، نظرات و ردپای محتوای پنهان نویسنده را بررسی کنید، سپس آنها را در برنامه منبع ویرایش کنید.

مثال

فایل آفیس → گزارش بازرسی اطلاعات پنهانابزار را باز کنید →

این راهنما ابزارهای وب عمومی و محدودیت های پشتیبانی آنها را توضیح می دهد. اصل خود را نگه دارید و نتیجه دانلود شده را بررسی کنید. Coverton · اصلاحات و تماس

این ترجمه با کمک نرم افزار تهیه شده است. همچنین می توانید نسخه انگلیسی آن را بخوانید. به انگلیسی بخوانید