বিষয়বস্তু এড়িয়ে যান
Coverton ব্লগ
এই নিবন্ধে
নথি এবং পাঠ্য

DOCX, HWPX এবং কপি করা নথি থেকে পাঠ্য বের করুন এবং পরিষ্কার করুন

একটি ডকুমেন্টকে TXT হিসাবে সংরক্ষণ করা তার শব্দগুলিকে পুনরায় ব্যবহারযোগ্য করে তোলে, কিন্তু মূল পৃষ্ঠার বিন্যাস বা বিন্যাস ধরে রাখে না। DOCX, PPTX, ODT, EPUB, HWPX বা RTF এর জন্য টুলটি নির্বাচন করুন, তারপর উৎসের সাথে গুরুত্বপূর্ণ পাঠের তুলনা করুন।

বিনামূল্যে টুল ব্যবহার করুন →

প্রথমে কোরিয়ান ডকুমেন্ট ফরম্যাট চেক করুন

HWPX রিডার সমর্থিত অনুচ্ছেদ, টেবিল এবং ছবি পরিচালনা করে। লিগ্যাসি HWP অসমর্থিত, এবং পাঠক মূল ফন্ট, আকার, সমীকরণ বা পৃষ্ঠা সংখ্যা পুনরুত্পাদন করে না। জমা দেওয়া আসলটি সংরক্ষণ করুন এবং পাঠ্য পুনঃব্যবহারের জন্য TXT ফলাফলটি ব্যবহার করুন।

পরিষ্কার লাইন বিরতি এবং অদৃশ্য অক্ষর সাবধানে

অনুলিপি করা-PDF ক্লিনআপ অভ্যন্তরীণ লাইন বিরতিতে যোগ দেয় যখন ফাঁকা-লাইন-বিচ্ছিন্ন অনুচ্ছেদগুলি বজায় থাকে। উৎসের বিপরীতে টেবিল, কবিতা এবং তালিকা পর্যালোচনা করুন। ঐচ্ছিক অদৃশ্য-অক্ষর অপসারণ শুধুমাত্র U+200B এবং BOM প্রভাবিত করে। NFKC এবং NFKD স্বাভাবিককরণও সামঞ্জস্যপূর্ণ অক্ষর পরিবর্তন করে।

রূপান্তর গোপনীয়তা পরিদর্শন থেকে ভিন্ন

Markdown-থেকে-HTML নথি মার্কআপ রূপান্তর করে; HTML-to-TXT ট্যাগ এবং লেআউট বাতিল করে। Office পরিদর্শক লেখকের তথ্য, মন্তব্য, লুকানো শীট এবং বাহ্যিক-লিঙ্ক ট্রেস রিপোর্ট করে। শুধুমাত্র একটি প্রতিবেদনের অর্থ এই নয় যে এই আইটেমগুলি ফাইল থেকে সরানো হয়েছে৷

সঠিক টুল নির্বাচন করুন

উদাহরণ ইনপুট কর্মপ্রবাহ চিত্রিত; তারা একটি নির্দিষ্ট ফাইলের আকার, স্বীকৃতি নির্ভুলতা বা সামঞ্জস্যের প্রতিশ্রুতি দেয় না।

DOCX কে পাঠ্য এ রূপান্তর করুন

অনুসন্ধান বা সংগঠিত করার জন্য পাঠ্য বের করুন। TXT কপি ডকুমেন্ট লেআউট বা ছবি পুনরুত্পাদন করে না।

উদাহরণ

document.docx → extracted text.txt
  1. DOCX ফরম্যাটে ফাইল বেছে নিন। প্রতি ব্যাচের সর্বোচ্চ ফাইল: 1।
  2. টেবিল কলাম বিভাজক পর্যালোচনা করুন, তারপর প্রক্রিয়াকরণ শুরু করুন।
  3. TXT ফলাফল ডাউনলোড করুন এবং এর বিষয়বস্তু এবং গুণমান পরীক্ষা করুন।
কি চেক করতে হবে

টেক্সট বের করা হয়েছে, মূল পৃষ্ঠা লেআউট নয়। ইমেজ, ফরম্যাটিং, এবং এমবেডেড অবজেক্ট রাখা হয় না। ওসিআর কার্যকর করা হয় না।

ওয়ার্ড নথির সাথে, নথির প্যাকেজ থেকে পাঠ্যের বিভাগগুলি পড়া হয়। ফলাফলে টেবিল এবং টেক্সট ক্ষেত্র পরীক্ষা করুন; তাদের চাক্ষুষ বিন্যাস গৃহীত হয় না. পুরানো বাইনারি .doc ফাইলগুলি সমর্থিত নয়৷

টুল খুলুন →

PPTX কে পাঠ্য এ রূপান্তর করুন

একটি কার্যকরী প্রতিলিপিতে স্লাইড পাঠ্য সংগ্রহ করুন। একটি বিভাজক চয়ন করুন এবং নিষ্কাশন আদেশ পর্যালোচনা করুন.

উদাহরণ

slides.pptx → slide-separated text.txt
  1. PPTX ফরম্যাটে ফাইল বেছে নিন। প্রতি ব্যাচের সর্বোচ্চ ফাইল: 1।
  2. টেবিল কলাম বিভাজক পর্যালোচনা করুন, তারপর প্রক্রিয়াকরণ শুরু করুন।
  3. TXT ফলাফল ডাউনলোড করুন এবং এর বিষয়বস্তু এবং গুণমান পরীক্ষা করুন।
কি চেক করতে হবে

পাঠ্য ক্ষেত্রগুলির দৃশ্যমান অবস্থান থেকে পড়ার ক্রম ভিন্ন হতে পারে। ছবি এবং কথ্য বিষয়বস্তু প্রতিলিপি করা হয় না.

টুল খুলুন →

ODT কে পাঠ্য এ রূপান্তর করুন

একটি OpenDocument ফাইল থেকে প্লেইন টেক্সট বের করুন। টেবিল, ফন্ট এবং পেজিনেশন TXT-এ সংরক্ষিত নেই।

উদাহরণ

document.odt → extracted text.txt
  1. ODT ফরম্যাটে ফাইল বেছে নিন। প্রতি ব্যাচের সর্বোচ্চ ফাইল: 1।
  2. টেবিল কলাম বিভাজক পর্যালোচনা করুন, তারপর প্রক্রিয়াকরণ শুরু করুন।
  3. TXT ফলাফল ডাউনলোড করুন এবং এর বিষয়বস্তু এবং গুণমান পরীক্ষা করুন।
কি চেক করতে হবে

টেক্সট বের করা হয়েছে, মূল পৃষ্ঠা লেআউট নয়। ইমেজ, ফরম্যাটিং, এবং এমবেডেড অবজেক্ট রাখা হয় না। ওসিআর কার্যকর করা হয় না।

OpenDocument পাঠ্য এবং শৈলী আলাদাভাবে সঞ্চয় করে। TXT আউটপুট একটি নির্দিষ্ট লেআউট হিসাবে টেমপ্লেট, কলাম বা পৃষ্ঠা বিরতি গ্রহণ করে না। রপ্তানির পরে তালিকা এবং টেবিল চেক করুন।

টুল খুলুন →

EPUB কে পাঠ্য এ রূপান্তর করুন

ব্যক্তিগত কর্মপ্রবাহের জন্য একটি সমর্থিত EPUB থেকে পাঠ্য সংগ্রহ করুন। সুরক্ষিত বই এবং জটিল পড়ার বিন্যাসের জন্য সমর্থন পরীক্ষা করুন।

উদাহরণ

book.epub → প্লেইন রিডিং text.txt
  1. EPUB ফরম্যাটে ফাইল বেছে নিন। প্রতি ব্যাচের সর্বোচ্চ ফাইল: 1।
  2. টেবিল কলাম বিভাজক পর্যালোচনা করুন, তারপর প্রক্রিয়াকরণ শুরু করুন।
  3. TXT ফলাফল ডাউনলোড করুন এবং এর বিষয়বস্তু এবং গুণমান পরীক্ষা করুন।
কি চেক করতে হবে

DRM সুরক্ষিত বই সমর্থিত নয়। ন্যাভিগেশন, টাইপোগ্রাফি এবং চিত্রগুলি TXT-এ হারিয়ে গেছে।

টুল খুলুন →

HWPX কে পাঠ্য এ রূপান্তর করুন

HWPX থেকে পাঠ্য বের করুন। লিগ্যাসি HWP এবং মূল সম্পাদনা বিন্যাসের সুনির্দিষ্ট পুনরুৎপাদনের জন্য অন্যান্য কর্মপ্রবাহের প্রয়োজন।

উদাহরণ

document.hwpx → section text.txt
  1. HWPX ফরম্যাটে ফাইল বেছে নিন। প্রতি ব্যাচের সর্বোচ্চ ফাইল: 1।
  2. টেবিল কলাম বিভাজক পর্যালোচনা করুন, তারপর প্রক্রিয়াকরণ শুরু করুন।
  3. TXT ফলাফল ডাউনলোড করুন এবং এর বিষয়বস্তু এবং গুণমান পরীক্ষা করুন।
কি চেক করতে হবে

HWPX এবং পুরানো বাইনারি HWP ভিন্ন ফর্ম্যাট। .hwp এর সাথে ফাইল খুলবে না।

টুল খুলুন →

RTF কে পাঠ্য এ রূপান্তর করুন

টেক্সট কপির জন্য সমর্থিত RTF কন্ট্রোল ফরম্যাটিং সরান। উৎসের সাথে বিশেষ অক্ষর এবং টেবিলের তুলনা করুন।

উদাহরণ

document.rtf → প্লেইন text.txt
  1. RTF ফরম্যাটে ফাইল বেছে নিন। প্রতি ব্যাচের সর্বোচ্চ ফাইল: 1।
  2. ইনপুট ফরম্যাট এবং ফাইল অর্ডার চেক করুন, তারপর প্রক্রিয়াকরণ শুরু করুন।
  3. TXT ফলাফল ডাউনলোড করুন এবং এর বিষয়বস্তু এবং গুণমান পরীক্ষা করুন।
কি চেক করতে হবে

টেক্সট বের করা হয়েছে, মূল পৃষ্ঠা লেআউট নয়। ইমেজ, ফরম্যাটিং, এবং এমবেডেড অবজেক্ট রাখা হয় না। ওসিআর কার্যকর করা হয় না।

সমৃদ্ধ পাঠ্য বিন্যাস এবং অক্ষর এনকোডিংয়ের জন্য নিয়ন্ত্রণ শব্দ রয়েছে। পাঠ্য রপ্তানির সময় এগুলি সরানো বা মূল্যায়ন করা হয়। ফলাফলে বিশেষ অক্ষর এবং পুরানো কোড পৃষ্ঠাগুলি পরীক্ষা করুন; এমবেড করা ছবি নিষ্কাশন করা হয় না.

টুল খুলুন →

MARKDOWN কে HTML এ রূপান্তর করুন

এইচটিএমএল হিসাবে মার্কডাউন লেখা রপ্তানি করুন। কিভাবে সমর্থিত শিরোনাম, তালিকা এবং অনুচ্ছেদ রেন্ডার হয় তা পরীক্ষা করুন।

উদাহরণ

# শিরোনাম + অনুচ্ছেদ → document.html
  1. MD, MARKDOWN ফরম্যাটে ফাইল বেছে নিন। প্রতি ব্যাচের সর্বোচ্চ ফাইল: 1।
  2. HTML নথি শৈলী, একটি নতুন ট্যাবে লিঙ্ক খুলুন পর্যালোচনা করুন, তারপর প্রক্রিয়াকরণ শুরু করুন।
  3. HTML ফলাফল ডাউনলোড করুন এবং এর বিষয়বস্তু এবং গুণমান পরীক্ষা করুন।
কি চেক করতে হবে

সীমিত মার্কডাউন সিনট্যাক্স সমর্থিত। জটিল টেবিল, বহু-সারি ঘর, এক্সটেনশন এবং স্ক্রিপ্ট সম্পূর্ণরূপে গ্রহণ করা হয় না।

টুল খুলুন →

HTML কে পাঠ্য এ রূপান্তর করুন

একটি HTML ফাইল থেকে পাঠ্য বের করুন। এটি একটি লাইভ ওয়েবসাইট স্ক্র্যাপ করার জন্য একটি URL পরিদর্শন করে না।

উদাহরণ

saved-page.html → পাঠযোগ্য text.txt
  1. HTML, HTM ফরম্যাটে ফাইল বেছে নিন। প্রতি ব্যাচের সর্বোচ্চ ফাইল: 1।
  2. ইনপুট ফরম্যাট এবং ফাইল অর্ডার চেক করুন, তারপর প্রক্রিয়াকরণ শুরু করুন।
  3. TXT ফলাফল ডাউনলোড করুন এবং এর বিষয়বস্তু এবং গুণমান পরীক্ষা করুন।
কি চেক করতে হবে

জাভাস্ক্রিপ্টের মাধ্যমে পুনরায় লোড করা সামগ্রী পুনরুদ্ধার করা বা কার্যকর করা হয় না। CSS লেআউট সংরক্ষিত নয়।

টুল খুলুন →

HWPX পড়ুন

সমর্থিত HWPX অনুচ্ছেদ, টেবিল এবং ছবি পড়ুন এবং পাঠ্য বের করুন। লিগ্যাসি HWP এবং সুনির্দিষ্ট লেআউট সম্পাদনা অসমর্থিত।

উদাহরণ

document.hwpx → সমর্থিত বিষয়বস্তুর পূর্বরূপ + TXTটুল খুলুন →

পাঠ্য তালিকা পরিষ্কার করুন

এক-আইটেম-প্রতি-লাইন তালিকায় খালি জায়গা, সদৃশ এবং হোয়াইটস্পেস পরিষ্কার করুন। ক্রম পরিবর্তন করার উদ্দেশ্যে শুধুমাত্র তখনই সাজান।

উদাহরণ

বারবার লাইন আইটেম → পরিষ্কার লাইন তালিকাটুল খুলুন →

ইউনিকোড স্বাভাবিক করুন

পচনশীল কোরিয়ান পাঠ্য সহ ভিন্নভাবে রচিত ইউনিকোডকে স্বাভাবিক করুন। সামঞ্জস্য স্বাভাবিককরণ অক্ষর পরিবর্তন করতে পারে।

উদাহরণ

পচনশীল পাঠ্য + NFC → রচনা করা পাঠ্যটুল খুলুন →

অদৃশ্য চরিত্র

অদৃশ্য অক্ষরের জন্য অনুলিপি করা পাঠ্য পরীক্ষা করুন এবং অপসারণের আগে অবস্থান এবং কোড পয়েন্ট পর্যালোচনা করুন।

উদাহরণ

অদৃশ্য অক্ষর সহ পাঠ্য → অবস্থান/কোড-পয়েন্ট রিপোর্টটুল খুলুন →

লাইন বিরতি সরান

অনুলিপি করা গদ্যে অবাঞ্ছিত লাইন বিরতিতে যোগ দিন। টেবিল, কবিতা এবং তালিকা ইচ্ছাকৃত লাইন বিরতির উপর নির্ভর করতে পারে।

উদাহরণ

মোড়ানো গদ্য + ফাঁকা অনুচ্ছেদ → যুক্ত অনুচ্ছেদটুল খুলুন →

অফিস ফাইলে লুকানো তথ্য পরিদর্শন করুন

অফিস ফাইল শেয়ার করার আগে লেখক মেটাডেটা, মন্তব্য এবং লুকানো-সামগ্রী ট্রেস পরিদর্শন করুন, তারপর উৎস অ্যাপ্লিকেশনে সেগুলি সম্পাদনা করুন।

উদাহরণ

অফিস ফাইল → লুকানো-তথ্য পরিদর্শন প্রতিবেদনটুল খুলুন →

এই গাইড সর্বজনীন ওয়েব টুল এবং তাদের সমর্থন সীমা বর্ণনা করে। আপনার আসল রাখুন এবং ডাউনলোড করা ফলাফল দেখুন। Coverton · সংশোধন এবং যোগাযোগ

এই অনুবাদটি সফ্টওয়্যার সহায়তায় প্রস্তুত করা হয়েছিল। আপনি ইংরেজি সংস্করণ পড়তে পারেন. ইংরেজিতে পড়ুন