Lumaktaw sa nilalaman
Coverton Blog
Sa artikulong ito
Mga dokumento at teksto

I-extract at linisin ang text mula sa DOCX, HWPX at mga kinopyang dokumento

Ang pag-save ng dokumento bilang TXT ay ginagawang magagamit muli ang mga salita nito, ngunit hindi pinapanatili ang orihinal na layout o pag-format ng pahina. Piliin ang tool para sa DOCX, PPTX, ODT, EPUB, HWPX o RTF, pagkatapos ay ihambing ang mahalagang text sa pinagmulan.

Gamitin ang libreng tool →

Suriin muna ang Korean document format

Pinangangasiwaan ng HWPX reader ang mga sinusuportahang talata, talahanayan at larawan. Ang Legacy HWP ay hindi sinusuportahan, at ang mambabasa ay hindi gumagawa ng orihinal na mga font, hugis, equation o pagination. Panatilihin ang orihinal na isinumite at gamitin ang resulta ng TXT para sa muling paggamit ng teksto.

Maingat na malinis ang mga line break at invisible na character

Ang Copied-PDF cleanup ay sumasali sa mga internal line break habang pinapanatili ang mga blankong line-separated na talata. Suriin ang mga talahanayan, tula at listahan laban sa pinagmulan. Ang opsyonal na invisible-character na pag-alis ay nakakaapekto sa U+200B at BOM lamang. Binabago din ng normalisasyon ng NFKC at NFKD ang mga character sa compatibility.

Ang conversion ay iba sa privacy inspeksyon

Kino-convert ng Markdown-to-HTML ang markup ng dokumento; Ang HTML-to-TXT ay nagtatapon ng mga tag at layout. Ang inspektor ng Office ay nag-uulat ng impormasyon ng may-akda, mga komento, mga nakatagong sheet at mga bakas ng panlabas na link. Ang isang ulat lamang ay hindi nangangahulugan na ang mga item na iyon ay tinanggal mula sa file.

Piliin ang tamang tool

Ang mga halimbawang input ay naglalarawan sa daloy ng trabaho; hindi sila nangangako ng partikular na laki ng file, katumpakan ng pagkilala o pagiging tugma.

I-convert ang DOCX sa Text

I-extract ang text para sa paghahanap o pag-aayos. Ang kopya ng TXT ay hindi gumagawa ng layout ng dokumento o mga larawan.

Halimbawa

document.docx → na-extract na text.txt
  1. Pumili ng mga file sa DOCX na format. Mga maximum na file bawat batch: 1.
  2. Suriin ang Separator ng hanay ng talahanayan, pagkatapos ay simulan ang pagproseso.
  3. I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin

Kinukuha ang teksto, hindi ang orihinal na layout ng pahina. Ang mga larawan, pag-format, at mga naka-embed na bagay ay hindi pinapanatili. Ang OCR ay hindi naisakatuparan.

Sa mga dokumento ng Word, binabasa ang mga seksyon ng teksto mula sa pakete ng dokumento. Suriin ang mga talahanayan at mga patlang ng teksto sa resulta; hindi pinagtibay ang kanilang visual arrangement. Ang mga lumang binary .doc na file ay hindi suportado.

Buksan ang tool →

I-convert ang PPTX sa Text

Kolektahin ang slide text sa isang gumaganang transcript. Pumili ng separator at suriin ang order ng pagkuha.

Halimbawa

slides.pptx → slide-separated text.txt
  1. Pumili ng mga file sa PPTX na format. Mga maximum na file bawat batch: 1.
  2. Suriin ang Separator ng hanay ng talahanayan, pagkatapos ay simulan ang pagproseso.
  3. I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin

Maaaring iba ang pagkakasunud-sunod ng pagbabasa mula sa nakikitang posisyon ng mga field ng teksto. Ang mga imahe at sinasalitang nilalaman ay hindi na-transcribe.

Buksan ang tool →

I-convert ang ODT sa Text

I-extract ang plain text mula sa isang OpenDocument file. Ang mga talahanayan, font at pagination ay hindi pinapanatili sa TXT.

Halimbawa

document.odt → na-extract na text.txt
  1. Pumili ng mga file sa ODT na format. Mga maximum na file bawat batch: 1.
  2. Suriin ang Separator ng hanay ng talahanayan, pagkatapos ay simulan ang pagproseso.
  3. I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin

Kinukuha ang teksto, hindi ang orihinal na layout ng pahina. Ang mga larawan, pag-format, at mga naka-embed na bagay ay hindi pinapanatili. Ang OCR ay hindi naisakatuparan.

Ang OpenDocument ay nag-iimbak ng teksto at mga istilo nang hiwalay. Ang output ng TXT ay hindi gumagamit ng mga template, column o page break bilang nakapirming layout. Suriin ang mga listahan at talahanayan pagkatapos i-export.

Buksan ang tool →

I-convert ang EPUB sa Text

Mangolekta ng text mula sa isang sinusuportahang EPUB para sa mga personal na daloy ng trabaho. Suriin ang suporta para sa mga protektadong aklat at kumplikadong mga layout ng pagbabasa.

Halimbawa

book.epub → plain reading text.txt
  1. Pumili ng mga file sa EPUB na format. Mga maximum na file bawat batch: 1.
  2. Suriin ang Separator ng hanay ng talahanayan, pagkatapos ay simulan ang pagproseso.
  3. I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin

Hindi sinusuportahan ang mga librong protektado ng DRM. Nawala ang nabigasyon, palalimbagan at mga larawan sa TXT.

Buksan ang tool →

I-convert ang HWPX sa Text

I-extract ang text mula sa HWPX. Ang Legacy HWP at tumpak na pagpaparami ng orihinal na layout ng pag-edit ay nangangailangan ng iba pang mga daloy ng trabaho.

Halimbawa

document.hwpx → text ng seksyon.txt
  1. Pumili ng mga file sa HWPX na format. Mga maximum na file bawat batch: 1.
  2. Suriin ang Separator ng hanay ng talahanayan, pagkatapos ay simulan ang pagproseso.
  3. I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin

Ang HWPX at ang mas lumang binary HWP ay magkaibang mga format. Hindi magbubukas ang mga file na may .hwp.

Buksan ang tool →

I-convert ang RTF sa Text

Alisin ang suportadong RTF control formatting para sa isang text copy. Ihambing ang mga espesyal na character at talahanayan sa pinagmulan.

Halimbawa

document.rtf → plain text.txt
  1. Pumili ng mga file sa RTF na format. Mga maximum na file bawat batch: 1.
  2. Suriin ang format ng pag-input at pagkakasunud-sunod ng file, pagkatapos ay simulan ang pagproseso.
  3. I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin

Kinukuha ang teksto, hindi ang orihinal na layout ng pahina. Ang mga larawan, pag-format, at mga naka-embed na bagay ay hindi pinapanatili. Ang OCR ay hindi naisakatuparan.

Ang rich text ay naglalaman ng mga control na salita para sa pag-format at pag-encode ng character. Ang mga ito ay inalis o sinusuri sa panahon ng pag-export ng text. Suriin ang mga espesyal na character at mas lumang mga pahina ng code sa resulta; hindi kinukuha ang mga naka-embed na larawan.

Buksan ang tool →

I-convert ang MARKDOWN sa HTML

I-export ang pagsusulat ng Markdown bilang HTML. Tingnan kung paano nagre-render ang mga sinusuportahang heading, listahan at talata.

Halimbawa

# Heading + mga talata → document.html
  1. Pumili ng mga file sa MD, MARKDOWN na format. Mga maximum na file bawat batch: 1.
  2. Suriin ang Estilo ng HTML na dokumento, Buksan ang mga link sa isang bagong tab, pagkatapos ay simulan ang pagproseso.
  3. I-download ang resulta ng HTML at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin

Sinusuportahan ang Limitadong Markdown syntax. Ang mga kumplikadong talahanayan, multi-row na mga cell, extension at script ay hindi ganap na pinagtibay.

Buksan ang tool →

I-convert ang HTML sa Text

I-extract ang text mula sa isang HTML file. Hindi ito bumibisita sa isang URL para mag-scrape ng live na website.

Halimbawa

saved-page.html → nababasang text.txt
  1. Pumili ng mga file sa HTML, HTM na format. Mga maximum na file bawat batch: 1.
  2. Suriin ang format ng pag-input at pagkakasunud-sunod ng file, pagkatapos ay simulan ang pagproseso.
  3. I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin

Ang nilalamang na-reload sa pamamagitan ng JavaScript ay hindi nakuha o naisakatuparan. Ang layout ng CSS ay hindi napanatili.

Buksan ang tool →

Basahin ang HWPX

Basahin ang mga sinusuportahang HWPX na talata, talahanayan at larawan at kunin ang teksto. Ang legacy na HWP at tumpak na pag-edit ng layout ay hindi sinusuportahan.

Halimbawa

document.hwpx → suportadong preview ng content + TXTBuksan ang tool →

Malinis na listahan ng teksto

Linisin ang mga blangko, duplicate at whitespace sa isang-item-per-line na listahan. Pagbukud-bukurin lamang kapag nilayon ang pagbabago ng pagkakasunud-sunod.

Halimbawa

paulit-ulit na mga item sa linya → nalinis na listahan ng linyaBuksan ang tool →

Nag-normalize ang Unicode

I-normalize ang naiibang pagkakabuo ng Unicode, kabilang ang nabulok na Korean text. Maaaring baguhin ng normalization ng compatibility ang mga character.

Halimbawa

decomposed text + NFC → composed textBuksan ang tool →

Mga character na hindi nakikita

Suriin ang nakopyang teksto para sa mga hindi nakikitang character at suriin ang mga posisyon at mga punto ng code bago alisin.

Halimbawa

text na may hindi nakikitang mga character → ulat ng lokasyon/code-pointBuksan ang tool →

Alisin ang mga line break

Sumali sa mga hindi gustong line break sa kinopyang prosa. Maaaring depende ang mga talahanayan, tula at listahan sa mga sinadyang line break.

Halimbawa

balot na tuluyan + blangko ang mga talata → pinagsamang mga talataBuksan ang tool →

Suriin ang nakatagong impormasyon sa mga file ng Office

Suriin ang metadata ng may-akda, mga komento at mga bakas ng nakatagong nilalaman bago ibahagi ang mga file ng Office, pagkatapos ay i-edit ang mga ito sa source na application.

Halimbawa

File ng opisina → ulat ng inspeksyon ng nakatagong impormasyonBuksan ang tool →

Inilalarawan ng gabay na ito ang mga pampublikong tool sa web at ang kanilang mga limitasyon sa suporta. Panatilihin ang iyong orihinal at tingnan ang na-download na resulta. Coverton · Mga pagwawasto at pakikipag-ugnayan

Ang pagsasaling ito ay inihanda sa tulong ng software. Maaari mo ring basahin ang Ingles na bersyon. Basahin sa Ingles