I-extract at linisin ang text mula sa DOCX, HWPX at mga kinopyang dokumento
Ang pag-save ng dokumento bilang TXT ay ginagawang magagamit muli ang mga salita nito, ngunit hindi pinapanatili ang orihinal na layout o pag-format ng pahina. Piliin ang tool para sa DOCX, PPTX, ODT, EPUB, HWPX o RTF, pagkatapos ay ihambing ang mahalagang text sa pinagmulan.
Gamitin ang libreng tool →Suriin muna ang Korean document format
Pinangangasiwaan ng HWPX reader ang mga sinusuportahang talata, talahanayan at larawan. Ang Legacy HWP ay hindi sinusuportahan, at ang mambabasa ay hindi gumagawa ng orihinal na mga font, hugis, equation o pagination. Panatilihin ang orihinal na isinumite at gamitin ang resulta ng TXT para sa muling paggamit ng teksto.
Maingat na malinis ang mga line break at invisible na character
Ang Copied-PDF cleanup ay sumasali sa mga internal line break habang pinapanatili ang mga blankong line-separated na talata. Suriin ang mga talahanayan, tula at listahan laban sa pinagmulan. Ang opsyonal na invisible-character na pag-alis ay nakakaapekto sa U+200B at BOM lamang. Binabago din ng normalisasyon ng NFKC at NFKD ang mga character sa compatibility.
Ang conversion ay iba sa privacy inspeksyon
Kino-convert ng Markdown-to-HTML ang markup ng dokumento; Ang HTML-to-TXT ay nagtatapon ng mga tag at layout. Ang inspektor ng Office ay nag-uulat ng impormasyon ng may-akda, mga komento, mga nakatagong sheet at mga bakas ng panlabas na link. Ang isang ulat lamang ay hindi nangangahulugan na ang mga item na iyon ay tinanggal mula sa file.
Piliin ang tamang tool
Ang mga halimbawang input ay naglalarawan sa daloy ng trabaho; hindi sila nangangako ng partikular na laki ng file, katumpakan ng pagkilala o pagiging tugma.
I-convert ang DOCX sa Text
I-extract ang text para sa paghahanap o pag-aayos. Ang kopya ng TXT ay hindi gumagawa ng layout ng dokumento o mga larawan.
Halimbawa
document.docx → na-extract na text.txt- Pumili ng mga file sa DOCX na format. Mga maximum na file bawat batch: 1.
- Suriin ang Separator ng hanay ng talahanayan, pagkatapos ay simulan ang pagproseso.
- I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin
Kinukuha ang teksto, hindi ang orihinal na layout ng pahina. Ang mga larawan, pag-format, at mga naka-embed na bagay ay hindi pinapanatili. Ang OCR ay hindi naisakatuparan.
Sa mga dokumento ng Word, binabasa ang mga seksyon ng teksto mula sa pakete ng dokumento. Suriin ang mga talahanayan at mga patlang ng teksto sa resulta; hindi pinagtibay ang kanilang visual arrangement. Ang mga lumang binary .doc na file ay hindi suportado.
I-convert ang PPTX sa Text
Kolektahin ang slide text sa isang gumaganang transcript. Pumili ng separator at suriin ang order ng pagkuha.
Halimbawa
slides.pptx → slide-separated text.txt- Pumili ng mga file sa PPTX na format. Mga maximum na file bawat batch: 1.
- Suriin ang Separator ng hanay ng talahanayan, pagkatapos ay simulan ang pagproseso.
- I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin
Maaaring iba ang pagkakasunud-sunod ng pagbabasa mula sa nakikitang posisyon ng mga field ng teksto. Ang mga imahe at sinasalitang nilalaman ay hindi na-transcribe.
I-convert ang ODT sa Text
I-extract ang plain text mula sa isang OpenDocument file. Ang mga talahanayan, font at pagination ay hindi pinapanatili sa TXT.
Halimbawa
document.odt → na-extract na text.txt- Pumili ng mga file sa ODT na format. Mga maximum na file bawat batch: 1.
- Suriin ang Separator ng hanay ng talahanayan, pagkatapos ay simulan ang pagproseso.
- I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin
Kinukuha ang teksto, hindi ang orihinal na layout ng pahina. Ang mga larawan, pag-format, at mga naka-embed na bagay ay hindi pinapanatili. Ang OCR ay hindi naisakatuparan.
Ang OpenDocument ay nag-iimbak ng teksto at mga istilo nang hiwalay. Ang output ng TXT ay hindi gumagamit ng mga template, column o page break bilang nakapirming layout. Suriin ang mga listahan at talahanayan pagkatapos i-export.
I-convert ang EPUB sa Text
Mangolekta ng text mula sa isang sinusuportahang EPUB para sa mga personal na daloy ng trabaho. Suriin ang suporta para sa mga protektadong aklat at kumplikadong mga layout ng pagbabasa.
Halimbawa
book.epub → plain reading text.txt- Pumili ng mga file sa EPUB na format. Mga maximum na file bawat batch: 1.
- Suriin ang Separator ng hanay ng talahanayan, pagkatapos ay simulan ang pagproseso.
- I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin
Hindi sinusuportahan ang mga librong protektado ng DRM. Nawala ang nabigasyon, palalimbagan at mga larawan sa TXT.
I-convert ang HWPX sa Text
I-extract ang text mula sa HWPX. Ang Legacy HWP at tumpak na pagpaparami ng orihinal na layout ng pag-edit ay nangangailangan ng iba pang mga daloy ng trabaho.
Halimbawa
document.hwpx → text ng seksyon.txt- Pumili ng mga file sa HWPX na format. Mga maximum na file bawat batch: 1.
- Suriin ang Separator ng hanay ng talahanayan, pagkatapos ay simulan ang pagproseso.
- I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin
Ang HWPX at ang mas lumang binary HWP ay magkaibang mga format. Hindi magbubukas ang mga file na may .hwp.
I-convert ang RTF sa Text
Alisin ang suportadong RTF control formatting para sa isang text copy. Ihambing ang mga espesyal na character at talahanayan sa pinagmulan.
Halimbawa
document.rtf → plain text.txt- Pumili ng mga file sa RTF na format. Mga maximum na file bawat batch: 1.
- Suriin ang format ng pag-input at pagkakasunud-sunod ng file, pagkatapos ay simulan ang pagproseso.
- I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin
Kinukuha ang teksto, hindi ang orihinal na layout ng pahina. Ang mga larawan, pag-format, at mga naka-embed na bagay ay hindi pinapanatili. Ang OCR ay hindi naisakatuparan.
Ang rich text ay naglalaman ng mga control na salita para sa pag-format at pag-encode ng character. Ang mga ito ay inalis o sinusuri sa panahon ng pag-export ng text. Suriin ang mga espesyal na character at mas lumang mga pahina ng code sa resulta; hindi kinukuha ang mga naka-embed na larawan.
I-convert ang MARKDOWN sa HTML
I-export ang pagsusulat ng Markdown bilang HTML. Tingnan kung paano nagre-render ang mga sinusuportahang heading, listahan at talata.
Halimbawa
# Heading + mga talata → document.html- Pumili ng mga file sa MD, MARKDOWN na format. Mga maximum na file bawat batch: 1.
- Suriin ang Estilo ng HTML na dokumento, Buksan ang mga link sa isang bagong tab, pagkatapos ay simulan ang pagproseso.
- I-download ang resulta ng HTML at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin
Sinusuportahan ang Limitadong Markdown syntax. Ang mga kumplikadong talahanayan, multi-row na mga cell, extension at script ay hindi ganap na pinagtibay.
I-convert ang HTML sa Text
I-extract ang text mula sa isang HTML file. Hindi ito bumibisita sa isang URL para mag-scrape ng live na website.
Halimbawa
saved-page.html → nababasang text.txt- Pumili ng mga file sa HTML, HTM na format. Mga maximum na file bawat batch: 1.
- Suriin ang format ng pag-input at pagkakasunud-sunod ng file, pagkatapos ay simulan ang pagproseso.
- I-download ang resulta ng TXT at suriin ang nilalaman at kalidad nito.
Ano ang dapat suriin
Ang nilalamang na-reload sa pamamagitan ng JavaScript ay hindi nakuha o naisakatuparan. Ang layout ng CSS ay hindi napanatili.
Basahin ang HWPX
Basahin ang mga sinusuportahang HWPX na talata, talahanayan at larawan at kunin ang teksto. Ang legacy na HWP at tumpak na pag-edit ng layout ay hindi sinusuportahan.
Halimbawa
document.hwpx → suportadong preview ng content + TXTBuksan ang tool →Malinis na listahan ng teksto
Linisin ang mga blangko, duplicate at whitespace sa isang-item-per-line na listahan. Pagbukud-bukurin lamang kapag nilayon ang pagbabago ng pagkakasunud-sunod.
Halimbawa
paulit-ulit na mga item sa linya → nalinis na listahan ng linyaBuksan ang tool →Nag-normalize ang Unicode
I-normalize ang naiibang pagkakabuo ng Unicode, kabilang ang nabulok na Korean text. Maaaring baguhin ng normalization ng compatibility ang mga character.
Halimbawa
decomposed text + NFC → composed textBuksan ang tool →Mga character na hindi nakikita
Suriin ang nakopyang teksto para sa mga hindi nakikitang character at suriin ang mga posisyon at mga punto ng code bago alisin.
Halimbawa
text na may hindi nakikitang mga character → ulat ng lokasyon/code-pointBuksan ang tool →Alisin ang mga line break
Sumali sa mga hindi gustong line break sa kinopyang prosa. Maaaring depende ang mga talahanayan, tula at listahan sa mga sinadyang line break.
Halimbawa
balot na tuluyan + blangko ang mga talata → pinagsamang mga talataBuksan ang tool →Suriin ang nakatagong impormasyon sa mga file ng Office
Suriin ang metadata ng may-akda, mga komento at mga bakas ng nakatagong nilalaman bago ibahagi ang mga file ng Office, pagkatapos ay i-edit ang mga ito sa source na application.
Halimbawa
File ng opisina → ulat ng inspeksyon ng nakatagong impormasyonBuksan ang tool →Inilalarawan ng gabay na ito ang mga pampublikong tool sa web at ang kanilang mga limitasyon sa suporta. Panatilihin ang iyong orihinal at tingnan ang na-download na resulta. Coverton · Mga pagwawasto at pakikipag-ugnayan
Ang pagsasaling ito ay inihanda sa tulong ng software. Maaari mo ring basahin ang Ingles na bersyon. Basahin sa Ingles