Kumuha ng Text mula sa DjVu

I-recover ang nakatagong OCR text na naka-embed na sa isang DjVu document bilang UTF-8 plain text o bounded positional XML. Extraction ito, hindi bagong OCR.

Pribadong resulta · walang paghahanap sa network · walang pagbawas sa kalidad · mga file hanggang 1 GB

Ang XML ay isang limitadong representasyon ng DjVuLibre engine. Hindi ito ALTO o hOCR at hindi nito ginagarantiyahan ang pagkakasunod-sunod ng pagbasa.

Paalala sa mga karapatan at privacy: Iproseso lamang ang mga dokumentong may pahintulot kang gamitin. Maaaring maglaman ng pribado o naka-copyright na materyal ang nakatagong teksto, mga anotasyon, at mga scan. Mananatili ang mga resulta sa pribadong job ng uploader at ihahatid bilang no-store attachment sa loob ng kasalukuyang panahon ng pagpapanatili.

Ano ang ginagawa ng DjVu toolkit

May hangganang inspeksyon

Iniuulat ang bilang ng pahina, katutubong sukat, DPI at gamma kung available, naka-bundle na istruktura, nakatagong teksto, mga anotasyon, mga thumbnail, at mga foreground, background, at mask layer.

Tekstong mula sa source

Ang katumpakan at wika ng teksto ay ganap na nagmumula sa na-upload na source. Hindi pinapabuti, isinasalin, binabago, o ipinapadala ng Convertr ang nakuha na teksto sa upstream.

Native na pag-render ng page

Dinedecode ng naka-pin na ddjvu build ang mga napiling pahina sa buong katutubong sukat ng mga ito. Tahasang mabibigo ang hindi ligtas na pagpapalawak sa halip na putulin o paliitin ang output.

Tinatanggihan ang mga indirect DjVu document na may hindi nalutas na component reference. Hindi kailanman sinusundan ng toolkit ang component URLs, hindi kailanman inilalantad ang component identifier, hindi kailanman tumatanggap ng command script, at hindi kailanman nag-aalok ng crop o quality switches.

Kumuha ng Text mula sa DjVu

Kunin lamang ang nakatagong OCR text na naka-embed na sa isang DjVu document.

ang input
Isang .djvu o .djv file na may beripikadong lagda at TXT o positional XML na output.
Mga output
Kumpletong UTF-8 text o nilinis at may hangganang positional XML.
Mga tunay na limitasyon
Hindi ito lumilikha ng bagong OCR, nagpapahusay ng katumpakan, nagsasalin ng text, o gumagarantiya ng pagkakasunod-sunod ng pagbasa.
Privacy at paghawak ng data
Ang isang .djvu o .djv file na may beripikadong lagda at TXT o positional XML na output ay ina-upload sa isang compatible na Convertr worker pagkatapos mo lamang simulan ang operasyon. Awtomatiko ang processing, at awtomatikong dine-delete ang pansamantalang source at result file pagkatapos ng processing sa halip na itago bilang permanenteng storage.

Paano gamitin ang tool na ito

  1. Pumili ng isang na-verify-ang-lagda na .djvu o .djv file at TXT o positional XML output, at hintaying ma-validate ito ng page.
  2. Itakda ang mga available na opsyon sa output o pagsusuri, pagkatapos ay simulan ang pagproseso.
  3. Suriin ang iniulat na resulta at i-download ang kumpletong UTF-8 text o nilinis at may hangganang positional XML bago mag-expire ang pansamantalang link.

Mga karaniwang sanhi ng pagkabigo

Ang nawawalang text layer, invalid UTF-8, unsafe XML expansion, malformed document, o workspace exhaustion ay nagdudulot ng explicit failure.

Kapaki-pakinabang na halimbawa

Mag-upload ng DjVu na may naka-embed na text at i-download ang eksaktong djvutxt UTF-8 output.